데이터 보기
라이브러리 설치
pip: 파이썬 라이브러리를 설치하고 관리하는 기본 도구pandas: 파이썬에서 표 형태 데이터를 다루는 대표 라이브러리- 엑셀 표처럼 행과 열로 된 데이터를 불러오고 정리하고 계산하는 데 사용
openpyxl: 엑셀 파일을 읽고 쓰기 위한 보조 라이브러리
pip install pandas openpyxl
라이브러리 임포트
- 임포트(import): 설치된 라이브러리를 현재 코드에서 사용할 수 있게 불러오기
import pandas
as pd: pandas를 짧은 이름인pd로 사용하겠다는 약속
import pandas as pd
엑셀 파일 불러오기
- pandas를 이용하면 로컬에 있는 엑셀(
.xlsx) 자료를 손쉽게 파이썬으로 가져올 수 있음
# 선박 데이터를 엑셀 파일에서 읽어오기
df = pd.read_excel('ship.xlsx')
.: "~의"에 해당pd.read_excel():pd라는 라이브러리 안의read_excel()함수 사용
df테이블은 데이터 프레임(DataFrame)이라는 2차원 자료구조- 선박 제원 및 운항 데이터: 선명, 건조연도, 선박의 길이(Length) 및 폭(Beam), 최대 속도 등의 변수가 포함
문자열
'ship.xlsx': 파일 이름을 글자 그대로 전달한다는 뜻- 큰따옴표도 사용 가능:
"ship.xlsx" - 시작하는 따옴표와 끝나는 따옴표는 같아야 함
데이터를 표로 정리하기
- 행(row)
- 표에서 가로 방향 한 줄
- 하나의 사례
- 열(column)
- 표에서 세로 방향 한 줄
- 하나의 변수
| 열 | column | 변수 | |
|---|---|---|---|
| 행 | |||
| row | |||
| 사례 |
불러온 데이터의 상위/하위 행 확인
- 전체 데이터를 다 보는 대신 앞과 뒤의 일부 데이터만 빠르게 훑어볼 수 있음
# 첫 5행 확인
df.head()
# 마지막 3행 확인
df.tail(3)
메소드
- 메소드(method): 특정 데이터나 객체가 가지고 있는 전용 함수
df.head():df데이터 프레임에게 앞부분을 보여 달라고 요청- 실제로는
pd.DataFrame.head(df)가 실행됨 - 데이터의 종류(자료형)에 따라 메소드가 미리 정의되어 있음
df의 자료형이pd.DataFrame이기 때문에 그에 맞는 메소드가 자동으로 선택
변수의 종류
- 연속형 변수(continuous variable): 연속적인 수치
- 간격이 일정하고 덧셈, 뺄셈 등의 계산이 의미가 있음
- 예: 무게, 나이, 시간, 선박 총톤수(GT)
- 범주형 변수(categorical variable): 종류, 이름 등에 해당
- 숫자로 표시하더라도 양적인 개념이 아님
- 덧셈 등 대부분의 연산이 의미가 없음
- 순서가 있을 수도 있으나, 간격이 일정하지 않음
- 예: 주거 형태, 고향, 선종(컨테이너선, 벌크선 등)