logo

데이터 보기

라이브러리 설치

  • pip: 파이썬 라이브러리를 설치하고 관리하는 기본 도구
  • pandas: 파이썬에서 표 형태 데이터를 다루는 대표 라이브러리
    • 엑셀 표처럼 행과 열로 된 데이터를 불러오고 정리하고 계산하는 데 사용
  • openpyxl: 엑셀 파일을 읽고 쓰기 위한 보조 라이브러리
pip install pandas openpyxl

라이브러리 임포트

  • 임포트(import): 설치된 라이브러리를 현재 코드에서 사용할 수 있게 불러오기
import pandas
  • as pd: pandas를 짧은 이름인 pd로 사용하겠다는 약속
import pandas as pd

엑셀 파일 불러오기

  • pandas를 이용하면 로컬에 있는 엑셀(.xlsx) 자료를 손쉽게 파이썬으로 가져올 수 있음
# 선박 데이터를 엑셀 파일에서 읽어오기
df = pd.read_excel('ship.xlsx')
  • .: "~의"에 해당
    • pd.read_excel(): pd라는 라이브러리 안의 read_excel() 함수 사용
  • df 테이블은 데이터 프레임(DataFrame)이라는 2차원 자료구조
  • 선박 제원 및 운항 데이터: 선명, 건조연도, 선박의 길이(Length) 및 폭(Beam), 최대 속도 등의 변수가 포함

문자열

  • 'ship.xlsx': 파일 이름을 글자 그대로 전달한다는 뜻
  • 큰따옴표도 사용 가능: "ship.xlsx"
  • 시작하는 따옴표와 끝나는 따옴표는 같아야 함

데이터를 표로 정리하기

  • 행(row)
    • 표에서 가로 방향 한 줄
    • 하나의 사례
  • 열(column)
    • 표에서 세로 방향 한 줄
    • 하나의 변수
column변수
row
사례

불러온 데이터의 상위/하위 행 확인

  • 전체 데이터를 다 보는 대신 앞과 뒤의 일부 데이터만 빠르게 훑어볼 수 있음
# 첫 5행 확인
df.head()

# 마지막 3행 확인
df.tail(3)

메소드

  • 메소드(method): 특정 데이터나 객체가 가지고 있는 전용 함수
  • df.head(): df 데이터 프레임에게 앞부분을 보여 달라고 요청
  • 실제로는 pd.DataFrame.head(df)가 실행됨
  • 데이터의 종류(자료형)에 따라 메소드가 미리 정의되어 있음
  • df의 자료형이 pd.DataFrame이기 때문에 그에 맞는 메소드가 자동으로 선택

변수의 종류

  • 연속형 변수(continuous variable): 연속적인 수치
    • 간격이 일정하고 덧셈, 뺄셈 등의 계산이 의미가 있음
    • 예: 무게, 나이, 시간, 선박 총톤수(GT)
  • 범주형 변수(categorical variable): 종류, 이름 등에 해당
    • 숫자로 표시하더라도 양적인 개념이 아님
    • 덧셈 등 대부분의 연산이 의미가 없음
    • 순서가 있을 수도 있으나, 간격이 일정하지 않음
    • 예: 주거 형태, 고향, 선종(컨테이너선, 벌크선 등)
Previous
Python 데이터 포맷