데이터사이언스와 판다스 개요

데이터 과학자는 전통적으로 테이블 형태(2차원 행렬) 데이터를 선호합니다. 행과 열로 각 요소에 편리하게 접근할 수 있기 때문이죠. 엑셀이 그 대표 도구지만, 대용량·자동화·재현성 앞에서는 한계가 있습니다. 파이썬의 pandas 는 이 한계를 정면으로 해결합니다.


1. 왜 판다스인가

1.1 엑셀의 한계

  • 수십만 행을 넘기면 굼떠진다
  • 프로그래밍 가능한 재현성이 떨어진다 (클릭 기반)
  • 데이터 정제 · 조인 · 집계를 스크립트로 자동화하기 어렵다

1.2 판다스의 강점

  • NumPy 기반 → 처리 속도 빠름
  • 행과 열로 잘 구조화된 DataFrame 제공
  • 집계 · 결합 · 시각화까지 한 줄로 가능
  • matplotlib 와 결합되어 df.plot() 한 줄 시각화

2. 수업에서 다루는 두 축

2.1 판다스 실무 (교재 6장, 19개 절)

1차원 Series → 2차원 DataFrame → CSV 읽기 → 인덱싱 → 정제 → 집계 → 재구조화 → 결합 → 시각화.

2.2 속성 간 관계 분석 ⭐

개별 변수의 분포를 넘어 변수 사이의 관계를 본다. 데이터사이언스의 시작점.

  • 공분산 (Covariance) — 두 변수가 함께 움직이는 경향
  • 피어슨 상관계수 (Pearson correlation coefficient) — 스케일을 제거한 표준화 버전
  • 상관행렬 (Correlation Matrix) — 모든 쌍을 한 행렬로

3. NumPy vs Pandas 한눈에

측면NumPy ndarrayPandas Series / DataFrame
차원다차원1D (Series) / 2D (DataFrame)
인덱스 레이블없음 (정수 위치만)이름 있는 인덱스 · 컬럼
자료형 혼합단일 dtype열마다 다른 dtype 가능
결손값직접 처리NaN + 전용 함수 (isna, dropna, fillna)
읽기np.loadtxt, np.genfromtxtpd.read_csv, pd.read_excel

4. 학습 흐름

📐 수학 페이지, 🐍 파이썬 실무 페이지, 📊 응용 — 표시로 구분.

PART 1 · 🐍 판다스 실무
자료구조 → 입출력 → 분석 → 그룹핑
Series/DataFrame, loc/iloc, describe, groupby, pivot, merge
PART 2 · 📐→🐍 통계
기술통계 → 상관행렬
편차/분산/공분산 (수학) → df.corr() (파이썬)
PART 3 · 📊 ML 기초
머신러닝 입문
T/P/E, 지도/비지도/강화, 회귀/분류
PART 4 · 📐 회귀 수학
미분 → 경사 하강법
편미분/그래디언트, w·b 손계산 ⭐ 시험 출제
PART 5 · 🐍 회귀 실무
사이킷런 → 다항/규제
LinearRegression, train_test_split, Ridge/Lasso
PART 6 · 🎯 시험대비
종합 문제집
12개 섹션, 80+ 문제

📝 Checkpoint

Quiz

다음 중 판다스 DataFrame의 특징이 아닌 것은?

Quiz

NumPy의 ndarray와 비교해 Pandas DataFrame이 갖는 가장 큰 차별점은?


🔗 다음 학습