데이터사이언스와 판다스 개요
데이터 과학자는 전통적으로 테이블 형태(2차원 행렬) 데이터를 선호합니다. 행과 열로 각 요소에 편리하게 접근할 수 있기 때문이죠. 엑셀이 그 대표 도구지만, 대용량·자동화·재현성 앞에서는 한계가 있습니다. 파이썬의 pandas 는 이 한계를 정면으로 해결합니다.
1. 왜 판다스인가
1.1 엑셀의 한계
- 수십만 행을 넘기면 굼떠진다
- 프로그래밍 가능한 재현성이 떨어진다 (클릭 기반)
- 데이터 정제 · 조인 · 집계를 스크립트로 자동화하기 어렵다
1.2 판다스의 강점
- NumPy 기반 → 처리 속도 빠름
- 행과 열로 잘 구조화된 DataFrame 제공
- 집계 · 결합 · 시각화까지 한 줄로 가능
- matplotlib 와 결합되어
df.plot()한 줄 시각화
2. 수업에서 다루는 두 축
2.1 판다스 실무 (교재 6장, 19개 절)
1차원 Series → 2차원 DataFrame → CSV 읽기 → 인덱싱 → 정제 → 집계 → 재구조화 → 결합 → 시각화.
2.2 속성 간 관계 분석 ⭐
개별 변수의 분포를 넘어 변수 사이의 관계를 본다. 데이터사이언스의 시작점.
- 공분산 (Covariance) — 두 변수가 함께 움직이는 경향
- 피어슨 상관계수 (Pearson correlation coefficient) — 스케일을 제거한 표준화 버전
- 상관행렬 (Correlation Matrix) — 모든 쌍을 한 행렬로
3. NumPy vs Pandas 한눈에
| 측면 | NumPy ndarray | Pandas Series / DataFrame |
|---|---|---|
| 차원 | 다차원 | 1D (Series) / 2D (DataFrame) |
| 인덱스 레이블 | 없음 (정수 위치만) | 이름 있는 인덱스 · 컬럼 |
| 자료형 혼합 | 단일 dtype | 열마다 다른 dtype 가능 |
| 결손값 | 직접 처리 | NaN + 전용 함수 (isna, dropna, fillna) |
| 읽기 | np.loadtxt, np.genfromtxt | pd.read_csv, pd.read_excel 등 |
4. 학습 흐름
📐 수학 페이지, 🐍 파이썬 실무 페이지, 📊 응용 — 표시로 구분.
PART 1 · 🐍 판다스 실무
자료구조 → 입출력 → 분석 → 그룹핑
Series/DataFrame, loc/iloc, describe, groupby, pivot, merge
PART 2 · 📐→🐍 통계
기술통계 → 상관행렬
편차/분산/공분산 (수학) → df.corr() (파이썬)
PART 3 · 📊 ML 기초
머신러닝 입문
T/P/E, 지도/비지도/강화, 회귀/분류
PART 4 · 📐 회귀 수학
미분 → 경사 하강법
편미분/그래디언트, w·b 손계산 ⭐ 시험 출제
PART 5 · 🐍 회귀 실무
사이킷런 → 다항/규제
LinearRegression, train_test_split, Ridge/Lasso
PART 6 · 🎯 시험대비
종합 문제집
12개 섹션, 80+ 문제
📝 Checkpoint
Quiz
다음 중 판다스 DataFrame의 특징이 아닌 것은?
Quiz