학습 자료 & 로드맵
수업을 따라가기 위해 필요한 기초 지식을 단계별로 정리했습니다. 순서대로 하나씩 보면 됩니다.
- 00환경 세팅
Python, VS Code, Jupyter/Colab, Git — 수업 실습에 필요한 도구를 준비합니다.
W01 - 01Python 기초 튜토리얼
변수·자료구조·제어문·함수·파일 입출력 등 데이터 처리에 필요한 Python 핵심 문법.
W03 - 02Pandas 데이터 처리
DataFrame 사고방식, 데이터 불러오기·필터·집계·조인 — 이후 Spark DataFrame과 1:1로 대응됩니다.
W03 - 03빅데이터 개념 & 파이프라인
3V(5V), 등장 배경, 수집→저장→처리→분석→시각화 파이프라인, 배치 vs 스트리밍, 도구 지도.
W01W02 - 04데이터 수집
파일·DB·API·로그에서 데이터를 모으는 원리, 메시지 큐(Kafka)와 스트림 개념.
W04 - 05분산 저장 — HDFS, 클라우드, 파일 포맷
왜 분산 저장인가, HDFS 구조(NameNode/DataNode/블록/복제), 오브젝트 스토리지, CSV·JSON·Parquet 비교, 데이터 레이크.
W05 - 06MapReduce · Hadoop · YARN
map/shuffle/reduce의 동작 원리, Hadoop 생태계, YARN의 자원 관리 개념, Python으로 흉내 내는 워드카운트.
W06 - 07Spark 입문 · 처리 · 심화
Spark 등장 배경, RDD vs DataFrame, PySpark 설치와 첫 실행, DataFrame·Spark SQL, 파티셔닝·캐싱 등 성능 개념.
W07W09W10 - 08웨어하우스 · 레이크하우스 · SQL 분석
스키마 설계(스타 스키마), 배치 ETL, 분석형 SQL(윈도우 함수), 레이크하우스와 오픈 테이블 포맷(Iceberg/Delta).
W11 - 09Spark + HDFS / S3 연동
저장소와 처리 엔진을 잇기 — HDFS 경로 읽기, S3 인증(s3a)과 경로, MinIO로 로컬 S3 실습.
W12W13 - 10DuckDB · Polars — 가볍게 확인하기
클러스터 없이 노트북에서 수 GB를 처리하는 도구. Spark 결과를 빠르게 검증하고, 로컬/S3 Parquet을 SQL로 바로 조회.
W14 - 11시험 대비 & 종합 정리
중간고사(이론)·기말고사 범위 정리, 핵심 개념 체크리스트, 전체 파이프라인 한 장 요약.
W08W15W16