Roadmap · 12 steps

학습 자료 & 로드맵

수업을 따라가기 위해 필요한 기초 지식을 단계별로 정리했습니다. 순서대로 하나씩 보면 됩니다.

  1. 00
    환경 세팅

    Python, VS Code, Jupyter/Colab, Git — 수업 실습에 필요한 도구를 준비합니다.

    W01
  2. 01
    Python 기초 튜토리얼

    변수·자료구조·제어문·함수·파일 입출력 등 데이터 처리에 필요한 Python 핵심 문법.

    W03
  3. 02
    Pandas 데이터 처리

    DataFrame 사고방식, 데이터 불러오기·필터·집계·조인 — 이후 Spark DataFrame과 1:1로 대응됩니다.

    W03
  4. 03
    빅데이터 개념 & 파이프라인

    3V(5V), 등장 배경, 수집→저장→처리→분석→시각화 파이프라인, 배치 vs 스트리밍, 도구 지도.

    W01W02
  5. 04
    데이터 수집

    파일·DB·API·로그에서 데이터를 모으는 원리, 메시지 큐(Kafka)와 스트림 개념.

    W04
  6. 05
    분산 저장 — HDFS, 클라우드, 파일 포맷

    왜 분산 저장인가, HDFS 구조(NameNode/DataNode/블록/복제), 오브젝트 스토리지, CSV·JSON·Parquet 비교, 데이터 레이크.

    W05
  7. 06
    MapReduce · Hadoop · YARN

    map/shuffle/reduce의 동작 원리, Hadoop 생태계, YARN의 자원 관리 개념, Python으로 흉내 내는 워드카운트.

    W06
  8. 07
    Spark 입문 · 처리 · 심화

    Spark 등장 배경, RDD vs DataFrame, PySpark 설치와 첫 실행, DataFrame·Spark SQL, 파티셔닝·캐싱 등 성능 개념.

    W07W09W10
  9. 08
    웨어하우스 · 레이크하우스 · SQL 분석

    스키마 설계(스타 스키마), 배치 ETL, 분석형 SQL(윈도우 함수), 레이크하우스와 오픈 테이블 포맷(Iceberg/Delta).

    W11
  10. 09
    Spark + HDFS / S3 연동

    저장소와 처리 엔진을 잇기 — HDFS 경로 읽기, S3 인증(s3a)과 경로, MinIO로 로컬 S3 실습.

    W12W13
  11. 10
    DuckDB · Polars — 가볍게 확인하기

    클러스터 없이 노트북에서 수 GB를 처리하는 도구. Spark 결과를 빠르게 검증하고, 로컬/S3 Parquet을 SQL로 바로 조회.

    W14
  12. 11
    시험 대비 & 종합 정리

    중간고사(이론)·기말고사 범위 정리, 핵심 개념 체크리스트, 전체 파이프라인 한 장 요약.

    W08W15W16