16 weeks · 2026학년도 2학기

강의 계획

16주 강의 일정과 주차별 주제입니다.

  1. 01

    빅데이터란 무엇인가

    now

    빅데이터의 정의와 특성(Volume·Velocity·Variety 등), 등장 배경, 활용 사례, 데이터 기반 의사결정

  2. 02

    빅데이터 파이프라인

    수집→저장→처리→분석→시각화 전체 그림, 배치 vs 스트리밍, 대표 아키텍처, 도구 지도(landscape)

  3. 03

    Python 데이터 처리 기초

    Pandas로 데이터 불러오기·집계 개념, 데이터프레임 사고방식, 기본 실습

  4. 04

    데이터 수집

    파일/DB/API/로그로 데이터를 모으는 원리, 메시지 큐, 스트림 개념 소개

  5. 05

    분산 저장의 이해

    왜 분산 저장인가, HDFS 구조와 동작 원리, 클라우드 스토리지, 파일 포맷(CSV·JSON·Parquet), 데이터 레이크 개념

  6. 06

    분산 처리 기초

    MapReduce의 map/shuffle/reduce, Hadoop 생태계와 YARN 개념, 간단한 예제

  7. 07

    Spark 입문

    Spark 등장 배경, RDD와 DataFrame 개념, PySpark 기본 동작 확인

  8. 08

    중간고사 (이론 시험)

    시험

    빅데이터 개념·파이프라인·도구 원리에 대한 필기 이론 시험

  9. 09

    Spark로 데이터 처리

    DataFrame·Spark SQL 개념, 필터·집계·조인의 원리, 기본 예제 실습

  10. 10

    Spark 심화

    분산 처리 성능 개념(파티셔닝·캐싱), 대용량 처리 시 고려사항 — 원리 중심

  11. 11

    웨어하우스·레이크하우스와 SQL 분석

    스키마 설계, 배치 ETL, 분석형 SQL, 레이크하우스·오픈 테이블 포맷(Iceberg/Delta) 개념

  12. 12

    Spark, HDFS 연동

    Spark로 HDFS 경로의 데이터를 읽어와 처리하기, 저장소와 처리 엔진을 잇는 첫 단계 실습

  13. 13

    오브젝트 스토리지(S3) 연결

    S3 개념·경로·인증 방식, spark.read로 S3 데이터 읽어 같은 처리 실습

  14. 14

    데이터 소스 통합·비교

    로컬/HDFS/S3를 동일한 코드로 읽어 비교, DuckDB·Polars로 가볍게 확인, 전체 파이프라인

  15. 15

    종합 정리 및 발표

    수집→저장(로컬/HDFS/S3)→처리(Spark)→분석 전체 파이프라인 종합

  16. 16

    기말고사

    시험

    전체 내용 종합 평가