강의 계획
16주 강의 일정과 주차별 주제입니다.
- 01
빅데이터란 무엇인가
now빅데이터의 정의와 특성(Volume·Velocity·Variety 등), 등장 배경, 활용 사례, 데이터 기반 의사결정
- 02
빅데이터 파이프라인
수집→저장→처리→분석→시각화 전체 그림, 배치 vs 스트리밍, 대표 아키텍처, 도구 지도(landscape)
- 03
Python 데이터 처리 기초
Pandas로 데이터 불러오기·집계 개념, 데이터프레임 사고방식, 기본 실습
- 04
데이터 수집
파일/DB/API/로그로 데이터를 모으는 원리, 메시지 큐, 스트림 개념 소개
- 05
분산 저장의 이해
왜 분산 저장인가, HDFS 구조와 동작 원리, 클라우드 스토리지, 파일 포맷(CSV·JSON·Parquet), 데이터 레이크 개념
- 06
분산 처리 기초
MapReduce의 map/shuffle/reduce, Hadoop 생태계와 YARN 개념, 간단한 예제
- 07
Spark 입문
Spark 등장 배경, RDD와 DataFrame 개념, PySpark 기본 동작 확인
- 08
중간고사 (이론 시험)
시험빅데이터 개념·파이프라인·도구 원리에 대한 필기 이론 시험
- 09
Spark로 데이터 처리
DataFrame·Spark SQL 개념, 필터·집계·조인의 원리, 기본 예제 실습
- 10
Spark 심화
분산 처리 성능 개념(파티셔닝·캐싱), 대용량 처리 시 고려사항 — 원리 중심
- 11
웨어하우스·레이크하우스와 SQL 분석
스키마 설계, 배치 ETL, 분석형 SQL, 레이크하우스·오픈 테이블 포맷(Iceberg/Delta) 개념
- 12
Spark, HDFS 연동
Spark로 HDFS 경로의 데이터를 읽어와 처리하기, 저장소와 처리 엔진을 잇는 첫 단계 실습
- 13
오브젝트 스토리지(S3) 연결
S3 개념·경로·인증 방식, spark.read로 S3 데이터 읽어 같은 처리 실습
- 14
데이터 소스 통합·비교
로컬/HDFS/S3를 동일한 코드로 읽어 비교, DuckDB·Polars로 가볍게 확인, 전체 파이프라인
- 15
종합 정리 및 발표
수집→저장(로컬/HDFS/S3)→처리(Spark)→분석 전체 파이프라인 종합
- 16
기말고사
시험전체 내용 종합 평가