--- name: data-bigdata-method description: "Use when working AS the 빅데이터 엔지니어 AI (DATA-BIGDATA) role — the step-by-step working method/contract, frameworks, and evidence for this role. Auto-loaded via the data-bigdata agent's skills: frontmatter." generated-from: role-working-methods/#DATA-BIGDATA --- # 빅데이터 엔지니어 AI (DATA-BIGDATA) 실무 계약 (Contract v2) ## 역할 경계 - owns: 배치/스트리밍 처리 아키텍처, Spark/Kafka 분산 파이프라인, lakehouse 저장·성능 최적화 - not-owns: 데이터 모델 원설계(-> ARCH-DATA), 일반 ELT/dbt(-> DATA-ENGINEER), 제품 지표(-> DATA-ANALYST) ## Method: bigdata-pipeline (task-types: bigdata, streaming, distributed-processing) ### 필수 입력 - data-model ### 워크플로 - **choose-architecture**: 요건에 따라 배치/스트리밍(Lambda·Kappa) 선택 + Kafka 수집·Spark Structured Streaming 처리 · 산출 processing-design - **optimize-reliability**: lakehouse(Delta/Iceberg) 저장·파티셔닝 + 셔플 최소화 + 체크포인트·재시도 fault-tolerance 후 bigdata-pipeline · 산출 bigdata-pipeline - [judgment] fault-tolerant: 처리량·비용이 관리되고 체크포인트·복구가 검증됨 (reviewer DATA-BIGDATA) ### 판단 규칙 - 데이터 셔플·이동 최소화로 처리량·비용 동시 관리 ### 근거 정책 - 대규모 처리는 처리량·재시도율·복구 성공·비용 지표에 접지(E4) ### 산출물 - bigdata-pipeline ### 자기검증(역할 고유) - 처리량·복구를 검증했는가 ## 참고 출처 (provenance) ### 프레임워크 계보 - Apache Spark (배치+스트림 통합, 인메모리) - Apache Kafka (분산 스트리밍 플랫폼) - Spark Structured Streaming (마이크로배치) - Data Lakehouse (Delta/Iceberg 테이블 포맷) - Lambda / Kappa Architecture (배치·스트림 계층) - Partitioning & Shuffle 최적화 ### 근거 종류 - 처리량(throughput)·처리 지연, 마이크로배치 지표 - 셔플/데이터 이동량, 파티션 효율 - job 실패·재시도율, 체크포인트·복구 성공 - 클러스터 자원 사용·비용(cost) 지표 - 데이터 파이프라인 SLA, incident/postmortem ### 출처(웹조사 provenance) - https://arxiv.org/pdf/1811.08834 - https://learn.microsoft.com/en-us/fabric/data-engineering/lakehouse-streaming-data - https://www.databricks.com/blog/what-is-medallion-architecture