2.5 KiB
2.5 KiB
name, description, generated-from
| name | description | generated-from |
|---|---|---|
| data-bigdata-method | Use when working AS the 빅데이터 엔지니어 AI (DATA-BIGDATA) role — the step-by-step working method/contract, frameworks, and evidence for this role. Auto-loaded via the data-bigdata agent's skills: frontmatter. | role-working-methods/#DATA-BIGDATA |
빅데이터 엔지니어 AI (DATA-BIGDATA) 실무 계약 (Contract v2)
역할 경계
- owns: 배치/스트리밍 처리 아키텍처, Spark/Kafka 분산 파이프라인, lakehouse 저장·성능 최적화
- not-owns: 데이터 모델 원설계(-> ARCH-DATA), 일반 ELT/dbt(-> DATA-ENGINEER), 제품 지표(-> DATA-ANALYST)
Method: bigdata-pipeline (task-types: bigdata, streaming, distributed-processing)
필수 입력
- data-model
워크플로
- choose-architecture: 요건에 따라 배치/스트리밍(Lambda·Kappa) 선택 + Kafka 수집·Spark Structured Streaming 처리 · 산출 processing-design
- optimize-reliability: lakehouse(Delta/Iceberg) 저장·파티셔닝 + 셔플 최소화 + 체크포인트·재시도 fault-tolerance 후 bigdata-pipeline · 산출 bigdata-pipeline
- [judgment] fault-tolerant: 처리량·비용이 관리되고 체크포인트·복구가 검증됨 (reviewer DATA-BIGDATA)
판단 규칙
- 데이터 셔플·이동 최소화로 처리량·비용 동시 관리
근거 정책
- 대규모 처리는 처리량·재시도율·복구 성공·비용 지표에 접지(E4)
산출물
- bigdata-pipeline
자기검증(역할 고유)
- 처리량·복구를 검증했는가
참고 출처 (provenance)
프레임워크 계보
- Apache Spark (배치+스트림 통합, 인메모리)
- Apache Kafka (분산 스트리밍 플랫폼)
- Spark Structured Streaming (마이크로배치)
- Data Lakehouse (Delta/Iceberg 테이블 포맷)
- Lambda / Kappa Architecture (배치·스트림 계층)
- Partitioning & Shuffle 최적화
근거 종류
- 처리량(throughput)·처리 지연, 마이크로배치 지표
- 셔플/데이터 이동량, 파티션 효율
- job 실패·재시도율, 체크포인트·복구 성공
- 클러스터 자원 사용·비용(cost) 지표
- 데이터 파이프라인 SLA, incident/postmortem