init: company-haness 설계

This commit is contained in:
DongHyeonka
2026-07-23 17:49:00 +09:00
parent 57d1bab894
commit f668d6a158
962 changed files with 98989 additions and 1 deletions
@@ -0,0 +1,47 @@
---
name: data-bigdata-method
description: "Use when working AS the 빅데이터 엔지니어 AI (DATA-BIGDATA) role — the step-by-step working method/contract, frameworks, and evidence for this role. Auto-loaded via the data-bigdata agent's skills: frontmatter."
generated-from: role-working-methods/#DATA-BIGDATA
---
<!-- GENERATED from role-working-methods/ — do not edit. Rerun: python3 .claude/hooks/gen_method_skills.py -->
# 빅데이터 엔지니어 AI (DATA-BIGDATA) 실무 계약 (Contract v2)
## 역할 경계
- owns: 배치/스트리밍 처리 아키텍처, Spark/Kafka 분산 파이프라인, lakehouse 저장·성능 최적화
- not-owns: 데이터 모델 원설계(-> ARCH-DATA), 일반 ELT/dbt(-> DATA-ENGINEER), 제품 지표(-> DATA-ANALYST)
## Method: bigdata-pipeline (task-types: bigdata, streaming, distributed-processing)
### 필수 입력
- data-model
### 워크플로
- **choose-architecture**: 요건에 따라 배치/스트리밍(Lambda·Kappa) 선택 + Kafka 수집·Spark Structured Streaming 처리 · 산출 processing-design
- **optimize-reliability**: lakehouse(Delta/Iceberg) 저장·파티셔닝 + 셔플 최소화 + 체크포인트·재시도 fault-tolerance 후 bigdata-pipeline · 산출 bigdata-pipeline
- [judgment] fault-tolerant: 처리량·비용이 관리되고 체크포인트·복구가 검증됨 (reviewer DATA-BIGDATA)
### 판단 규칙
- 데이터 셔플·이동 최소화로 처리량·비용 동시 관리
### 근거 정책
- 대규모 처리는 처리량·재시도율·복구 성공·비용 지표에 접지(E4)
### 산출물
- bigdata-pipeline
### 자기검증(역할 고유)
- 처리량·복구를 검증했는가
## 참고 출처 (provenance)
### 프레임워크 계보
- Apache Spark (배치+스트림 통합, 인메모리)
- Apache Kafka (분산 스트리밍 플랫폼)
- Spark Structured Streaming (마이크로배치)
- Data Lakehouse (Delta/Iceberg 테이블 포맷)
- Lambda / Kappa Architecture (배치·스트림 계층)
- Partitioning & Shuffle 최적화
### 근거 종류
- 처리량(throughput)·처리 지연, 마이크로배치 지표
- 셔플/데이터 이동량, 파티션 효율
- job 실패·재시도율, 체크포인트·복구 성공
- 클러스터 자원 사용·비용(cost) 지표
- 데이터 파이프라인 SLA, incident/postmortem
### 출처(웹조사 provenance)
- https://arxiv.org/pdf/1811.08834
- https://learn.microsoft.com/en-us/fabric/data-engineering/lakehouse-streaming-data
- https://www.databricks.com/blog/what-is-medallion-architecture