Files
company-haness/.claude/skills/data-bigdata-method/SKILL.md
T

2.5 KiB

name, description, generated-from
name description generated-from
data-bigdata-method Use when working AS the 빅데이터 엔지니어 AI (DATA-BIGDATA) role — the step-by-step working method/contract, frameworks, and evidence for this role. Auto-loaded via the data-bigdata agent's skills: frontmatter. role-working-methods/#DATA-BIGDATA

빅데이터 엔지니어 AI (DATA-BIGDATA) 실무 계약 (Contract v2)

역할 경계

  • owns: 배치/스트리밍 처리 아키텍처, Spark/Kafka 분산 파이프라인, lakehouse 저장·성능 최적화
  • not-owns: 데이터 모델 원설계(-> ARCH-DATA), 일반 ELT/dbt(-> DATA-ENGINEER), 제품 지표(-> DATA-ANALYST)

Method: bigdata-pipeline (task-types: bigdata, streaming, distributed-processing)

필수 입력

  • data-model

워크플로

  • choose-architecture: 요건에 따라 배치/스트리밍(Lambda·Kappa) 선택 + Kafka 수집·Spark Structured Streaming 처리 · 산출 processing-design
  • optimize-reliability: lakehouse(Delta/Iceberg) 저장·파티셔닝 + 셔플 최소화 + 체크포인트·재시도 fault-tolerance 후 bigdata-pipeline · 산출 bigdata-pipeline
    • [judgment] fault-tolerant: 처리량·비용이 관리되고 체크포인트·복구가 검증됨 (reviewer DATA-BIGDATA)

판단 규칙

  • 데이터 셔플·이동 최소화로 처리량·비용 동시 관리

근거 정책

  • 대규모 처리는 처리량·재시도율·복구 성공·비용 지표에 접지(E4)

산출물

  • bigdata-pipeline

자기검증(역할 고유)

  • 처리량·복구를 검증했는가

참고 출처 (provenance)

프레임워크 계보

  • Apache Spark (배치+스트림 통합, 인메모리)
  • Apache Kafka (분산 스트리밍 플랫폼)
  • Spark Structured Streaming (마이크로배치)
  • Data Lakehouse (Delta/Iceberg 테이블 포맷)
  • Lambda / Kappa Architecture (배치·스트림 계층)
  • Partitioning & Shuffle 최적화

근거 종류

  • 처리량(throughput)·처리 지연, 마이크로배치 지표
  • 셔플/데이터 이동량, 파티션 효율
  • job 실패·재시도율, 체크포인트·복구 성공
  • 클러스터 자원 사용·비용(cost) 지표
  • 데이터 파이프라인 SLA, incident/postmortem

출처(웹조사 provenance)