스페셜 브리핑/AI-Ready Data

데이터를 믿게 만드는 메타데이터 출처 계보 설계

반응형
AI Daily Special · Part 3 · 14/36

데이터를 믿게 만드는 메타데이터 출처 계보 설계

자산 메타데이터 근원 출처 변환 계보를 구분하고 AI 결과를 역추적할 핵심 계보 지도를 설계할 수 있다.

메타데이터는 설명이고 출처와 계보는 연결된 역사다

13회에서 다온커머스가 보유 자산과 소유자 접근 상태를 최소 인벤토리에 기록했다. 그러나 주문 매출 값이 맞아 보여도 어떤 시스템의 어느 시점 데이터를 어떤 규칙으로 바꿨는지 설명할 수 없다면 AI 입력으로 신뢰하기 어렵다. 메타데이터는 의미 형식 시간 소유 품질처럼 데이터를 설명하는 데이터다. 출처(Provenance)는 생성 수집의 근원과 책임에, 데이터 계보(Data Lineage)는 시스템과 변환 단계를 지난 흐름에 초점을 둔다. 세 개념은 겹치지만 같지 않다. 모든 필드를 추적하기보다 중요한 AI 결정에서 원인과 책임을 거슬러 올라갈 만큼 식별자 버전 변환 실행 증거를 연결하자.

ISO/IEC 11179-1:2023 공개 개요는 메타데이터를 데이터에 대한 설명으로 다룬다. [S1] 제목 스키마 단위 갱신 시각 소유자 민감도 품질 상태 같은 설명은 자산을 이해하게 하지만 그 자체로 변환의 인과 경로를 모두 보여주지는 않는다. 메타데이터 레코드와 실제 데이터 버전의 식별자를 먼저 연결해야 이후 기록이 같은 대상을 가리킨다.

W3C PROV-O는 출처 기록의 출발점을 개체(Entity), 활동(Activity), 주체(Agent)로 설명한다. 활동이 개체를 사용하고 다른 개체를 생성하며 주체가 활동에 책임을 갖는 관계를 연결하면 출처 사슬이 된다. `wasDerivedFrom`은 한 개체가 다른 개체에서 변환됐음을 표현한다. [S2] W3C PROV Primer는 이런 기록이 데이터의 의미 있는 사용, 신뢰 판단, 권리 확인, 절차 검증과 재현에 쓰일 수 있다고 설명한다. [S3]

실무에서는 출처를 원천과 책임에, 계보를 파이프라인 흐름에 더 좁게 쓰기도 한다. 모든 표준과 제품이 동일하게 나누는 공식 정의는 아니다. W3C DCAT v3는 카탈로그 메타데이터에 버전 수정일 체크섬과 PROV-O 관계를 결합할 수 있게 한다. [S4] 이름보다 답할 질문과 증거를 확인해야 한다.

계보 요소대표 대상필수 증거확인할 위험
개체 Entity원천·중간·출력 데이터셋고유 ID·버전·스키마·체크섬복제본과 실제 원천 혼동
활동 Activity수집·정제·집계·학습작업명·실행 ID·코드·설정·시간선언 경로와 실제 실행 차이
주체 AgentOwner·Steward·서비스 계정책임 역할·승인·운영 팀개인정보나 비밀값 기록 금지
증거 Evidence로그·품질 검사·배포 기록성공 상태·입출력 버전·보존 위치로그 존재와 통제 수행 혼동
공통 식별자

메타데이터 레코드에 고유 자산 ID와 버전을 두고 출처는 생성 조건과 책임을 계보는 입력 변환 출력의 연결을 기록한다. 셋이 같은 식별자를 공유해야 검색 화면과 실행 증거가 어긋나지 않는다.

핵심 계보 지도는 실행 증거로 시작한다

계보의 최소 노드는 입력 데이터셋, 변환 작업, 출력 데이터셋이다. 여기에 실행 ID, 시작 종료 시각, 코드 또는 쿼리 버전, 입력 출력 데이터 버전, 핵심 매개변수, 실행 주체와 성공 실패 상태를 붙인다. ‘테이블 A가 테이블 B로 간다’는 화살표만으로는 어느 실행이 어떤 규칙을 사용했는지 재현하거나 오류가 처음 생긴 지점을 찾기 어렵다.

OpenLineage의 현재 문서는 Dataset, Job, Run을 핵심 객체로 둔다. 정적 스키마와 문서는 DatasetEvent와 JobEvent에, 실행 상태와 입출력은 RunEvent에 기록할 수 있다. [S5] Facet은 스키마 데이터 버전 품질 측정 코드 위치를 확장한다. [S6] 구현 가능한 공개 사양의 예이지 법적 의무는 아니다.

설계 계보와 관측 계보도 구분한다. 선언된 입출력은 변경 전 영향 범위를 보여주지만 실제 조건 분기와 임시 파일은 다를 수 있다. 실행 이벤트는 실제 경로를 보여줘도 미계측 수작업을 놓친다. 두 기록의 불일치를 경고하고 오류 비용이 큰 경계부터 실행 증거를 필수화한다.

그래프보다 증거

좋은 계보는 예쁜 그래프가 아니라 특정 실행을 다시 설명하는 증거 묶음이다. 노드와 화살표에 버전 시간 코드 실행 ID 책임 주체가 연결되지 않으면 영향 분석용 지도에 머문다.

추적 단위는 의사결정 위험에 맞춘다

모든 열의 모든 수식을 추적하면 비용과 노이즈가 커진다. 1단계는 데이터셋 수준의 원천 변환 출력 소비 모델을 잇는다. 2단계는 예측 목표 개인정보 가격 재고 정책 시행일처럼 오류 비용이 큰 필드만 열 수준으로 확장한다. 3단계는 학습 스냅숏과 평가 결과에 데이터 코드 설정 환경 버전을 묶는다.

자동 수집은 오케스트레이터 쿼리 엔진 변환 도구의 이벤트와 로그에서 시작한다. 수작업 CSV와 스프레드시트, 동적 SQL, 외부 SaaS 변환은 단절점이 되기 쉽다. 단절에는 `UNKNOWN`, `MANUAL`, `UNVERIFIED` 상태와 책임자 기한을 붙인다. 완전성은 전체 노드 수보다 중요 경로의 추적 가능 비율로 본다.

ISO/IEC 5259-3:2024 공개 개요는 분석과 머신러닝 데이터의 품질을 생애주기 전체에서 계획 유지 개선하는 관리체계를 다룬다. [S7] 계보는 품질 그 자체가 아니라 품질 측정값이 어떤 데이터 버전과 변환 실행에서 나왔는지 연결하는 기반이다. 표준 전문을 검토하지 않은 공개 개요만으로 준수 여부를 판정할 수는 없으며 구체적 보존 기간과 추적 깊이는 사용 목적 위험 규정에 맞춰 정해야 한다.

  1. 1 이벤트 식별변하지 않는 event ID와 사양 버전
  2. 2 실행 식별job 이름 run ID 실제 시작 종료 시각과 상태
  3. 3 입력원천 자산 ID 버전 파티션 또는 스냅숏
  4. 4 출력생성 자산 ID 버전 파티션 또는 스냅숏
  5. 5 변환쿼리 코드 커밋 규칙 설정과 주요 매개변수
  6. 6 책임실행 서비스와 책임 팀 승인된 역할
  7. 7 스키마입출력 필드 자료형과 변경 상태
  8. 8 품질적용 검사 결과 지표 기준과 실패 행동
  9. 9 시간이벤트 시간 처리 시간 적재 시간과 시간대
  10. 10 보호와 보존민감도 접근 정책 로그 보존 기간과 삭제 연결
단절을 상태로 관리

데이터셋 수준으로 전체 경로를 먼저 잇고 고위험 필드와 모델 스냅숏만 깊게 추적한다. 자동 수집이 못 보는 수작업 경로는 삭제하지 말고 미검증 단절로 관리한다.

다온커머스는 수요예측 한 경로를 연결한다

가상 조직 다온커머스는 주문 DB에서 14일 수요예측 특징 데이터까지 한 경로를 그린다고 가정한다. `orders_v3`와 `cancel_events_v2`가 원천 개체이고, 민호가 운영하는 `normalize_order_status` 작업이 취소 반영 규칙을 적용해 `validated_sales_daily_v5`를 만든다. 이어 매장 휴무와 프로모션을 결합한 `build_forecast_features`가 `forecast_features_20260909` 스냅숏을 생성하고 지아의 학습 실행이 이를 사용한다. 이름과 버전은 모두 교육용 가정이다.

메타데이터에는 주문시각과 적재시각, 시간대, SKU와 매장 키, 갱신 주기와 취소 지연 가정을 기록한다. 출처에는 원천 주문 시스템, 수집 커넥터, Owner 서윤, 주문운영 Steward와 수집 목적을 연결한다. 계보에는 입출력 버전, 실행 ID, 코드 커밋, 규칙 설정, 성공 상태와 품질 검사 결과를 붙인다. 비밀값과 원문 개인정보는 넣지 않는다.

예측 오차가 특정 매장에서 급증하면 출력에서 상류로 거슬러 해당 학습 스냅숏, 특징 생성 실행, 일별 판매 집계, 원천 주문과 취소 이벤트를 확인한다. 반대로 취소 규칙을 바꾸기 전에는 하류로 내려가 영향받는 특징셋 모델 보고서와 대시보드를 찾는다. 이 양방향 탐색이 근본 원인 분석과 변경 영향 분석이다. 값 하나의 책임자를 찾는 데 성공했는지도 사용자 테스트로 검증한다.

완료 기준

다온커머스의 완료 기준은 그래프 생성이 아니라 예측 이상 한 건에서 사용한 데이터 버전과 변환 규칙 책임자를 30분 안에 찾고 변경 대상의 하류 소비자를 누락 없이 검토하는 것이다. 30분은 교육용 목표값이다.

계보를 변경과 위험 통제에 연결한다

NIST AI RMF 1.0은 학습 데이터의 출처 유지와 AI 결정이 학습 데이터 부분집합에 어떻게 귀속되는지 지원하는 것이 투명성과 책무성에 도움이 될 수 있다고 설명한다. [S8] NIST AI RMF는 자발적 프레임워크이고 현재 개정 중이므로 법적 의무처럼 표현하지 않는다. 영국 정부의 2026년 핵심 데이터 자산 메타데이터 지침도 데이터 출처를 기록하라는 별도 절을 두지만 적용 범위는 해당 정부 맥락이다. [S9]

EU AI Act의 2026년 7월 27일 통합본 Article 10은 적용 대상 고위험 AI 시스템 제공자의 학습 검증 테스트 데이터 거버넌스에서 데이터 수집 과정과 원천, 주석 라벨링 정제 갱신 보강 집계 같은 준비 작업을 다루도록 규정한다. [S10] 이는 모든 AI 프로젝트에 자동 적용되는 일반 의무가 아니며 시스템 분류 역할 적용 시점 관할을 법률 전문가와 확인해야 한다. 이 글은 법률 자문이 아니다.

스키마 변경이나 품질 실패가 나면 계보로 하류 소비자를 찾아 알림 승인 롤백을 시작한다. 삭제 요구나 라이선스 만료 때 영향 범위를 추적해도 계보만으로 삭제 완료를 증명할 수 없다. 원본 캐시 특징 저장소 모델 아티팩트와 백업의 실행 증거를 확인해야 한다. 중요 경로의 상류 추적 성공률, 실행 증거 연결률, 미검증 단절 노후도와 영향 검토 시간을 본다.

통제와 증거 구분

계보 그래프를 카탈로그 화면에만 두지 말고 품질 경보 변경 승인 장애 분석 삭제와 라이선스 검토의 시작점으로 연결한다. 관계가 존재한다는 기록과 통제가 실제 수행됐다는 증거는 구분한다.

마무리와 다음 회차

메타데이터는 데이터의 의미와 상태를 설명하고 출처는 생성 조건과 책임을 보여주며 데이터 계보는 입력 변환 출력의 연결을 추적한다. 세 기록은 공통 자산 ID와 버전 실행 ID를 공유할 때 AI 결과의 근거가 된다. 전체 데이터셋 수준의 경로를 먼저 잇고 고위험 필드와 학습 스냅숏만 깊게 추적하자. 다음 15회에서는 이 계보를 끊지 않도록 원본을 보존하는 Raw Validated Curated 저장 구조를 설계한다.

다음 15회차 원본을 보존하는 수집 및 저장 구조 2026년 9월 11일

출처 및 읽을거리

확인 기준일: 2026-09-09 KST

  • [S1] ISO - ISO/IEC 11179-1:2023 Information technology Metadata registries Part 1 Framework
    Locator: Public abstract and publication status; metadata refers to descriptions of data and the document provides the conceptual foundation for metadata registries · 확인일: 2026-09-09 · 제한: ISO 공개 개요만 확인했으며 표준 전문 준수 판정은 아니다.
  • [S2] W3C - PROV-O The PROV Ontology
    Locator: W3C Recommendation; sections 2 and 3.1 on Entity Activity Agent used wasGeneratedBy wasDerivedFrom and responsibility relations · 확인일: 2026-09-09 · 제한: 범용 웹 출처 온톨로지이며 조직의 운영 필드와 보존정책은 별도 설계가 필요하다.
  • [S3] W3C - PROV Model Primer
    Locator: W3C Working Group Note; introduction on provenance uses for meaningful use ownership trust compliance checking and reproducibility · 확인일: 2026-09-09 · 제한: 입문용 비규범 문서이며 구현 사양은 PROV 계열 권고를 확인해야 한다.
  • [S4] W3C - Data Catalog Vocabulary DCAT Version 3
    Locator: W3C Recommendation 22 August 2024; abstract sections 6 11 15 and example C.2 on metadata versioning checksums qualified attribution and dataset provenance · 확인일: 2026-09-09 · 제한: 웹 카탈로그 상호운용 어휘이며 내부 실행 계보 수집을 자동 제공하지 않는다.
  • [S5] OpenLineage - OpenLineage Object Model
    Locator: Current documentation checked 2026-09-09; Dataset Job Run and RunEvent JobEvent DatasetEvent model · 확인일: 2026-09-09 · 제한: 공개 사양의 구현 모델이며 조직별 정확한 추적 단위와 통제 의무는 별도다.
  • [S6] OpenLineage - Facets and Extensibility
    Locator: Current documentation checked 2026-09-09; facets attached to Run Job input and output Datasets with immutable versioned schema URLs for custom facets · 확인일: 2026-09-09 · 제한: 문서상 현재 버전은 변경될 수 있으므로 구현 시 고정 사양 버전을 선택해야 한다.
  • [S7] ISO - ISO/IEC 5259-3:2024 Artificial intelligence Data quality management requirements and guidelines
    Locator: Public overview and publication status; data quality management for analytics and ML across the data life cycle · 확인일: 2026-09-09 · 제한: ISO 공개 개요만 확인했으며 계보 필드나 준수 여부를 단정하지 않는다.
  • [S8] NIST - Artificial Intelligence Risk Management Framework AI RMF 1.0
    Locator: Sections 3.4 and 3.5; training-data provenance and attribution can support transparency and accountability; AIRC notes AI RMF 1.0 is being revised · 확인일: 2026-09-09 · 제한: 자발적 프레임워크이며 개정 중이다. 법적 의무나 자동 감사 증명으로 해석하지 않는다.
  • [S9] UK Government Digital Service - Recording metadata to describe critical data assets
    Locator: Published 16 April 2026; sections 5 to 9 including time dates provenance identification and appropriate use · 확인일: 2026-09-09 · 제한: 영국 정부 맥락의 지침이며 다른 관할 조직에는 참고용이다.
  • [S10] EUR-Lex - Regulation EU 2024 1689 consolidated text 27 July 2026 Article 10
    Locator: Article 10 paragraphs 1 and 2 on high-risk AI systems data governance including data collection origin and preparation operations · 확인일: 2026-09-09 · 제한: 적용 대상 고위험 AI 시스템 제공자에 관한 조항이다. 구체적 적용 여부와 시점은 법률 검토가 필요하다.
2026-09-09-ai-ready-data-ep14-metadata-provenance-lineage.pdf
1.6 MB
반응형
이 글이 유용했다면 링크를 공유해 보세요.