스페셜 브리핑/AI-Ready Data

흩어진 데이터를 AI 자산으로 바꾸는 인벤토리와 카탈로그

반응형
AI Daily Special · Part 3 · 13/36

흩어진 데이터를 AI 자산으로 바꾸는 인벤토리와 카탈로그

AI 사용 목적에 필요한 데이터 자산을 빠짐없이 찾고 소유자 민감도 접근 가능성을 담은 최소 인벤토리를 설계할 수 있다.

인벤토리는 보유 목록이고 카탈로그는 발견 경험이다

12회에서 품질 지표와 실패 행동을 데이터 계약으로 묶었다. 하지만 계약할 데이터가 어디에 있는지, 같은 이름의 복제본 중 무엇이 원본인지, 누가 사용을 승인하는지 모르면 계약은 문서에 머문다. 데이터 인벤토리는 조직이 보유하거나 통제하는 데이터 자산을 식별하고 최소한의 위치·책임·위험 정보를 기록한 관리 목록이다. 데이터 카탈로그는 이 기록을 사람이 검색하고 비교하며 접근 절차까지 찾도록 만드는 체계 또는 도구다. 두 용어의 경계는 조직과 표준마다 다르므로 이름보다 기능을 확인해야 한다. 이번 회차의 목표는 비싼 도구를 먼저 고르는 것이 아니라 AI Use Case에 필요한 자산을 발견하고 검증 가능한 최소 기록을 만드는 것이다.

W3C의 Data Catalog Vocabulary(DCAT) v3는 카탈로그를 데이터셋·데이터 서비스 같은 자원을 설명하는 메타데이터의 큐레이션된 모음으로 정의하고, 표준화된 표현이 발견성과 여러 카탈로그 사이의 연합 검색을 높인다고 설명한다. [S1] DCAT은 웹 상호운용성을 위한 어휘이며 모든 조직의 내부 운영 절차를 대신하지 않는다.

미국 연방 최고데이터책임자위원회의 Enterprise Data Inventories 보고서는 인벤토리를 더 기술적이고 세분화된 메타데이터까지 담는 기반 목록으로, 카탈로그를 그 자산을 발견하게 하는 메커니즘으로 구분한다. [S8] 다만 업계 제품과 조직 규정은 두 말을 서로 바꾸어 쓰기도 한다. 따라서 ‘인벤토리냐 카탈로그냐’보다 식별·검색·책임·접근·갱신 기능이 실제로 작동하는지 보는 편이 안전하다.

ISO/IEC 11179-1:2023은 메타데이터를 데이터에 대한 설명으로 다루며 메타데이터 레지스트리의 개념 기반을 제시한다. [S2] ISO/IEC 11179-33:2023은 데이터셋의 고유 식별자, 제목, 이해 가능한 설명 등을 등록해 적절한 데이터셋 발견과 중복 작업 방지를 돕는 구조를 설명한다. [S3] 공개 개요와 열람 가능한 범위에 근거한 설명이며 표준 전문 준수 판정은 아니다.

탐색 영역대표 자산발견 단서확인할 위험
업무 시스템주문 DB·ERP·CRM·POS시스템 등록부·담당자운영계 임의 스캔 금지
분석 저장소웨어하우스·레이크·파일스키마·쿼리·파이프라인원본과 파생본 구분
문서 콘텐츠정책·PDF·이미지·상담 지식공식 폴더·검색·소유자권한·시행일·라이선스
외부 SaaS협력사 피드·API·SaaS 추출계약·API 목록·청구 기록사용권·종료 시 회수
기능으로 구분

인벤토리는 무엇이 존재하는지 통제하는 기준 목록이고 카탈로그는 사용자가 그 목록에서 적합한 자산을 찾고 이해하며 접근하는 경험이다. 한 시스템이 두 기능을 함께 제공할 수 있다.

AI Use Case에서 역으로 탐색 범위를 만든다

전사 파일을 무작정 훑으면 자산 수는 늘지만 AI 판단에 필요한 데이터는 찾기 어렵다. 먼저 AI Use Case의 입력·정답·평가·운영 모니터링·근거 문서를 적고, 각 항목이 만들어지는 업무 사건과 시스템을 역추적한다. 수요예측이라면 주문뿐 아니라 취소, 품절, 재고 스냅숏, 프로모션, 매장 휴무처럼 관측값의 의미를 바꾸는 자산도 후보에 넣는다.

탐색은 시스템 등록부와 아키텍처 문서에서 시작해 웨어하우스·레이크의 스키마, 배치·스트리밍 파이프라인, BI 쿼리, 공유 드라이브, SaaS 내보내기, API와 협력사 전달 파일로 넓힌다. 자동 스캔은 위치와 형식을 잘 찾지만 업무 의미·금지 용도·실제 소유자를 확정하지 못한다. 현업 Data Steward 인터뷰, 최근 쿼리와 접근 요청, 장애 기록을 결합해 기계 발견 결과를 사람이 검증한다.

NIST CSF 2.0 구현 예시는 지정한 데이터 유형과 그 메타데이터의 인벤토리를 유지하고, 비정형적으로 생긴 데이터를 계속 발견하며, 분류 태그와 데이터 소유자·위치를 추적하는 방법을 제시한다. [S4] 이는 사이버보안 위험관리의 자발적 예시이지 AI 데이터 카탈로그의 의무 사양은 아니다. 그러나 개인정보·지식재산·운영기술 데이터처럼 먼저 찾아야 할 위험 중심 범위를 정하는 데 유용하다.

발견 원칙

처음부터 모든 파일을 완벽히 등록하려 하지 말고 AI 결정에 영향을 주거나 민감도가 높은 데이터 유형을 우선순위로 정한다. 자동 발견은 후보를 만들고 책임자는 의미와 사용 가능성을 승인한다.

최소 기록은 찾기 판단 책임 접근을 가능하게 한다

최소 인벤토리 레코드는 네 질문에 답해야 한다. 찾기 위해서는 고유 ID·제목·설명·위치가 필요하고, 적합성을 판단하려면 업무 목적·대상 범위·기간·갱신 주기·알려진 한계가 필요하다. 책임을 묻기 위해 Owner·Steward·연락처와 마지막 확인일을, 안전하게 접근하기 위해 민감도·접근권한·라이선스·승인 절차를 기록한다.

2026년 영국 정부의 핵심 데이터 자산 메타데이터 지침은 title·description·identifier, creator·dateCreated, temporalCoverage, 표준 적합성, accessRights·securityClassification·license와 버전 관련 속성을 제시한다. [S9] W3C DCAT도 제목·설명·식별자·연락처·발행자·수정일·접근권리 같은 속성을 제공한다. [S1] 이 목록은 유용한 출발점이지만 조직의 법률·보안·기록관리 요구에 맞춘 프로필이 필요하다.

NIST AI RMF 1.0은 AI 설계 단계에서 시스템 목표·가정·맥락·요구사항과 데이터셋의 메타데이터·특성을 문서화하는 일을 명시한다. [S5] 그러므로 자산 레코드에 ‘AI에 사용 가능’ 체크 하나만 두지 않는다. 승인된 Use Case, 금지 용도, 품질 상태, 대표성 범위, 평가 책임자를 연결하고 근거가 없으면 적합을 추정하지 말고 ‘미검증’으로 표시한다.

  1. 1 자산 식별변하지 않는 자산 ID, 제목, 짧은 설명과 상태
  2. 2 위치와 접근원천 위치, 배포 형태, 승인 포털 또는 담당 팀
  3. 3 책임Data Owner, Data Steward, 기술 담당, 공용 연락처
  4. 4 목적현재 업무 목적, 승인된 AI Use Case, 금지 또는 미승인 용도
  5. 5 범위대상 집단, 필드·문서 유형, 시간 범위, 포함·제외 기준
  6. 6 갱신발생 주기, 제공 지연, 마지막 갱신, 다음 검토일
  7. 7 출처생성 시스템, 수집 방식, 원본·복제·파생 상태
  8. 8 권리와 민감도개인정보·기밀 분류, 접근권한, 라이선스와 계약 제한
  9. 9 품질과 한계검증 상태, 알려진 결측·지연·대표성 한계, 품질 계약 링크
  10. 10 사용 관계주요 소비자, 모델·보고서·파이프라인 의존성과 폐기 영향
상태를 숨기지 않기

빈칸을 지우거나 임의 추정값으로 채우면 발견성은 높아 보여도 판단 신뢰는 낮아진다. 미확인과 해당 없음과 접근 제한을 서로 다른 상태로 기록하고 검증 책임과 기한을 붙인다.

다온커머스는 여섯 자산으로 시작한다

가상 조직 다온커머스는 ‘14일 수요예측’과 ‘정책 근거형 고객센터 RAG’ 두 Use Case만 범위로 잡는다. 자동 스캔과 담당자 인터뷰로 주문·결제, 매장 POS, 상품 마스터, 재고·입고, 프로모션, 정책 문서 여섯 자산을 1차 목록에 올린다고 가정한다. 파일과 테이블 수를 자산 수로 그대로 세지 않고 하나의 책임과 생애주기로 관리할 수 있는 업무 단위를 기준으로 묶는다.

주문 데이터 레코드는 자산 ID DC-ORD-001, 주문·결제 이벤트, 원천 주문 DB와 웨어하우스 배포본, Owner 서윤, Steward 주문운영팀, 개인정보 포함, 수요예측 승인·마케팅 재사용 미승인, 15분 갱신, 취소 반영 최대 4시간 지연 가능으로 기록한다. 수치와 조직은 교육용 가정이다. 실제 접근 경로에는 비밀번호나 토큰을 적지 않고 승인 포털이나 담당 팀을 연결한다.

정책 문서는 RAG의 핵심 자산이지만 중복본과 시행일 누락 때문에 상태를 ‘조건부’로 둔다. 고객센터 문서 저장소의 공식 폴더와 폐기 절차를 찾기 전에는 모든 PDF를 일괄 색인하지 않는다. 반대로 BI에 자주 쓰이지 않는 매장 휴무표가 예측 오차를 설명한다면 사용 빈도와 무관하게 후보에 남긴다. 자산 우선순위는 인기보다 AI 결과 영향과 오류 비용으로 정한다.

1차 범위

다온커머스의 1차 목표는 전사 100퍼센트 완성이 아니라 두 Use Case의 핵심 자산 여섯 개에서 소유자 접근 상태 민감도 사용 제한을 검증하는 것이다.

카탈로그는 도입 프로젝트가 아니라 갱신 운영이다

ISO/IEC 5259-3:2024 공개 개요는 분석·머신러닝 데이터 품질을 데이터 생애주기 전체에서 계획·유지·개선하는 관리체계를 설명한다. [S6] ISO/IEC 5259-5:2025는 조직 전략과 책임을 연결하는 거버넌스 수준의 방향을 제시한다. [S7] 카탈로그도 한 번 채운 엑셀이나 검색 화면이 아니라 생성·변경·폐기 이벤트와 책임자 업무에 연결해야 한다.

새 데이터셋 생성, 스키마 변경, 접근정책 변경, 파이프라인 중단, Owner 이동이 생기면 레코드 갱신 작업을 자동 또는 수동으로 연다. 영국 정부의 2026년 데이터 소유권 모델은 중요 데이터 자산에 이름 있는 Owner와 Steward 역할을 메타데이터와 중앙 등록부에 연결할 것을 요구한다. [S10] 이 요구는 해당 영국 정부 범위의 정책이며 다른 조직에는 책임 설계 참고로 사용해야 한다.

첫 30일은 두 Use Case와 민감 데이터 유형을 범위로 삼고 후보 발견률, Owner 확인률, 접근 경로 검증률, 90일 이상 미확인 레코드 비율을 본다. 검색 횟수나 등록 건수만 성공 지표로 삼지 않는다. 사용자가 적합한 자산을 찾은 뒤 승인된 경로로 접근하고, 부적합·중복 자산을 피했는지까지 확인한다. 도구 구매는 이 운영 흐름과 필드가 검증된 뒤 결정해도 늦지 않다.

운영 기준

완성도보다 신뢰 가능한 범위를 공개한다. 후보 발견 검증 승인 폐기 상태를 구분하고, 마지막 확인일과 다음 검토일이 지난 레코드는 검색 결과에서 경고한다.

마무리와 다음 회차

데이터 인벤토리는 AI에 필요한 자산을 빠짐없이 식별하고 최소한의 위치·책임·위험 정보를 유지하는 기준 목록이다. 데이터 카탈로그는 그 기록을 검색과 비교와 안전한 접근으로 연결한다. 첫 버전은 전사 완벽성보다 두세 개 AI Use Case와 민감 데이터 유형에서 검증 가능한 범위를 만드는 것이 낫다. 다음 14회에서는 이 최소 목록을 바탕으로 메타데이터를 정교화하고 출처와 데이터 계보를 연결한다.

다음 14회차 메타데이터·출처·데이터 계보 2026년 9월 9일

출처 및 읽을거리

확인 기준일: 2026-09-07 KST

2026-09-07-ai-ready-data-ep13-data-inventory-catalog.pdf
1.7 MB
반응형
이 글이 유용했다면 링크를 공유해 보세요.