스페셜 브리핑/AI-Ready Data

AI 데이터 품질 5차원: 정확성·완전성·일관성·유효성·최신성 측정법

반응형
AI Daily Special · Part 2 · 07/36

AI 데이터 품질 5차원: 정확성·완전성·일관성·유효성·최신성 측정법

정확성·완전성·일관성·유효성·최신성을 구분하고, AI 사용 목적에 맞는 품질 규칙과 실패 행동을 설계할 수 있다.

품질 차원은 만능 점수가 아니라 측정 질문이다

06회에서 다온커머스는 AI 데이터 준비도를 사람·프로세스·기술·거버넌스의 증거로 진단했다. 이제 Part 2의 첫 질문은 더 구체적이다. ‘품질이 좋다’를 무엇으로 측정할 것인가? 데이터 품질(Data Quality)은 정해진 사용 목적에 필요한 데이터 특성을 측정하고 관리하는 상태다. 품질 차원은 그 상태를 바라보는 서로 다른 렌즈다. 한 차원의 점수가 높아도 다른 차원의 실패를 가릴 수 있으므로, 하나의 종합점수보다 목적별 차원·규칙·임계값·실패 행동을 함께 써야 한다.

ISO/IEC 5259-1은 분석·머신러닝 데이터 품질을 생애주기 전반에서 평가·개선하고 의도한 목적에 적합하게 만드는 공통 언어로 설명한다. ISO/IEC 5259-2는 이를 측정 가능한 특성과 보고 기준으로 연결한다. [S3][S4] ISO 공개 소개만으로 유료 표준 전문의 세부 측정식을 재현할 수는 없지만, ‘목적을 먼저 정하고 측정 가능한 특성으로 바꾼다’는 방향은 분명하다.

영국 정부 데이터 품질 프레임워크도 품질을 목적 적합성(Fitness for Purpose)으로 보고, 여섯 핵심 차원을 고정된 처방이 아닌 사용자 요구에 맞춰 선택·확장할 수 있는 측정 특성으로 다룬다. [S1][S2] 이번 회차는 그중 AI 실무에서 가장 자주 충돌하는 정확성·완전성·일관성·유효성·최신성 다섯 가지에 집중한다. 중복 여부를 보는 유일성은 09회에서 중복·오류·노이즈·이상치와 함께 다룬다.

측정 원칙

품질 차원은 문제의 이름이고, 품질 규칙은 실제로 판정할 수 있는 문장이다. 차원만 고르고 기준과 행동을 비워 두면 운영 통제가 아니다.

다섯 차원을 같은 값에 대입해 구분한다

정확성(Accuracy)은 값이 현실이나 승인된 참조값과 맞는 정도다. 완전성(Completeness)은 필요한 레코드와 필수 값이 존재하는 정도다. 일관성(Consistency)은 같은 대상의 값과 규칙이 시스템·시점·필드 사이에서 모순되지 않는 정도다. 유효성(Validity)은 값이 형식·범위·업무 규칙을 만족하는 정도다. 최신성(Timeliness)은 데이터가 사용 시점의 현실을 충분히 반영하고 필요한 시간 안에 도착하는 정도다. [S1][S2]

다섯 차원은 서로 대체되지 않는다. 전화번호 ‘010-0000-0000’은 형식 규칙을 통과해 유효하지만 실제 고객 번호가 아니어서 부정확할 수 있다. 모든 SKU에 가격이 채워져 완전해도 원화·달러 규칙이 채널마다 다르면 일관되지 않다. 어제 기준 재고가 정확했더라도 오늘 발주 추천 시점에는 오래되어 최신성이 부족할 수 있다.

정확성은 현실과 비교해야 하므로 참조값이 없으면 직접 측정하기 어렵다. 이때 무리하게 ‘정확도 100%’를 만들지 말고 표본 원천 대조, 현업 확인, 센서 교정 같은 검증 절차와 확인 불가 비율을 함께 기록한다. 유효성 검사는 자동화하기 쉽지만, 규칙을 통과했다는 사실을 현실과 일치한다는 증거로 확대하면 안 된다.

차원판단 질문예시 지표실패 행동
정확성현실·승인 참조값과 맞는가?원천 대조 일치 건수 / 대조 건수표본 재검수·배치 중단
완전성필요한 레코드와 값이 있는가?충족 대상 수 / 존재해야 할 대상 수보완 요청·결측 표시
일관성시스템·필드·시점 사이 모순이 없는가?규칙·교차원천 불일치율원천 우선순위·격리
유효성형식·범위·업무 규칙을 지키는가?규칙 통과 값 / 검사 값입력 거부·오류 큐
최신성사용 시점에 충분히 새롭고 제때 도착했는가?SLA 이내 도착·전파 비율지연 경보·안전한 이전본

측정식보다 먼저 분모와 시간창을 고정한다

완전성은 보통 ‘필수 값이 존재하는 대상 수 ÷ 존재해야 하는 전체 대상 수’로 시작한다. 그러나 전체 대상이 활성 SKU인지, 지난 90일 판매 SKU인지, 신규 등록까지 포함하는지에 따라 분모가 달라진다. 조건상 값이 필요 없는 레코드를 결측으로 세면 점수는 낮아지고, 수집되지 않은 레코드를 분모에서도 빼면 점수는 거짓으로 높아진다. 결측의 원인과 처리 판단은 다음 08회의 주제다.

최신성은 ‘업데이트 시각이 현재와 얼마나 가까운가’만으로 부족하다. 발주 추천은 매일 06시 실행이라면 POS 판매가 05시 30분까지 적재되어야 한다는 서비스 시간창이 필요하다. 정책 RAG는 문서 수정 후 승인·검색 색인·캐시 삭제까지의 전파 지연을 측정해야 한다. 같은 24시간 지연도 월간 보고에는 허용되지만 실시간 재고 추천에는 치명적일 수 있다.

NIST AI RMF Playbook은 무엇을 측정할지가 평가 목적·대상·필요에 달려 있고, 측정하지 못한 위험도 문서화해야 한다고 설명한다. 또한 데이터 선택과 재사용이 원래 사회적 맥락·시점에서 분리되면 타당성 문제가 생길 수 있다고 경고한다. [S5][S6] 따라서 품질 지표에는 대상 모집단, 측정 단위, 시간창, 제외 조건, 참조 기준과 미측정 영역을 메타데이터로 붙여야 한다.

지표 해석

분자는 코드가 계산하지만 분모와 시간창은 업무가 결정한다. 이 둘이 버전 관리되지 않으면 같은 지표 이름으로 서로 다른 품질을 보고하게 된다.

차원 간 충돌은 Use Case별로 승인한다

영국 정부 프레임워크는 최신성을 높이기 위해 더 빨리 공개하면 수집량·검수 시간이 줄어 완전성이나 정확성이 낮아질 수 있다고 설명한다. [S1][S2] 충돌을 없애려 하기보다 어느 차원을 우선하고 어떤 손실을 허용할지 사용자에게 알려야 한다. 하나의 전사 임계값보다 오류 비용이 다른 Use Case별 계약이 필요한 이유다.

가상 조직 다온커머스의 수요예측에서는 매일 06시 발주 추천을 위해 POS 판매 적재 최신성 99%를 우선한다고 가정한다. 마감 후 취소 데이터가 늦게 들어와 완전성이 97%라면 과거 패턴으로 보정하되, 대형 프로모션 매장은 추천을 보류한다. 반면 고객센터 RAG의 반품 정책은 문서 조항의 정확성과 시행일 일관성이 우선이다. 최신 문서 여부를 확인하지 못하면 답변 생성보다 상담원 인계를 선택한다. 수치는 모두 교육용 가정이다.

법적 기준은 실무 권고와 구분해야 한다. EU AI Act 제10조는 적용 대상 고위험 AI의 학습·검증·시험 데이터에 목적에 맞는 거버넌스를 요구하며, 관련성·충분한 대표성·가능한 범위의 오류 최소화·완전성을 규정한다. [S7] 모든 조직과 모든 AI에 자동 적용되는 일반 의무는 아니며, 실제 적용 시에는 최신 통합 법령과 시스템 분류를 별도로 확인해야 한다.

가상 사례

가상 사례 수치는 설명을 위한 가정이다. 우선 차원, 허용 손실, 예외 슬라이스, 실패 행동을 Use Case Owner가 승인해야 한다.

품질 차원 선택표를 운영 계약으로 완성한다

차원 선택표는 다섯 행을 모두 채우는 체크리스트가 아니다. 먼저 AI가 내리는 결정과 오류 비용을 적고, 그 결정에 치명적인 필드와 레코드를 고른다. 다음으로 각 차원에 질문 하나, 지표 하나, 임계값 하나, 실패 행동 하나를 연결한다. 측정 가능하지만 행동과 연결되지 않는 지표는 관찰용으로 표시하고 go/no-go 기준과 섞지 않는다.

전문가 검토에서는 상관된 지표의 중복 계산을 경계한다. 예를 들어 빈 문자열을 유효성 실패와 완전성 실패에 모두 세는 것은 진단에는 유용하지만 종합점수에서 이중 감점이 될 수 있다. 점수 집계보다 원인 코드와 영향받는 데이터 슬라이스를 보존해야 다음 정제·재수집·승인 조치를 고를 수 있다. 데이터 품질 연구에서도 차원 용어와 경계가 일관되지 않음을 오래전부터 지적해 왔다. [S8] 조직 내부 정의서가 필요한 이유다.

이번 회차의 결과물은 아래 선택표다. 표를 채운 뒤에는 ① 실제 레코드 표본으로 규칙을 시험하고 ② 경계 사례를 현업 Steward와 검토하며 ③ 임계값 초과 시 알림·격리·배치 중단·사람 검토 중 무엇을 실행할지 확인한다. 12회에서 이 지표와 실패 행동을 Data Contract로 묶기 전까지는 작게 반복해 정의와 분모를 안정화한다.

  1. 사용 목적AI가 지원하는 결정, 사용자, 예측·답변 시점
  2. 대상핵심 자산·필드·레코드·슬라이스와 제외 조건
  3. 측정차원, 질문, 분자·분모, 참조값, 시간창
  4. 판정목표·경고·차단 임계값과 허용 예외
  5. 행동알림·재수집·격리·배치 중단·사람 검토와 책임자
보관할 결과물

보관할 결과물: Use Case별 품질 차원 선택표. 차원마다 대상·측정 질문·지표/분모·시간창·임계값·실패 행동·책임자를 한 줄로 남긴다.

마무리와 다음 회차

데이터 품질은 하나의 점수가 아니다. 정확성은 현실, 완전성은 존재, 일관성은 모순, 유효성은 규칙, 최신성은 사용 시점과의 거리를 묻는다. 다섯 질문을 목적·분모·시간창·임계값·실패 행동과 연결해야 비로소 AI 운영에서 쓸 수 있는 품질 규칙이 된다. 다음 08회에서는 결측이 오류인지 현실의 신호인지 구분하고, 언제 채우고 언제 남겨야 하는지 판단한다.

다음 08회차: 결측값은 언제 채우고 언제 남겨야 하는가 · 2026년 8월 26일

출처 및 읽을거리

확인 기준일: 2026-08-24 KST

2026-08-24-ai-ready-data-ep07-quality-dimensions.pdf
1.6 MB
반응형
이 글이 유용했다면 링크를 공유해 보세요.