결측값은 언제 채우고 언제 남겨야 할까: AI 데이터 결측 처리 5단계
결측 원인을 구분하고, 복구·유지·삭제·대치 중 목적에 맞는 처리를 선택해 검증할 수 있다.
결측은 채우기 전에 원인을 복원한다
07회에서는 완전성을 ‘필요한 값이 존재하는가’라는 측정 질문으로 바꿨다. 그러나 빈칸을 발견했다고 바로 평균으로 채우면 완전성 숫자는 좋아져도 현실의 의미는 사라질 수 있다. 결측값(Missing Value)은 관측되어야 할 수 있지만 기록되지 않았거나, 의도적으로 비어 있는 값이다. 핵심 답은 간단하다. 먼저 왜 비었는지와 AI가 그 값을 어떻게 쓰는지 확인하고, 원천에서 복구할 수 있으면 복구하며, 비어 있음 자체가 의미라면 남기고 표시한다. 삭제와 대치는 그다음 선택이며 반드시 선택 편향과 불확실성을 검증해야 한다.
같은 null이라도 ‘해당 없음’, ‘아직 도착하지 않음’, ‘수집 실패’, ‘응답 거부’는 전혀 다른 상태다. 해당 없음은 정상적인 구조적 결측이고, 도착 지연은 최신성 문제이며, 수집 실패는 파이프라인 장애일 수 있다. 응답 거부는 개인정보·민감도와 연결될 수 있다. 이 원인을 하나의 0이나 평균으로 합치면 모델은 서로 다른 현실을 같은 신호로 배운다.
따라서 처리 전에 원본 결측을 보존하고 `missing_reason`, 원천 시스템, 관측 예정 시각, 마지막 성공 수집 시각을 함께 남긴다. 숫자 0은 ‘실제로 0’일 때만 쓴다. 빈 문자열, 9999, -1처럼 임시 코드를 섞으면 유효성 검사를 통과하더라도 결측률과 분포가 왜곡된다.
ISO/IEC 5259-2는 분석·머신러닝 데이터 품질을 측정 가능한 특성으로 평가·보고하는 공통 기반을 제공한다. [S8] EU AI Act 제10조는 적용 대상 고위험 AI에서 목적에 맞는 데이터 거버넌스와 관련 데이터 격차의 식별·대응을 요구한다. [S9] 이는 모든 빈칸을 채우라는 뜻이 아니라, 목적과 위험에 맞춰 결측을 식별하고 처리 근거를 남기라는 방향으로 읽어야 한다.
결측 처리의 첫 단계는 값 생성이 아니라 상태 복원이다. ‘왜 비었는지 모름’을 숨기지 않는 것이 품질 관리의 출발점이다.
MCAR·MAR·MNAR는 분석 가정이다
완전무작위결측(MCAR)은 결측 여부가 관측된 값과 관측되지 않은 값 모두에 의존하지 않는다는 가정이다. 무작위결측(MAR)은 이미 관측된 변수를 조건으로 보면 결측 여부가 아직 보지 못한 값에 더 의존하지 않는다는 가정이다. 비무작위결측(MNAR)은 관측된 정보를 고려한 뒤에도 결측 가능성이 보이지 않은 값 자체와 관련되는 경우다. Rubin의 원 연구는 MAR와 모수의 분리 조건에서 결측 생성 과정을 무시할 수 있는 통계적 조건을 제시했다. [S1] ‘MAR니까 아무렇게나 채워도 된다’는 뜻은 아니다.
관측 데이터만으로 MAR와 MNAR를 완전히 판별하기는 어렵다. Little의 검정은 특정 조건에서 MCAR 가정을 점검하는 도구지만, 기각하지 못했다고 MCAR가 증명되거나 MAR·MNAR 중 하나가 자동 확정되지는 않는다. [S2] 국가학술원 보고서와 EMA 지침도 결측 방법의 가정을 명시하고, 결과가 가정에 얼마나 민감한지 분석할 것을 강조한다. [S3][S4] 두 자료는 임상시험 맥락이므로 일반 AI에 대한 법적 의무가 아니라 엄격한 추론 원칙의 참고다.
실무 진단은 원인 로그와 패턴 비교에서 시작한다. 날짜·매장·채널·기기·하위집단별 결측률을 보고, 결측인 행과 아닌 행의 관측 변수 분포를 비교한다. 특정 매장 업로드 실패 뒤에만 재고가 비거나, 고액 주문일수록 고객 응답이 빠진다면 단순 무작위로 가정하기 어렵다. ‘결측률 5% 이하면 안전’ 같은 보편 임계값은 없다. 비율이 작아도 중요한 집단에 몰리면 위험하다.
MCAR·MAR·MNAR는 관찰 결과만으로 확정하는 이름표가 아니라 분석 가정이다. 원인 증거와 민감도 분석을 함께 기록한다.
복구·유지·삭제·대치를 순서대로 검토한다
가장 좋은 처리는 추정이 아니라 원천 복구다. 지연된 파일, 재처리 가능한 이벤트 로그, 승인된 마스터에서 값을 다시 얻을 수 있다면 먼저 복구한다. ‘해당 없음’처럼 비어 있음이 사실이라면 null을 유지하고 이유 코드를 붙인다. 모델이 결측을 직접 처리하지 못하면 명시적 범주나 결측 표시를 사용하되, 표시 자체가 민감한 행동이나 차별적 접근을 대리하는지 검토한다.
행이나 열 삭제는 단순하지만 표본과 사용 환경을 바꿀 수 있다. 삭제 전후의 기간·채널·매장·하위집단 분포와 학습 가능한 표본 수를 비교하고, 결측 때문에 빠진 집단의 오류 비용을 확인한다. 목표값 라벨이 없는 행은 특징값처럼 평균으로 채우지 않는다. 승인된 원천에서 정답을 복구하거나 별도 미라벨 데이터로 보관하고, 필요하면 사람 검토·반지도학습 같은 별도 절차를 설계한다.
대치(Imputation)는 관측된 정보로 결측값을 추정하는 방법이다. 평균·중앙값·최빈값 같은 단순 대치, 다른 변수를 쓰는 다변량 대치, 가까운 사례를 쓰는 KNN, 결측을 직접 다루는 모델을 비교할 수 있다. scikit-learn은 단변량·다변량·이웃 기반 방법과 결측 표시를 제공하며, 대치 뒤에도 원래 결측이었던 위치를 보존할 수 있다고 설명한다. [S5] 대치값은 관측 사실이 아니라 추정치이므로 원본과 덮어쓰지 않는다.
| 선택 | 적합한 조건 | 필수 안전장치 | 검증 증거 |
|---|---|---|---|
| 원천 복구 | 승인된 원천에서 다시 얻을 수 있음 | 원천·시점·키 일치 확인 | 복구율·대조 일치율 |
| 그대로 유지 | 해당 없음·미관측 자체가 의미 | 이유 코드와 결측 표시 보존 | 결측 슬라이스 성능 |
| 행·열 삭제 | 사용 목적에 불필요하고 선택 영향이 작음 | 삭제 전후 분포·표본 비교 | 범위·하위집단 손실 |
| 단순 대치 | 안정적 기준선이 필요하고 왜곡이 허용됨 | 학습 데이터에서만 통계 산출 | 기준선 대비 성능·편향 |
| 다변량·모델 처리 | 다른 변수 관계가 유용하고 검증 가능 | 과적합·불확실성·운영 비용 점검 | 교차검증·민감도 결과 |
채운 값은 ‘정답’이 아니다. 원본 값, 처리 값, 처리 방법·버전, 결측 표시를 분리해야 재현과 감사가 가능하다.
다온커머스에서는 0과 모름을 분리한다
가상 조직 다온커머스의 수요예측용 ‘프로모션 할인율’ 필드가 24만 개 SKU-매장-일 레코드 가운데 7% 비어 있다고 가정하자. 조사 결과 4%는 실제 비프로모션이라 0으로 확정할 수 있고, 2%는 지연된 프로모션 원장에서 복구 가능하며, 1%는 특정 매장 인터페이스 장애로 원인을 알지만 값을 복구하지 못했다.
전부 0으로 채우면 마지막 1%의 ‘알 수 없음’이 ‘할인 없음’으로 바뀐다. 반대로 7%를 모두 삭제하면 장애 매장과 해당 기간이 학습에서 사라진다. 다온커머스는 원천 복구 후 남은 1%를 null과 `promo_missing=1`로 유지하고, 중앙값 대치+표시 모델과 결측을 직접 처리하는 모델을 비교한다. 전체 오차뿐 아니라 장애 매장·프로모션 기간의 예측 오차와 과잉 발주 비용을 따로 본다.
판매량 목표값이 비어 있다면 프로모션 할인율과 같은 방식으로 추정하지 않는다. POS 재전송이나 주문 원장 대조로 검증된 판매량을 복구하지 못한 날짜는 감독학습 정답에서 제외하고, 누락 기간·매장 범위를 별도 증거로 남긴다. 작은 결측률보다 어떤 결정과 집단이 사라졌는지가 더 중요하다.
가상 수치의 목적은 방법을 고르는 연습이다. ‘0’, ‘해당 없음’, ‘복구됨’, ‘알 수 없음’을 서로 다른 상태로 보존한다.
대치 모델보다 검증 설계를 먼저 고정한다
학습·검증·테스트를 먼저 나눈 뒤 대치 통계와 대치 모델은 학습 데이터에만 맞춘다. 전체 데이터의 평균이나 이웃을 먼저 계산하면 테스트 정보가 학습 과정에 스며드는 데이터 누수(Data Leakage)가 생긴다. scikit-learn은 `SimpleImputer`를 포함한 전처리도 학습 데이터에서만 `fit`하고 Pipeline으로 교차검증할 것을 권고한다. [S6] 시간 예측이라면 미래 기간으로 대치 통계를 계산하지 않는다.
최소 비교선은 ① 결측 행 삭제, ② 단순 대치, ③ 단순 대치+결측 표시, ④ 모델의 결측 직접 처리다. 필요할 때만 다변량·다중 대치를 추가한다. 전체 성능, 결측이 있던 행의 성능, 주요 하위집단과 시간 구간, 운영 비용을 함께 비교한다. 결측 메커니즘이 MNAR일 가능성이 있거나 오류 비용이 크면 대치값을 합리적 범위로 움직이는 민감도 분석을 수행하고 결론이 바뀌는 경계를 보고한다.
NIST AI RMF Playbook은 데이터 선택·정제·분석의 가정과 결측·이상치 처리 방법, 알려진 한계를 문서화하도록 제안한다. [S7] 이번 회차의 결과물은 아래 의사결정표다. 처리 이유, 학습 시점 통계, 대치 비율, 결측 표시, 슬라이스 결과, 되돌리기 조건을 버전과 함께 남기면 12회의 Data Contract에 연결할 수 있다.
- 1. 목적필드가 지원하는 예측·답변·결정과 오류 비용
- 2. 원인해당 없음·지연·실패·거부·미상과 근거 로그
- 3. 패턴전체 및 시간·채널·하위집단별 결측률
- 4. 처리복구·유지·삭제·대치 방법과 학습 범위
- 5. 검증기준선·결측 슬라이스·민감도·운영 비용
- 6. 기록원본/처리값 분리, 버전, 책임자, 되돌리기 조건
보관할 결과물: 필드별 결측 처리 의사결정표. 원인 증거와 처리 전후 성능이 없으면 ‘대치 완료’를 품질 PASS로 기록하지 않는다.
마무리와 다음 회차
결측값은 자동으로 고칠 오류도, 무조건 남길 신호도 아니다. 먼저 빈 이유를 보존하고 원천 복구 가능성을 확인한다. 남기거나 삭제하거나 대치할 때는 선택 편향, 정보 누수, 불확실성과 하위집단 영향을 검증한다. 처리값을 원본처럼 덮어쓰지 않고 방법·버전·결측 표시를 남겨야 같은 판단을 다시 만들 수 있다. 다음 09회에서는 중복·오류·노이즈·이상치를 구분하고, ‘이상해 보인다’는 이유만으로 실제 희귀 사례를 지우지 않는 진단법을 다룬다.
다음 09회차: 중복·오류·노이즈·이상치 구분하기 · 2026년 8월 28일
출처 및 읽을거리
확인 기준일: 2026-08-26 KST
- [S1] Biometrika / Oxford Academic - Inference and Missing Data
Locator: Abstract; conditions for ignorability under missing at random and distinct parameters · 확인일: 2026-08-26 · 제한: 1976년 통계 추론 원 연구다. MAR가 무조건 안전한 대치나 일반 AI 운영 절차를 의미하지 않는다. - [S2] Journal of the American Statistical Association - A Test of Missing Completely at Random for Multivariate Data with Missing Values
Locator: Abstract; assessment of the MCAR assumption by comparing observed-value means across missingness patterns · 확인일: 2026-08-26 · 제한: 특정 다변량 조건의 검정이다. 비기각은 MCAR의 증명이나 MAR/MNAR의 판별이 아니다. - [S3] National Academies Press - The Prevention and Treatment of Missing Data in Clinical Trials
Locator: Summary recommendations; prevention, explicit assumptions and sensitivity analysis · 확인일: 2026-08-26 · 제한: 임상시험을 위한 합의 보고서다. 일반 AI에 대한 법적 의무가 아니라 엄격한 결측 추론의 참고 원칙으로 사용했다. - [S4] European Medicines Agency - Guideline on Missing Data in Confirmatory Clinical Trials
Locator: Sections 4-7; bias, handling methods and sensitivity analyses; effective 2011 · 확인일: 2026-08-26 · 제한: 의약품 확증 임상시험 규제 지침이다. 유통 수요예측 등 다른 분야에 직접 적용되는 의무가 아니다. - [S5] scikit-learn - Imputation of missing values - User Guide 1.9.0
Locator: Sections 8.4.1-8.4.7; simple, multivariate, KNN, indicators and native NaN handling · 확인일: 2026-08-26 · 제한: 구현 문서이며 특정 데이터에 최적 방법을 보장하지 않는다. IterativeImputer는 문서상 experimental이다. - [S6] scikit-learn - Common pitfalls and recommended practices - Data leakage
Locator: Section 12.2; split before preprocessing, fit transformations on training data only, use Pipeline · 확인일: 2026-08-26 · 제한: scikit-learn 워크플로우 지침이다. 다른 프레임워크에서도 같은 누수 원칙을 별도 구현해야 한다. - [S7] NIST AI Resource Center - NIST AI RMF Playbook
Locator: MAP 2.3 pp. 74-75; document assumptions and treatment of missing, spurious and outlier data · 확인일: 2026-08-26 · 제한: 자발적 가이드이며 NIST는 AI RMF 1.0과 Playbook 개정을 진행 중이라고 표시한다. - [S8] ISO - ISO/IEC 5259-2:2024 - Data quality measures
Locator: Public overview; measurable characteristics and standardized data-quality reporting for analytics and ML · 확인일: 2026-08-26 · 제한: ISO 공개 소개 범위만 사용했다. 유료 표준 전문의 세부 측정식이나 적합성 요구를 재현하지 않았다. - [S9] EUR-Lex - Regulation (EU) 2024/1689 - Artificial Intelligence Act
Locator: Article 10(2)(h), 10(3); data gaps, intended-purpose governance and dataset quality · 확인일: 2026-08-26 · 제한: 제10조는 적용 대상 고위험 AI에 관한 법률 기준이다. 시스템 분류·적용 시점·관할은 별도 법률 검토가 필요하다.
'스페셜 브리핑 > AI-Ready Data' 카테고리의 다른 글
| AI 데이터의 사각지대: 대표성·범위·균형을 점검하는 법 (1) | 2026.08.31 |
|---|---|
| 중복·오류·노이즈·이상치, 무엇을 지우고 무엇을 남길까 (0) | 2026.08.28 |
| AI 데이터 품질 5차원: 정확성·완전성·일관성·유효성·최신성 측정법 (0) | 2026.08.24 |
| AI 데이터 준비도 진단: 사람·프로세스·기술·거버넌스 4축 체크리스트 (0) | 2026.08.21 |
| AI 데이터 생애주기: 수집부터 폐기까지 신뢰와 사용권을 지키는 법 (0) | 2026.08.19 |