중복·오류·노이즈·이상치, 무엇을 지우고 무엇을 남길까
중복·오류·노이즈·이상치를 서로 다른 질문으로 판별하고, 자동 삭제 대신 검토·수정·격리·보존 결정을 설계할 수 있다.
탐지 결과는 삭제 명령이 아니다
08회에서는 빈칸을 채우기 전에 왜 비었는지 확인했다. 이번에도 원칙은 같다. 값이 낯설거나 반복된다고 곧바로 삭제하면 실제 고객, 정상 반품, 희귀 수요처럼 AI가 배워야 할 현실까지 사라질 수 있다. 중복(Duplicate)은 같은 실체나 사건이 의도한 데이터 단위보다 여러 번 표현된 상태, 오류(Error)는 승인된 사실·규칙과 틀린 값, 노이즈(Noise)는 목적에 필요한 신호를 흐리는 변동이나 부정확한 표시, 이상치(Outlier)는 나머지 관측과 크게 달라 추가 판단이 필요한 값이다. 네 범주는 겹칠 수 있지만 같은 말이 아니다. 탐지 결과는 삭제 명령이 아니라 조사 대기열이다.
첫 질문은 레코드 단위(Record Grain)다. 한 행이 주문 한 건인지, 주문 상품 한 줄인지, 고객의 하루 요약인지 먼저 고정해야 반복을 판단할 수 있다. 같은 고객이 같은 상품을 두 번 샀다면 주문 사건 두 건일 수 있지만, 동일한 주문 ID와 라인 번호가 재전송으로 두 번 적재됐다면 기술적 중복 후보다. 중복은 값이 똑같은지가 아니라 ‘같은 실체·사건을 의도보다 여러 번 세었는가’로 판정한다.
오류는 비교 기준이 필요하다. 현실의 승인 원천, 업무 규칙, 센서 교정값, 사람이 검증한 라벨처럼 무엇이 맞는지를 보여 줄 근거가 있어야 한다. 형식에 맞지 않는 날짜는 유효성 오류일 수 있고, 형식은 맞지만 실제 배송일과 다른 날짜는 정확성 오류일 수 있다. 참조 사실이 없으면 ‘오류 확정’보다 ‘검토 필요’가 정직하다.
노이즈와 이상치는 목적과 분포를 묻는다. 노이즈는 예측이나 판단에 필요한 신호를 가리는 불규칙 변동, 입력 잡음, 모호한 라벨 등을 넓게 가리킨다. 이상치는 주변 분포나 예상 패턴에서 멀리 떨어진 관측이다. 이상치는 희귀하지만 정확할 수 있고, 노이즈는 한 점이 튀지 않아도 데이터 전체에 퍼질 수 있다. ISO/IEC 5259-2는 AI·분석용 데이터 품질을 측정 가능한 특성으로 평가·보고하는 공통 기반을 제시한다. [S1]
| 유형 | 판별 질문 | 핵심 증거 | 기본 대응 |
|---|---|---|---|
| 중복 | 같은 실체·사건을 여러 번 셌는가 | 레코드 단위·키·계보·원천 로그 | 병합·분리·검토 |
| 오류 | 승인된 사실·규칙과 틀렸는가 | 참조 원천·업무 규칙·검증 라벨 | 수정·격리·재수집 |
| 노이즈 | 목적의 신호를 흐리는가 | 반복 측정·라벨 지침·처리 전후 성능 | 필터·재라벨·가중치 |
| 이상치 | 분포·맥락에서 이례적인가 | 시간·집단·사건 로그·영향 분석 | 보존·격리·추가 조사 |
분류 순서: 같은 실체·사건인가 → 참조 사실과 틀렸는가 → 목적의 신호를 흐리는가 → 분포에서 이례적인가. 한 레코드에 여러 표지가 붙을 수 있다.
중복 제거는 동일성 판단이다
완전 일치 중복은 비교적 쉽지만, 현실의 중복은 이름 철자, 주소, 상품 코드, 시간대가 조금씩 다르다. 영국 정부 데이터 품질 프레임워크는 고유성을 ‘각 실체를 하나의 레코드로 표현하는 정도’로 설명하며, 일부 필드가 달라도 같은 사람을 가리키면 중복일 수 있다고 예시한다. [S3] 반대로 모든 필드가 같아도 독립적으로 발생한 두 거래라면 중복이 아니다.
레코드 연결(Record Linkage)은 여러 레코드가 같은 실체를 가리키는지 판별하는 과정이다. Fellegi-Sunter 원 연구는 필드의 일치·불일치 패턴으로 match, non-match, 검토 구간을 나누는 확률적 틀을 제시했다. [S5] 미국 Census Bureau의 품질 표준도 유효 링크 기준, 비교 변수, 가중치·임계값, 사람 검토와 오류율 모니터링을 명시하도록 요구한다. [S4] 이 표준의 법적 적용 대상은 Census 업무이지만, 불확실한 쌍을 자동 병합하지 않는 실무 원칙은 일반 조직에도 유용하다.
따라서 중복 제거에는 오탐 병합(False Match)과 미탐 분리(False Non-match)를 함께 측정한다. 고객 두 명을 한 사람으로 합치면 개인정보·추천·한도 결정이 섞일 수 있고, 한 사람을 둘로 남기면 이력과 품질 지표가 갈라진다. 정확 일치는 자동 후보로, 유사 일치는 점수와 근거를 붙인 검토 대상으로 만들고, 병합 전 원본 ID와 계보를 보존한다.
이름이 비슷하다는 이유만으로 합치지 않는다. 동일성 기준, 오탐·미탐 비용, 사람 검토 구간과 되돌리기 키가 함께 있어야 한다.
오류와 노이즈는 수정 방법이 다르다
오류는 근거가 있으면 고칠 수 있다. 판매 상태가 ‘정상’인데 수량이 -3이고 승인된 반품 원장에도 기록이 없다면 상태 또는 수량 오류 후보가 된다. 반면 반품 상태의 -3은 정상일 수 있다. 범위 규칙 하나만으로 음수를 삭제하면 반품 수요가 사라진다. 수정값은 승인 원천에서 가져오고 원본, 수정 이유, 실행 버전과 책임자를 남긴다.
노이즈는 반드시 한 값의 사실 오류로 환원되지 않는다. OCR의 작은 문자 흔들림, 센서의 미세 진동, 배경 음성, 라벨러의 모호한 경계 판단처럼 데이터와 목적의 관계를 흐릴 수 있다. 특히 라벨 노이즈는 ‘무작위 실수’뿐 아니라 분류 체계의 중첩과 지침 부족에서 생긴다. Confident Learning 연구는 모델의 교차검증 확률과 클래스 조건부 노이즈 가정으로 라벨 오류 후보를 순위화한다. [S8] 이는 자동 정답 교체기가 아니라, 가정과 모델에 의존하는 검토 우선순위 도구다.
노이즈 처리의 목표는 무조건 평활화가 아니다. 평균화·필터링·재라벨링 전후에 중요한 경계 사례, 소수 집단, 급격한 변화가 사라지지 않는지 확인한다. 고위험 AI에 관한 EU AI Act 제10조는 적용 대상에서 목적에 맞는 데이터 거버넌스, 준비·정제 과정, 편향과 데이터 격차의 식별·대응, 데이터셋의 관련성·대표성·가능한 범위의 오류 최소화를 규정한다. [S10] 적용 분류·시점·관할은 별도 법률 검토가 필요하다.
오류는 근거로 수정하고, 노이즈는 신호 보존을 검증한다. 둘 다 원본을 덮어쓰지 말고 처리 전후 비교가 가능해야 한다.
이상치는 삭제 대상이 아니라 가설이다
NIST 통계 핸드북은 이상치를 표본의 다른 값에서 비정상적으로 멀리 떨어진 관측으로 설명하면서, 무엇을 비정상으로 볼지는 분석자나 합의 과정의 판단에 달렸다고 밝힌다. [S7] 상자그림의 1.5×IQR, z-score, 거리·밀도 기반 점수는 후보를 찾는 규칙이지 오류를 증명하는 법칙이 아니다. 분포가 치우치거나 계절성·하위집단이 섞이면 정상 값도 쉽게 튄다.
scikit-learn 문서는 학습 데이터 안의 이탈 관측을 찾는 outlier detection과, 깨끗하다고 본 학습 분포에서 새 관측의 새로움을 찾는 novelty detection을 구분한다. [S6] 알고리즘마다 정상 영역 가정과 임계값이 다르며 `contamination` 같은 값은 탐지 경계를 바꾼다. 임계값은 ‘진짜 이상치 비율’의 자동 정답이 아니라 운영상 검토 용량과 오류 비용을 반영해 검증해야 한다.
이상치의 원인은 입력 실수, 장비 고장, 정책 변경, 특별 행사, 사기, 새로운 고객 행동처럼 다양하다. NIST는 자동 이상치 제거가 새로운 현상까지 가릴 수 있으므로 원인을 조사하라고 경고한다. [S7] AI 학습에서는 ① 원천 대조, ② 시간·매장·상품·집단 맥락 확인, ③ 영향 분석, ④ 수정·격리·가중치·보존 중 선택, ⑤ 재평가 순서가 안전하다.
이상 탐지 점수는 판결문이 아니다. 유효한 희귀 사례는 대표성과 안전성 평가에 꼭 필요한 데이터일 수 있다.
다온커머스의 데이터 문제 분류 장부
가상 조직 다온커머스가 하루치 POS 데이터 120만 행에서 1만8천 행을 ‘이상’으로 표시했다고 가정하자. 주문 ID·라인 번호·적재 배치까지 같은 6천 행은 재전송 로그와 대조해 기술적 중복으로 확정한다. 같은 고객·상품·수량이지만 주문 ID와 승인 시각이 다른 4천 행은 반복 구매이므로 보존한다. 상품명만 비슷한 3천 쌍은 상품 마스터의 공급사 코드·바코드·규격을 비교해 match, non-match, 사람 검토로 나눈다.
수량 -1인 2천 행 중 반품 상태와 원장이 맞는 행은 정상이다. 판매 상태인데 승인 원천과 모순되는 행만 오류 후보로 격리한다. 특정 매장의 소수점 판매량 흔들림은 센서·단위 변환 노이즈인지 조사하고, 프로모션 당일 판매 급증은 분포상 이상치지만 실제 행사 로그가 있으면 보존한다. 수치는 모두 교육용 가정이며 실제 통계가 아니다.
최종 산출물은 ‘데이터 문제 분류 장부’다. 후보마다 레코드 단위, 탐지 규칙, 문제 유형, 근거 원천, 사용 목적 영향, 처리 결정, 승인자, 되돌리기 키를 기록한다. NIST AI RMF Playbook은 결측·허위·이상 데이터 처리와 가정·제한의 문서화를 자발적 실천으로 제안하며 개정 예정임을 표시한다. [S2] 53명의 고위험 분야 실무자 인터뷰 연구는 데이터 문제가 뒤늦게 누적되는 ‘데이터 캐스케이드’를 보고했다. [S9] 보편 비율은 아니지만 원인 단계에서 기록할 이유를 보여 준다.
- 1. 단위한 행이 나타내는 실체·사건·시점과 허용 반복을 정의한다.
- 2. 탐지정확 일치, 규칙 위반, 잔차·거리·밀도 점수와 임계값을 기록한다.
- 3. 근거승인 원천, 계보, 로그, 사람 검토와 불확실성을 연결한다.
- 4. 영향전체·하위집단·시간 구간별 성능과 오탐·미탐 비용을 비교한다.
- 5. 결정수정·병합·격리·가중치·보존·재수집 중 목적에 맞게 선택한다.
- 6. 복구원본 ID, 처리 버전, 승인자, 되돌리기 키와 재검토 조건을 남긴다.
보관할 결과물: 데이터 문제 분류 장부. 탐지 규칙만 있고 근거·영향·되돌리기 조건이 없으면 자동 삭제를 승인하지 않는다.
마무리와 다음 회차
중복·오류·노이즈·이상치는 모두 ‘이상해 보이는 데이터’에서 시작하지만 판정 질문과 처리 방법이 다르다. 중복은 동일성, 오류는 참조 사실, 노이즈는 신호 관련성, 이상치는 분포와 맥락의 문제다. 탐지 규칙은 후보를 모을 뿐 삭제를 정당화하지 않는다. 원천·계보·시간·하위집단·오류 비용을 확인하고 원본과 되돌리기 경로를 보존해야 실제 희귀 사례를 지키면서 품질을 높일 수 있다. 다음 10회에서는 대표성·범위·균형을 살펴보고, 정제된 데이터에도 남아 있는 데이터 사각지대를 찾는다.
다음 10회차: 대표성·범위·균형과 데이터 사각지대 · 2026년 8월 31일
출처 및 읽을거리
확인 기준일: 2026-08-28 KST
- [S1] ISO - ISO/IEC 5259-2:2024 - Data quality measures
Locator: Public overview; measurable data-quality characteristics for analytics and ML · 확인일: 2026-08-28 · 제한: 공개 소개 범위만 사용했다. - [S2] NIST AI Resource Center - NIST AI RMF Playbook
Locator: Playbook status and voluntary-use notice; MAP/MEASURE documentation practices · 확인일: 2026-08-28 · 제한: 자발적 가이드이며 AI RMF 1.0 개정에 따라 갱신 예정이다. - [S3] UK Government Data Quality Hub - The Government Data Quality Framework
Locator: Data quality dimensions and uniqueness; lifecycle causes and root-cause practices · 확인일: 2026-08-28 · 제한: 영국 중앙정부 지침이며 일반 조직에는 실무 참고다. - [S4] U.S. Census Bureau - Statistical Quality Standard C4: Linking Data Records
Locator: C4-2 to C4-4; valid-link criteria, parameters, clerical review, testing and monitoring · 확인일: 2026-08-28 · 제한: Census 기관 표준이며 일반 조직의 법적 의무가 아니다. - [S5] Journal of the American Statistical Association - A Theory for Record Linkage
Locator: Fellegi and Sunter (1969); match, non-match and possible-link decision framework · 확인일: 2026-08-28 · 제한: 고전 원 연구로 조건부 독립 등 가정 검증이 필요하다. - [S6] scikit-learn - Novelty and Outlier Detection - User Guide 1.9.0
Locator: Definitions of outlier versus novelty detection; estimator assumptions and threshold controls · 확인일: 2026-08-28 · 제한: 구현 문서이며 점수만으로 삭제를 정당화하지 못한다. - [S7] NIST/SEMATECH - What are outliers in the data? - e-Handbook of Statistical Methods
Locator: Definition, graphical methods and analyst judgement; related warning on automatic rejection · 확인일: 2026-08-28 · 제한: 일반 통계 지침이며 특정 AI 임계값은 없다. - [S8] Journal of Artificial Intelligence Research - Confident Learning: Estimating Uncertainty in Dataset Labels
Locator: JAIR 70 (2021), 1373-1411; class-conditional noise assumptions and label-error ranking · 확인일: 2026-08-28 · 제한: 가정·모델·데이터 의존적이며 자동 교체 보장이 아니다. - [S9] ACM CHI / Google Research - Everyone wants to do the model work, not the data work: Data Cascades in High-Stakes AI
Locator: 2021 paper; interviews with 53 practitioners and reported 92% prevalence in the study sample · 확인일: 2026-08-28 · 제한: 질적 인터뷰 표본이므로 92%를 보편화하지 않는다. - [S10] EUR-Lex - Regulation (EU) 2024/1689 - Artificial Intelligence Act
Locator: Article 10(1)-(4); intended-purpose data governance, preparation, bias, gaps, errors and representativeness · 확인일: 2026-08-28 · 제한: 고위험 AI 기준이며 검토가 필요하다.
'스페셜 브리핑 > AI-Ready Data' 카테고리의 다른 글
| 평균 성능이 숨기는 실패: 편향·롱테일을 슬라이스로 평가하는 법 (0) | 2026.09.02 |
|---|---|
| AI 데이터의 사각지대: 대표성·범위·균형을 점검하는 법 (1) | 2026.08.31 |
| 결측값은 언제 채우고 언제 남겨야 할까: AI 데이터 결측 처리 5단계 (1) | 2026.08.26 |
| AI 데이터 품질 5차원: 정확성·완전성·일관성·유효성·최신성 측정법 (0) | 2026.08.24 |
| AI 데이터 준비도 진단: 사람·프로세스·기술·거버넌스 4축 체크리스트 (0) | 2026.08.21 |