평균 성능이 숨기는 실패: 편향·롱테일을 슬라이스로 평가하는 법
전체 평균에 가려진 하위집단·희귀 사건·교차 조건의 실패를 찾고, 표본 수와 오류 비용을 반영한 슬라이스 평가안을 설계할 수 있다.
편향은 경로의 결과다
10회에서는 데이터가 실제 사용 환경을 대표하는지 모집단·범위·균형으로 점검했다. 이번에는 그 사각지대가 모델 결과에서 어떻게 드러나는지 본다. 편향(Bias)은 데이터·설계·측정·운영 과정에서 특정 방향의 체계적 차이를 만드는 요인 또는 결과다. 롱테일(Long Tail)은 개별 빈도는 낮지만 합치면 중요하거나 오류 비용이 큰 희귀 사례의 긴 분포다. 둘은 다르지만 연결된다. 드문 사례가 수집·라벨·평가에서 밀리면 평균은 높아도 특정 집단과 경계 조건은 계속 실패할 수 있다.
NIST SP 1270은 AI 편향을 통계·계산 편향만으로 좁히지 않고, 체계적 편향과 인간의 인지 편향이 서로 작용하는 사회기술적 문제로 설명한다. [S1] 따라서 ‘편향이 있는 데이터’를 찾아 삭제하는 것만으로 끝나지 않는다. 목표를 누가 정했는지, 어떤 사람이 수집 경로에서 빠졌는지, 라벨 기준이 누구의 경험을 정상으로 삼았는지, 어떤 오류를 평균 지표가 상쇄했는지까지 이어서 본다.
선택 편향은 들어온 사례가 목표 모집단과 다를 때, 측정 편향은 센서·설문·대리변수가 집단별로 다르게 작동할 때, 라벨 편향은 정답 기준이 흔들리거나 과거 의사결정의 차이를 복제할 때 나타난다. 데이터 감사와 결과 감사를 함께 해야 하는 이유다.
EU AI Act 제10조는 적용 대상인 고위험 AI의 데이터 거버넌스에서 가능한 편향을 조사하고 탐지·예방·완화 조치를 요구한다. [S2] 모든 AI에 동일하게 적용되는 문장은 아니며 시스템 분류·역할·관할·적용 시점은 법률 검토가 필요하다. 실무적으로는 편향 경로와 대응 책임을 품질 기록에 포함할 근거가 된다.
| 평가 층위 | 핵심 질문 | 핵심 증거 | 기본 대응 |
|---|---|---|---|
| 전체 평균 | 시스템 전반의 성능은 어떤가 | 가중 평균·운영 분포 | 전체 추세 감시 |
| 핵심 슬라이스 | 중요 집단·조건에서 성능이 유지되는가 | 사전 지정 지표·표본 수 | 조건별 보완 |
| 교차집단 | 두 축 이상이 만날 때 격차가 커지는가 | 교차 조건 오류·불확실성 | 추가 확인·제한 |
| 최악·테일 | 가장 취약한 조건과 희귀 사건은 무엇인가 | 최악 성능·오류 비용 | 수집·검토·중단 |
편향을 하나의 숫자로 ‘제거’했다고 선언하지 않는다. 데이터 생성부터 배포 결과까지 어떤 경로에서 차이가 생겼는지 추적하고, 남은 위험과 사용 제한을 기록한다.
롱테일은 실패 비용의 지도다
롱테일 분포에서는 소수의 헤드(Head) 사례가 관측 대부분을 차지하고, 많은 테일(Tail) 사례는 각각 조금씩 나타난다. 실제 운영 데이터는 이런 모양이 흔하다. CVPR의 장꼬리 인식 연구는 현실 데이터에서 다수·소수 클래스와 미관측 클래스를 함께 다루는 문제가 중요하며, 전체 클래스 스펙트럼에서 성능이 고르게 나오지 않는다고 설명한다. [S3] 다만 이 결과는 시각 분류 연구에서 나온 것이므로 수요예측·문서 검색에 같은 알고리즘을 그대로 옮긴다는 뜻은 아니다.
희귀 사례도 오류 비용과 의미가 다르다. 피해가 큰 사건은 위험 슬라이스로 분리하고, 라벨 오류·중복·새 유형이 섞였는지 확인한다. ICCV 2023 연구는 장꼬리 학습에서 헤드 내부의 의미 구조와 테일의 과도한 강조 사이의 균형 문제를 지적했다. [S4] ‘테일만 늘리기’가 항상 정답은 아니다.
학습·평가 목적도 분리한다. 학습에서는 재표본·가중치·표현 학습을 실험할 수 있지만, 운영 성능 추정용 테스트는 실제 빈도를 보존한다. 위험 확인용 스트레스 세트는 테일을 의도적으로 많이 넣을 수 있으나 전체 발생률 추정에 섞지 않는다. 데이터셋마다 자연 분포, 학습 분포, 위험 평가 분포를 명시한다.
테일의 우선순위는 건수만으로 정하지 않는다. 발생 가능성, 피해 규모, 탐지 가능성, 사람의 개입 가능성을 함께 보고 수집·검토·사용 제한을 선택한다.
평균을 슬라이스·교차집단·최악 성능으로 분해한다
슬라이스(Slice)는 평가를 위해 나눈 의미 있는 하위집단이다. 지역·기기·언어·상품 수명주기 같은 운영 조건과, 필요성과 권한을 검토한 사람 집단 특성을 후보로 삼는다. 단일 축만 보면 교차 조건의 실패가 다시 평균에 묻힌다. Gender Shades 원 연구는 피부색과 성별을 교차해 평가했을 때 당시 상용 분류기의 오류율이 가장 낮은 집단 0.8%와 가장 높은 집단 최대 34.7%로 크게 달랐음을 보였다. [S5] 이 수치는 2018년 특정 과제·데이터·시스템의 결과이며 현재 모든 얼굴 분석 모델로 일반화하면 안 된다. 핵심은 교차집단 평가가 숨은 격차를 드러냈다는 방법론이다.
NIST AI RMF Playbook은 집단 간뿐 아니라 집단 내부와 교차집단의 차이, 작은 집단과 단일 개인에 미치는 편향, 거짓양성·거짓음성 같은 품질 지표를 살피도록 제안한다. [S6] Playbook은 자발적 제안이며 체크리스트가 아니다. 조직은 사용 맥락과 오류 비용에 맞는 지표를 고른다. 예를 들어 희귀 이상 탐지에서는 정확도보다 재현율과 누락 비용이, 자동 승인에서는 거짓양성과 이의제기 경로가 더 중요할 수 있다.
전체 평균 외에 매크로 평균, 슬라이스별 지표, 최악 집단 성능(Worst-group Performance), 표본 수와 신뢰구간을 함께 보고한다. 숨은 층화(Hidden Stratification)는 큰 라벨 안의 세부 유형 성능이 다른 현상이다. NeurIPS 연구는 거친 클래스만으로 학습한 모델이 하위유형별로 크게 다른 성능을 낼 수 있다고 설명한다. [S7] 오류 검토와 군집은 탐색 도구일 뿐, 자동 군집을 실제 사회집단이나 원인으로 단정하지 않는다.
슬라이스가 작을수록 지표는 흔들린다. ‘성능이 낮다’ 또는 ‘문제없다’고 단정하기 전에 분자·분모, 불확실성, 반복 측정과 오류 사례를 함께 본다.
발견·판정·행동을 연결한다
슬라이스를 무한히 늘리면 우연한 격차와 다중 비교 문제가 커진다. 먼저 사용 목적과 피해 시나리오에서 사전 지정 슬라이스를 만든다. 다음으로 오류 로그에서 새 패턴을 탐색하고, 발견용 데이터와 확인용 데이터를 분리한다. 같은 테스트 세트를 보며 슬라이스를 만들고 통과 여부까지 판단하면 평가에 과적합할 수 있다.
각 슬라이스에는 정의, 포함·제외 규칙, 데이터 소유자, 표본 수, 기준 지표, 허용 차이, 최소 증거량과 실패 행동을 적는다. NIST AI RMF Core는 위험 측정에 불확실성, 벤치마크 비교, 문서화와 배포 맥락을 포함하고, 측정하지 못한 위험도 기록하도록 제안한다. [S8] 작은 표본은 통과로 간주하지 말고 ‘증거 부족’ 상태를 둘 수 있다.
최근 ICML 연구는 훈련과 목표 데이터의 하위집단 비율 차이가 성능을 떨어뜨릴 수 있어 최악 집단 정확도를 별도 평가한다. [S9] 방법론 도입보다 평균과 최악 슬라이스의 간극을 운영 지표로 두고, 임계값 초과 시 수집·학습·사람 검토·기능 제한 중 정해진 행동으로 연결하는 일이 우선이다.
평가표의 마지막 열은 반드시 행동이다. 임계값을 넘었는데도 누가 무엇을 언제 할지 없으면 측정은 대시보드 장식에 머문다.
다온커머스의 슬라이스 평가 설계
가상 조직 다온커머스의 14일 수요예측 모델이 전체 가중절대백분율오차(WAPE) 12%라고 가정하자. 평균만 보면 목표 15%를 통과한다. 그러나 ‘지방 소형 매장×출시 30일 이내 신상품×주말 프로모션’ 슬라이스는 42건뿐이고 품절 누락률이 31%라고 가정한다. 수치는 모두 교육용 가상 값이다. 이 조합은 빈도는 낮지만 매대 공백과 긴급 물류를 만들 수 있어 별도 승인 조건이 필요하다.
팀은 판매 빈도뿐 아니라 매장 규모, 지역, 신상품, 프로모션, 품절, 반품, 업로드 지연을 조합해 사례 수·WAPE·누락률·손실 비용을 본다. 지아는 오류 후보를 찾고, 서윤과 매장 Steward는 업무 의미를, 민호는 수집 누락을 확인한다.
승인안은 전체 WAPE, 사전 지정 핵심 슬라이스, 최악 슬라이스, 증거 부족 슬라이스를 한 표에 둔다. 예시 행동은 ‘표본 100건 미만은 자동 통과 금지’, ‘품절 누락률 20% 초과 시 해당 조건의 발주 추천을 사람 검토로 전환’, ‘다음 프로모션 전 추가 수집’이다. 임계값은 조직의 가정이며 실제 운영에서는 비용·규제·안전·통계적 검정력에 맞춰 검증해야 한다.
- 1. 목적AI의 결정, 사용자, 피해 시나리오와 전체 승인 지표를 적는다.
- 2. 슬라이스사전 지정 단일·교차 조건과 포함·제외 규칙을 정의한다.
- 3. 증거사례 수, 오류 수, 기준 기간, 불확실성과 데이터 누락을 기록한다.
- 4. 지표전체 평균, 슬라이스별 거짓양성·거짓음성, 최악 성능을 연결한다.
- 5. 기준허용 차이, 최소 증거량과 ‘증거 부족’ 상태를 정한다.
- 6. 행동추가 수집·재학습·사람 검토·기능 제한·중단 조건을 지정한다.
- 7. 책임Owner, 실행 담당자, 재검토일과 변경 기록을 남긴다.
보관할 결과물: 슬라이스 평가 설계안. 슬라이스 정의, 오류 비용, 지표, 표본 수, 불확실성, 허용 기준, 실패 행동, 책임자와 재검토일을 한 장에 연결한다.
마무리와 다음 회차
편향은 한 번의 데이터 정제로 사라지는 결함이 아니라 생성·수집·라벨·학습·측정·배포 경로에서 누적될 수 있는 체계적 차이다. 롱테일은 단순히 적은 클래스가 아니라 드물지만 중요하거나 피해가 큰 사건의 지도다. 전체 평균, 핵심 슬라이스, 교차집단, 최악 성능과 증거 부족 상태를 함께 보고, 각 실패를 수집·검토·제한 행동에 연결해야 평균 뒤의 위험이 운영 통제로 바뀐다. 다음 12회에서는 지금까지의 품질 차원과 슬라이스 평가를 품질 지표·허용 기준·Data Contract로 묶는다.
다음 12회차: 품질 지표·허용 기준·Data Contract · 2026년 9월 4일
출처 및 읽을거리
확인 기준일: 2026-09-02 KST
- [S1] NIST - NIST SP 1270 - Towards a Standard for Identifying and Managing Bias in Artificial Intelligence
Locator: Sections 3-4; systemic, statistical/computational and human bias across the AI lifecycle · 확인일: 2026-09-02 · 제한: NIST 특별간행물의 사회기술적 편향 관리 프레임이며 단일 공정성 지표나 의무 임계값을 정하지 않는다. - [S2] EUR-Lex - Regulation (EU) 2024/1689 - Artificial Intelligence Act
Locator: Article 10(2)(f)-(g), 10(3)-(5); examination, prevention and mitigation of possible biases for high-risk AI data governance · 확인일: 2026-09-02 · 제한: 고위험 AI 관련 법률 기준이며 적용 여부·역할·관할·시행 시점은 별도 법률 검토가 필요하다. - [S3] IEEE/CVF CVPR - Large-Scale Long-Tailed Recognition in an Open World
Locator: Abstract and Introduction; head, tail and open classes in naturally long-tailed recognition · 확인일: 2026-09-02 · 제한: 시각 인식 원 연구로 다른 업무에 그대로 일반화하지 않는다. - [S4] IEEE/CVF ICCV - Subclass-balancing Contrastive Learning for Long-tailed Recognition
Locator: Abstract; head-class semantic substructures and tail-class overemphasis trade-off · 확인일: 2026-09-02 · 제한: 시각 장꼬리 인식 연구이며 보편 처방이 아니다. - [S5] Proceedings of Machine Learning Research - Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification
Locator: Abstract and Tables 2-3; intersectional error disparities in the evaluated 2018 systems · 확인일: 2026-09-02 · 제한: 2018년 특정 얼굴 성별 분류 과제·데이터·상용 시스템 결과이며 현재 시스템 전체로 일반화하지 않는다. - [S6] NIST AI Resource Center - AI RMF Playbook - Measure
Locator: Measure suggestions on within-group/intersectional disparities, small groups, FPR/FNR and context-specific metrics · 확인일: 2026-09-02 · 제한: 자발적 실천 제안이며 AI RMF 1.0 개정 후 갱신 예정으로 표시되어 있다. - [S7] NeurIPS - No Subclass Left Behind: Fine-Grained Robustness in Coarse-Grained Classification Problems
Locator: Abstract; hidden stratification and variable performance across unlabeled subclasses · 확인일: 2026-09-02 · 제한: 제안된 군집 기반 접근은 탐색 도구이며 자동 군집을 실제 사회집단이나 원인으로 단정할 수 없다. - [S8] NIST AI Resource Center - AI Risk Management Framework 1.0 - Core
Locator: Measure 1 and 2, Measure 4.1-4.3; uncertainty, benchmarks, deployment context and documented limits · 확인일: 2026-09-02 · 제한: 자발적 프레임워크이며 NIST는 AI RMF 1.0 개정 작업이 진행 중이라고 표시한다. - [S9] Proceedings of Machine Learning Research - Diverse Prototypical Ensembles Improve Robustness to Subpopulation Shift
Locator: ICML 2025 abstract; subpopulation shift and worst-group accuracy evaluation · 확인일: 2026-09-02 · 제한: 2025년 연구 방법과 실험 결과이며 조직별 배포 전에 데이터·가정·비용 검증이 필요하다.
'스페셜 브리핑 > AI-Ready Data' 카테고리의 다른 글
| 흩어진 데이터를 AI 자산으로 바꾸는 인벤토리와 카탈로그 (0) | 2026.09.07 |
|---|---|
| 품질 지표를 실패 행동으로 연결하는 Data Contract 설계 (0) | 2026.09.04 |
| AI 데이터의 사각지대: 대표성·범위·균형을 점검하는 법 (1) | 2026.08.31 |
| 중복·오류·노이즈·이상치, 무엇을 지우고 무엇을 남길까 (0) | 2026.08.28 |
| 결측값은 언제 채우고 언제 남겨야 할까: AI 데이터 결측 처리 5단계 (1) | 2026.08.26 |