데이터보다 AI 사용 목적을 먼저: 오류 비용에서 데이터 요구사항을 역산하는 법
AI 사용 사례의 결정과 실패 비용에서 필요한 데이터·품질·평가·중단 조건을 역산할 수 있다.
목적부터, 데이터는 그다음
02회차에서는 같은 원천도 운영·BI·AI가 서로 다른 준비 기준을 가진다고 봤다. 이번 결론은 그보다 한 단계 앞선다. 보유 데이터 목록을 펼치기 전에 누가 어떤 순간에 어떤 결정을 내리고, 틀렸을 때 무엇을 잃는지 정해야 데이터의 단위·시점·대표성·권한·평가 기준을 제대로 고를 수 있다.
AI 사용 사례(AI use case)는 모델 이름이 아니라 특정 사용자가 정해진 맥락에서 AI 출력으로 수행할 업무와 결정을 뜻한다. '수요예측 모델 구축'은 기술 과제일 뿐이다. '매장 발주 담당자가 매일 오전 9시에 14일 발주량을 검토해 품절과 과잉재고를 줄인다'처럼 사용자·행동·시점·성과가 있어야 사용 사례가 된다. Google은 먼저 비-ML 언어로 제품 목표를 쓰고, 단순 규칙이나 기존 절차가 더 나은지 비교한 뒤 ML 접근을 택하라고 권고한다. [S3]
반대로 '주문 데이터 3년치가 있으니 예측을 해보자'에서 시작하면 이미 수집된 필드가 문제 정의를 지배한다. 발주가 변경될 수 있는 마감시각, 예측 시점에 알 수 있는 입고 예정, 신규 매장과 프로모션 같은 중요한 조건이 빠져도 발견이 늦다. 데이터가 많다는 사실은 행동 가능성이나 목적 적합성(Fitness for Purpose)을 증명하지 않는다. ISO/IEC 5259-1의 공개 설명도 데이터 품질을 의도한 목적에 적합한지 평가·관리하는 문제로 연결한다. [S6]
시작 질문은 '어떤 데이터가 있는가?'가 아니라 '누가 어떤 결정을 더 잘 내리게 할 것인가?'다.
목적에서 데이터로 내려오는 일곱 연결고리
NIST AI RMF의 MAP 기능은 의도된 목적, 사용자와 영향받는 사람, 배포 환경, 조직 목표, 위험 허용도와 시스템 요구를 먼저 문서화하고 구체적 과업·사람의 감독·데이터 선택과 검증을 연결한다. 특히 예상되는 AI 오류의 금전적·비금전적 비용을 조직의 위험 허용도와 함께 검토하도록 한다. [S1] 이것은 데이터팀이 사업 문장을 그대로 받으라는 뜻이 아니라, 검증 가능한 요구사항으로 번역하라는 뜻이다.
- 사용자출력을 쓰는 사람과 영향받는 사람
- 결정출력 뒤 실제 행동과 책임
- 시점입력이 필요한 순간과 범위
- 출력예측·분류·생성·설명 형식
- 성과사업 지표와 모델 지표
- 오류유형별 비용과 허용 한도
- 감독사람 승인·보류·되돌리기
Google의 문제 프레이밍은 이상적 결과와 모델 목표를 구분하고, 필요한 출력이 분류·수치 예측·생성 중 무엇인지 정한 뒤 성공 지표를 세우는 흐름을 제시한다. [S4] 모델 지표와 사업 지표도 분리해야 한다. 정확도나 F1이 높아도 발주 변경이 늦거나 상담원이 출처를 확인할 수 없다면 업무 성과는 개선되지 않을 수 있다. [S5]
오류 비용이 품질 임계값을 만든다
예측
과대 발주는 재고 비용, 과소 발주는 품절 비용을 만든다. 상품·매장별 허용 범위를 나눠야 한다.
RAG
근거 없음은 답변 보류로 처리할 수 있다. 틀린 정책 안내보다 안전한 실패가 우선일 수 있다.
EU AI Act Article 10은 고위험 AI의 데이터 거버넌스와 학습·검증·테스트 데이터 품질을 의도된 목적에 연결하고, 관련성·대표성·오류·완전성·데이터 공백과 사용 환경을 다룬다. [S7] 이는 모든 프로젝트에 같은 법적 의무가 적용된다는 뜻은 아니다. 다만 목적이 달라지면 필요한 데이터와 위험 통제도 다시 평가해야 한다는 규제적 근거를 보여준다. 적용 대상과 시점은 공식 최신 안내와 법률 자문으로 별도 확인해야 한다. [S8]
전문가 판단: 품질 임계값은 데이터팀의 관행이 아니라 오류 비용·위험 허용도·사람의 개입 능력에서 나온다.
다온커머스 Use Case-to-Data 캔버스
가상의 다온커머스는 두 목표를 동시에 검토한다. Use Case A는 매장·상품별 14일 수요예측과 발주 추천이다. 사용자는 발주 담당자이고, 매일 오전 9시 승인 전에 추천을 수정할 수 있어야 한다. 설명용 가정으로 식품성 상품은 과대 발주 비용을, 인기 필수품은 품절 비용을 더 크게 둔다. 이 목적에서 주문·POS·재고·입고·프로모션의 예측 시점 스냅숏, 상품·매장별 평가, 수동 수정 로그가 요구된다.
Use Case B는 상담원이 배송·교환·반품 정책을 근거로 답하는 고객센터 RAG다. 사용자는 상담원이고 영향받는 사람은 고객이다. 답변은 승인된 정책 문장과 시행일을 인용해야 하며, 충돌·권한 부족·근거 없음이면 생성하지 않고 보류한다. 그래서 고객 문의 이력만 많이 모으는 것보다 정책 승인본, 문단 구조, 유효기간, 접근권한, 폐기 전파와 질문-근거-답변 평가셋이 우선이다.
| 캔버스 항목 | 수요예측·발주 | 고객센터 RAG | 데이터 요구 |
|---|---|---|---|
| 사용자·행동 | 발주 담당자가 추천량 승인·수정 | 상담원이 근거 답변 검토·전달 | 행동 로그·승인 상태 |
| 결정 시점 | 매일 09시, 향후 14일 | 문의 시점의 유효 정책 | 시점 스냅숏·시행일 |
| 주요 오류 비용 | 과대=재고, 과소=품절 | 오답=고객 피해, 모름=지연 | 오류 유형별 라벨·가중치 |
| 필수 근거 | 주문·POS·재고·입고·프로모션 | 승인 정책·권한·인용 위치 | 출처·계보·접근권한 |
| 허용 실패 | 고위험 SKU 보류·사람 승인 | 근거 없음·충돌 시 답변 보류 | 임계값·중단·에스컬레이션 |
두 사례의 수치와 임계값은 아직 가정이다. 캔버스의 목적은 숫자를 꾸미는 것이 아니라 무엇을 측정하고 누가 승인할지 드러내는 데 있다. 데이터 공백이 보이면 즉시 수집부터 시작하지 말고, 간단한 규칙·수동 절차·작은 파일럿과 비교해 AI가 추가 가치를 낼 수 있는지 확인한다. NIST는 MAP 결과가 설계·개발·배포의 초기 go/no-go 판단에 충분한 맥락을 제공해야 한다고 설명한다. [S1]
가치·데이터·위험 세 문을 통과하라
첫째는 가치 문이다. AI 출력이 실제 행동으로 이어지고 사업 지표와 연결되는가? 둘째는 데이터 문이다. 결정 시점에 사용할 수 있는 입력, 정답·근거, 대표 하위집단과 권한이 있으며 공백을 측정할 수 있는가? 셋째는 위험 문이다. 오류 유형별 허용 한도, 보류·사람 승인·되돌리기, 운영 모니터링이 정의됐는가? 세 문 중 하나라도 답이 없으면 모델 종류보다 실험 범위 축소나 비-AI 대안을 먼저 검토한다.
- 목적AI가 아니라 비-AI 언어로 개선하려는 결과를 한 문장으로 썼는가?
- 사용자출력을 쓰는 사람과 간접적으로 영향받는 사람을 구분했는가?
- 결정출력 뒤 실제 행동, 책임자와 되돌릴 수 있는 범위를 정했는가?
- 시점입력이 사용 가능해야 하는 순간과 예측·검색 범위를 고정했는가?
- 성과사업 지표, 모델 지표, 배포 허용 기준을 서로 분리했는가?
- 오류거짓 양성·거짓 음성·근거 없음의 비용과 하위집단을 적었는가?
- 데이터입력·정답/근거·대표성·권한·최신성·공백을 추적할 수 있는가?
- 실패 행동보류·사람 승인·중단·되돌리기와 재평가 조건이 있는가?
승인 규칙: 가치·데이터·위험 세 문이 모두 열려야 본격적인 데이터 구축과 모델 실험으로 진행한다.
마무리와 다음 회차
AI Ready Data는 보유 데이터에 모델을 붙이는 프로젝트가 아니다. 사용자의 결정, 시점, 성공과 오류 비용을 먼저 정하고 그 목적에 필요한 입력·정답·근거·대표성·권한·품질·실패 행동을 역산하는 계약이다. 다음 04회차에서는 이 캔버스를 바탕으로 정형·반정형·비정형·멀티모달 데이터가 각각 어떤 의미와 맥락을 잃기 쉬운지 살펴본다.
다음 04회차: 정형·반정형·비정형·멀티모달 데이터 · 2026년 8월 17일
출처 및 읽을거리
확인 기준일: 2026-08-14 KST
- [S1] NIST AI Resource Center - AI Risk Management Framework 1.0 - AI RMF Core
Locator: MAP 1.1-1.6, MAP 2.1-2.3, MAP 3.1-3.5, MAP 5.1; MEASURE 1.1 · 확인일: 2026-08-14 · 제한: NIST AI RMF 1.0은 자발적 프레임워크이며 개정 작업이 진행 중이다. 법적 의무로 표현하지 않았다. - [S2] NIST AI Resource Center - AI RMF Playbook - Map
Locator: MAP 1.4 Suggested Actions; MAP 2.2-3.5; MAP 5.1 Suggested Actions · 확인일: 2026-08-14 · 제한: Playbook은 프레임워크 적용을 돕는 자발적 권고다. 조직의 맥락과 위험 허용도에 맞게 선택해야 한다. - [S3] Google for Developers - Understand the problem
Locator: State the goal; Clear use case for ML; Predictive ML and data; Predictions vs. actions · 확인일: 2026-08-14 · 제한: Google의 교육용 ML 실무 권고이며 모든 AI 프로젝트에 강제되는 표준은 아니다. - [S4] Google for Developers - Framing an ML problem
Locator: Define the ideal outcome and model goal; Identify output; Define success metrics · 확인일: 2026-08-14 · 제한: 예측 ML과 생성형 AI 문제 정의를 위한 교육 지침이다. 도메인 위험 분석을 대체하지 않는다. - [S5] Google for Developers - Measuring success
Locator: Business metrics; Model metrics; Acceptability goals; Connection between model and business metrics · 확인일: 2026-08-14 · 제한: 제품·ML 프로젝트 운영 권고다. 예시 임계값을 다온커머스에 그대로 적용하지 않았다. - [S6] ISO - ISO/IEC 5259-1:2024 - Data quality for analytics and machine learning - Part 1
Locator: What is ISO/IEC 5259-1?; Why is it important?; Published status · 확인일: 2026-08-14 · 제한: 공개 소개 페이지만 확인했다. 유료 표준 전문의 세부 요구사항은 인용하거나 재현하지 않았다. - [S7] EUR-Lex - Regulation (EU) 2024/1689 - Artificial Intelligence Act
Locator: Article 3(12)-(13); Article 9; Article 10(2)-(4) · 확인일: 2026-08-14 · 제한: Article 10은 고위험 AI 시스템에 대한 법률 조항이다. 적용 대상·시점·관할 판단은 별도 법률 검토가 필요하다. - [S8] European Commission - Navigating the AI Act
Locator: High-risk classification; provider and deployer obligations; intended purpose and input data · 확인일: 2026-08-14 · 제한: 집행·표준화 일정과 가이드가 변할 수 있는 공식 설명 페이지다. 법률 원문을 대체하지 않는다.
'스페셜 브리핑 > AI-Ready Data' 카테고리의 다른 글
| AI 데이터 생애주기: 수집부터 폐기까지 신뢰와 사용권을 지키는 법 (0) | 2026.08.19 |
|---|---|
| 정형·반정형·비정형·멀티모달: AI가 놓치기 쉬운 의미의 경계 (0) | 2026.08.17 |
| 일반 데이터·BI 데이터·AI 데이터의 차이: 같은 원천, 다른 준비 기준 (0) | 2026.08.12 |
| AI Ready Data란 무엇인가: 깨끗함을 넘어 목적·근거·운영까지 (0) | 2026.08.10 |
| AI Daily Special 예고|AI Ready Data 완전정복, 36회 연재를 시작합니다 (0) | 2026.08.05 |