데일리 브리핑/AI

Claude 연속 장애가 남긴 교훈, 에이전트 복구 설계의 7가지 기준

반응형
AI Daily Research #026

Claude 연속 장애, 에이전트 운영은 복구 설계가 성능이다

Anthropic은 Claude API·Code·Cowork 장애와 Fable 5 오류를 모두 해결했다. 그러나 8월 12~15일 공식 기록에 반복 장애가 이어졌고 원인은 공개되지 않았다. 오늘의 실무 결론은 재시도·회로 차단·작업 재개·다중 공급자 복구를 제품 기능으로 설계하라는 것이다.

Executive Summary · 1개 뉴스와 3개 분석

01

Claude 장애 2건 해결, 현재는 전 구성요소 정상

Claude API·Code·Cowork는 24분, Fable 5·claude.ai는 4시간 11분 영향을 받았다. 모두 해결됐고 현재 미해결 사건은 0건이다. [S1][S2][S3][S4]

02

세 날 연속 기록, 단일 장애보다 반복성이 문제

8월 12~15일 사건 기록은 반복성을 보여주지만 공통 원인을 증명하지 않는다. 겹치는 사건 시간을 고유 다운타임으로 더하지 않는다. [S1][S2]

03

자동 재시도만으로는 장기 작업을 지키지 못한다

공식 SDK는 일시 오류를 기본 두 번 재시도한다. 장기 작업에는 체크포인트·멱등 키·회로 차단·durable queue가 추가로 필요하다. [S5][S6]

오늘의 큰 흐름

최신 두 major 사건은 해결됐고 현재는 정상이다. 반복 사건과 원인 공백을 과장하지 않되, 에이전트 팀은 재시도보다 체크포인트·멱등성·회로 차단·안전한 재개를 운영 계약으로 만들어야 한다.

초보자를 위한 핵심 용어

영향 시간

상태 페이지가 사후에 명시한 실제 사용자 영향 구간이다. 게시·조사·모니터링 시간과 다르다. [S1][S2]

지수 백오프

실패할 때마다 대기 시간을 늘려 재시도 폭주를 막는 방식이다. 공식 SDK는 일시 오류를 기본 두 번 재시도한다. [S5]

회로 차단

오류율이 임계치를 넘으면 새 호출을 잠시 멈춰 공급자와 내부 큐의 추가 과부하를 막는 통제다.

Fallback

Fable 안전 분류 거절을 다른 모델로 넘기는 기능이다. 서비스 장애나 과부하의 자동 복구와 같지 않다. [S7]

Claude 장애 2건 해결, 현재는 전 구성요소 정상

FACT - Claude API·Claude Code·Claude Cowork 영향은 8월 14일 20:14~20:38 UTC의 24분이었다. 별도 Fable 5·claude.ai 사건의 영향은 20:00 UTC부터 8월 15일 00:11 UTC까지 4시간 11분이었다. 두 사건은 major로 기록됐고 모두 resolved다. [S1][S2]

장애가 대화 UI에만 머물지 않고 API와 코딩·업무 에이전트를 함께 건드렸다. 장기 작업은 한 번의 실패가 코드 실행·도구 호출·사람 승인 상태까지 잃게 만들 수 있다.

FACT - 08:09 KST 기준 상태 페이지는 claude.ai, Console, API, Code, Cowork, Government를 모두 operational로 표시하고 unresolved API는 빈 배열을 반환한다. [S1][S3][S4]

운영 중단은 토큰 비용보다 재실행·사람 대기·중복 쓰기·배포 지연을 키운다. 공급자 SLA와 별개로 내부 완료율·복구시간·중복 실행률을 측정해야 한다.

초보자가 기억할 한 문장

현재 정상은 사실이지만 복구 설계가 충분하다는 뜻은 아니다.

앞으로 확인할 것

원인·사용자 수·지역·재발 방지는 미공개다. 추가 사건과 RCA를 확인한다.

세 날 연속 기록, 단일 장애보다 반복성이 문제

FACT - 공식 기록에는 8월 12일 다중 모델 성능 저하, 13일 Mythos 5·Fable 5·Sonnet 5 오류, 14일 API·Code·Cowork 장애, 15일 Fable 5 오류 해결이 연속으로 남아 있다. [S1][S2]

Incident Analysis - 마지막 사건의 해결이 직전 #025 cutoff 뒤에 확정돼 오늘의 상태 변경으로 선정했다.

한 번의 짧은 사건은 일반 운영 변동일 수 있지만, 여러 날과 구성요소에 걸친 반복은 단일 재시도 규칙이 아니라 시스템 차원의 복구 전략을 요구한다.

CALCULATION - 최근 Fable 사건은 251분, API·Code·Cowork 사건은 24분이다. 서로 일부 겹치고 영향 범위가 달라 합계 275분을 고유 다운타임으로 해석하지 않는다.

핵심 균형

반복성은 평균 가동률 뒤에 숨으므로 사건 단위와 작업 단위를 함께 본다.

정책과 산업에 주는 의미

평균 uptime보다 사건 빈도·업무 시간 중첩·완료율·RTO를 함께 본다.

자동 재시도만으로는 장기 작업을 지키지 못한다

FACT - Claude 공식 SDK는 연결 오류, rate limit, 5xx를 지수 백오프로 기본 두 번 재시도하고 retry-after가 있으면 따른다. 500·504·529 오류 처리와 request-id 보존이 공식 문서에 명시돼 있다. [S5][S6]

짧은 순간 오류에는 충분할 수 있지만 24분 또는 수시간 영향에는 무제한 재시도가 비용·부하·중복 쓰기를 키운다.

INTERPRETATION - 재시도 예산, jitter, 회로 차단, durable queue, 단계 체크포인트, 멱등 키, dead-letter queue, 운영자 재개 기능을 한 복구 경로로 묶는다.

복구 성공률과 RTO를 높이면 공급자 변경 없이도 실제 작업 손실을 줄일 수 있다. 반대로 다중 공급자는 데이터·정책·품질 편차를 새 위험으로 만든다.

가장 큰 병목

재시도는 복구의 한 부품이며 작업 상태 보존이 핵심이다.

앞으로 볼 지표

스트리밍은 HTTP 200 뒤에도 실패할 수 있어 완료 이벤트와 도구 결과를 검증한다.

모델 fallback과 서비스 복구는 별도 통제다

FACT - Fable의 server-side fallback은 안전 분류가 요청을 거절할 때만 작동하고 rate limit, overload, server error는 그대로 반환한다. [S7]

한국 팀은 새벽 UTC 장애가 KST 업무 시작과 겹칠 수 있으므로 글로벌 상태만 보지 말고 국내 업무 큐·승인자·사용자 공지 시간을 함께 측정해야 한다.

안전 fallback, 동일 공급자 모델 fallback, 다른 공급자 fallback, 큐 대기, 읽기 전용 축소 모드를 서로 다른 정책으로 설계한다.

OUTLOOK - 반복 장애가 장기화되면 멀티모델 게이트웨이와 에이전트 신뢰성 도구 수요가 늘 수 있으나 하루의 사건으로 시장 변화를 확정하지 않는다.

핵심 판단

거절 fallback과 장애 복구를 같은 스위치로 취급하지 않는다.

아직 남은 위험

Fable 안전 fallback은 rate limit·overload·server error를 처리하지 않는다. 장애 복구 정책을 별도로 둔다. [S7]

그래서 우리에게 어떤 의미가 있을까?

개발자

개발자 - 오류 유형과 request-id를 보존한다.

기업

운영자 - 체크포인트와 회로 차단을 훈련한다.

투자자

보안·정책 - 대체 모델의 데이터·도구 권한을 승인한다.

창업자

리더 - uptime 외 완료율·RTO·중복 쓰기를 승인 지표로 둔다.

기업·생태계 전략 비교

주체현재 전략강점핵심 리스크
Anthropic Status사건 공개구성요소·시간원인 공백
API client제한 재시도SDK 기본값폭주·중복
Agent runtime상태 보존체크포인트부분 실행
SRESLO·회로 차단운영 관측평균값 착시
Security권한·대체 통제정책 게이트대체 경로 유출

Agent Recovery Gate: 재시도보다 상태 보존과 안전한 재개가 에이전트 복구의 핵심이다.

오류 분류, 재시도 예산, 체크포인트, 멱등성, 회로 차단, 큐, 대체 모델, 사람 승인과 RTO를 함께 확인한다.

오류 유형, 작업 상태, 권한과 복구 모드를 결합해 재시도·대기·대체·사람 승인을 결정한다.

강점

강점 - 긴 작업을 처음부터 다시 시작하지 않고 증거와 함께 재개한다.

주의점

한계 - 공급자 원인과 고객별 실제 오류율 없이는 재발 확률을 산정하지 못한다.

추천 사용법

읽기 작업부터 chaos test를 수행하고 배포·결제·외부 메시지는 멱등성과 사람 승인을 통과시킨다.

Claude Incident Cluster and Recovery Matrix

Claude 상태 페이지·Incident API·Component API·Unresolved API와 공식 오류·rate limit·fallback 문서를 대조했다. 상태·시간은 FACT, 기간 계산은 CALCULATION, 복구 설계는 INTERPRETATION이다. [S1][S2][S3][S4][S5][S6][S7]

오해하지 말아야 할 점

무엇이 얼마나 오래 영향을 받았고 지금은 정상인지, 공식 자동 재시도가 무엇을 해결하고 무엇을 해결하지 못하는지 나눈 조사다.

공식 Statuspage JSON과 Claude 오류·rate limit·fallback 문서를 대조했다. 사건·현재 상태는 FACT, 시간은 CALCULATION, 복구 설계는 INTERPRETATION이다. [S1][S2][S3][S4][S5][S6][S7]

구성BrowseComp해석
API·Code·Cowork24분20:14~20:38 UTC 영향. [S1][S2]
Fable 5·claude.ai4시간 11분20:00~00:11 UTC 영향. [S1][S2]
현재 상태전부 정상미해결 0건, 6개 구성요소 operational. [S3][S4]
원인미공개확인·수정 언급만 있고 RCA는 없다.

오류 유형별 정책, 체크포인트, 멱등 키, 회로 차단, durable queue, 승인된 대체 경로와 복구 훈련을 묶는다.

검증·개선 루프의 최소 구조

state=load(job_id)
try:
  result=run_step(state, idempotency_key)
  checkpoint(result)
except transient:
  retry_with_budget_and_jitter()
except sustained:
  open_circuit(); queue(job_id)
if fallback_allowed and policy_ok: resume_on_approved_model()
else: require_human_resume()

# 입력: 오류 유형, request-id, 작업 단계, 멱등 키, 권한, 대체 모델, 복구 예산
# 상태: 공식 사건, 내부 로그, 원인 공백, 담당자·기한
# 종료 조건: 재시도 예산 소진, 회로 개방, 멱등성 없음, 대체 정책 미승인, 사람 승인 필요

def evaluate(item):
    return 완료·대기·대체·사람 재개 중 한 상태와 감사 가능한 증거를 남긴다.

AI Builder Corner - Agent Continuity Layer

문제 장기 AI 작업이 공급자 오류 때 처음부터 다시 시작되거나 부분 쓰기를 중복 실행한다.

MVP 단계 체크포인트, 멱등 키, durable queue, 회로 차단, 승인된 모델 대체와 운영자 재개 콘솔을 제공한다.

차별화 모델 라우팅보다 작업 상태와 권한을 보존해 완료 손실을 줄인다.

위험 대체 경로가 데이터·비용·품질·권한 정책을 우회할 수 있다.

앞으로 어떻게 될까?

3개월

Anthropic 추가 장애 없이 상태 안정

3개월

사후 원인·재발 방지 설명 공개

6개월

에이전트 체크포인트·재개 기능 확대

6개월

다중 모델·공급자 복구 수요 증가

1년

SLO가 토큰 외 완료율·RTO로 확장

오늘 바로 할 일 4가지

  1. 오류 분류 고정오늘 안에 refusal·429·5xx·timeout·stream 오류를 분리하고 각 재시도·대체·중지 정책을 문서화한다.
  2. 체크포인트 검증48시간 안에 대표 장기 작업 20건을 강제 중단해 멱등 재개율과 중복 쓰기 0건을 확인한다.
  3. 회로 차단 훈련7일 안에 24분·4시간 장애 시나리오로 queue·RTO·공지·사람 승인 절차를 훈련한다.
  4. 공급자 집중 점검7일 안에 승인된 대체 모델·데이터 경계·비용·품질 임계치와 사용 금지 작업을 등록한다.

오늘의 실무 프롬프트

에이전트 신뢰성 책임자

Claude 장애를 가정해 작업 상태를 보존하고 안전하게 재개하는 복구 계획을 만든다.
1. 작업 단계, 오류 유형, request-id, 멱등성, 도구 권한, 큐, 대체 모델, RTO, 운영자
2. 중복 쓰기 0, 재개 증거 100%, 재시도 폭주 0, 미승인 대체 0, 목표 RTO 충족
3. 공식 상태·오류 문서와 내부 요청 로그·큐·도구 결과·승인 기록만 증거로 사용한다.
4. 멱등성, 체크포인트, 오류 분류, 대체 정책, 책임자 중 하나라도 없으면 자동 재개를 중지한다.
5. job, step, error, request_id, retries, checkpoint, circuit, fallback, owner, status
6. 배포·결제·외부 메시지·비밀값·데이터 이동과 공급자 변경 전에 사람이 승인한다.
7. 작업별 재시도 예산 2회. 오류율 임계치 또는 2회 실패 시 회로를 열고 큐로 이동한다.

핵심 작업과 RTO
오류별 재시도 정책
대체 모델·데이터·도구 허용

Editor's Insight

오늘의 새 사실은 모델 출시가 아니라 직전 cutoff 뒤 확정된 장애 해결이다.

API·Code·Cowork와 Fable 5·claude.ai 사건은 범위가 달라 하나의 다운타임으로 합치지 않았다.

8월 12~15일 연속 기록은 평균 uptime만으로 작업 위험을 보지 말라는 신호다.

현재 모든 구성요소가 정상인 사실과 근본 원인이 공개되지 않은 사실을 함께 유지해야 한다.

공식 SDK의 기본 재시도는 짧은 일시 오류용이며 수시간 장애의 상태 보존을 대신하지 않는다.

Fable 안전 fallback은 서비스 장애 fallback이 아니므로 운영 정책을 분리해야 한다.

최종 경쟁력은 실패하지 않는 모델보다 실패 뒤 중복 없이 완료하는 시스템에서 나온다.

마무리

오늘은 직전 cutoff 뒤 해결이 확정된 Claude 장애 클러스터 1건을 선정했다.

다음 확인점은 추가 사건, 원인·재발 방지 공개, 내부 재개 성공률과 RTO다.

에이전트 운영에서 성능은 정답률뿐 아니라 실패 뒤 작업을 보존하고 안전하게 완료하는 능력이다.

참고 자료

2026-08-16-ai-daily-research-026.pdf
1.9 MB
반응형
이 글이 유용했다면 링크를 공유해 보세요.