데일리 브리핑/AI

AI Daily #070 더 빠른 모델보다 중요한 에이전트 실행 통제

반응형
AI Daily Research #070

에이전트 경쟁이 모델 성능에서 실행 통제로 이동했다

9월 28일에는 성능, 실행, 통제, 판매 채널이 동시에 바뀌었다. Anthropic은 더 빠르고 저렴하다고 주장하는 Claude Sonnet 5.5를 전면 출시했고, NVIDIA는 에이전트 권한을 workload 밖에서 집행하는 Open Agent Safety Platform과 OpenShell 0.1 계열을 공개했다. H Company는 GUI·코드·MCP·API를 넘나드는 Holo4 가중치와 평가 trajectory를 배포했고, Meta는 Muse 제품군을 기업 시장에 묶는 Meta Enterprise Platform을 출범시켰다.

Executive Summary · 주요 뉴스 4개

01

Anthropic이 Claude Sonnet 5.5를 전면 출시하고 비용·속도·도구 사용 계약을 함께 바꿨다

Claude Sonnet 5.5가 전 플랫폼과 GitHub Copilot에 출시됐다. 같은 토큰 단가지만 공급자는 더 빠른 출력과 task당 비용 절감을 주장한다. [S1][S3]

02

NVIDIA가 OpenShell과 BlueField Sentry를 묶어 에이전트 통제를 workload 밖으로 옮겼다

NVIDIA는 OpenShell runtime과 선택적 BlueField Sentry를 결합해 agent 권한을 workload 밖에서 통제하는 reference design을 공개했다. [S4][S5]

03

H Company가 GUI·코드·MCP·API를 한 모델로 다루는 Holo4 가중치와 평가 trajectory를 공개했다

Holo4는 GUI·코드·MCP·API를 한 모델 계열에서 다루며 weights와 benchmark trajectory를 공개했다. [S7]

04

Meta가 Muse·Business Agent·API·Code를 기업 제품군으로 묶는 Enterprise Platform을 출범시켰다

Meta는 Muse·Business Agent·API·Code를 초기 범위로 하는 Enterprise Platform과 전담 책임자를 발표했다. 제품별 GA, 가격, 지역, SLA와 data governance는 아직 공개되지 않아 구매 가능 상태로 해석하면 안 된다. [S10]

오늘의 큰 흐름

공통점은 모델 단독 성능보다 실제 일을 맡기는 운영 시스템이다. 더 싼 Sonnet도 API migration과 safeguard 경로가 필요하고, open-weight computer-use 모델도 harness·license·trajectory 검증이 필요하다. NVIDIA와 Meta는 에이전트 권한, 자격증명, 네트워크, 감사 기록을 제품 경쟁의 중심으로 끌어올렸다.

초보자를 위한 핵심 용어

Adaptive thinking

모델이 task와 effort에 따라 reasoning 양을 조절하고 tool call 사이에도 생각을 이어가는 방식.

Out-of-band enforcement

agent가 바꿀 수 없는 별도 runtime이나 hardware가 권한과 effect path를 검사하는 통제 방식.

Execution trajectory

agent가 본 상태, 선택한 행동, tool 결과와 최종 상태를 단계별로 보존한 실행 기록.

Usage-based billing

좌석 정액이 아니라 agent task·model·runtime 사용량에 따라 비용이 쌓이는 과금 방식.

Anthropic이 Claude Sonnet 5.5를 전면 출시하고 비용·속도·도구 사용 계약을 함께 바꿨다

FACT - Anthropic은 2026년 9월 28일 Claude Sonnet 5.5를 공개했고 model ID를 claude-sonnet-5-5로 지정했다. FACT - 입력·출력 가격은 각각 2달러와 10달러, cache read·write는 0.20달러와 2.50달러다. FACT - GitHub Copilot에서는 Pro, Pro+, Max, Business, Enterprise에 일반 제공되며 점진 배포된다. ATTRIBUTED_CLAIM - Anthropic은 Sonnet 5 대비 출력 속도 30% 이상, task당 비용 최대 30% 절감과 Terminal-Bench 4.0 70.6%를 보고했다. [S1][S3]

일상 코딩과 문서 업무에 Opus급 판단을 항상 쓰지 않고도 높은 처리량을 노릴 수 있다. 그러나 실제 전환 비용은 토큰 단가보다 effort 재조정, tool loop 수정, safeguard fallback과 회귀 시험에서 결정된다.

thinking 필드를 생략하면 adaptive thinking이 켜지고, up-front thinking을 끄려면 high 이하에서 between_tools를 사용해야 한다. forced tool choice는 거부되므로 auto와 strict tools로 바꾸고, computer use는 Claude API·Google Cloud에서 computer_toolset_20260801로 이동해야 한다. [S2]

고빈도 지원·코딩·문서 생성에서 공급자가 주장하는 step·token 감소가 재현되면 완료 task당 비용을 낮출 수 있다. GitHub Copilot 관리자에게는 default enablement와 provider list pricing 검토가 필요하다. [S1][S3]

초보자가 기억할 한 문장

Sonnet 5.5 전환은 더 빠른 모델 선택이 아니라 thinking·tool·safeguard 계약을 다시 승인하는 migration이다.

앞으로 확인할 것

model ID 교체만으로는 부족하다. thinking, forced tool choice, computer use와 fallback 동작을 migration guide대로 다시 검증해야 한다. [S2]

NVIDIA가 OpenShell과 BlueField Sentry를 묶어 에이전트 통제를 workload 밖으로 옮겼다

FACT - NVIDIA는 2026년 9월 28일 Open Agent Safety Platform reference design과 OpenShell 기술 walkthrough를 공개했다. FACT - OpenShell은 Apache 2.0 open source이며 kernel-level sandbox, external supervisor, credential protection, policy verification을 제공한다. FACT - GitHub release 목록은 0.1.1을 최신으로 표시하고 0.1.0도 별도 release로 유지한다. ATTRIBUTED_CLAIM - NVIDIA는 Vera Rubin POD에서 BlueField-4가 model path의 out-of-band 관찰·집행 지점이 될 수 있다고 설명한다. [S4][S5][S6]

Out-of-band enforcement는 agent process가 접근하거나 바꿀 수 없는 별도 계층에서 권한과 네트워크 요청을 검사·차단하는 방식이다.

prompt와 model alignment만으로 agent 권한을 통제하지 않고, agent가 수정할 수 없는 runtime·hardware boundary에서 effect path를 막는 운영 모델을 제시한다.

Gateway는 sandbox fleet과 policy lifecycle을 관리하고, Supervisor는 outbound request를 검사하며, Sandbox는 filesystem·process 권한을 제한한다. credential은 workload 밖에 남고 승인된 request에만 삽입된다. [S5]

핵심 균형

신뢰할 수 있는 agent의 핵심은 스스로 잘 행동하라는 지시가 아니라 agent 밖에서 권한과 effect path를 집행하는 것이다.

정책과 산업에 주는 의미

공개 글의 0.1.0과 repository 최신 0.1.1을 구분하고, prover coverage와 hardware별 보장 범위를 확인해야 한다. [S6]

H Company가 GUI·코드·MCP·API를 한 모델로 다루는 Holo4 가중치와 평가 trajectory를 공개했다

FACT - H Company는 2026년 9월 28일 Holo4-27B와 Holo4-35B-A3B, Holotron4 Nano를 공개했다. FACT - 두 Holo4 모델은 GUI, code, MCP, API interface를 지원하고 API와 여러 precision의 weights로 제공된다. FACT - 27B model card는 CC BY-NC 4.0, 35B-A3B card는 Apache 2.0을 명시한다. ATTRIBUTED_CLAIM - H Company는 OSWorld 2.0에서 27B 61.7%, 35B-A3B 30.9%를 보고하며 public trajectories를 공개한다. [S7][S8][S9]

하나의 업무가 화면 클릭, shell, code, MCP와 SaaS API를 오갈 때 interface별 모델을 조합하는 복잡성을 줄일 수 있다. 공개 trajectory는 성공률 숫자보다 실패 과정을 검토할 수 있게 한다.

두 모델은 최대 262,144 token context를 설정하고 hai-agents harness가 screenshot·tool result를 전달해 click, typing, code와 tool call을 실행한다. harness memory와 shell access가 실제 장기 성능에 큰 영향을 준다. [S7][S8][S9]

on-prem 또는 자체 inference를 원하는 팀은 API와 open weights 사이를 선택할 수 있다. 하지만 27B의 비상업 라이선스는 기업 사용을 제한할 수 있어 35B-A3B와 동일하게 취급하면 안 된다.

가장 큰 병목

Holo4의 핵심은 open weight보다 여러 interface를 오가는 실행 trace와 harness를 검증 가능한 자산으로 함께 내놓은 데 있다.

앞으로 볼 지표

27B는 비상업 라이선스, 35B-A3B는 Apache 2.0이다. benchmark도 harness·subset 차이를 포함하므로 자체 업무로 다시 시험해야 한다. [S8][S9]

Meta가 Muse·Business Agent·API·Code를 기업 제품군으로 묶는 Enterprise Platform을 출범시켰다

FACT - Meta는 2026년 9월 28일 Meta Enterprise Platform 시작과 CJ Desai의 임명을 발표했다. FACT - 초기 focus로 Muse agent, Meta Business Agent, Muse API, Muse Code를 명시했다. ATTRIBUTED_CLAIM - Meta는 model, agent, infrastructure와 business reach를 결합해 기업이 자체 업무에 배포할 수 있는 제품과 서비스를 만들겠다고 밝혔다. UNCONFIRMED - 가격, 지역, SLA, data boundary, 관리자 control과 일반 제공 시점은 해당 발표에서 확인되지 않는다. [S10]

한국 기업은 Meta channel 연동의 영업 가치와 개인정보 국외 이전, 광고 data separation, local support를 동시에 확인해야 한다.

발표는 제품 architecture나 API contract보다 portfolio 방향을 제시한다. Muse agent와 Code, Business Agent가 공통 identity·policy·data plane을 공유하는지는 후속 문서가 필요하다.

성공 여부는 announcement가 아니라 enterprise SKU, partner ecosystem, admin control, support와 cross-product data governance 공개 속도에 달려 있다.

핵심 판단

Meta Enterprise Platform은 구매 가능한 완성 제품보다 기업 agent 사업의 조직·portfolio 방향을 먼저 확정한 출범 발표다.

아직 남은 위험

제품별 GA, 가격, 지역, SLA와 data governance는 아직 공개되지 않아 구매 가능 상태로 해석하면 안 된다.

그래서 우리에게 어떤 의미가 있을까?

개발자

개발자는 Sonnet 5.5의 model ID보다 thinking·tool·fallback breaking changes를 먼저 고친다.

기업

보안팀은 agent가 바꿀 수 없는 runtime policy와 credential boundary를 설계한다.

투자자

MLOps 팀은 Holo4 trajectory를 replay하고 model·harness·license를 함께 versioning한다.

창업자

경영진은 platform announcement와 GA를 분리하고 비용·권한·지원 계약이 채워질 때 예산을 승인한다.

기업·생태계 전략 비교

주체현재 전략강점핵심 리스크
Anthropic Sonnet 5.5task cost-performancebroad cloud·IDE availabilitymigration breaks·supplier metrics
GitHub Copilotprovider model distributionIDE·CLI·agent coveragegradual rollout·default enablement
NVIDIA OpenShellout-of-process policy enforcementsandbox·credential·auditversion·prover coverage
H Company Holo4multi-interface open computer useweights·trajectories·quantizationlicense split·supplier harness
Meta Enterprise Platformagent portfolio bundlingdistribution·business reachGA·pricing·governance unknown

NVIDIA OpenShell 0.1.x: 정책을 생성하는 도구가 아니라 같은 시험으로 정책 효과를 증명하는 release workflow다.

NVIDIA 발표, OpenShell technical post와 GitHub release 상태를 비교해 runtime control과 version uncertainty를 분리했다.

기존 coding·research agent를 sandbox에 넣고 filesystem, process, network, API, credential 권한을 workload 밖에서 집행하는 open-source runtime.

강점

agent·child process·subagent가 동일한 filesystem·network ceiling을 우회하지 못하는가.

주의점

policy proposal, approval, credential insertion, block와 rollback이 감사 가능하게 남는가.

추천 사용법

비운영 agent에서 deny-by-default policy와 credential proxy를 검증하는 제한된 pilot.

공개 trajectory가 computer-use 평가를 바꾸는 Holo4

Holo4는 GUI, code, MCP, API를 한 모델 계열에서 다루고 benchmark 결과뿐 아니라 public execution trajectory를 제공한다. [S7][S8][S9]

오해하지 말아야 할 점

점수만 공개하는 대신 agent가 무엇을 보고 어떤 action을 골랐는지 replay할 수 있어 성공과 실패를 더 구체적으로 검토할 수 있다.

weights와 trajectory 공개는 확인됐지만 공개 benchmark를 한국어 기업 workflow의 독립 성능으로 일반화할 수 없다.

구성BrowseComp해석
27B densemulti-interface agent화면·code·MCP·API 중 task에 맞는 interface를 바꿔 사용한다.
35B-A3B MoEtrajectory disclosure최종 score뿐 아니라 단계별 action을 replay·download할 수 있다.
Holotron4 Nanolicense split같은 제품군이라도 commercial use 조건이 모델별로 다르다.
Public trajectoriesharness dependencememory·shell·context management가 model score와 분리되지 않는다.

public trajectory를 자체 replay하고 final state, side effect, recovery, human takeover와 license를 같은 평가표에 기록한다.

검증·개선 루프의 최소 구조

bundle = lock(model, effort, harness, runtime, policy, licenses)
trial = replay(representative_tasks, bundle)
assert trial.completion >= target
assert trial.effects <= approved_authority
assert trial.credentials_exposed == 0
assert all(trajectory.final_state_verified)
publish_evidence_or_block(bundle, trial)

# 입력: 공급자 claim, 공식 docs, release state, public weights·trajectory와 자체 baseline.
# 상태: SOURCE·VERIFIED·GAP·NEXT_ACTION으로 version, authority, license와 GA 상태를 기록한다.
# 종료 조건: missing version, incompatible tool contract, unsupported policy domain, license ambiguity, unverified final state or no rollback.

def evaluate(item):
    return 승인된 authority와 license 안에서 재현된 조합만 제한 배포하고 나머지는 GAP와 다음 검증을 반환한다.

AI Builder Corner - Agent Authority Evidence Hub

문제 model, harness, runtime policy, license와 GA 상태가 흩어져 실제 배포 권한과 완료 비용을 함께 판단하기 어렵다.

MVP model migration matrix, policy boundary, trajectory replay, license·GA ledger와 task economics를 한 run evidence로 저장한다.

차별화 score가 아니라 실제 effect path와 final state를 검증하는 cross-vendor evidence.

위험 vendor API 변화, trajectory 개인정보, policy prover coverage, benchmark maintenance와 legal interpretation.

앞으로 어떻게 될까?

3개월

3개월 - Sonnet 5.5 migration 사례가 effort·tool contract별로 축적될 것이다.

3개월

3개월 - OpenShell 0.1.x의 policy schema와 extension contract가 빠르게 안정화될 수 있다.

6개월

6개월 - computer-use 모델 평가는 점수와 함께 trajectory·harness hash를 요구하게 될 것이다.

6개월

6개월 - enterprise agent 플랫폼은 model보다 identity·credential·audit plane으로 차별화될 것이다.

1년

1년 - DPU·confidential compute 같은 hardware control이 고권한 agent의 선택적 방어층이 될 수 있다.

오늘 바로 할 일 4가지

  1. Sonnet migration A/B대표 task 100건에서 effort, thinking, strict tools, computer toolset와 fallback을 바꾸며 완료율·p95·비용을 재측정한다.
  2. Agent 권한 경계 증명비운영 OpenShell 0.1.x sandbox에서 file·network·credential·subagent ceiling과 audit를 검증한다.
  3. Holo4 replay·license 검토한국어 GUI 혼합 업무를 replay하고 27B 비상업·35B Apache 조건을 배포안별로 승인한다.
  4. Meta 플랫폼 상태표Muse·Business Agent·API·Code별 GA, region, price, SLA, retention과 admin control 공개 여부를 추적한다.

오늘의 실무 프롬프트

기업 AI agent release manager

새 model·runtime·computer-use agent·platform이 정해진 권한 안에서 대표 업무를 완료하는지 검증한다.
1. 비운영 계정과 합성·마스킹 데이터의 대표 workflow로 제한한다.
2. 대표 workflow 완료율과 비용 목표를 만족하고 승인 범위 밖 side effect와 credential exposure가 없으며 증거를 재현할 수 있다.
3. official announcement, docs, release, model card를 우선하고 FACT와 supplier claim을 분리한다.
4. supplier benchmark를 독립 결과로, open weights를 상업 사용 허가로, platform launch를 GA로 취급하지 않는다.
5. version manifest, migration diff, policy evidence, trajectory replay, license·GA matrix, 비용·위험과 승인 결정.
6. model·policy·license·GA 변경, 외부 write, credential scope 확대와 배포 승인 전에 사람이 검토한다.
7. 각 candidate의 task·token·GPU·human review budget을 고정하고 초과 시 사람에게 반환한다.

model ID·effort·pricing·migration contract
harness·runtime·policy·credential provider version
trajectory·final-state·side-effect acceptance criteria

Editor's Insight

오늘의 네 사건은 agent 시대의 경쟁력이 단순히 더 높은 model score에서 나오지 않는다는 점을 보여준다.

Sonnet 5.5는 같은 token 단가에서 더 빠르고 효율적이라고 주장하지만, 그 이득을 얻으려면 thinking과 tool contract를 다시 맞춰야 한다.

NVIDIA는 agent가 스스로 지키는 guardrail보다 agent가 손댈 수 없는 runtime·hardware boundary를 전면에 세웠다.

Holo4는 open weights뿐 아니라 trajectory를 공개해 model, harness와 실행 증거를 함께 평가하게 만든다.

Meta는 아직 세부 SKU가 없는 단계에서도 Muse 제품군을 기업 사업 축으로 묶어 distribution 경쟁에 들어갔다.

따라서 조직은 benchmark, open source, platform launch라는 표면적 라벨보다 migration contract, authority ceiling, license와 GA 상태를 먼저 읽어야 한다.

다음 release gate는 모델이 얼마나 똑똑한지가 아니라 정해진 권한 안에서 일을 끝내고, 비용과 side effect를 재현 가능하게 증명하는지를 물어야 한다.

마무리

오늘의 변화는 agent 경쟁의 중심이 model score에서 migration, runtime control과 execution evidence로 이동했음을 보여준다.

기업은 더 빠른 모델, 더 안전한 runtime, 더 열린 computer-use weights와 새 플랫폼을 각각 다른 상태로 검증해야 한다.

모델 성능보다 권한 경계와 완료 증거를 함께 승인한다.

참고 자료

2026-09-29-ai-daily-research-070.pdf
2.5 MB
반응형
이 글이 유용했다면 링크를 공유해 보세요.