데일리 브리핑/AI

AI Daily #071 상시 실행 에이전트와 실험으로 검증하는 AI

반응형
AI Daily Research #071

AI 경쟁이 답변에서 상시 실행과 실험 증거로 이동했다

9월 29일의 핵심은 더 좋은 답변이 아니라 더 오래 일하고, 더 넓게 행동하며, 현실 실험으로 결과를 검증하는 AI 시스템이었다. OpenAI는 GPT-6.1 Sol과 상시 실행 에이전트 Dots를 공개했고, Microsoft Research는 생물학 세계모델과 wet-lab loop를 결합한 Quine을 제한 공개했다.

Executive Summary · 주요 뉴스 3개와 1개 분석

01

OpenAI가 Astra 근접 성능을 목표로 한 GPT-6.1 Sol을 Work·Codex·API에 출시했다

GPT-6.1 Sol이 Work·Codex·API에 출시됐다. 105만 token context와 computer use를 지원하며 OpenAI는 Astra 가격의 5분의 1에서 근접 성능을 주장한다. [S1][S2]

02

OpenAI가 장기 맥락과 cloud computer를 가진 Dots를 출시했다

Dots는 자체 cloud computer와 장기 맥락을 가진 always-on agent다. ChatGPT·Slack·Teams에서 일하고 plugin을 쓰며, action은 Custom Rules와 Auto-review를 따른다. [S4][S5]

03

Microsoft Research가 생물학 세계모델과 wet-lab loop를 결합한 Quine을 공개했다

Quine은 여러 생물학 modality를 함께 학습한 world model과 wet-lab harness를 결합한다. 췌장암 cell-state 후보를 우선순위화하고 상위 결과를 실험했다고 Microsoft가 밝혔다. [S7][S8]

04

Meta가 Muse·Business Agent·API·Code를 기업 제품군으로 묶는 Enterprise Platform을 출범시켰다

Meta는 Muse·Business Agent·API·Code를 초기 범위로 하는 Enterprise Platform과 전담 책임자를 발표했다. 제품별 GA, 가격, 지역, SLA와 data governance는 아직 공개되지 않아 구매 가능 상태로 해석하면 안 된다. [S10]

오늘의 큰 흐름

세 사건은 model, agent, science system의 단위가 모두 커지고 있음을 보여준다. 더 싼 frontier reasoning은 운영 비용을 낮추지만, persistent agent는 memory·permission·approval 위험을 키운다. Quine은 benchmark가 아니라 실제 실험이 AI 연구 시스템의 검증 단위가 되어야 함을 보여준다.

초보자를 위한 핵심 용어

Task economics

token뿐 아니라 도구 호출, 재시도, 지연, 검토와 실패 비용을 합친 완료 업무 1건의 총비용.

Proactive research

명시적 요청 전에도 허용된 연결 소스를 읽어 변화를 찾는 background mode.

Biology world model

여러 생물학 modality의 상태와 intervention 결과를 함께 표현·예측하려는 모델.

Usage-based billing

좌석 정액이 아니라 agent task·model·runtime 사용량에 따라 비용이 쌓이는 과금 방식.

OpenAI가 Astra 근접 성능을 목표로 한 GPT-6.1 Sol을 Work·Codex·API에 출시했다

FACT - OpenAI는 2026년 9월 29일 GPT-6.1 Sol을 Plus·Pro·Business·Enterprise·Edu의 Work와 Codex, API model ID gpt-6.1-sol로 출시했다. FACT - 표준 가격은 input 2달러, cached input 0.10달러, cache write 2.50달러, output 10달러이며 context 1,050,000 tokens, 최대 output 128,000 tokens다. ATTRIBUTED_CLAIM - OpenAI는 DeepSWE 1.1, GDP.pdf, AutomationBench와 OSWorld 2.0에서 Sol 6 대비 개선 및 Astra 근접 cost-performance를 보고했다. [S1][S2]

고난도 agent workload의 경제성이 최고 모델의 token 가격에서 cache 재사용, reasoning effort, task 완료율의 조합으로 이동한다. 기존 Sol 이용자는 같은 가격대에서 더 높은 capability를 시험할 수 있지만 production 승격은 자체 workflow 결과가 필요하다.

Responses API tool calling, web/file search, hosted shell, computer use, MCP와 skills를 지원한다. reasoning effort는 low부터 max까지 지원하고 none·minimal은 지원하지 않는다. 긴 context에는 별도 가격 배수가 적용되므로 105만 token을 곧바로 저비용으로 해석하면 안 된다. [S2]

Astra보다 낮은 list price로 복잡한 coding·document·computer-use task를 routing할 후보가 생겼다. 실제 TCO는 cache hit, reasoning effort, tool call, retry, review와 실패 비용을 포함해 계산해야 한다.

초보자가 기억할 한 문장

GPT-6.1 Sol은 Astra급 업무의 후보 비용을 낮추지만, 실제 우위는 모델 가격이 아니라 재현된 완료 task economics로 증명해야 한다.

앞으로 확인할 것

Chat에는 아직 제공되지 않고, benchmark·비용 우위는 공급자 측정이다. 자체 workflow와 long-context 가격 구간을 함께 검증해야 한다. [S3]

OpenAI가 장기 맥락과 cloud computer를 가진 Dots를 출시했다

FACT - OpenAI는 2026년 9월 29일 Dots rollout을 시작했다. FACT - 각 dot은 cloud computer·browser와 4,000개 이상 app ecosystem을 사용하고 ChatGPT·Slack·Teams에서 이어서 일할 수 있다. FACT - proactive research는 read-only지만 승인된 본 작업은 Custom Rules와 Auto-review 아래에서 외부 action을 수행할 수 있다. ATTRIBUTED_CLAIM - OpenAI는 bug triage, launch revision과 invoice 사례를 제시했다. [S4][S5]

Proactive research는 연결 소스를 미리 읽는 background mode이며 직접 외부 action은 별도 검토를 거친다.

assistant가 한 번의 대화를 넘어 장기 목표와 background monitoring을 맡는다. 생산성만큼 permission drift, stale context와 irreversible action 위험도 누적된다.

Dots는 persistent context, cloud computer, plugins, Activity View와 Auto-review를 묶는다. proactive research와 action execution의 권한은 다르다.

핵심 균형

Dots의 핵심은 장기 기억과 행동 권한을 가진 agent의 지속적 감독이다.

정책과 산업에 주는 의미

내부 red-team 결과는 유망하지만 실제 장기 운영 위험을 없애지 않는다. memory deletion, permission drift와 irreversible action을 별도 통제해야 한다. [S6]

Microsoft Research가 생물학 세계모델과 wet-lab loop를 결합한 Quine을 공개했다

FACT - Microsoft Research는 2026년 9월 29일 Quine과 Quine Fellows를 발표했다. FACT - 초기 접근은 Fellows와 select research collaboration으로 제한되고 clinical·medical use가 아니다. ATTRIBUTED_CLAIM - 연구진은 pancreatic cancer cell-state transition 후보를 한 주말에 좁혀 상위 compound의 실험 효과를 확인했고, 수개월의 실험을 줄일 가능성이 있다고 보고했다. [S7]

AI for science의 가치가 benchmark score에서 어떤 실험을 먼저 할지 결정하고 결과를 다음 질문과 training signal로 되돌리는 closed loop로 이동한다.

단일 specialist model orchestration 대신 여러 biological modality의 shared representation을 학습해 한 modality의 evidence가 다른 prediction에 영향을 주도록 설계했다. harness는 question, proposal, experiment와 measurement를 반복 연결한다.

신약·바이오 연구에서 scarce wet-lab capacity를 높은 정보가치의 실험에 우선 배정할 수 있다. 그러나 product availability, integration, pricing과 validation protocol이 없는 현재는 조달 가능한 임상 도구가 아니다.

가장 큰 병목

Quine의 의미는 생물학을 완전히 모델링했다는 데 있지 않고, AI 제안을 실제 실험이 반박·갱신하는 loop를 연구 시스템의 중심에 둔 데 있다.

앞으로 볼 지표

현재 research-only·제한 접근이며 exact data와 독립 재현은 공개되지 않았다. cell-state shift를 치료 효과로 확대 해석하면 안 된다. [S9][S10]

모델·에이전트·연구 시스템의 공통 과제는 더 긴 자율성을 검증 가능한 상태로 바꾸는 것이다

INTERPRETATION - 세 발표는 capability가 커질수록 평가 단위가 response quality에서 stateful execution system으로 이동한다는 공통 흐름을 보여준다. FACT - 각 시스템은 model·memory 또는 world state·tool·approval·feedback loop를 결합한다. OUTLOOK - enterprise release gate는 task completion, authority ceiling, state freshness와 external validation을 한 묶음으로 요구하게 될 가능성이 높다. [S2][S5][S7]

한국 조직은 AI agent account lifecycle과 연구 data governance를 기존 IAM·ISMS·IRB 절차에 연결할 필요가 있다.

model snapshot, harness, memory state, tool permission, approvals와 final-state evidence를 run manifest로 묶어야 재현과 rollback이 가능하다.

장기 가치는 더 큰 model만이 아니라 state와 action을 안전하게 운영하고 외부 결과로 검증하는 control plane에 축적될 수 있다.

핵심 판단

더 오래 일하는 AI를 승인하려면 intelligence보다 state·authority·evidence의 수명주기를 먼저 통제해야 한다.

아직 남은 위험

제품 범주와 증거 수준은 서로 다르다. 공통 control을 쓰되 supplier claim과 independent validation을 분리해야 한다.

그래서 우리에게 어떤 의미가 있을까?

개발자

개발자는 Sol 6.1을 동일 task·effort·cache 조건에서 Sol 6와 재평가한다.

기업

보안팀은 Dots를 사람과 유사한 identity lifecycle과 least privilege 대상으로 관리한다.

투자자

연구팀은 Quine류 system에 prediction뿐 아니라 null result와 assay provenance를 요구한다.

창업자

경영진은 seat·token 대신 verified completion, approval burden, incident와 validated hypothesis를 KPI로 본다.

기업·생태계 전략 비교

주체현재 전략강점핵심 리스크
OpenAI GPT-6.1 Solnear-frontier task economicslong context·tools·distributionsupplier benchmark·long-context cost
OpenAI Dotsalways-on delegated workcloud computer·cross-channel memorypermission drift·persistent context
Microsoft Quinemodel-lab closed loopmultimodal world model·wet lablimited access·replication gap
Enterprise Controlstate and authority lifecyclereplay·rollback·auditoperating complexity
Independent Validationsupplier-to-local evidencedecision-grade prooftest cost·data access

OpenAI Dots: 정책을 생성하는 도구가 아니라 같은 시험으로 정책 효과를 증명하는 release workflow다.

Dots 발표, privacy·security FAQ와 Astra system card의 dots evaluation을 비교해 product capability와 제한을 분리했다.

GPT-6 Astra, cloud computer, browser, plugins, persistent context, cross-channel messaging와 delegated work를 결합한 always-on agent.

강점

proactive read와 user-authorized write가 정책·로그에서 명확히 분리되는가.

주의점

memory, permission change, approval, rollback과 deletion 뒤 잔존 artifact를 재구성할 수 있는가.

추천 사용법

낮은 영향의 read-heavy recurring workflow에서 별도 test identity와 엄격한 approval rule로 시작한다.

Quine은 AI for science의 평가 단위를 wet-lab loop로 옮긴다

Quine은 genomics, proteins, chemistry, RNA·cell state와 bioimaging을 하나의 biology world model에서 연결하고 scientist·tools·literature·wet lab을 반복 harness로 묶는다. [S7]

오해하지 말아야 할 점

AI가 정답을 선언하는 대신 어떤 실험을 먼저 할지 제안하고, 실제 실험이 그 제안을 확인하거나 반박해 다음 질문을 바꾸는 구조다.

wet-lab validation은 공개됐지만 독립 재현과 임상 효능은 확인되지 않았고 현재 research-only다.

구성BrowseComp해석
Genomics·proteinsshared representation한 modality의 evidence가 다른 prediction에 영향을 줄 수 있게 한다.
Chemistry·cell statecompound prioritizationscarce assay capacity를 정보가치가 높은 후보에 먼저 배정한다.
Bioimagingexperimental feedback예상 밖 결과가 다음 model·question을 바꾸는 signal이 된다.
Wet-lab feedbacklimited accessresearch-only Fellows·collaboration 단계이며 clinical product가 아니다.

prediction과 experiment를 동일 provenance graph에 기록하고 blinded replication, null result와 confidence calibration을 release gate로 사용한다.

검증·개선 루프의 최소 구조

bundle = lock(model, harness, memory_state, tools, permissions)
trial = replay(representative_tasks, bundle)
assert trial.state_freshness <= ttl
assert trial.effects <= approved_authority
assert trial.irreversible_actions == 0
assert trial.external_evidence_verified
publish_or_block(bundle, trial)

# 입력: supplier benchmark, official docs, task traces, permission log와 experimental measurement.
# 상태: SOURCE·VERIFIED·GAP·NEXT_ACTION으로 version, state freshness, authority와 result를 기록한다.
# 종료 조건: unknown state age, revoked permission, missing owner, irreversible action, unsupported data boundary or no external validation.

def evaluate(item):
    return fresh state와 승인된 authority 안에서 재현된 system만 제한 배포하고 나머지는 GAP와 다음 검증을 반환한다.

AI Builder Corner - Persistent AI Control Ledger

문제 model, memory, permission, approval와 external evidence가 분리돼 장기 agent·science workflow의 실제 위험을 재구성하기 어렵다.

MVP worker manifest, state TTL, permission diff, approval log, final-state proof와 experiment provenance를 한 run ledger로 저장한다.

차별화 response score가 아니라 시간에 따라 변하는 state·authority·external proof를 연결한다.

위험 connector drift, 개인정보, assay data access, approval fatigue와 cross-system schema 유지비.

앞으로 어떻게 될까?

3개월

3개월 - GPT-6.1 Sol의 enterprise routing benchmark가 cache·effort별로 축적될 것이다.

3개월

3개월 - Dots rollout에서 app별 permission과 memory 운영 사례가 드러날 것이다.

6개월

6개월 - persistent agent 계정에 IAM과 offboarding 절차를 적용하는 조직이 늘 것이다.

6개월

6개월 - AI for science 평가는 static score와 함께 wet-lab reproduction을 요구할 것이다.

1년

1년 - model·memory·tool·approval·evidence를 묶은 worker manifest가 표준 운영 단위가 될 수 있다.

오늘 바로 할 일 4가지

  1. Sol 6.1 task economics대표 coding·PDF·computer-use 100건에서 Sol 6와 6.1의 완료율, p95, cache, tool call, review와 task TCO를 비교한다.
  2. Dot 권한·기억 지도test identity로 plugin read·write, Custom Rules, approval, memory·deletion과 잔존 artifact를 표로 검증한다.
  3. Persistent agent red-teamstale requirement, revoked permission, wrong recipient, prompt injection과 irreversible action scenario를 재생한다.
  4. Quine 검증 계약prediction, assay protocol, negative result, blinded replication과 research-only 금지선을 하나의 evidence dossier로 요구한다.

오늘의 실무 프롬프트

stateful AI release manager

긴 context와 지속적 권한을 가진 model·agent·science system이 정해진 범위 안에서 검증 가능한 결과를 내는지 판단한다.
1. 합성·마스킹 데이터, test identity와 비임상·비운영 환경으로 제한한다.
2. 대표 workflow가 시간·비용 목표 안에서 완료되고 authority 위반이 없으며 결과를 독립적으로 확인·재현할 수 있다.
3. 공식 발표·docs·system card·experiment record를 우선하고 supplier claim과 independent evidence를 분리한다.
4. supplier benchmark를 독립 결과로, read-only research를 전체 action restriction으로, cell-state shift를 치료 효과로 취급하지 않는다.
5. versioned manifest, state·permission diff, action log, final-state 또는 assay evidence, 비용·위험과 승인 결정.
6. permission 확대, external communication, payment, production write, experiment execution과 clinical interpretation 전에 사람이 검토한다.
7. task·token·tool·human review 또는 experiment budget을 고정하고 초과 시 사람에게 반환한다.

model·harness·memory snapshot과 pricing
tools·plugins·permission·approval policy
task final state 또는 experiment endpoint

Editor's Insight

오늘의 세 사건은 AI의 단위가 response에서 지속되는 system으로 커지고 있음을 보여준다.

GPT-6.1 Sol은 frontier급 업무를 더 낮은 가격으로 가져오지만 긴 context와 tool use가 늘수록 단순 token price보다 task economics가 중요해진다.

Dots는 AI가 기억하고 먼저 찾아보고 실제 action을 이어 가는 시간을 며칠과 몇 주로 늘린다.

그 결과 permission과 memory도 장기 상태가 되어 stale context와 잘못된 승인이 누적될 수 있다.

Quine은 이 문제의 다른 면을 보여준다. 더 긴 reasoning보다 실제 experiment가 model state를 갱신하고 잘못된 가설을 제거해야 한다.

따라서 persistent AI를 위한 공통 release gate는 version, state freshness, authority ceiling, human review와 external evidence를 함께 고정해야 한다.

다음 경쟁력은 더 많은 일을 오래 하는 능력과 그 과정이 틀렸을 때 빨리 멈추고 되돌리며 증거로 설명하는 능력을 동시에 갖추는 데서 나온다.

마무리

오늘의 변화는 AI가 한 번 답하는 도구에서 오래 기억하고 행동하며 실험으로 배우는 system으로 이동했음을 보여준다.

자율성이 길어질수록 state, permission, evidence와 rollback의 품질이 intelligence만큼 중요하다.

더 오래 일하는 AI일수록 상태와 권한을 더 짧게 검증한다.

참고 자료

2026-09-30-ai-daily-research-071.pdf
2.4 MB
반응형
이 글이 유용했다면 링크를 공유해 보세요.