AI 스택의 다음 병목은 속도·학습 루프·편집 가능성이다
최근 24시간에 해당하는 대형 공식 발표는 없었다. 대신 주말에 공개돼 이번 실행에서 처음 교차 검증한 세 사건을 선정했다. Liquid AI는 시각언어모델의 출력을 바꾸지 않는 speculative decoding drafter를 공개했고, Qwen 연구진은 실행 증거가 데이터·학습·하네스를 다시 고치는 폐루프를 제시했으며, inclusionAI는 투명 배경과 레이어 분해를 겨냥한 MIT 라이선스 디자인 모델을 공개했다.
Executive Summary · 주요 뉴스 3개와 1개 분석
Liquid AI가 VLM 출력을 유지하며 디코딩을 가속하는 DSpark drafter를 공개했다
Liquid AI는 LFM2.5-VL-3B용 experimental DSpark drafter와 세 런타임 경로를 공개했다. [S1][S2]
Qwen 연구진이 실행 증거로 데이터·학습·하네스를 함께 고치는 mobile agent 폐루프를 제시했다
Qwen-Planner-Agent는 데이터·훈련·하네스를 action-feedback-verification loop로 연결한다. [S4][S5]
세 사건은 더 큰 단일 모델보다 주변 시스템의 병목을 줄이는 방향을 공유한다. 첫째는 같은 출력을 더 빨리 만드는 추론 경로, 둘째는 실패 흔적을 다음 학습과 런타임 개선으로 되돌리는 개발 경로, 셋째는 생성물을 다시 편집 가능한 자산으로 바꾸는 출력 경로다.
초보자를 위한 핵심 용어
작은 drafter가 다음 토큰을 먼저 제안하고 원래 모델이 검증해 같은 출력을 더 빨리 만드는 방식.
모델과 memory·skill·tool runtime을 실행 실패에 따라 함께 개선하는 개발 루프.
색상과 투명도를 함께 저장해 배경 제거와 요소별 재편집을 돕는 이미지 구성.
좌석 정액이 아니라 agent task·model·runtime 사용량에 따라 비용이 쌓이는 과금 방식.
Liquid AI가 VLM 출력을 유지하며 디코딩을 가속하는 DSpark drafter를 공개했다
사실 | FACT - Liquid AI는 2026년 9월 24일 LFM2.5-VL-3B-DSpark를 experimental model로 공개했고 Hugging Face 가중치와 SGLang·MLX-VLM·llama.cpp 경로를 연결했다. FACT - drafter는 279.5M BF16 파라미터이며 target model이 제안 토큰을 검증한다. ATTRIBUTED_CLAIM - 공급자 표에서 decode 최대 가속은 H100 2.66배, M5 Max 3.13배, M3 Ultra 2.14배였다. [S1][S2][S3]
왜 중요한가 | 엣지와 단일 GPU에서 시각 입력을 읽는 agent는 모델 교체 없이 응답 지연을 줄일 수 있다. 특히 greedy decoding에서는 target이 모든 제안 토큰을 검증하므로 속도와 출력 동일성을 함께 노리는 구조다.
기술적 의미 | drafter는 target hidden state의 여러 층을 사용해 다음 토큰 묶음을 제안하고 target이 승인한다. 실제 이득은 draft acceptance, block size, vision encoder 비용, runtime overhead와 하드웨어에 따라 달라진다.
사업적 의미 | 카메라·문서·현장 이미지 기반 AI를 로컬에서 실행하는 조직은 같은 모델 품질을 유지하면서 지연과 GPU 시간을 줄일 가능성이 있다. 다만 별도 drafter 메모리와 런타임 버전 관리가 추가된다.
VLM 가속의 핵심은 더 작은 모델로 바꾸는 것이 아니라 target 출력을 보존한 채 검증 가능한 초안을 먼저 제시하는 것이다.
앞으로 확인할 것
최대 3.13배는 특정 장비·batch 1·temperature 0의 공급자 수치이며 일반 서비스 결과가 아니다.
Qwen 연구진이 실행 증거로 데이터·학습·하네스를 함께 고치는 mobile agent 폐루프를 제시했다
사실 | FACT - arXiv 보고서는 2026년 9월 24일 제출됐고 Alibaba Token Hub·MAI Team 소속 연구진이 작성했다. FACT - 구조는 AI for Data, AI for Training, AI for Harness의 세 단계이며 held-out development set의 결과와 실패 패턴을 다음 개선에 사용한다. ATTRIBUTED_CLAIM - 저자들은 Qwen-Planner-Agent 27B가 MobilePA-Bench 평가 대상 중 최고 overall score와 비교 대상 상용 모델보다 낮은 추정 task당 output cost를 기록했다고 보고했다. FACT - GitHub 저장소는 가중치·훈련 코드·agent implementation 공개가 아니라고 명시한다. [S4][S5][S6]
용어 정리 | Model–harness co-evolution은 모델 가중치와 모델 밖의 memory·skill·tool runtime을 실행 증거에 따라 함께 개선하는 방식이다.
왜 중요한가 | agent 품질을 model checkpoint 하나의 속성으로 보는 대신 데이터 생성, reward, memory, skill과 failure trace를 하나의 개발 시스템으로 다룬다.
기술적 의미 | CARE는 모델 competence에 맞춰 reward와 advantage를 조정하고, harness는 tool-conditioned skill·persistent memory·실행 피드백을 조합한다. 개선 루프가 model과 runtime 양쪽을 동시에 바꾼다.
agent를 개선하는 단위는 모델이 아니라 실행 실패가 다시 데이터·학습·하네스로 돌아오는 폐루프다.
정책과 산업에 주는 의미
저장소는 연구 자료용이며 weights·training code·agent implementation 공개가 아니므로 재현 가능성은 제한적이다.
inclusionAI가 투명 배경 생성과 디자인 레이어 분해를 겨냥한 Ming 모델 두 종을 공개했다
사실 | FACT - Ming-Image-0.1-Design model card는 6B text-to-image 모델, UI·인포그래픽·포스터, transparent-background RGBA output과 MIT license를 명시한다. 권장값은 2048×2048, 12 steps, CFG 1.0, BF16이며 검증 하드웨어는 80GiB VRAM 단일 CUDA GPU다. FACT - Design-Layer는 별도 6B Image-Text-to-Image 모델로 layer decomposition과 RGBA를 표방한다. [S7][S8][S9]
왜 중요한가 | 생성 이미지가 최종 flatten 결과에 머물지 않고 투명 배경이나 분리 레이어를 가지면 제작 workflow의 수정·재사용·PPT 전환 비용을 줄일 가능성이 있다.
기술적 의미 | RGBA decoder와 디자인 특화 text rendering이 핵심이다. 그러나 layer semantic consistency, occlusion 복원, typography fidelity와 downstream format 변환은 모델 카드만으로 보장되지 않는다.
사업적 의미 | 마케팅·커머스·콘텐츠 팀은 포스터와 UI 시안을 빠르게 만들고 일부 요소를 후편집할 수 있다. 다만 80GiB 검증 구성은 로컬 도입 비용이 높고 hosted inference 의존성이 생길 수 있다.
디자인 생성의 다음 가치는 한 장을 예쁘게 만드는 것보다 수정 가능한 구조를 남기는 데 있다.
앞으로 볼 지표
RGBA 지원과 공급자 예시는 FACT지만 한글·레이어 편집 품질은 독립 검증 전까지 미확인이다.
추론·개선·출력의 병목이 모델 밖 시스템으로 이동한다
사실 | INTERPRETATION - 세 공개는 서로 다른 조직과 제품이지만 inference path, development loop, output format이라는 모델 밖 병목을 줄인다는 공통 구조를 가진다. FACT - 각각 experimental drafter, research report, public MIT model repositories라는 서로 다른 성숙도다. [S1][S2][S4][S5][S7][S8]
한국에 왜 중요한가 | 국내 팀은 한글 데이터·UI·디자인을 대표 suite로 만들고 공급자 최고값 대신 자체 완료 시간과 수정 비용을 측정해야 한다.
기술적 의미 | deployment bundle은 target model뿐 아니라 drafter, runtime version, memory·skill, eval traces와 artifact schema를 함께 고정해야 한다.
투자 관점 | runtime 최적화, agent observability, editable media와 provenance가 모델 commoditization 위의 응용 가치층이 될 수 있다.
다음 AI 경쟁은 더 큰 모델 하나가 아니라 더 빠른 실행, 더 짧은 학습 루프, 더 편집 가능한 결과를 묶는 시스템이다.
아직 남은 위험
성숙도와 시험 조건이 달라 직접 성능 비교로 해석하면 안 된다.
그래서 우리에게 어떤 의미가 있을까?
개발자
개발자는 같은 target·prompt·sampling으로 DSpark의 출력 보존과 p95를 먼저 시험한다.
기업
기업은 model·runtime·harness·artifact schema를 하나의 manifest로 잠그고 롤백한다.
투자자
디자인팀은 한글 text accuracy, alpha edge와 layer 재조합 손실을 승인 기준으로 둔다.
창업자
경영진은 토큰 가격보다 완료 시간, 재작업, GPU·사람 비용과 독립 재현으로 투자를 판단한다.
기업·생태계 전략 비교
| 주체 | 현재 전략 | 강점 | 핵심 리스크 |
|---|---|---|---|
| Liquid AI DSpark | target-preserving VLM acceleration | H100·Apple·GGUF runtime paths | supplier benchmark·target lock-in |
| SGLang·MLX-VLM·llama.cpp | hardware-specific speculative runtime | open integration paths | version drift·sampling limits |
| Qwen-Planner-Agent | data·training·harness closed loop | execution-evidence feedback | implementation unavailable |
| Ming Design Models | text-rich RGBA·layer output | MIT weights·editable assets | 80GiB baseline·Korean fidelity |
| Enterprise AI Ops | runtime·harness·artifact manifest | workflow evidence·rollback | benchmark leakage·version sprawl |
LFM2.5-VL-3B-DSpark: 정책을 생성하는 도구가 아니라 같은 시험으로 정책 효과를 증명하는 release workflow다.
검토 범위 | Liquid AI 공식 글과 model card의 구조·runtime requirement·측정 조건을 검토하고 공급자 결과와 자체 재현 과제를 분리했다.
LFM2.5-VL-3B target에 붙이는 experimental speculative-decoding drafter로 SGLang·MLX-VLM·llama.cpp 경로를 제공한다.
강점
baseline과 동일한 target·prompt·sampling에서 최종 출력이 보존되는가.
주의점
vision encoder까지 포함한 end-to-end p95와 peak memory가 실제로 개선되는가.
한글 문서 VQA와 현장 이미지의 latency가 병목인 제한된 pilot.
실행 증거가 모델과 하네스를 함께 개선하는 Qwen-Planner-Agent
연구는 data generation, planner training, memory·skill·tool harness를 action-feedback-verification contract로 연결한다. [S4][S5]
agent가 어디서 실패했는지 기록하고, 그 기록으로 다음 연습 문제·학습법·도구 설명을 함께 고치는 구조다.
폐루프 구조와 공급자 benchmark claim은 확인됐지만 구현 공개와 독립 재현은 아직 없다.
| 구성 | BrowseComp | 해석 |
|---|---|---|
| AI for Data | human-gated task flywheel | 실행 가능한 task와 trajectory를 만들고 실패 유형에 따라 다음 데이터 구성을 바꾼다. |
| AI for Training | competence-aware online RL | 모델 competence에 맞춰 reward와 advantage를 조정해 완료와 비용을 함께 최적화한다. |
| AI for Harness | skill·memory runtime | tool-conditioned skill과 persistent memory가 task별 context를 구성한다. |
| Execution Feedback | preserved failure traces | 실패 증거를 다음 model·harness 변경과 held-out 회귀 시험으로 연결한다. |
실패 trace를 보존하고 model·memory·skill update를 각각 versioning하며 held-out suite로 회귀를 막는다.
검증·개선 루프의 최소 구조
bundle = lock(target, drafter, runtime, harness, artifact_schema)
baseline = run(representative_tasks, bundle.without_optional_layers())
candidate = run(representative_tasks, bundle)
assert same_output_or_approved_delta(baseline, candidate)
assert candidate.p95 < baseline.p95 and candidate.edit_cost <= limit
preserve_failures_and_publish_evidence(bundle, candidate)
# 입력: 공급자 claim, 환경 조건, 공개 자산, 자체 baseline.
# 상태: SOURCE·VERIFIED·GAP·NEXT_ACTION 필드로 성숙도와 재현 상태를 기록한다.
# 종료 조건: missing version, changed task set, unresolved output delta, unsupported license or no rollback.
def evaluate(item):
return 독립 재현된 조합만 제한 배포하고 나머지는 GAP와 다음 안전 시험을 반환한다.
AI Builder Corner - AI Workflow Evidence Bench
문제 모델·runtime·harness·editable output이 서로 다른 조건으로 평가돼 실제 workflow 비용을 비교하기 어렵다.
MVP 동일 task set에서 latency, success, memory, 재작업 시간, layer 품질과 artifact hash를 한 run에 저장한다.
차별화 모델 점수가 아니라 runtime·harness·artifact를 묶은 end-to-end 증거.
위험 공급자 API 변화, task leakage, 시각 품질의 주관성, benchmark 유지 비용.
앞으로 어떻게 될까?
3개월 - VLM drafter 지원이 더 많은 runtime과 target 조합으로 확장될 수 있다.
3개월 - Ming 계열의 ComfyUI·hosted inference·design skill 연결이 빠르게 보완될 수 있다.
6개월 - agent benchmark는 model-only와 harness-enabled 결과를 분리 보고하게 될 것이다.
6개월 - editable layer와 provenance가 생성 이미지 도구의 구매 기준이 될 수 있다.
1년 - runtime·harness·artifact를 함께 잠그는 deployment manifest가 일반화될 수 있다.
오늘 바로 할 일 4가지
- VLM 가속 A/B 고정자체 이미지 100건에서 동일 target·prompt·sampling으로 baseline과 DSpark의 output·p95·memory를 비교한다.
- 실패 trace 구조화agent 실패를 task·tool·permission·recovery로 나눠 model·memory·skill update와 연결한다.
- 편집 가능성 검증한글 디자인 50건에서 RGBA edge, 텍스트 정확도, layer 재조합 손실과 수정 시간을 측정한다.
- 성숙도 라벨 분리experimental·research-only·public weights·production support를 구매·배포 표에 따로 기록한다.
오늘의 실무 프롬프트
AI 스택 검증 책임자
새 model 주변 최적화가 실제 workflow의 속도·성공률·수정 비용을 개선하는지 독립 재현한다.
1. 비운영 데이터와 대표 task set 하나로 제한한다.
2. 대표 workflow에서 품질을 유지하며 p95 또는 재작업 시간이 개선되고 실패 증거가 재현 가능하다.
3. 공식 model card·paper·repository를 사용하고 공급자 claim과 자체 측정값을 분리한다.
4. 공급자 최고값을 일반화하지 않고 research repository를 production package로 취급하지 않는다.
5. environment manifest, baseline/candidate 표, 실패 trace, editable-output 샘플, 비용과 승인 결정.
6. model·runtime 변경, memory 승격, 외부 게시와 디자인 최종 승인 전에 사람이 검토한다.
7. pilot GPU 시간과 task 수를 고정하고 초과 시 사람에게 반환한다.
target·drafter·runtime·hardware version
agent model·harness·memory·skill version
artifact schema·RGBA·layer acceptance criteria
Editor's Insight
오늘의 세 사건은 거대 모델 발표가 없는 날에도 AI 스택이 어디에서 진화하는지 선명하게 보여준다.
Liquid AI는 같은 target이 낼 답을 작은 drafter가 먼저 제안하게 해 VLM latency를 줄이려 한다.
Qwen 연구진은 실행 실패를 다음 데이터·reward·memory·skill 개선으로 돌려 agent 개발 자체를 폐루프로 만든다.
inclusionAI는 완성된 한 장보다 투명 배경과 분리 레이어처럼 다시 손댈 수 있는 결과를 전면에 둔다.
세 방향의 공통점은 모델을 교체하는 대신 모델 주변의 시간, 학습, 수정 비용을 줄인다는 것이다.
하지만 최고 속도, benchmark 우위와 편집 품질은 모두 공급자 조건 안의 주장이라 같은 독립 workload에서 다시 측정해야 한다.
따라서 다음 AI 도입표는 모델 이름보다 runtime·failure loop·artifact structure와 독립 재현 증거를 먼저 적어야 한다.
마무리
AI의 다음 경쟁력은 더 큰 모델만이 아니라 같은 결과를 더 빨리 만드는 실행 경로다.
실패를 학습으로 돌리고 결과를 다시 편집 가능하게 만드는 시스템이 실제 workflow 가치를 결정한다.
모델보다 runtime·feedback loop·editable artifact를 함께 검증한다.
참고 자료
- Liquid AI - LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond
- Liquid AI - LFM2.5-VL-3B-DSpark model card
- Liquid AI - LFM2.5-VL-3B target model
- MAI Team - Qwen-Planner-Agent technical report
- Tongyi-MAI - Qwen-Planner-Agent research repository
- Tongyi-MAI - Qwen-Planner-Agent project site
- inclusionAI - Ming-Image-0.1-Design model card
- inclusionAI - Ming-Image-0.1-Design-Layer model card
- inclusionAI - Official model index
- inclusionAI - Ming-Image 0.1 Design official demo
'데일리 브리핑 > AI' 카테고리의 다른 글
| AI Daily #071 상시 실행 에이전트와 실험으로 검증하는 AI (0) | 2026.09.30 |
|---|---|
| AI Daily #070 더 빠른 모델보다 중요한 에이전트 실행 통제 (0) | 2026.09.29 |
| AI Daily #068 Copilot이 실행 OS로, 에이전트 평가는 릴리스 게이트로 (0) | 2026.09.27 |
| AI Daily #067 Live Avatar·보안 메모리·휴머노이드, 경쟁은 연속성으로 (0) | 2026.09.26 |
| AI Daily #065 ART·MentalHealthBench·Voice·Sandbox, 사람 중심 검증 경계 (0) | 2026.09.24 |