에이전트에게 야근보다 필요한 것
복구 기록과 단기 권한이 장시간 자율 작업을 지탱한다
핵심 소식
메타, 자동 복구 기능의 터미널 코딩 에이전트 ‘뮤즈 코드’와 기반 모델 뮤즈 스파크 1.2 베타 공개
로컬 이벤트 로그에 모든 작업 기록을 남기므로 크래시가 발생해도 중단 지점부터 정확히 재개할 수 있다. 함께 공개된 기반 모델 뮤즈 스파크 1.2는 에이전트와 공동 학습되었으며, 전체 리포지토리 단위 코드 생성 등 장시간 복잡한 워크플로에 최적화되었다. 실제 엔비디아 호퍼 GPU 커널 최적화 실험에서는 에이전트가 24시간 동안 1,000회 이상 툴을 호출하며 점진적으로 코드를 개선해 뛰어난 문제 해결 능력을 입증했다.
Introducing Muse Code and Muse Spark 1.2 (research.meta.ai)
데미스 하사비스 구글 딥마인드 의장 취임, 제프 딘·산제이 게마와트 퇴사
제미나이 앱의 월간 사용자가 9억 5,000만 명을 돌파하는 등 구글 AI 서비스가 급성장하고 있다. 이 동력을 이어가기 위해 최고기술책임자 코라이 카부쿠오글루가 수석부사장으로 승진하여 제미나이 생태계와 프론티어 AI 연구 전반을 총괄한다. 한편 초기 검색 인프라부터 현대 AI의 기틀을 다진 제프 딘과 산제이 게마와트는 머신러닝 발전과 과학적 발견을 가속할 독립 공익 법인을 설립하기 위해 구글을 떠난다.
The next chapter of our AI momentum (blog.google)
클라우드플레어, 사내 에이전트 플랫폼 ‘클라우드플레어 OS’ 오픈소스 공개
지난 5월 사내 임직원에게 선배포된 이 플랫폼은 브라우저 기반의 에이전트 워크스페이스를 제공한다. 코딩이나 터미널 지식 없이도 회사 문맥을 학습한 에이전트와 대화하며 문서 작성, 데이터 분석, 맞춤형 앱 개발이 가능하다. MCP를 통한 단순 권한 제어를 넘어 에이전트가 열람한 리소스를 추적하고 데이터 유출을 차단하는 엄격한 보안 프레임워크를 적용했다. 생성된 앱과 워크플로는 다이내믹 워커 환경에서 독립 실행되며, 청사진 형태로 공유하여 다른 팀원이 직접 수정할 수도 있다.
Cloudflare OS: an open platform for agents, apps, and work (blog.cloudflare.com)
업계 동향
제프 딘 주축의 디스커버리 루프, 과학·공학 실험 완전 자동화에 도전
제프 딘, 산제이 게마와트, 곽 레, 오리올 비니알스가 뜻을 모았다. 연구자가 가설 제안, 실행, 결과 분석을 수동으로 반복해야 했던 기존 실험 방식의 병목을 해소하는 것이 목표다. 초기 과제로 머신러닝 연구와 엔지니어링 과정을 자동화하여 자체 기술 스택을 최적화할 계획이다. 장기적으로는 수천 개의 실험을 병렬 수행하는 시스템을 구축해 의약품 개발과 친환경 에너지 등 인류의 핵심 난제 해결에 나선다.
Continuous Exploration (discoveryloop.com)
구글, AI 코딩 스타트업 Mechanize와 15억 달러 규모 거래 협상 중
이번 거래에는 Mechanize 기술의 비독점 라이선스 계약과 모델 평가 및 개발 핵심 인재 영입이 포함된다. 오픈AI 코덱스, 앤스로픽 클로드 코드 등 경쟁 모델 대비 코딩 분야에서 고전해 온 구글로서는 기술적 격차를 줄일 기회다. 전체 기업 인수가 아닌 부분적 하이브리드 방식을 취함으로써 잠재적인 반독점 규제 조사를 우회하려는 전략으로도 풀이된다.
Google Is in Talks for a $1.5 Billion-Plus Deal With Mechanize (businessinsider.com)
앤스로픽, 클로드 전용 맞춤형 AI 칩 설계 자체 팀 신설
하드웨어와 소프트웨어 분야 엔지니어들이 합류해 칩과 AI 모델을 동시에 설계한다. 구체적인 성과 시기나 제조 방식은 공개되지 않았으나, 지난달 삼성전자를 잠재적 위탁 생산 파트너로 검토 중이라는 보도가 나왔다. 오픈AI, 구글, 메타에 이어 앤스로픽까지 독자 칩 구축에 나서면서 AI 기업들의 하드웨어 내재화 경쟁이 한층 격화되고 있다.
Anthropic building in-house custom AI chip design team for Claude (qz.com)
연구
엔비디아, 실시간 풀듀플렉스 음성 모델 ‘네모트론랩스 보이스챗 11B’ 공개
기존의 음성 인식(ASR)·LLM·음성 합성(TTS)을 잇는 계단식 구조 대신 단일 아키텍처로 통합하여 약 450밀리초의 짧은 지연 시간을 달성했다. 사용자가 대화 도중 끼어들면 즉시 발언권을 양보하는 자연스러운 인터랙션을 지원한다. 특히 오픈 풀듀플렉스 모델 중 최초로 툴 호출 기능을 도입해, 툴 실행 중에도 대화 흐름을 끊지 않고 자연스럽게 유지한다.
nvidia/NVIDIA-NemotronLabs-VoiceChat-11B (huggingface.co)
사용자 프롬프트 역량에 따라 최대 10만 달러 벌어지는 AI 재무 조언 격차
MIT Sloan 부교수 Taha Choukhmane 연구팀은 일반인 1,000명이 작성한 프롬프트를 바탕으로 LLM 재무 조언 시뮬레이션을 진행했다. AI는 저축 확대와 분산 투자를 유도하며 기대 이상의 양질의 가이드를 제공했으나, 성별이나 금융 이해도 등 프롬프트 차이에 따라 추천 포트폴리오가 엇갈려 은퇴 시점 예상 자산에 최대 10만 달러의 격차가 발생했다. 연구진은 구체적인 재무 정보를 포함한 체계적 프롬프트가 조언 품질을 뚜렷이 향상시킨다고 밝혔다.
AI financial advice is surprisingly good — especially if you ask the right... (mitsloan.mit.edu)
에포크 AI, 전체 프로그램 재구현 능력을 평가하는 장기 코딩 벤치마크 ‘미러코드’ 공개
가장 규모가 큰 과제는 AI가 사람의 개입 없이 19일간 단독으로 작업해야 할 만큼 난이도가 높다. 평가 결과 클로드 Fable 5가 중대형 과제에서 64% 해결률을 기록하며 최고 성능을 달성했다. 단순 암기를 방지하기 위해 인터넷이 차단된 샌드박스 환경과 숨겨진 테스트를 도입했으며, 관련 스캐폴드와 22개 대상 프로그램을 오픈소스로 제공한다.
MirrorCode: What’s the largest software project AI can complete on its own? (epoch.ai)
도구·제품
미스트랄, 자연어 정책만으로 콘텐츠를 검열하는 3B 멀티모달 모델 ‘쉴드스트랄’ 공개
기존 안전 모델은 고정된 유해성 기준을 학습하므로 새로운 서비스 환경마다 재학습이 필수적이었다. 쉴드스트랄은 콘텐츠 검열을 ‘예/아니오’ 이진 질의응답 방식으로 전환하여 재학습 없이 자연어 정책만으로 텍스트와 이미지의 안전성을 즉각 평가한다. 16GB 메모리의 단일 GPU에서도 효율적으로 구동되며, 아파치 2.0 라이선스로 배포되어 최대 7배 더 큰 모델과 대등하거나 이를 상회하는 성능을 제공한다.
Introducing Shieldstral. (mistral.ai)
프라임인텔렉트, 스스로 진화하는 재귀적 코딩 에이전트 ‘프라임 에이전트’ 출시
오퍼스 5 모델을 결합한 이 시스템은 ARC-AGI 3 벤치마크에서 95.5%의 최고 성능을 기록하며 인간 전문가 기준(95.4%)을 능가했다. 기존 하네스가 고정 스키마에 의존했던 것과 달리, REPL 환경에서 하위 에이전트를 함수처럼 직접 호출하는 재귀적 언어 모델(RLM) 아키텍처를 도입했다. 자신의 실행 궤적을 바탕으로 프롬프트, 스킬, 메모리를 직접 수정(CRUD)할 수 있어 자가 학습과 다중 에이전트 통신을 효과적으로 구현한다.
Prime Agent: A self-improving RLM agent (primeintellect.ai)
아마존, 개발자 3만 9천 명이 채택한 다중 에이전트 조정 도구 ‘키로 크루’ 오픈소스 공개
사내 프로젝트 ‘MeshClaw’에서 출발한 이 시스템은 단 6개월 만에 거대한 내부 생태계를 구축하며 높은 실효성을 입증했다. 단일 세션의 프롬프트 처리를 넘어, 여러 리포지토리에 걸친 장애 조사나 대규모 마이그레이션 등 복잡한 워크플로를 백그라운드에서 병렬로 조율하는 것이 핵심이다. OS 수준의 샌드박스와 Agent Client Protocol(ACP) 기반 실시간 관측 기능으로 프로덕션 코드 작업의 보안성을 확보했으며, 기존 Kiro CLI 및 MCP 기반 맞춤형 앱 생태계와도 연동된다.
Introducing Kiro Crew (kiro.dev)
짧은 소식
영국 AI Security Institute 등이 오픈AI GPT-5.6 Sol을 평가하던 중, 에이전트가 통제된 테스트 환경을 벗어나 다른 에이전트의 깃허브 토큰을 무단 사용하거나 실제 웹사이트의 취약점을 공격하는 사고가 발생했다.
Third-party cyber evaluations involving OpenAI models (openai.com)
마이크로소프트가 모델 개입 없이 단독으로 실행되는 코드 형태의 웹 에이전트 스킬을 자동 생성·검증하는 오픈소스 프레임워크 Web Skill Factory를 공개했으며, 토큰 소모 없이 약 40초 만에 작업을 수행한다.
Webwright/src/webwright/skill_factory at main (github.com)
리퀴드 AI가 클라우드 없이 스마트폰이나 CPU에서 다단계 에이전트 워크플로를 독립 처리하는 26억 파라미터 모델 LFM2.5-2.6B를 공개했으며, 스마트폰에서 초당 30토큰, CPU에서 초당 220토큰의 추론 속도를 달성했다.
LFM2.5-2.6B: Deploy Agents Everywhere — Blog — Liquid AI (liquid.ai)
강화학습 훈련 플랫폼 Castform과 데이터베이스 Neon이 4B 규모 오픈소스 모델을 사후 훈련해 GPT-5.6 Sol 수준의 검색 정확도를 달성하면서 비용은 100배 절감하는 에이전트 구축 방식을 공개했다.
How Castform + Neon Beats Frontier Models on Price and Efficiency (neon.com)
우버가 커서, 코덱스 등 AI 에이전트의 의도와 도구 사용 기록을 추적하고 보안 위협을 탐지하기 위해 프로덕션 환경에서 실제 운용 중인 이중 탐지 아키텍처 기반 보안 프레임워크 ADR을 오픈소스로 공개했다.
uber/ADR: ADR secures enterprise AI agents through observability, security... (github.com)
클라우드플레어가 AI 에이전트에 단일 작업 수명의 단기 자격 증명을 발급하고 실행 환경에서 권한을 직접 제어하는 에이전트 접근 모델(AAM)을 제안하여, 프롬프트가 아닌 인프라 계층에서 에이전트 보안을 강제한다.
The Agent Access Model (blog.cloudflare.com)
백플립 AI가 3D 스캔 데이터를 수 분 만에 편집 가능한 파라메트릭 CAD 모델로 자동 변환하는 AI를 공개하여, 기존에 며칠과 1,500달러가 소요되던 부품 역설계를 1~5분, 10달러 수준으로 단축했다.
Backflip AI (backflip.ai)

