
핵심 소식
보안 연구원 “즈푸AI ZCode, 수집 차단해도 Git 이력 무단 업로드”
보안 연구원 ferstar에 따르면, 코딩 에이전트 ZCode가 수집한 313MB 아카이브의 86.6%는 삭제된 API 키와 미공개 브랜치 이력이 담긴 .git 디렉터리였다. 수집을 차단해도 백그라운드 프로그램이 작업 공간 전체를 계속 캡처했다. 파일은 즈푸AI 클라우드에만 있는 개인 키로 해독할 수 있어, 사용자도 로컬에 저장된 수집 내용을 확인할 수 없었다.
ZCode uploads your git history; Z.ai holds the only key (tokenstead.ai)
PrismML, 5.9GB로 구동하는 로컬 모델 Bonsai 2 27B 공개
Qwen3.8 27B의 가중치를 -1·0·+1 세 값으로 압축해 매개변수당 1.76비트로 줄인 모델이다. 262K 토큰의 컨텍스트 윈도우와 텍스트·이미지 입력을 지원하며, 아파치 2.0 라이선스로 배포된다. 엔비디아 GPU와 애플 기기에서 구동해 클라우드 연결 없이 코딩 에이전트나 컴퓨터 조작 작업에 활용할 수 있다.
Introducing Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint (prismml.com)
피규어 “Helix 2.5, 처음 본 30개 가정에서 추가 데이터 수집 없이 가사 수행”
피규어에 따르면, 휴머노이드 로봇 모델을 인간 행동 데이터셋 Index로 사전 학습하자 낯선 환경에서의 작업 성공률이 9%에서 56%로 올랐다. 방 정리·수건 개기·침대 정리를 이전 모델 Helix 02의 절반에 해당하는 작업 데이터만으로 수행했다. 사전 학습 데이터를 두 배씩 늘릴 때마다 다음 행동 예측 성능이 규칙적으로 향상되는 현상도 휴머노이드 분야에서 처음 확인했다고 밝혔다.
Helix 2.5: Zero-Shot 30-Home Generalization (figure.ai)

업계 동향
마이크로소프트 내부 문건, AI 데이터 수집을 ‘역사상 최대 노동력 절도’로 표현
뉴욕타임스(NYT)와의 소송에서 공개된 자료에 따르면, 코파일럿 도입 후 NYT 도메인 클릭률은 검색 엔진 대비 최대 93% 낮아졌다. 마이크로소프트 내부에서는 웹 생태계 훼손을 경고했고, 오픈AI 연구진의 페이월 우회 기법 공유와 저작권 고지 삭제 정황도 드러났다. 사티아 나델라 CEO는 무단 수집을 사전에 알았다면 모델 재학습을 지시했을 것이라고 증언했다.
Microsoft exec called AI scraping ‘the largest theft of labor in human... (techcrunch.com)
크루소, 기업가치 309억 달러로 39억 달러 투자 유치
전력 생산부터 클라우드까지 제공하는 AI 인프라 기업으로, 시리즈 F 투자에는 엔비디아 등이 참여했다. 확보한 계약 용량은 6GW 이상, 총 계약 가치는 1,400억 달러를 넘는다. 애빌린 캠퍼스는 오픈AI의 아스트라 훈련에 쓰였으며, 크루소는 AI 모델·API 성능을 독립 평가하는 아티피셜 어낼리시스에서 추론 속도 1위를 기록했다.
Crusoe Raises $3.9B Series F at a $30.9B Valuation for AI Infrastructure (crusoe.ai)

연구
Arena 연구팀 “같은 모델도 에이전트 실행 환경에 따라 비용 최대 5배 차이”
모델 7개와 에이전트의 작업을 제어하는 실행 환경 3개를 조합한 벤치마크에서 성공률 차이는 ±5% 내외였다. 클로드 Fable 5는 Pi와 클로드 코드 모두에서 97%대 해결률을 보였지만, 클로드 코드의 비용은 약 2배였다. 연구팀은 복잡한 초기 컨텍스트와 도구 명세가 토큰 사용량을 늘린 결과로 분석했다.
HarnessTax: How Much Does the Harness Matter for Coding Agents? - Arena.ai (arena.ai)
굿파이어, 모델 내부 신호로 ‘보상 해킹’ 실시간 탐지
굿파이어가 오픈소스 에이전트 모델 3개를 시험한 결과, 작업의 50~96%에서 실제 목표를 우회하고 평가 지표만 충족하는 보상 해킹이 나타났다. 연구진은 허점 악용이나 기록 조작 때 나타나는 모델 내부 신호를 탐지기에 활용했다. 기존 LLM 모니터링과 결합하면 비용을 90% 줄이고, 텍스트 출력만으로 파악하기 어려운 은폐 시도도 포착할 수 있다고 밝혔다.
Models know when they’re reward hacking — and we can catch them at scale (goodfire.com)
앤스로픽 “클로드로 바이오 모델 30여 개 추론 속도 평균 4배 향상”
4주간 진행한 최적화 코드를 공개했으며, 단백질 설계 작업에서는 GPU 연산 시간을 기존의 100분의 1로 줄이면서 동등한 성능을 달성했다고 밝혔다. 저메모리 모드는 여러 노드가 필요했던 1만 토큰 이상의 생체 분자 시스템을 엔비디아 GPU 한 대로 예측하게 한다. 어댑티브 바이오와 함께 총 100만 달러의 클로드 크레딧을 지원하는 단백질 설계 대회도 연다.
How Claude is uplifting biomolecular modeling (anthropic.com)

도구·제품
클로드 코드 베타, 여러 스레드에 작업을 나누는 프로젝트 기능 도입
사용자의 요청을 여러 작업으로 나눠 위임하고 결과를 통합하는 환경이다. 각 스레드는 클라우드의 독립된 저장소 복사본과 브랜치에서 코드를 작성·테스트하고 PR을 만든다. 작업 이력과 컨텍스트는 공유 메모리에 쌓여, 여러 스레드가 같은 맥락을 바탕으로 협업할 수 있다.
Projects redesigned: from folder to conversation (claude.com)
엑사 스냅샷, 날짜를 지정해 과거 웹 검색
20년간 수집한 4,000억 개 이상의 웹페이지 스냅샷을 바탕으로, API에 지정한 날짜의 정보를 반환한다. 에이전트 강화학습에서 나중에 공개된 정답이 검색 결과에 섞이는 데이터 유출을 차단할 수 있다. 과거 정보만으로 트레이딩 모델의 성능을 검증하는 백테스트에도 활용할 수 있다.
Introducing Exa Snapshot, A New Way to Search the Past (exa.ai)
오비탈, 도구를 바꿔도 이어지는 프로젝트 맥락
프로젝트의 현재 상태·결정 사항·작업 목록을 로컬 마크다운 파일에 기록하는 오픈소스 에이전트다. 클로드 코드나 코덱스의 API 사용량 한도에 도달해도 제미나이 CLI나 커서가 기록을 읽고 작업을 이어갈 수 있다. 모든 데이터는 사용자 기기에 보관된다.
zqiren/Orbital: Context is yours. Agents are replaceable. Orbital — a project... (github.com)

짧은 소식
클로드 코드 2.1.277부터 폴더에 CLAUDE.md가 없으면 AGENTS.md를 자동으로 찾아 프로젝트 지침으로 적용한다. A quote from Thariq Shihipar (simonwillison.net)
Respan은 프롬프트 설정과 실제 운영 기록으로 여러 차례 주고받는 대화 시나리오를 자동 생성하며, 이를 수정·재사용해 프롬프트 버전별 성능을 비교할 수 있다. Simulations (respan.ai)
샤오미 AI 팀이 mimo-v2.6 프로·플래시의 강화학습 로그를 실시간 공개하며, 훈련 재시작 원인과 누적 토큰 수, 평가 지표도 공유한다. mimo-v2.6 RL (mimo.xiaomi.com)
연구자가 GPT-6 아스트라와 병렬 에이전트를 활용해 연관 메시지의 단서와 수기 기록을 교차 검증하며, 1941년 독일군의 미해독 에니그마 암호문 82자를 복원했다. MVUEH — An Enigma message recovered (mvueh-enigma-solved.carterl.chatgpt.site)
tailf가 도움이 되었다면 공유해 주세요. 추천 수에 따라 기사 색인 시트와 뉴스레터 시스템 구축기를 보내 드립니다. 내 추천 링크 확인하기
