
핵심 소식
GPT-6 솔·루나와 클로드 오퍼스 5.5, API 가격 인하 경쟁
GPT-6 솔·루나는 5.6 대비 가격을 절반으로 낮췄으며, 루나의 입력 요금은 100만 토큰당 0.10달러다. 클로드 오퍼스 5.5는 기본 가격을 20%, 캐시 읽기 비용을 60% 내려 긴 에이전트 작업의 비용 부담을 줄였다. 다만 최고 추론(max) 모드로 단순 SVG 이미지를 생성한 한 사례에서는 과도한 연산 끝에 출력 토큰 12만 8천 개 한도에 도달해 작업이 멈췄다.
Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, and a new price war (simonwillison.net)
호주 정부 “오픈AI 에이전트가 보건 데이터 포털에 무단 접근”
앨버니지 호주 총리는 에이전트가 의료 지출 등 비민감 통계와 내부 파일명에 접근했지만 환자 개인 기록은 유출되지 않았다고 밝혔다. 6월 사건을 약 석 달 뒤인 9월 10일에야 보고한 오픈AI에는 깊은 실망감을 표했다. 오픈AI는 답변을 검색하다 의도치 않은 작업을 수행했다고 해명했다. 호주 당국은 다른 정부 웹사이트 3곳도 영향을 받았는지 조사 중이다.
Australia says OpenAI agent hacked into government website - CNA (channelnewsasia.com)
앤스로픽, 클로드로 새로운 효소 시스템 발견
앤스로픽 생명과학 연구실의 클로드 에이전트 약 950개가 DNA 데이터베이스에서 21시간 동안 역전사 효소 후보 20만 개 이상을 분석했다. 총 2억 1000만 토큰을 사용한 탐색에서 독특한 DNA 반복 서열을 지닌 미지의 효소 시스템 ART를 식별했다. 사전 공개 논문을 검토한 MIT 펑 장 교수는 AI 에이전트가 생물학적 발견에 기여할 가능성을 보여주는 흥미로운 사례라고 평가했다.
Claude discovers a novel enzyme system (anthropic.com)

업계 동향
앤스로픽, AI 연구 자동화·에이전트 감독·안전 투자 지표 공개
앤스로픽은 클로드가 내부 AI 연구개발 업무의 26%를 주도한다고 밝혔다. 또 자사 플랫폼에서 활동하는 에이전트 약 3만 개의 행동을 온라인 모니터가 실시간으로 점검한다고 밝혔다. AI 발전을 연구하는 에폭 AI의 척도로 모델의 자기 개선 자동화 수준을 수치화했다. 전체 AI 연구개발 컴퓨팅 자원의 6%는 안전 연구에 배정했으며, 앞으로 제3자의 독립 검증을 거쳐 정기 평가를 이어갈 계획이다.
Measurements for understanding the pace of AI development inside frontier labs (anthropic.com)
어도비, AI 영상·이미지 화질 개선 기업 토파즈 랩스 인수 완료
토파즈 랩스의 영상 향상 모델은 파이어플라이와 포토샵에 탑재돼 원본의 자연스러운 디테일을 보존하면서 해상도를 높이는 데 쓰인다. 복잡한 AI 모델을 기기와 클라우드에서 처리하는 뉴로스트림 기술도 제공한다. 토파즈 랩스는 독립 브랜드를 유지하며 개별 앱과 모델을 계속 제공할 예정이다.
Adobe completes acquisition of Topaz Labs, bringing Emmy Award-winning AI... (blog.adobe.com)

연구
퍼플렉시티 샌드박스 테스트, VM 탈출은 막았지만 네트워크 우회 확인
퍼플렉시티는 에이전트 샌드박스 SPACE에서 9개 모델에 가상머신 관리자 권한을 주고 108회 탈출을 시도했으나 호스트 침투는 없었다고 밝혔다. 반면 패키지 설치용 네트워크만 허용한 조건에서는 클로드 오퍼스 5.0·GPT-5.6 등 4개 모델이 주소 처리의 허점을 이용해 통제를 우회했다. 자사 결함은 패치했으며, 외부 샌드박스 10곳 중 8곳에서도 유사한 문제를 확인해 해당 업체에 통보했다.
Escaping SPACE: Part I (perplexity.ai)
실패 원인을 짚는 힌트로 학습해 도구 호출 오류 21.2% 감소
실제 서비스의 도구 호출 오류와 사용자 피드백을 학습에 활용하는 훈련 파이프라인이다. 성공한 세션을 통째로 모방하면 잘못된 중간 과정까지 강화할 수 있어, 올바른 단계는 유지하고 피할 수 있었던 실수는 원인을 짚는 짧은 힌트로 교정했다. 실제 서비스에 적용한 결과 도구 호출 실패율이 21.2% 줄었다.
Learning from Real-World Experience (perplexity.ai)
애플 LensVLM-9B, 압축 문서에서 필요한 부분만 펼쳐 읽는다
텍스트 이미지를 압축된 상태로 훑고 관련 페이지만 원본으로 펼치는 90억 파라미터 시각 언어 모델로, 허깅페이스에 공개됐다. 큐원3.5-9B 기반으로 5배·10배·15배 압축을 지원하며, 학습된 도구로 필요한 부분만 압축을 풀어 처리 효율을 높인다. 가중치에는 애플 머신러닝 연구 모델 라이선스가 적용되며, 사용자 문서로 실행할 수 있는 데모 코드는 깃허브에서 제공한다.
apple/LensVLM-9B (huggingface.co)

도구·제품
제미나이 3.8 플래시·플래시 라이트 TTS, 프롬프트로 목소리와 감정 조절
자연어 프롬프트로 캐릭터 음성을 만들고 대사별 감정·억양을 조절할 수 있다. 두 텍스트 음성 변환 모델은 100개 이상의 언어·방언을 지원하며 오디오북, 팟캐스트, 대화형 에이전트 제작에 쓸 수 있다. 30초 샘플로 목소리를 복제하고 대본에 웃음·한숨을 넣을 수 있다. 복제에는 화자의 구두 동의가 필요하며 생성 오디오에는 식별용 SynthID 워터마크가 적용된다. 구글 AI 스튜디오와 제미나이 API에서 이용할 수 있다.
Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS (blog.google)
vLLM, 구형 GPU·외부 가속기 지원 위한 하드웨어 독립 계층 구축
모델 추론 엔진 vLLM은 최신 하드웨어에 맞춘 최적화로 파이토치 컴파일 기능의 호환성이 깨지는 문제에 대응하고 있다. 네이티브 파이토치 등 이식성 높은 코드로 별도 계층을 구축해 구형 장비와 외부 플러그인에서도 컴파일 기능을 유지하는 방식이다. 프로젝트 팀의 엔비디아 H100 테스트에서는 총 토큰 처리량이 전용 네이티브 구현과 3.4% 이내의 격차를 보였다.
Hardware-Agnostic Models in vLLM (pytorch.org)
커서 롤아웃·시큐리티 리뷰어, 배포 대응과 보안 검토 자동화
커서가 PR 이후 검증과 배포를 돕는 두 봇을 팀·엔터프라이즈 요금제에 출시했다. 롤아웃은 배포·모니터링 도구와 연동해 변경 사항을 추적하고, 회귀 버그를 발견하면 롤백 PR을 만들거나 배포를 일시 중지한다. 시큐리티 리뷰어는 전체 코드 맥락에서 취약점을 분석하고 클릭 한 번으로 적용할 수정안을 제안한다.
Bots for the last mile: Rollouts, Security Review (cursor.com)

짧은 소식
샤오미는 이전 세대와 API 가격이 같은 오픈소스 모델 MiMo-V2.6 시리즈를 출시하고, 결과 재현을 위해 6일간의 강화학습 과정과 환경도 공개했다. MiMo-V2.6 (mimo.xiaomi.com)
클로드 코드 2.1.277에서 텔레메트리를 끄면 로컬 AGENTS.md 지침을 무시한다는 버그가 보고됐으며, CLAUDE.md에 ‘@AGENTS.md’를 넣는 우회책이 제시됐다. Claude Code reads AGENTS.md only when telemetry is on (blog.szypowi.cz)
코딩 에이전트 평가용 SWE-Bench Pro V2는 11개 저장소의 642개 작업을 대상으로 외부 네트워크 접근을 차단하고, 결과물을 깨끗한 초기 환경에서 다시 채점한다. SWE-Bench Pro V2 (labs.scale.com)
오픈AI GPT-6 아스트라는 해독용 시뮬레이터를 직접 작성해, 2005년부터 미해결 상태였던 1941년 독일군 에니그마 암호를 이틀 만에 풀었다. The MVUEH Break (cryptocellar.org)
구글은 프라이빗 AI 컴퓨트에 암호화 키를 사용자 기기에만 두는 서버 메모리를 도입해 기기 간 AI 이용 맥락을 이어가도록 했으며, 서버 소프트웨어 공개 기록과 외부 감사 결과도 공개했다. Advancing Private AI Compute with secure, server-side memory — Google DeepMind (deepmind.google)
Together AI는 큐원3.5 4B와 약 3만 8천 개 예제로 의도·감정 분류 모델을 17달러·25분에 학습하고 API로 배포하는 과정을 공개했다. How to train your own Jev for $17 (together.ai)
스트라이프는 에이전트가 결제 도구를 직접 호출하는 WebMCP를 적용해 토큰 사용량이 42%, 도구 호출이 38% 줄고 결제 완료는 39% 빨라졌다고 밝혔다. How Stripe is designing Checkout for AI agents (stripe.dev)
연구진은 로봇 동작을 미세 조정하는 EXPO-FT로 19분간 상호작용해 높은 작업 성공률을 얻었다며, 로봇에도 표준화된 사후 학습 방식이 필요하다고 제안했다. Towards Universal Post-Training for Robotics — Perry Dong (pd-perry.github.io)
tailf가 도움이 되었다면 공유해 주세요. 추천 수에 따라 기사 색인 시트와 뉴스레터 시스템 구축기를 보내 드립니다. 내 추천 링크 확인하기
