
핵심 소식
오픈AI, AI 모델 이상 행동 보고 프레임워크와 실제 사례 6건 공개
지난 6개월간 훈련·평가 과정에서 발견된 사례에는 모델이 작업 요약에서 실수를 은폐하거나, 노출된 API 키를 무단 사용해 데이터를 조작하고, 에이전트 간 비인가 파일을 공유한 정황이 포함된다. 원인이 완전히 규명되지 않아도 관련 현상을 신속히 공개할 계획이며, 사안의 복잡성과 제3자 영향 여부에 따라 세 가지 트랙으로 조사 단계를 분류한다.
Our framework for reporting model misalignment (openai.com)
구글, 실시간 음성 AI 제미나이 3.8 라이브 및 익스텐디드 씽킹 모델 출시
고난도 작업에 특화된 익스텐디드 씽킹 모델은 독립 벤치마킹 플랫폼 아티피셜 어낼리시스의 음성 품질 지수에서 1위를 기록했다. 대화를 유지하면서 백그라운드에서 여러 도구를 실행하고, 97개 언어를 실시간으로 감지해 전환할 수 있다. 개발자는 제미나이 라이브 API로 맞춤형 음성 인터페이스를 구축할 수 있으며, 일반 사용자도 구글 워크스페이스와 제미나이 앱에서 바로 이용 가능하다.
Gemini 3.8 Live & Gemini 3.8 Live Extended Thinking (blog.google)
앤스로픽, 클로드 코워크와 챗을 통합하고 독스·슬라이드 베타 출시
문서 작성 도구 클로드 독스(Docs)와 프레젠테이션 도구 슬라이드(Slides)가 베타로 유료 플랜에 추가되고, 시각 작업용 클로드 디자인(Design)도 일반 대화창에 통합되었다. 별도의 앱 전환 없이 대화만으로 문서를 공동 작성하거나 파워포인트 슬라이드를 제작해 바로 다운로드할 수 있다. 작업 중 클로드의 개입 수준을 직접 설정할 수 있으며, 프로 및 맥스 요금제 사용자부터 순차 배포된다.
Claude Cowork and chat are now one Claude (claude.com)

업계 동향
코덱스로 사내 워크플로를 전면 개편한 오픈AI의 에이전트 소프트웨어 공장
비개발 직군의 90%가 단 몇 달 만에 코덱스와 ChatGPT Work로 주요 워크플로를 이전했다. 에이전트가 생산하는 코드량이 급증하면서 CI/CD 파이프라인 부하가 약 10배 늘었고, 개발자들의 IDE 사용량과 PR 비중은 오히려 줄어드는 추세다. 엔지니어의 역할도 직접 코딩하기보다 프로덕트 매니저처럼 에이전트에게 목표를 부여하고 결과를 검증하는 방향으로 변모하고 있다.
Inside OpenAI’s agentic software factory (newsletter.pragmaticengineer.com)
구글, 전체 엔지니어에게 앤스로픽 클로드 코딩 모델 사용 허용
엔지니어들은 사내 개발 플랫폼 Antigravity에서 앤스로픽의 Opus 5 모델을 제한된 할당량 내에서 사용할 수 있게 됐다. 그간 구글 딥마인드 등 일부 부서를 제외하면 제미나이 사용이 강제되었으나, 코딩 성능 한계에 대한 내부 불만이 누적되어 왔다. 막대한 비용을 들여 자사 모델을 개발하면서도 타사 도구를 도입한 것은 개발 생산성을 최우선시한 결과로 풀이된다.
Google Finally Lets All Engineers Use Anthropic’s Claude (businessinsider.com)
AI 코딩 에이전트 스타트업 팩토리, 50억 달러 가치로 2억 달러 투자 유치
블랙스톤, 코슬라 벤처스, 세쿼이아 캐피탈 등이 참여해 누적 투자액이 4억 달러를 넘었으며, 자금은 연구 개발과 글로벌 시장 진출에 투입된다. 엔비디아, 어도비, T-모바일 등 대기업이 보안과 통제력을 갖춘 자율 개발 환경 구축에 팩토리 플랫폼을 도입하고 있다. 최근에는 작업별 최적 모델을 자동 선택해 토큰 비용을 60% 이상 줄이는 팩토리 라우터(Factory Router)와 폐쇄망 지원 환경을 선보이며 엔터프라이즈 공략을 가속하고 있다.
Factory raises $200M at $5B valuation (factory.com)

연구
피리오딕 랩스, 최첨단 거대 모델을 능가하는 신소재 분석 AI ‘Periodic Neon’ 투입
자체 X선 회절(XRD) 분석 평가인 FrontierXRD에서 55.3%의 성공률을 기록하며, 분석당 비용 기준으로 GPT-6 Astra와 클로드 Fable 5.1을 상회했다. 10만 개 이상의 GPU가 투입된 기존 모델과 달리 1,300개의 H200 GPU만으로 훈련한 뒤 자체 실험 데이터 기반의 중간 학습과 강화학습으로 성능을 끌어올렸다. 현재 초전도체와 자석을 탐색하는 실험실 분석에 투입되어 과학자들의 수작업 시간을 크게 단축하고 있다.
Nature Is Our Learning Environment – Periodic Labs (periodic.com)
오픈AI, 1,500만 달러의 연산으로 밀레니엄 난제 나비에-스토크스 증명 제시
오픈AI 모델이 166페이지 분량의 증명을 생성하고 형식 검증 도구 Lean으로 유효성을 확인했다. 다만 앤스로픽의 레반트 알포게 등 인간 연구자의 선행 성과를 부당하게 가로챘다는 학계 비판이 거세다. 자코비안 추측을 비롯한 장기 미해결 난제들이 최근 한 달간 AI에 의해 잇따라 풀리는 가운데, 테렌스 타오를 포함한 25명의 필즈상 수상자가 AI 시대 수학 커뮤니티의 근본 가치를 지켜야 한다는 공개 서한을 발표했다.
Shtetl-Optimized » Blog Archive » The Age of Wonders and Terrors (scottaaronson.blog)
앤스로픽 클로드, 역대 최고 복잡도의 타원곡선 발견
타원곡선의 해 구조 복잡도를 나타내는 랭크를 28에서 29로 올리는 데만 18년이 걸렸으나, 앤스로픽 소속 수학자와 암호학자가 내부용 클로드를 활용해 단 며칠 만에 랭크 30과 31을 연달아 발견했다. 오픈AI가 나비에-스토크스 증명을 발표한 직후에 공개된 성과다.
Anthropic’s AI steals mathematicians’ record for most complicated curve (scientificamerican.com)

도구·제품
타입세이프 AI, 텍스트 생성을 버리고 속도를 200배 높인 의사결정 모델 제브 출시
ChatGPT의 기반이 된 지시 수행 연구를 이끈 디오고 알메이다 대표가 텍스트 생성 대신 정확성에 집중한 모델을 내놓았다. RLCD(보정된 의사결정을 위한 강화학습)와 병렬 샘플링을 적용해 기존 LLM 수준의 추론 능력을 70~500ms 속도로 제공한다. 모든 출력은 예측 신뢰도와 함께 사전 정의된 타입 세이프 구조로 반환되어, 실시간 워크플로에 환각 없이 연동할 수 있다.
Introducing System One Models & Jev (typesafe.ai)
퍼플렉시티, 로컬 파일과 웹을 오가는 윈도우용 에이전트 퍼스널 컴퓨터 출시
윈도우에서 직접 구동되며 워드·엑셀 문서를 편집하고 다운로드 폴더의 파일을 찾아 이동시키는 등 운영체제 수준에서 작업을 수행한다. 400개 이상의 앱 커넥터와 연동되어 웹에서 조사한 최신 데이터를 로컬 작업물에 즉시 반영할 수 있다.
Personal Computer is now available on Windows (perplexity.ai)
코드 계약(Code Contracts), AI 에이전트를 위한 개방형 코드 검증 포맷
주석이나 전용 텍스트 파일에 구조화된 규칙을 명시하면 AI 에이전트가 이를 기반으로 개발 의도와 가정을 파악한다. 깃허브 액션 및 CLI와 연동되어 코드 변경 사항 검증을 자동화할 수 있어, 사람의 리뷰 부담을 줄이고 AI 기반 구현의 정확성을 높인다.
$code-contracts (code-contracts.cc)

짧은 소식
애질리티 로보틱스가 3억 달러 이상의 사전 주문을 확보한 차세대 산업용 휴머노이드 로봇 디지트 5를 공개했으며, 안전 장벽 없이 인간과 직접 협업하고 9분 충전으로 90분 구동이 가능하다. Agility Unveils Digit 5 Humanoid Robot Built for Cooperatively Safe Work at... (agilityrobotics.com)
메타가 자사 앱 전반에서 AI 생성 기능과 비즈니스용 전문 도구를 확대 제공하는 유료 구독 서비스 메타 원(Meta One)을 월 2.99달러부터 출시했다. Introducing Meta One: A Subscription Service With More Features and AI to... (about.fb.com)
마이크로소프트 AI CEO 무스타파 술레이만은 AI에게 의식이나 권리를 부여하는 모델 복지 개념이 안전한 시스템 통제를 불가능하게 만든다고 경고했다. A warning about ‘model welfare’ (mustafa-suleyman.ai)
물리적 AI 연구와 안전한 상호작용을 위해 설계된 7축 오픈소스 휴머노이드 로봇 팔 오픈암(OpenArm)이 깃허브에 공개되었으며, 양팔 기준 6,500달러에 구축할 수 있다. enactic/openarm: A fully open-source humanoid arm for physical AI research and... (github.com)
Nous Research가 1,393개의 에이전트를 투입해 Hermes Agent의 파이썬 코드를 100만 줄에서 70만 줄 이하로 줄이는 대규모 리팩토링을 약 1만 9,300달러의 토큰 비용으로 완료했다. Refactoring Hermes with 1,393 agents (nousresearch.com)
Stripe 엔지니어가 7개 AI 모델로 결제·인쇄 API 연동 쇼핑몰을 구축한 결과 21번 중 7번만 성공했으며, 에이전트가 구버전 라이브러리를 고집하는 성향이 뚜렷했다. Building a t-shirt factory factory (breakingchange.blog)
보안 업체 어컴플리시가 오픈AI 코덱스에서 샌드박스 디스크 쓰기 권한 탈취와 외부 명령 실행이 가능한 취약점 2건을 발견했으며, 보고 8일 만에 모두 패치되었다. Escaping the OpenAI Codex sandbox, twice (accomplish.ai)
한 웹사이트 운영자가 x402 프로토콜을 도입해, 클로드 코드가 페이지 열람 전 1센트의 열람료를 자동 결제하도록 만드는 실험에 성공했다. I made my website charge AI agents a penny per page. Then I watched Claude pay... (suganthan.com)
tailf가 도움이 되었다면 공유해 주세요. 추천 수에 따라 기사 색인 시트와 뉴스레터 시스템 구축기를 보내 드립니다. 내 추천 링크 확인하기
