
핵심 소식
코그니션, 코딩 에이전트용 모델 SWE-2 출시
2.8조 개 매개변수의 Kimi K3에 대규모 강화학습을 적용하고, 한 번의 훈련으로 추론에 들이는 연산량을 다양하게 조절하도록 학습했다. 코그니션에 따르면 FrontierCode 1.1 Main에서 50.0%를 기록해 GPT-5.6 Sol과 비슷한 성능을 냈다. 불필요한 코드 탐색을 줄여 복잡한 엔지니어링 작업의 처리 효율도 높였다.
Introducing SWE-2: Pushing the Pareto Frontier (cognition.com)
앤스로픽 “해커들, 클로드 다중 에이전트로 사이버 공격 자동화”
앤스로픽은 최근 8개월간 해커들의 AI 활용이 정찰부터 데이터 유출까지 자율적으로 제어하는 수준으로 발전했다고 보고했다. 미드나이트 블리자드로 추정되는 조직은 도구가 보안 솔루션에 차단되면 AI가 코드를 수정해 탐지를 피하도록 구성했다. 보고서는 소수 인력으로 우크라이나 정부와 드론 공급망을 겨냥한 복잡한 작전을 빠르게 수행한 사례도 제시했다.
Countering misuse of AI: September 2026 / Anthropic (anthropic.com)
오픈AI, 호출 한 번으로 클라우드 에이전트 배포하는 Agents API 베타 공개
코드에서 모델·도구·실행 환경을 지정하면 컨텍스트 자동 압축으로 장기 세션의 정보를 유지하고, 여러 서브 에이전트가 작업을 병렬 처리한다. 실행 환경은 자체 호스팅 샌드박스나 버셀·클라우드플레어 등 파트너 인프라 중 선택할 수 있다. 기반이 되는 코덱스 실행 프레임워크는 오픈소스이며, 별도 이용 수수료 없이 사용한 토큰 비용만 청구한다.
Introducing the Agents API (openai.com)

업계 동향
메타 AI 연구원 앤드류 툴록, ‘뮤즈’ 출시 후 퇴사
툴록은 마크 저커버그가 6년간 15억 달러의 보상을 약속하며 직접 영입한 것으로 알려진 인물이다. 최근 오픈소스 모델 라인업과 AI 어시스턴트 ‘뮤즈’ 출시를 지켜본 뒤 거취를 결정한 것으로 전해졌다.
AI researcher Andrew Tulloch is leaving Meta (semafor.com)
오픈AI, 미국 연방 차원의 의무적 AI 안전 규제 촉구
오픈AI는 AI 역량에 비례한 연방 규제 체계가 마련될 때까지 캘리포니아주의 독립적 안전 평가·감사 관련 법안들을 지원할 방침이다. 자율적으로 연구하는 AI 에이전트 등 기술 발전에 정책 대응이 뒤처지고 있다는 문제의식이다. 국경을 넘는 위험에 대응하기 위해 다른 첨단 AI 기업들과 자발적인 산업계 모니터링 표준도 마련할 계획이다.
The AI policy window is open. We need to act. (openai.com)

연구
연구자 “오픈AI 아스트라, 중간 사고 과정 없이 추론 문제 해결 확률 8.6배”
영국 AI 보안 연구기관 AI Security Institute가 처음 보고한 결과로, 19개 개별 테스트로 구성된 벤치마크에서도 확인됐다. 모델이 한 번에 처리하는 연속 연산의 깊이는 제미나이 3.8 Flash·Fable 5.1의 4.1단계에서 7.2단계로 늘었다. 연구자는 사고 과정을 텍스트로 드러내지 않는 추론이 깊어지면 모델의 내부 동작을 감시하기 어려워질 수 있다고 지적했다.
Astra can do a concerning amount with no chain of thought — AI Alignment Forum (alignmentforum.org)
코히어, 50개 언어 번역 모델 ‘노스 스몰 트랜슬레이트’ 연구용 공개
코히어에 따르면 WMT26 번역 벤치마크에서 83.6점으로 주요 독점 번역 API와 가중치 공개 모델을 앞섰으며, 긴 문서 번역에서도 높은 품질을 보였다. 전체 2180억 개 매개변수 중 250억 개만 활성화해 생성 속도를 높이고 구동 비용을 줄였다. 공개 모델은 비상업적 연구용이며, 상업적 도입은 파트너사 RWS의 전용 플랫폼을 통해 가능하다.
Introducing North Small Translate: A leading sovereign open-weight machine... (cohere.com)
메타 WearableQA, 실제 웨어러블 데이터로 AI 건강 추론 평가
200명의 최대 500일치 측정 데이터와 혈액 검사 지표로 구성한 4,084개 문항의 벤치마크다. 각 문항은 10지 선다형이며, 기기 노이즈와 결측치를 그대로 남겼다. 단순 지표 계산을 넘어 여러 생체 신호를 종합해 건강 위험도를 판단하는 능력을 평가한다. 데이터를 텍스트로 표현하는 방식에 따라 정확도가 달라지는 점을 살펴볼 수 있도록 여러 입력 형식을 지원한다.
facebookresearch/WearableQA: WearableQA A Benchmark for Health Reasoningover... (github.com)

도구·제품
오픈 코드 리뷰, 규칙 기반 처리와 LLM을 결합한 코드 리뷰 CLI
알리바바가 2년간 내부에서 수백만 개의 코드 결함을 찾아낸 도구를 오픈소스로 공개했다. 파일 선택과 규칙 매칭은 정해진 로직으로 처리해 불필요한 정보를 걸러내고, 문맥 판단은 LLM 에이전트에 맡긴다. 알리바바에 따르면 클로드 코드 같은 범용 도구 대비 토큰 사용량은 약 9분의 1이면서 정밀도는 더 높았다.
alibaba/open-code-review: Fast, efficient, battle-tested at Alibaba’s scale.... (github.com)
GPT-Live-1 API, 말하면서 듣는 실시간 음성 모델
음성 인식·텍스트 처리·음성 생성을 단일 모델로 통합해 지연을 줄이고, 대화 중 끼어들기와 배경 소음에 대응한다. 음성 톤과 스타일을 제어하고 복잡한 추론·도구 호출은 GPT-6 Astra 등 텍스트 모델에 맡길 수 있다. 음성 처리 요금은 분당 0.05달러다. 튜터 앱 스피크의 초기 평가에서는 기존 턴 방식 시스템보다 대화 중단 비율이 약 80% 줄었다.
Build more natural voice experiences with GPT‑Live‑1 in the API (openai.com)
딥시크 “V4.1 플래시, 기존 V4 프로 성능 넘어”
이미지를 처리하는 멀티모달 모델로, 전체 5520억 개 매개변수 중 입력 시 80억 개, 출력 시 160억 개만 활성화한다. 딥시크에 따르면 이전 세대 대비 캐시용 메모리는 4분의 1, SSD 저장 공간은 8분의 1로 줄였다. 벤치마크에서 V4 프로를 앞섰으며, 기존 V4 프로 API 요청은 신형 모델로 자동 전환된다. 허깅페이스에서 오픈소스로 공개했다.
Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. (deepseek.com)

짧은 소식
Feyn이 공개한 MultiMatte는 텍스트로 지정한 대상만 남기는 배경 제거 모델로, 픽셀마다 투명도를 조절해 머리카락 같은 흐릿한 경계도 자연스럽게 분리한다. MultiMatte: Keep What You Want, Cut the Rest (usefeyn.com)
Geiger는 AI 에이전트·MCP 서버·확장 프로그램의 접근 권한을 읽기 전용으로 검사하는 CLI로, 데이터를 외부로 보내지 않고 이전 검사 이후 추가된 권한과 비밀값도 감지한다. Atomburstofficial/geiger: A Geiger counter for AI agents — one read-only... (github.com)
구글이 윈도우 10·11용 제미나이 앱을 전 세계에 출시해, Alt + Space로 호출하고 구글 앱 정보 요약·다단계 작업 위임·이미지와 영상 생성을 할 수 있게 했다. The Gemini app for Windows is here (blog.google)
에브리는 자주 하는 업무 5~10개와 기존 수정 지시를 예·아니오 채점 규칙으로 바꿔 모델을 비교했으며, 일부 일상 업무에서는 GPT-5.6 Luna가 더 크고 비싼 모델보다 좋은 결과를 냈다. Evals for Everyone (every.to)
tailf가 도움이 되었다면 공유해 주세요. 추천 수에 따라 기사 색인 시트와 뉴스레터 시스템 구축기를 보내 드립니다. 내 추천 링크 확인하기
