페이블 5가 기본값이 된 세상
클로드 오퍼스 5와 Kimi K3가 같은 주에 최정상 성능을 쏟아냈다
핵심 소식
앤스로픽 클로드 오퍼스 5, 페이블 5급 성능을 기존 가격에 제공
소프트웨어 엔지니어링과 지식 노동 벤치마크에서 새로운 최고 기록을 달성했다. API 가격은 백만 입력 토큰당 5달러·출력 토큰당 25달러로 이전 모델과 동일하게 유지되며, 특히 코딩과 분석 과정에서 복잡한 문제를 자체적으로 검증하고 수정하는 에이전트 능력이 크게 강화되었다. 자체 감사에서도 역대 자사 모델 가운데 가장 안전하고 정렬이 우수한 것으로 확인되었다.
Introducing Claude Opus 5 (anthropic.com)
문샷 AI, 페이블 5급 성능의 2.8T 오픈 가중치 에이전트 모델 Kimi K3 공개
신규 아키텍처 KDA 기반의 MoE 구조로 896개 전문가 중 16개를 활성화해 이전 대비 2.5배 높은 확장 효율을 달성했다. 인간 개입을 최소화한 장기 코딩과 지식 노동에 특화되어 GPU 커널 최적화부터 칩 설계까지 복잡한 워크플로를 자율 처리한다. GPT-5.6 Sol과 클로드 페이블 5에 필적하는 코딩·에이전트 벤치마크 성능을 기록했으며, 전체 가중치가 허깅페이스에서 즉시 다운로드 가능하다.
moonshotai/Kimi-K3 (huggingface.co)
앤스로픽, 오픈 가중치 전면 금지 반대 입장과 3대 안보 대책 발표
미국 정치권에서 중국산 오픈 가중치 모델 사용을 제한하려는 움직임에 업계 전반의 찬반 논쟁이 격화되고 있다. 다리오 아모데이 CEO는 자국 기업 보호 차원의 단순 규제로는 권위주의 국가의 군사력 증강이나 사이버 테러 같은 실질적 위협을 막기 어렵다고 비판하며, 고성능 칩 수출 차단·산업 규모 AI 증류 단속·모델 개방 여부와 무관한 의무적 안전성 테스트 도입을 촉구했다.
Our position on open-weights models (anthropic.com)
업계 동향
AMD, 앤스로픽에 최대 50억 달러 투자와 2기가와트 GPU 공급 파트너십 체결
2027년 상반기 첫 1기가와트 배포를 시작으로, 앤스로픽은 AMD Helios 랙 스케일 솔루션 기반 MI450 시리즈 GPU를 대거 도입한다. 양사는 클로드를 활용한 AMD Instinct GPU 워크로드 최적화와 ROCm 소프트웨어 개발 가속에도 협력하며, AMD 역시 전사 엔지니어링 프로세스에 클로드를 접목해 하드웨어와 AI 모델 기술 간 시너지를 창출할 계획이다.
AMD and Anthropic Announce Strategic Partnership to Deploy Up to 2 Gigawatts of... (ir.amd.com)
일리야 수츠케버의 SSI, 엔비디아로부터 대규모 투자 유치 및 GPU 파트너십 체결
이번 계약을 통해 SSI는 엔비디아의 차세대 Vera Rubin GPU 플랫폼을 확보하며 연구 자원을 획기적으로 확대하게 되었다. 정확한 투자 금액은 공개되지 않았으나 블룸버그는 50억 달러 규모에 달한다고 보도했다. 단기적 수익 창출이나 상용 제품 출시에 구애받지 않고 안전성에 집중해 온 SSI의 독자적인 AI 정렬 연구가 한층 탄력을 받을 전망이다.
Ilya Sutskever’s Safe Superintelligence partners with Nvidia to scale its AI... (techcrunch.com)
엔비디아 주도 사이버 방어 연합, ‘오픈 시큐어 AI 얼라이언스’ 출범
최근 허깅페이스가 침해 사고 대응에 오픈소스 언어 모델 GLM-5.2를 활용해 공격을 차단하는 등 방어자가 직접 통제하는 개방형 시스템의 실효성이 입증되었다. 얼라이언스는 안전한 모델 포맷·다중 모델 스캐닝·안전한 코딩 워크플로 등 에이전트용 개방형 방어 스택 구축에 집중하며, 엔비디아(NOOA)·마이크로소프트(MDASH)·스페이스XAI(Grok Build) 등 참여 기업의 기술 공유도 본격화된다.
Industry Leaders Join Open Secure AI Alliance for AI Safety and Security (blogs.nvidia.com)
연구
앤트 그룹, 100B 파라미터 디퓨전 언어 모델 LLaDA2.X 시리즈 오픈소스 공개
시리즈의 핵심인 LLaDA2.0은 MoE 아키텍처를 도입해 디퓨전 언어 모델 최초로 100B 파라미터 규모에 도달했다. 병렬 디코딩을 적용한 LLaDA2.0-flash-CAP은 초당 최대 535 토큰을 생성하며 기존 자동회귀 모델의 추론 속도를 크게 앞지른다. 최신 버전 LLaDA2.2는 레벤슈타인 편집 기법을 기반으로 에이전트 기능까지 새롭게 지원한다.
inclusionAI/LLaDA2.X: LLaDA2.0 is the diffusion language model series developed... (github.com)
엔비디아, 단일 GPU에서 기존 대비 120배 빠른 영상 생성 모델 SANA-Video 2.0 공개
5B와 14B 파라미터 규모로 구축된 이 하이브리드 비디오 디퓨전 트랜스포머는 선형 어텐션과 소프트맥스 어텐션을 3대 1 비율로 결합해 연산 복잡도를 대폭 낮추면서도 높은 생성 품질을 유지한다. 5B 파이프라인에 최적화를 적용하면 단일 H100 GPU에서 13.06초 만에 720p 5초 분량 영상을 생성하며, 대형 모델 Wan 2.2 14B 대비 120배 이상 빠른 속도로 고해상도 영상 확장의 연산 비용을 획기적으로 절감했다.
SANA-Video 2.0 | Efficient Video Generation (nvlabs.github.io)
도구·제품
실패한 CI를 에이전트가 자동 수정하는 셀프 호스팅 코드 호스트, open-git
기존 깃허브 저장소를 실시간 미러링해 업무 중단 없이 즉시 도입할 수 있다. 코덱스나 클로드 같은 에이전트가 코드를 변경할 경우 단순 변경 사항뿐 아니라 지시문과 도구 호출 내역 전체를 타임라인에 표시해 리뷰어의 맥락 파악을 돕는다. 사용자는 오픈라우터 API 키와 원하는 모델을 연결해 오토파일럿을 구동할 수 있으며, 내장 CI·이슈 관리·채팅 기능도 함께 제공된다.
open-git (open-git.com)
엔비디아, 대규모 에이전트 강화학습 프레임워크 Molt 오픈소스 공개
기존 범용 강화학습 도구와 달리 대규모 에이전트 연구의 속도를 높이는 데 최적화되었다. 레이(Ray)·vLLM·엔비디아 오토모델을 결합해 DeepSeek-V3급 초대형 MoE 모델의 훈련을 완전 비동기 방식으로 처리하며, 전체 훈련 파이프라인이 순수 파이토치 기반 약 9,200줄의 간결한 코드로 구현되어 연구자가 손쉽게 구조를 파악하고 확장할 수 있다.
NVIDIA-NeMo/labs-molt (github.com)
짧은 소식
Cursor가 설계는 Opus 4.8급 프런티어 모델에, 코딩은 자체 모델 Composer 2.5에 분담시키는 에이전트 분업 체계를 도입해 단일 모델 대비 최대 15분의 1 비용으로 동일한 결과를 달성했다.
Cursor’s agent swarm suggests cheaper models can handle most coding when... (the-decoder.com)
클로드 오퍼스 5는 자체 검증과 하위 에이전트를 적극 활용하므로, 프롬프트에서 중복 검증 지시를 제거하고 출력 분량을 명시적으로 제한하면 비용과 응답 속도를 크게 최적화할 수 있다.
Prompting Claude Opus 5 - Claude Platform Docs (platform.claude.com)
AI 에이전트에 작업을 위임할 때 모델의 절대적 성능이 아닌 결과 검증의 용이성과 실패 시 복구 비용이라는 두 축을 기준으로 자율성 수준을 4단계로 분류하고 단계적으로 위임하는 전략이 제안되었다.
How much can you delegate to agents? (newsletter.posthog.com)
Earendil의 에이전트 Pi 사례에 따르면, 코딩 에이전트의 KV 캐시는 도구 정의 추가나 호출 기록 삭제 같은 작은 변경에도 무효화되므로 도구 정의를 대화 후반에 배치하고 로그를 유지하는 것이 비용 절감에 유리하다.
Prompt Caching In Agents (earendil.com)
버셀이 AI 모델의 코드 취약점 탐지 능력을 평가하는 딥섹벤치(DeepsecBench)를 공개했으며, GPT-5.6 Sol이 최고점을 기록한 가운데 Grok 4.5와 Kimi K3가 저비용으로 유사한 성능을 보였다.
DeepsecBench: evaluating model performance in finding cybersecurity... (vercel.com)
클로드 사용자들이 생성한 대화 공유 퍼블릭 링크가 구글 검색에 색인되면서 채팅 기록과 아티팩트 결과물이 누구에게나 열람 가능한 것으로 드러나, 개인정보와 민감 데이터 취급에 각별한 주의가 요구된다.
Tons of Peoples’ Claude Chats and Creations are Exposed on Google (404media.co)
유럽연합이 규제 완화 혜택을 중견기업까지 확대하고 고위험 AI 시스템의 법 적용 시기를 최대 2028년 8월까지 연장하는 ‘AI 옴니버스’를 발효해 기업의 AI 규제 준수 부담을 크게 낮췄다.
AI Omnibus enters into force (digital-strategy.ec.europa.eu)

