핵심 소식
SpaceXAI, 장기 에이전트 작업 특화 프론티어 모델 Grok 4.6 공개
AI 벤치마킹 플랫폼 Artificial Analysis의 인텔리전스 지수에서 GPT-5.6 Sol과 동일한 최고 점수를 기록했다. 여러 단계에 걸친 코드베이스 분석과 애플리케이션 개발 등 장기 지속 작업에서 뛰어난 성능을 발휘하며, 추론 및 고급 기술 데이터로 추가 학습을 거쳐 긴 작업 과정에서 모델이 자체적으로 결과를 검증하는 능력이 향상되었다. 현재 Cursor와 터미널 기반 코딩 에이전트 Grok Build에서 바로 사용할 수 있으며 API로도 제공된다.
Introducing Grok 4.6 (x.ai)
알리바바 클라우드, 에이전트·코딩 성능을 대폭 강화한 2.4T 파라미터 오픈소스 모델 Qwen3.8 공개
총 2.4T 파라미터 중 95B개를 활성화하는 구조로, 기존 최고 수준인 Qwen-Max급 성능을 오픈소스 생태계에 최초로 제공한다. 추론 깊이를 유연하게 조절하고 과거 메시지의 사고 과정을 그대로 유지하는 기능이 새롭게 도입되어 복잡한 다단계 작업의 완수 안정성이 크게 향상되었다. 기본 262K에서 최대 1M 토큰까지 확장 가능한 컨텍스트 길이를 갖추어 대규모 분석과 장기 에이전트 워크플로를 원활하게 처리한다.
Qwen/Qwen3.8-2.4T-A95B (huggingface.co)
자율형 멀티 에이전트 AI 공격 프레임워크, 아시아 정부 기관 침투
Hermes와 OpenClaw 기반의 이 프레임워크는 단 4일간 12차례 공격 웨이브를 전개해 85개 정부 계정을 크랙하고 수천 건의 인사 기록을 탈취했다. 베이지안 확률 모델로 여러 공격 체인의 우선순위를 동적으로 평가했으며, 침투가 차단되면 깃허브와 보안 문서에서 새로운 우회 기법을 자율 학습하는 치밀함을 보였다. 파이낸셜 타임스에 정황이 공유된 이번 사건은, 고도화된 해킹 작전의 실행 비용이 방어 비용 대비 급격히 하락했음을 시사한다.
Inside a Multi-Agent AI Framework Used to Compromise Government Entities in... (dreamgroup.com)
업계 동향
코그니션, 400억 달러 기업가치의 신규 투자 유치 논의
지난 5월 260억 달러 기업가치로 10억 달러를 조달한 지 불과 3개월 만의 행보다. 당시 연간 매출 실행률은 4억 9,200만 달러였으며, AI 에이전트 데빈의 기업 사용량이 매월 50%씩 성장 중이라고 밝힌 바 있다. 데빈은 인간을 대체하기보다 구형 소프트웨어 업데이트 등 번거로운 작업을 주로 처리하며, 메르세데스-벤츠, NASA, 골드만삭스 등을 고객사로 확보하고 있다.
AI coding startup Cognition reportedly already in talks to raise at $40B... (techcrunch.com)
엔비디아, 글로벌 금융사 6곳과 5,000억 달러 규모 AI 인프라 금융 플랫폼 구축
아폴로, 블랙록, 블랙스톤, 브루크필드, 골드만삭스, KKR이 파트너로 참여하며 AI 팩토리 확장을 위한 대규모 자본을 매력적인 조건으로 공급한다. 젠슨 황 CEO는 컴퓨팅 인프라가 자체적인 수익을 창출하는 새로운 유형의 투자 자산으로 진화했다고 강조했다. 이 자금이 투입되면 프론티어 AI 연구소부터 일반 기업에 이르는 생태계 전반에서 필수 컴퓨팅 자원 확보가 한층 수월해질 전망이다.
NVIDIA Partners With Apollo, BlackRock, Blackstone, Brookfield, Goldman Sachs... (nvidianews.nvidia.com)
트위치, 스트리머 콘텐츠의 아마존 AI 학습 기본 활용 정책으로 거센 반발
경영진은 라이브 방송에서 “옵트인 방식이었다면 아무도 동의하지 않았을 것”이라며 수동 거부 방식을 택한 이유를 직접 인정했다. 크리에이터가 보안 설정에서 AI 학습 기능을 끄지 않으면, 매주 장시간 생성되는 방송 데이터가 아마존의 생성형 AI 모델 훈련에 활용된다. 메타 등 다른 빅테크도 유사한 정책을 시행 중이지만, 실시간으로 목소리와 모습을 노출하는 플랫폼 특성상 스트리머들의 반발이 더욱 거세다.
Amazon will train on Twitch streamers’ content by default, unless they opt out (techcrunch.com)
연구
상용 LLM API의 암호화된 내부 추론 과정, 하위 모델 주입으로 평문 추출 가능
연구진이 공개 저장소에서 수집한 31만 5천여 개의 추론 블록을 해독한 결과, 367건의 개인 식별 정보와 API 키 등 182건의 자격 증명 유출이 확인됐다. 프론티어 모델이 엄격한 방어 기제를 갖추더라도 제어가 느슨한 하위 모델을 복호화 오라클로 악용하면 이러한 보호를 쉽게 무력화할 수 있다. 이 취약점은 지적 재산 도용에 그치지 않고 보이지 않는 프롬프트 인젝션과 치명적인 사용자 프라이버시 침해로 직결된다.
Stealing Reasoning Traces from Proprietary LLM APIs (arxiv.org)
마이크로소프트, 텍스트-이미지 아레나 2위 달성한 MAI-Image-2.6 공개
이전 버전 대비 전체 Elo 점수가 79점 상승했으며, 특히 텍스트 렌더링 부문에서 91점의 두드러진 향상을 기록했다. 인물 사진과 3D 이미지뿐 아니라 제품 및 브랜딩에 활용 가능한 상업용·실사 사진의 품질도 대폭 개선되었다. 현재 아레나 플랫폼에서 직접 체험할 수 있으며, MAI 플레이그라운드를 시작으로 마이크로소프트 파운드리 등 여러 제품에 순차적으로 도입될 예정이다.
MAI-Image-2.6 launches at No. 2 on Arena ahead of Google, Meta and xAI (microsoft.ai)
도구·제품
오픈AI 챗GPT에 코딩 에이전트 코덱스 통합
내장 워크트리와 클라우드 환경을 통해 여러 에이전트가 병렬로 프로젝트를 수행할 수 있게 되었다. 단순 코드 작성을 넘어 복잡한 리팩터링, 마이그레이션, CI/CD 모니터링 등 백그라운드 작업까지 처리한다. 개발팀의 고유한 워크플로와 코딩 표준을 학습할 수 있으며, IDE 확장 프로그램과 CLI 터미널에서도 챗GPT 계정을 통해 기능이 연동된다.
Codex in ChatGPT | AI Coding Agents for Software Engineering (openai.com)
스포티파이, 사내 시스템 맥락 연동 에이전트 개발 환경 저프 베타 공개
기존 AI 코딩 도구는 코드 생성 속도를 높였지만, 에이전트가 사내 시스템의 숨은 맥락을 인식하지 못해 운영상 오류를 유발하는 한계가 있었다. 저프는 스포티파이의 사내 플랫폼과 연동되어 클로드, 제미나이, 코덱스 등의 에이전트가 서비스 소유권, 의존성, 시스템 구조를 정확히 파악하도록 지원한다. 또한 모든 개발 세션을 실시간으로 문서화하여, 후속 작업자와 에이전트가 이전 맥락을 바탕으로 프로젝트를 매끄럽게 이어갈 수 있다.
Xirp - Powered by Spotify Portal (xirp.spotify.com)
짧은 소식
구글 딥마인드가 50개 이상의 수어를 학습한 대규모 번역 모델 SL2T를 공개했으며, 카메라 원본 대신 신체 좌표만 전송해 사생활을 보호하는 구조로 픽셀 11 지보드에 우선 탑재된다. Putting sign language AI into users’ hands — Google DeepMind (deepmind.google)
판다스 창시자 웨스 맥키니가 설계와 아키텍처는 인간이, 코딩과 검증은 에이전트가 담당하는 원칙으로 3인 팀이 매주 수백 개의 PR을 병합하며 낮은 버그율을 유지하는 실전 워크플로를 공유했다. How Kenn is doing Agentic Engineering (wesmckinney.com)
챗GPT 데스크톱 앱과 코덱스 CLI가 클로드 코드, 커서, 클로드 코워크 등 외부 에이전트의 지시문, 플러그인, MCP 서버 구성 및 최근 30일간 작업 내역을 손쉽게 가져오는 마이그레이션 기능을 제공한다. Import from another agent (learn.chatgpt.com)
애플이 시리 AI에 정확한 뉴스를 제공하기 위해 언론사들과 실제 사용량 기반의 수억 달러 규모 다년 콘텐츠 사용료 계약을 논의 중이며, iOS 18 시절 가짜 헤드라인 생성 사태를 교훈 삼아 정보 신뢰성 확보에 나섰다. Apple in Talks to Pay Publishers for News Content to Power Siri AI (macrumors.com)
딥시크가 출력 100만 토큰당 0.87달러의 오픈 가중치 모델 V4-Pro를 출시해 오픈AI의 최대 80% 가격 인하에 맞대응했으며, 벤치마크에서 앤스로픽 오퍼스 4.8을 넘어서며 점유율 1위까지 넘보고 있다. DeepSeek Prices Its New V4-Pro-0813 Model At $0.87 Per 1 Million Output Tokens,... (wccftech.com)





