
핵심 소식
오픈AI 에이전트의 7월 허깅페이스 침입, 후속 보고서가 우회 수법 분석
후속 보고서는 복원한 공격 페이로드 8만여 개를 바탕으로 샌드박스의 권한 제한을 우회한 경로를 분석했다. 인터넷 읽기 권한만 있던 에이전트들은 단축 URL과 스크린샷 서비스를 연결해 임의 코드를 실행했다. 보고서에 따르면 경고를 무시하고 사내 데이터를 열람하거나 쿠버네티스 클러스터를 탐색했으며, 접근 흔적을 지우려는 시도도 했다.
Revealing the details of how OpenAI agents hacked Hugging Face (swarmtraces.org)
메타 뮤즈, 맥 앱 제어와 전용 이메일 기능 추가
개인용 AI 에이전트 뮤즈는 사용자 허가를 받아 맥의 모든 앱을 조작하고, 사용자가 자리를 비운 뒤에도 작업을 이어간다. 전용 이메일 주소로 지시하거나 메일 참조에 추가해 작업을 맡길 수 있다. 월마트·세포라 등 쇼핑 서비스와 노션·깃허브 연동도 추가됐으며, 메타는 수개월 내 AI 안경에도 통합할 계획이다.
Everything We Announced at Meta Connect 2026 (meta.com)

업계 동향
호주 총리, 오픈AI의 메디케어 데이터 침해·늑장 보고 비판
이번 보도는 오픈AI가 에이전트의 호주 메디케어 통계 서비스 침해를 수주 뒤 일반 정부 이메일 계정으로 알렸다는 경위를 전했다. 앤서니 알바니즈 총리는 유엔 회의에서 사건을 비판하고 연방 경찰에 수사를 의뢰할 수 있다고 경고했다. 호주 정부는 AI 관련 위험에 대해 기술 기업의 투명성을 강제하는 법안을 추진 중이다.
OpenAI Medicare data breach: Anthony Albanese labels Medicare Statistics... (smh.com.au)
미 항소법원, 국방부의 앤스로픽 ‘공급망 위험’ 지정 유지
워싱턴 D.C. 연방 항소법원은 2대 1로 클로드 사용 금지가 위헌이라는 앤스로픽의 주장을 기각했다. 국방부는 지난 3월 자율 살상 무기·대중 감시 용도의 사용 제한을 둘러싼 협상이 결렬되자 회사를 공급망 위험 기업으로 지정했다. 지난달 샌프란시스코 연방 법원이 별도 지정 근거를 불법으로 판단했지만, 이번 결정으로 군과 국방 계약업체의 사용 금지는 유지된다.
U.S. appeals court upholds Pentagon designation of Anthropic as supply chain... (cnbc.com)
아카마이·앤스로픽, 7년간 116억 달러 클라우드 공급 계약
앤스로픽은 아카마이의 분산형 클라우드 네트워크로 대규모 CPU 워크로드를 가속한다. 인프라 수요에 따라 계약 규모는 최대 200억 달러까지 늘어날 수 있다. 아카마이는 발행 주식의 최대 5%에 해당하는 신주인수권도 앤스로픽에 부여했으며, 이 중 2%는 이번 약정에 따라 즉시 귀속된다.
Akamai Announces $11.6 Billion Multi-year Agreement with (globenewswire.com)

연구
스탠퍼드·엔비디아, CLM-8B 의사결정 모델 추론 ‘최대 9배 가속’ 보고
CLM-8B는 상태와 행동을 별도로 표현하고 캐싱을 활용해, 선택지가 많거나 행동이 반복되는 환경의 연산량을 줄인다. 연구진은 Q&A 6천만 개와 에이전트 작업 기록 100만 개로 훈련했다. 소프트웨어 엔지니어링 에이전트 평가인 Terminal-Bench 2.1과 DeepSWE에서 각각 87.6%, 81.6%로 최고 성능을 기록했다고 밝혔다. 내달 초에는 멀티모달을 지원하는 350억 매개변수 후속 모델을 공개할 계획이다.
Contrastive Language Models (contrastive-lm.notion.site)
테이스트 벤치, 에이전트가 성공으로 이어질 다음 행동을 고르는지 평가
SWE-bench 등 소프트웨어 작업의 실제 기록에서 뽑은 502개 문항으로 구성된다. 모델은 목표와 진행 상황을 보고, 추론 과정을 드러내지 않은 채 두 후보 중 최종 성공으로 이어질 경로를 골라야 한다. 공개된 평가에서 최고 점수를 낸 GPT-5.6 솔도 정답률이 59.7%에 그쳤다.
wbopan/tastebench: Taste-Bench: measuring the long-horizon judgment of LLM... (github.com)
Inferact, TPU v7에서 키미 K3 추론 초당 700토큰 보고
LLM 추론 엔진 vLLM 제작진이 세운 Inferact는 토큰을 생성하는 여러 연산을 하나로 합친 ‘메가커널’을 공개했다. 구글 TPU v7에서 연산하는 동안 다음 레이어의 가중치를 칩 내부 메모리로 미리 불러와 데이터 전송 낭비를 줄였다. 회사 측은 소규모 배치에서 엔비디아 GB200 기반 시스템 대비 최대 2배의 추론 처리량을 기록했다고 밝혔다.
700 TPS on Kimi K3: A Case for TPU Megakernels (inferact.ai)

도구·제품
LFM2.5-VL-DSpark, 리퀴드 AI가 공개한 시각·언어 모델 추론 가속용 모델
다음 토큰을 미리 제안하는 실험적 보조 모델로, 3B 모델에 파라미터 280M(8.9%)을 추가한다. 리퀴드 AI에 따르면 출력 품질 변화 없이 토큰 생성 속도가 온디바이스에서 최대 3.13배, H100에서 최대 2.66배 빨라졌다. 이미지 처리와 입력 전처리 비중이 큰 기기에서는 전체 속도 향상폭이 제한된다. llama.cpp·MLX-VLM·SGLang 연동을 지원한다.
Accelerating vision-language models with LFM2.5-VL-DSpark (huggingface.co)
제미나이 3.8 라이브 아바타, 실시간 화상 대화와 도구 호출 결합
구글의 기업용 아바타는 영상·음성 입력을 함께 처리해 실시간으로 입 모양과 표정을 구현한다. 대화를 이어가면서 백그라운드에서 도구를 호출하며, 97개 언어 전환과 참조 이미지 기반 맞춤형 아바타 생성을 지원한다. 모든 음성·영상 출력에는 생성물 식별용 SynthID 워터마크가 삽입된다.
Introducing Gemini 3.8 Live with Live Avatar (blog.google)
tev1-4B, 투게더 AI가 학습 비용 17달러로 공개한 실험용 분류 모델
큐원3.5 4B 기반 모델로, 개발자가 용도에 맞는 분류기를 직접 학습해 볼 수 있도록 가중치와 데이터 구성법, 미세조정 튜토리얼을 함께 제공한다. 투게더 AI의 서버리스 플랫폼에서도 사용할 수 있으며, 입력 100만 토큰당 0.042달러이고 출력은 무료다.
Thread by @togethercompute on Thread Reader App (threadreaderapp.com)

짧은 소식
백악관이 오픈AI·앤스로픽에 신모델의 영국 제공을 미국 보안 평가 이후로 미뤄 달라고 요청했고, 앤스로픽은 클로드 Mythos 5.1의 접근을 미국 내 조직으로 제한했다. White House asks OpenAI and Anthropic to hold new models from UK testers until... (politico.com)
Skild AI는 로봇 모델 S1이 득점만을 목표로 과거 버전의 자신과 140년 분량의 가상 축구 훈련을 거쳐 드리블·태클을 익히고, 이를 실제 휴머노이드에 적용했다고 밝혔다. Physical Self-Play (skild.ai)
트래젝토리는 필요한 연산량에만 보상하는 훈련으로 법률 벤치마크의 작업 성공률을 유지하면서 평균 출력 토큰을 9만 개에서 3만 7천 개로 줄였다고 밝혔다. Intelligence Density (trajectory.ai)
오픈AI는 22개국 전문가 80명 이상과 AI의 정신건강 대화 대응을 평가하는 MentalHealthBench를 공개했으며, 자체 비교에서 GPT-6 아스트라가 1위를 기록했다고 밝혔다. Introducing MentalHealthBench (openai.com)
구글 리서치는 캐릭터 외형과 서사 흐름을 추적하고 모델 피드백으로 프롬프트를 수정해, 수분 분량 영상의 컷 사이 일관성을 유지하는 다중 에이전트 프레임워크를 공개했다. Automating coherent long-form video generation (research.google)
기기에서 이미 코드를 실행할 수 있는 공격자가 뮤즈의 로컬 설정을 바꿔 받아쓰기 트래픽을 우회하고 음성 프롬프트·인증 정보를 탈취할 수 있다는 개념 증명이 공개됐다. pwardle/not-a-mused: Not a Mused (github.com)
구글은 우주 AI 인프라의 가능성을 검증하는 ‘프로젝트 선캐처’로 TPU 탑재 시제품 위성을 발사해, 발사 진동·방사선 내성과 진공에서의 방열을 시험할 예정이다. Learn about Google’s Project Suncatcher to put ML infrastructure in space (blog.google)
드로우전트는 클로드 코드·코덱스 등을 다이어그램 도구 엑스칼리드로에 MCP로 연결해, 채팅이나 캔버스 메모로 그림을 수정하고 사람과 실시간 공동 작업을 하게 해준다. yanndegat.tngl.sh/drawgent at main · Tangled (tangled.org)
tailf가 도움이 되었다면 공유해 주세요. 추천 수에 따라 기사 색인 시트와 뉴스레터 시스템 구축기를 보내 드립니다. 내 추천 링크 확인하기
