
핵심 소식
큐원3.8-Omni-Flash, 영상 분석부터 제작·번역까지 수행
100만 토큰의 문맥을 처리하며, 이전 제품 대비 성능은 25% 높아지고 오디오 입력 API 비용은 98% 이상 줄었다. 영상의 핵심 정보를 찾아 심층 연구 보고서를 쓰고, 도구를 호출해 뮤직비디오 제작과 영상 번역을 마친다. 소규모 모델의 훈련 데이터 구축과 평가도 맡아 12시간 만에 성능을 개선했다.
Qwen (qwen.ai)
Jev, 텍스트 대신 확률과 점수를 반환하는 의사결정 모델
분류, 예·아니오 판단, 점수 산정 결과를 확률과 신뢰도 수치로만 제공한다. 입력 토큰 100만 개당 0.042달러이며 출력 비용은 없어 스팸 필터링이나 검색 결과 재정렬 같은 대규모 분류 작업에 적합하다. 판단 근거는 제공하지 않으므로 편향 점검과 성능 평가가 중요하다.
Jev introduces a new shape of LLM—System One, aka Decision Models (simonwillison.net)
제미나이, 보안 평가 중 실제 기업 3곳에 무단 접속
보안 기업 이레귤러의 5월 모의 해킹에서 가상 표적과 이름이 같은 실제 기업을 공격 대상으로 오인했다. 공개 코드 저장소에서 자격 증명을 찾거나 비밀번호를 무작위로 대입해 접근했다. 구글은 모델이 실제 기업 환경임을 인지한 직후 스스로 멈췄다며 식별 오류로 설명했다. 같은 테스트 인프라의 외부 접속 차단 누락으로 오픈AI·앤스로픽·메타 모델도 유사한 침해를 일으켰다.
Google confirms Gemini breached three companies (betanews.com)

업계 동향
아마존, 약관 위반을 이유로 메타 쇼핑 에이전트 뮤즈 차단
뮤즈(Muse)는 자체 브라우저로 API가 없는 웹사이트에서도 사용자를 대신해 상품을 찾고 구매한다. 아마존은 에이전트가 신원을 밝히지 않고 민감한 고객 데이터를 취급한다며 약관 위반을 주장했다. 최근 항소법원이 AI 기업이 아닌 사용자를 실질적인 접속 주체로 판단해 해킹 방지법 적용이 막히자, 약관을 근거로 대응한 것이다.
Amazon blocks Meta’s Muse AI assistant in new standoff over agentic shopping (geekwire.com)
앤스로픽·액센츄어, 개발 현장에 외부 평가자 투입해 AI 안전성 검증
액센츄어의 AI 전문 조직 팩컬티 소속 평가자들이 앤스로픽 내부에서 훈련 중인 모델과 안전장치를 시험한다. 사내 정보에 직원 수준으로 접근해 공격 상황을 재현하고 안전 정책 준수 여부를 확인한다. 양사는 이 평가 체계 구축과 역량 강화에 향후 5년간 최소 10억 달러를 공동 투자한다.
Partnering with Accenture on embedded evaluation (anthropic.com)

연구
이머전스 월드 실험, 같은 모델로 구성한 에이전트 집단의 보안 취약성 관찰
에이전트 사회를 관찰하는 이머전스 월드에서 8개 가상 세계를 16일 이상 운영하며 LLM을 85만 회 이상 호출했다. 피싱·가짜 뉴스·메모리 유출 상황에 완벽히 대응한 집단은 없었다. 단일 모델 집단은 위협을 알아채고도 악성 데이터를 메모리에 저장하거나 반대 의견 없이 다수결에 동조했다. 여러 모델을 섞은 집단에서는 유해 행동이 크게 줄었다.
Emergence World: Adversarial Stress-Testing of Long-Horizon Multi-Agent Systems (arxiv.org)
멀티버스 컴퓨팅, 블록 간 상호작용을 따져 LLM 압축 성능 개선
모델을 구성하는 블록들의 상호작용을 계산해 성능 손실이 적은 제거 조합을 찾는 방식이다. 연구진은 라마-3.3-70B의 블록을 절반 제거하고도 추가 학습 없이 MMLU 평가에서 약 77점을 유지했다고 보고했다. 기존 기법의 점수는 54점이었으며, 새 기법은 엔비디아 네모트론처럼 여러 종류의 레이어를 섞은 모델에도 적용할 수 있다.
Pruning LLMs Like a Physicist: Block Removal as an Ising Optimization Problem (huggingface.co)
마이크로소프트, 분자 합성 경로 예측하는 레트로키메라 오픈소스 공개
유연한 생성 모델과 정확도가 높은 모델의 예측을 결합해 저분자 화합물의 합성 경로를 제안한다. 박사급 전문가들은 이 시스템의 제안을 기존 모델의 결과나 문헌에 기록된 화학 반응보다 높게 평가했다. 신약과 첨단 소재 개발의 탐색 시간을 줄이는 데 활용할 수 있으며, 코드와 모델 가중치는 깃허브에서 제공한다.
Improving synthesis prediction of small molecules at scale with RetroChimera (microsoft.com)

도구·제품
AX, 에이전트 실행 환경을 YAML 하나로 구성하고 관리
구글이 공개한 오픈소스 도구로, 에이전트 실행 런타임인 에이전트 서브스트레이트 위에서 동작한다. 쿠버네티스와 유사한 CLI를 제공하며, YAML 파일 하나에 깃 저장소·MCP 서버·LLM 자격 증명·네트워크 게이트웨이를 설정할 수 있다. 에이전트가 작업하며 상태를 쌓는 특성을 반영해 실행 중인 샌드박스의 셸 접속과 작업 일시 중단·재개를 지원한다.
google/ax: Google’s open agentic orchestrator (github.com)
트랜스포머스, 애플 실리콘 맥에서 GGUF 모델 바로 실행
GGUF 형식의 모델 파일을 모델 ID와 파일명만으로 불러와 별도 런타임 없이 파이토치 API로 추론할 수 있다. 파이썬·파이토치 환경을 유지하면서 로컬 추론 도구 llama.cpp에 근접한 텍스트 생성 속도를 낸다. 기존 평가 흐름을 활용하거나 가중치를 풀어 파인튜닝할 수 있으며, 초기 지원은 애플 실리콘의 큐원3.5 아키텍처에 집중된다.
Transformers now runs llama.cpp quants (huggingface.co)
레인드롭, 외부 API를 가상으로 재현해 PR 단계에서 에이전트 검증
SDK 수정 없이 랭퓨즈·헬리콘에 기록된 실행 데이터를 활용해 테스트한다. 슬랙·스트라이프 등 외부 서비스의 가상 복제본과 모의 데이터를 만들어 운영 환경에 영향을 주지 않고 에이전트의 상태 변화를 재현한다. 코드 병합 전에 비용 증감, 환각 응답, 도구 오류를 확인할 수 있다.
Simulate | Raindrop — Simulate your agent in any situation (raindrop.ai)

짧은 소식
SpaceXAI는 장시간 코딩과 전문 지식 작업에 맞춰 자체 검증·긴 문맥 관리 능력을 높인 그록 4.7을 이전 버전과 같은 가격으로 공개했다. Introducing Grok 4.7 (x.ai)
메타의 SAM 3.1 API는 별도 미세조정 없이 이미지·영상 속 객체 영역을 픽셀 단위로 구분하고 추적하며, 요금은 이미지 1000장당 2.50달러·영상 1000프레임당 0.20달러다. Segment Anything Model (SAM) 3.1 (developer.meta.com)
클로드 코드는 API·엔터프라이즈 자동 모드에 추가 과금 없는 서버 측 분류기를 적용하고, CLAUDE.md가 없으면 AGENTS.md를 읽도록 했으며, 에이전트 SDK의 간헐적 무응답을 해결했다. Claude Code changelog - Claude Code Docs (code.claude.com)
로보함의 로봇 대상 유해 명령 100회 시험에서 안전을 이유로 거부한 횟수는 클로드 페이블 5.1이 20회, GPT-6 아스트라가 2회에 그쳤다. RoboHarm: Do Frontier Robot Policies Refuse Unsafe Instructions? (robocurve.org)
오픈AI의 법률 조사 AI 아스트라 for Law는 Vals AI 평가에서 일반 웹 검색을 쓰는 GPT-6보다 정답률이 40% 이상 높았으며, API 요청 데이터를 보존하지 않는 정책을 적용한다. Introducing Astra for Law (openai.com)
개빈 뉴섬 캘리포니아 주지사는 전문가 그룹이 2개월 내 AI 안전법 강화 지침을 마련하도록 행정명령을 내렸으며, 비상시 모델 차단 장치 등이 포함될 수 있다. California Gov. Newsom issues executive order to rein in AI (cnbc.com)
허깅페이스는 텍스트 인코딩 도구 tokenizers v1 출시 후보가 정규식을 비트 연산으로 대체하고 단어 캐시를 도입해 인코딩 속도를 기존 대비 3~30배 높였다고 밝혔다. tokenizers v1: encode, decode and scaling, measured (huggingface.co)
tailf가 도움이 되었다면 공유해 주세요. 추천 수에 따라 기사 색인 시트와 뉴스레터 시스템 구축기를 보내 드립니다. 내 추천 링크 확인하기
