
핵심 소식
위키미디어, 오픈AI 운영 추정 에이전트의 무단 활동 조사 결과 공개
위키미디어는 자체 조사에서 샌드박스 무단 편집과 공개 메모 도구를 통한 외부 데이터 우회 수집 시도를 확인했다. 수백만 건의 API 요청은 지난 5월 쿼리 서비스 장애의 주요 원인 중 하나로 지목됐다. 시스템 데이터 침해나 에이전트 간 공조 정황은 없었다. 재단은 봇 트래픽에 따른 인프라 비용 부담을 지적하며 오픈AI 등 AI 기업에 에이전트 통제를 요구했다.
OpenAI “rogue” agent activities found on Wikimedia projects – Diff (diff.wikimedia.org)
마이크로소프트, DB 변경 결과로 에이전트 신뢰성 평가하는 ThinkingBox 공개
마이크로소프트가 507개 비즈니스 워크플로를 모델별로 20회씩 평가한 결과, 정상 종료된 도구 호출 시도의 77.61%에서 잘못된 DB 값이 발견됐다. 전체 오류의 약 80%는 도구 사용 문제로 분석됐다. 클로드 오퍼스 5.5가 가장 높은 일관성을 보였고, 오픈소스 모델 중에서는 키미-K3가 두각을 나타냈다. 허깅페이스에 공개된 평가 환경은 OpenEnv 인터페이스로 실행할 수 있다.
The Agent Said It Was Done. The Database Disagreed. (huggingface.co)
블랙 포레스트 랩스, 배치부터 후편집까지 제어하는 플럭스 3 이미지 공개
피사체와 텍스트를 배치할 사각 영역의 좌표를 지정해 이미지 구도를 설계할 수 있다. 참조 이미지를 최대 10장 활용하며, 4K 해상도(5456 × 3072픽셀) 렌더링을 지원한다. 생성 후에도 객체 추가나 색상 변경 등 픽셀 단위 편집이 가능하다. 자체 인프라 배포와 파인튜닝을 위한 상업용 가중치 라이선스도 제공한다.
FLUX 3 Image: Maximum control over every pixel (bfl.ai)

업계 동향
오픈AI, EU 챗GPT·코덱스에 텍스트 워터마크 도입
EU AI법 대응 기술인 textGrain은 단어 선택에 미세한 통계 신호를 넣으며, 전 세계 API 고객은 적용 여부를 선택할 수 있다. 오픈AI 평가에서 400토큰 텍스트의 탐지율은 약 95%였지만, 수학처럼 어휘가 제한되거나 내용을 10~25% 수정하면 성능이 크게 떨어졌다. 내부 평가에서는 아스트라의 출력 품질 저하가 관찰되지 않았다. 탐지 도구는 기술적 한계와 오탐 위험을 고려해 당분간 승인된 연구자·전문 기관에만 개방한다.
Our approach to EU text provenance rules (openai.com)
마이크로소프트의 AI 종량제 전환 전략과 초기 성과 보도
보도에 따르면 코파일럿 코워크는 종량제 적용 직후 수천 곳의 유료 고객을 확보했고, 깃허브 코파일럿은 요금 조정 이후 매출 성장세가 전 분기 대비 60% 가속화됐다. 올해 초 클로드 코드 등 AI 제품에 주도권을 내주자 경영진이 고정 구독료 대신 토큰 사용량에 따른 과금을 서두른 결과다. 사티아 나델라 CEO는 자체 최고 성능 모델에 집중하던 전략을 여러 AI 모델을 연결하는 생태계 구축으로 전환하고 있다.
Satya Nadella reinvented Microsoft once. Can he do it in the AI era? (cnbc.com)

연구
워싱턴대·메타, 컨텍스트를 직접 편집하는 언어 모델 제안
컨텍스트 언어 모델(CLM)은 모델이 읽는 문맥을 파일처럼 다루며 Bash 명령어로 직접 편집한다. 연구진은 장기 추론 평가 BrowseComp-Plus에서 기존 최고 수준의 문맥 관리 전략보다 정확도가 11.4% 높고 연산량은 21.5% 적었다고 보고했다. 12시간 분량의 EdgeBench 작업에서는 컴퓨팅 자원을 59% 절약했다. 서버 실행 환경에서는 캐시 재사용 기법으로 연산량을 35% 추가로 줄일 수 있다고 밝혔다.
Context Language Models (arxiv.org)
레드햇 평가, 프롬프트 인젝션 탐지서 소형 분류기 효율 두드러져
레드햇의 비교 평가에서 사전 학습된 2억 매개변수 텍스트 분류기는 정확도 89.01%, 지연 시간 54.1ms를 기록했다. LLM이 직접 판정하는 큐원3.6-35B는 89.31%로 정확도가 가장 높았다. 텍스트 대신 정형화된 판단을 반환하는 제브(Jev) 등 의사결정 모델은 대형 모델보다 빠르고 저렴했지만, 특정 위험 탐지에 특화된 소형 분류기의 종합 성능을 넘지는 못했다.
Benchmarking AI decision models against traditional guardrails (developers.redhat.com)
Dust 연구진, 가중치 대신 내부 계산값 바꾸는 학습법 공개
트랜스포머 학습 알고리즘 Dust는 모델 내부 계산값을 조금씩 바꿔, 한 번의 모델 실행으로 대규모 후보군을 평가한다. 연구진은 100만 토큰 이상 구간에서 기존 학습 기법 EGGROLL보다 연산 효율이 약 1,000~10,000배 높았다고 보고했다. 2억 4,300만 매개변수 모델이 120배 더 작은 모델을 능가해, 모델 규모가 커져도 효율이 떨어지지 않는 결과를 보였다.
Dust: Pretraining Transformers Without Backpropagation (qlabs.sh)

도구·제품
스트라타, 일반 PC에서 큐원 3.8을 실행하는 오픈소스 추론 엔진
1250억 매개변수 모델을 VRAM 12GB 이상인 PC에서 실행하며, 자주 쓰는 가중치를 GPU에 유지하고 시스템 RAM과 CPU도 함께 활용한다. 개발진이 제시한 RTX 4090 기준 답변 생성 속도는 초당 약 100토큰이다. 윈도우·리눅스 원클릭 설치와 로컬 오픈AI·앤스로픽 호환 API를 지원해 기존 코딩 에이전트와 연동할 수 있다.
Niko1221/Strata: Qwen3.8-Flash-Next on any consumer hardware: one-click install... (github.com)
데빈, 세션 간 기억을 유지하고 매일 정리하는 메모리·드리밍 도입
AI 소프트웨어 엔지니어 데빈은 사용자의 수정 사항과 프로젝트 환경을 깃 저장소 기반 메모리 드라이브에 마크다운으로 저장하고 다음 작업에 활용한다. 드리밍은 매일 백그라운드에서 이 메모리를 검토해 중복을 통합하고 불필요한 정보를 삭제한다. 코그니션은 다른 에이전트에도 적용할 수 있도록 메모리 시스템 구축에 사용한 표준을 오픈소스로 공개했다.
Memory and dreaming: how Devin learns from working with you (devin.ai)
컴피 에이전트, 컴피UI 안에서 생성 워크플로 구성·실행
앤스로픽 모델을 기반으로 시각 자료와 캔버스 오류를 읽고, 추천 모델에 맞춰 노드를 연결한 뒤 사용자 승인을 받아 생성 작업을 실행한다. 결과물과 함께 파이프라인 전체를 워크플로로 남겨 재사용하거나 수정할 수 있다. 현재 컴피 클라우드에서 이용할 수 있으며, 자체 GPU와 커스텀 노드를 지원하는 로컬 버전도 도입할 예정이다.
Comfy Agent — The first agent for craft (comfy.org)

짧은 소식
리플렉션이 코딩·추론·에이전트용 5010억 매개변수 모델 빔(Beam)을 발표했으며, 현재 최종 안전성 검토 중인 모델의 가중치와 기술 보고서를 이달 말 공개할 예정이다. Introducing Beam: Reflection’s 501B open-weight model (reflection.ai)
딥시크가 코딩·리서치·백그라운드 작업을 지원하고 플러그인으로 기능을 확장하는 오픈소스 AI 에이전트 ‘딥시크 하니스’의 공개 프리뷰를 전 세계에 선보였다. DeepSeek Harness | Explore the limits of intelligence (deepseek.com)
코히어가 클라우드부터 폐쇄망까지 보안·비용 통제·워크플로 관리를 통합 지원하는 기업용 AI 에이전트 플랫폼 ‘노스 2’를 공개했다. North 2: Enterprise AI Without Compromises (cohere.com)
메타와 마이크로소프트가 클로드 사내 사용을 축소하면서 메타의 클로드 코드 사용자는 6만 명에서 3만 명으로 줄고, 마이크로소프트의 관련 지출은 3분의 1 이상 감소했다고 보도됐다. Meta and Microsoft pull back from Claude as Anthropic transforms from partner... (the-decoder.com)
a16z는 소비자 결제 데이터를 처음 반영한 7번째 생성형 AI 앱 100선 보고서에서 지출 상위 1% 사용자가 전체 AI 결제액의 19.5%를 차지한다고 밝혔다. The Top 100 Gen AI Consumer Apps — 7th Edition (a16z.com)
그록 전직 엔지니어들이 엔비디아와의 200억 달러 계약을 이사회가 주주 동의 없이 헐값에 승인했다며 지난 2일 소송을 제기했고, 그록은 근거 없는 주장이라고 반박했다. Nvidia-Groq $20 billion deal faces stockholder lawsuit (cnbc.com)
메타가 ESP32 보드나 라즈베리 파이로 개인용 AI 에이전트 뮤즈와 연동하는 하드웨어를 만들 수 있는 오픈소스 기기 SDK를 깃허브에 공개했다. Muse Gadgets: Open source hardware for your Muse (gadgets.muse.ai)
챗GPT 안전 보고서 작성을 주도한 데이비드 로빈슨이 오픈AI를 떠나며 애틀랜틱 기고문에서 AI 업계의 조직 문화를 비판하고 더 철저한 계획과 안전장치를 요구했다. OpenAI safety leader quits, warning AI company’s culture is ‘broken’ (theguardian.com)
tailf가 도움이 되었다면 공유해 주세요. 추천 수에 따라 기사 색인 시트와 뉴스레터 시스템 구축기를 보내 드립니다. 내 추천 링크 확인하기
