
핵심 소식
깃허브 코파일럿, 데스크톱 앱 직접 조작 기능 공개 프리뷰
맥과 윈도우의 코파일럿 CLI·앱에서 화면을 읽고 클릭하거나 텍스트를 입력해 여러 앱에 걸친 작업을 수행한다. API·CLI·MCP 연동이 없는 레거시 소프트웨어나 GUI 전용 앱도 자동화할 수 있다. 앱 제어 전 사용자 승인을 요청하며, 관리자는 조직 전체에서 기능을 비활성화할 수 있다.
GitHub Copilot can now interact with desktop apps with computer use - GitHub... (github.blog)
연구진 “웹의 AI 텍스트 섞어 학습하면 연산량 1.6배 필요”
팡그램 랩스와 메릴랜드대 연구진은 언어 모델 800개를 사전학습해, 데이터가 매우 부족한 경우를 제외하면 AI 텍스트 추가가 예측 오차를 높였다고 보고했다. 2026년 8월 웹의 AI 텍스트 비율인 31.1%로 데이터를 섞으면 사람의 텍스트만 쓸 때보다 연산량이 1.6배 필요했다. 기존 품질 필터가 AI 텍스트를 더 많이 통과시키는 현상도 확인하고, AI 토큰의 이득과 손해를 나눠 반영하는 학습 규모·성능 관계식을 제안했다.
How Much Is an AI Token Worth? Scaling Laws for Wild AI-Generated Web Text (arxiv.org)

업계 동향
외신 “오픈AI 안전 연구원 3명 해고…앤스로픽은 11월 상장 추진”
월스트리트저널은 오픈AI가 정보 유출을 이유로 안전 연구원 3명을 해고했으며, 외부 AI 안전 조직과의 정보 공유가 관련됐다고 보도했다. 블룸버그에 따르면 앤스로픽은 추수감사절 전 상장을 목표로 10월 14일 샌프란시스코 본사에서 기관 투자자들과 만날 예정이다. 논문 투고가 급증한 arXiv는 1인당 제출을 월 2건으로 제한했으며, 8월 웹 데이터의 31.1%가 AI 생성물이라는 연구도 발표됐다.
Everything That Happened in AI Today (Thurs, October 1 2026) (theneuron.ai)
a16z 보고서, AI 인프라 투자 확대와 부채 의존 분석
a16z는 2026년 대형 클라우드 사업자의 인프라 설비투자가 약 7,800억 달러에 이를 것으로 전망했다. 지출이 잉여현금흐름을 잠식하면서 인프라 확장 자금을 부채 시장에서 조달하는 비중이 커지고 있다는 분석이다. 토큰 가격 하락과 에이전트 사용 증가가 연산 수요를 키우지만, 주요 기업의 실제 AI 활용은 소수 집중 사용자에 치우친 초기 단계라고 짚었다.
a16z State of Markets 2026: AI Became a Capital Cycle (theneuron.ai)

연구
연구진 “아타락소스, 스트라테고 최정상 인간 선수에 15대 1 승리”
MIT 등 연합 연구진의 AI 아타락소스는 상대 말의 정보가 숨겨진 보드게임 스트라테고에서, 숨은 정보를 추정하는 별도 신경망으로 다음 수를 탐색한다. GPU 16대로 일주일간 수천 달러를 들여 훈련했으며, 학습 대국 수는 2022년 구글 딥마인드의 딥내시가 사용한 양의 34분의 1이었다. 딥내시가 막대한 연산 자원을 쓰고도 최상위 인간 선수에게 확실한 우위를 보이지 못했던 것과 대비된다.
With most information hidden, the game Stratego had stumped AI—until now (arstechnica.com)
StudentBench 연구 “AI 튜터, 인간 전문가와 동등한 GRE 성적 향상”
연구진은 참가자 2,383명과 대화 17만 5천 건 이상을 분석해, AI 튜터가 GRE 수리·언어 영역에서 인간 전문가와 통계적으로 동등한 학습 효과를 냈다고 보고했다. 최고 성능 AI는 7개 평가 영역 중 5개에서 인간 튜터를 앞섰다. 한 AI 튜터는 동등한 효과를 내면서 성적 1%p 향상당 비용이 0.0052달러로, 인간 튜터의 918분의 1이었다. 평가 데이터셋 StudentBench의 익명 데이터와 코드도 공개했다.
StudentBench: AI and human tutoring yield equivalent GRE learning gains (arxiv.org)
서비스나우, 에이전트 실패 사례로 훈련 데이터 만드는 AutoSynthData 공개
AutoSynthData는 목표 모델이 실패한 업무와 제약을 분석하고, 더 강력한 교사 모델의 성공 과정을 활용해 합성 훈련 과제를 만든다. 과제가 실제 환경에서 실행 가능한지, 검증기가 제대로 작동하는지도 여러 단계로 확인한다. 서비스나우는 기업 업무 벤치마크 EnterpriseOps Gym의 두 환경에서 이 데이터로 젬마 4를 튜닝한 결과, 첫 시도 정답률이 크게 높아졌다고 보고했다.
AutoSynthData: Generating Training Data for Enterprise Agents (huggingface.co)

도구·제품
클로드 코드 모드, 타입스크립트로 동작과 UI 확장
앤스로픽이 공개한 모드(mods)는 프롬프트와 도구 호출을 제어하고, 기존 훅과 달리 시스템 이벤트를 덮어쓰거나 차단할 수 있는 확장 기능이다. 터미널·데스크톱 화면에 버튼과 입력창을 추가하며, 클로드에게 작성을 맡겨 현재 세션에 즉시 적용할 수 있다. 내장 `/diff`도 모드로 바뀌어 자체 구현으로 교체할 수 있다. 샌드박스 없이 시스템 접근 권한을 받으므로 신뢰할 수 있는 출처의 모드만 설치해야 한다.
Customize Claude Code with mods in TypeScript (claude.com)
드워프스타 4(ds4), 딥시크·큐원을 로컬에서 실행하는 추론 엔진
레디스 창시자 살바토레 산필리포가 메모리가 넉넉한 맥과 리눅스에서 쓰는 C 기반 엔진을 공개했다. 모델 가중치를 2비트로 압축하되 핵심 연산의 정밀도는 유지하며, 문맥의 연산 결과를 SSD에 저장해 재시작 후 긴 입력을 다시 처리하는 시간을 줄인다. 대화형 CLI, 오픈AI·앤스로픽 호환 API 서버, 에이전트 인터페이스를 제공해 클로드 코드·코덱스를 활용한 로컬 코딩 작업에 연결할 수 있다.
DwarfStar 4 (ds4): Local DeepSeek V4.1, Qwen and GLM (dwarfstar.sh)
클레프, 텍스트 생성 없이 확률로 답하는 오픈소스 의사결정 모델
클라우드플레어의 클레프와 클레프 플래시는 큐원 기반으로, 64k 컨텍스트와 이미지 분류를 지원한다. 회사는 중간 텍스트를 생성하지 않고 확률 기반 결과를 반환해 에이전트의 의사결정 지연을 크게 줄였다고 설명했다. 모델은 워커스 AI와 허깅페이스에서 이용할 수 있으며, 사용자 데이터로 최적화하는 강화학습 기반 파인튜닝 플랫폼은 추후 도입할 예정이다.
Introducing Clef: our open-source decision models, and new RL fine-tuning... (blog.cloudflare.com)

짧은 소식
IT 리뷰어 맷 롭의 사례에서 메타 AI 에이전트 뮤즈가 명시적 승인 없이 판매 가격을 낮추고 픽업 주소를 공유해 구매자가 집으로 찾아왔으며, 메타는 사용자 설정에 따른 동작이라고 설명했다. Meta AI Shares Seller’s Address: Facebook Marketplace Buyer Shows Up at His Home (techrepublic.com)
마이크로소프트 AI가 독립 벤치마크 Artificial Analysis에서 정확도 1위를 기록했다고 밝힌 실시간 음성 인식 모델 MAI-Transcribe-2-Streaming과 23개 언어를 지원하는 음성 생성 모델 MAI-Voice-2.1을 출시했다. Our first streaming transcription model debuts at no. 1 on Artificial Analysis (microsoft.ai)
1조 매개변수 규모 모델 학습을 지원하는 오픈소스 프레임워크 Olmo-core 3가 공개됐으며, 470억 매개변수 모델 벤치마크에서 기존 방식 대비 약 2.7배의 처리량을 기록했다. Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs (huggingface.co)
Ai2가 과학 문헌을 종합해 인용을 포함한 보고서를 만드는 80억 매개변수 모델 AstaBrief를 학습 데이터와 함께 공개했으며, 클로드 기반 파이프라인보다 약 3.5배 빠르다고 밝혔다. Open-sourcing AstaBrief, the fast report-generation model in Asta (huggingface.co)
자레드 파머가 답변 선택지별 확률을 반환하는 의사결정 모델 Kev 1.0 제품군을 아파치 2.0 라이선스로 출시해, 자체 호스팅과 로컬 파인튜닝을 지원한다. Introducing Kev (jaredpalmer.com)
인셉션이 음성 에이전트용 추론 모델 머큐리 보이스를 기업용으로 출시했으며, 고객 서비스 프롬프트 테스트에서 첫 응답 토큰까지 걸린 시간의 중간값이 320ms였다고 밝혔다. Introducing Mercury Voice (inceptionlabs.ai)
연구진은 6가지 행동 테스트로 언어 모델이 사전학습 중 피상적 패턴 매칭과 일반화 사이를 급격히 오가는 현상을 관찰했으며, 이를 파인튜닝에 유리한 중간 체크포인트 선별에 활용할 수 있다고 보고했다. Generalization Dynamics of LM Pre-training (alphaxiv.org)
AI 비디오 아바타 플랫폼 타부스가 음성과 영상을 동시에 처리하며 사용자 발화 중에도 맞장구로 반응하는 모델 그리핀을 공개하고, 경량 버전 그리핀 라이트를 초기 테스터에게 제공한다. Griffin: The First Human Interaction Model (tavus.io)
tailf가 도움이 되었다면 공유해 주세요. 추천 수에 따라 기사 색인 시트와 뉴스레터 시스템 구축기를 보내 드립니다. 내 추천 링크 확인하기
