
핵심 소식
앤스로픽 “러시아 지원 추정 해킹 그룹, AI로 사이버 공격 자동화”
앤스로픽에 따르면 이 그룹은 AI 에이전트로 악성코드를 수정·재구축하며 보안 시스템을 우회했다. 우크라이나 정부·군사 기관과 드론 공급망 기술을 겨냥해 침투와 데이터 탈취를 시도했다. 앤스로픽은 AI가 공격에 필요한 기술적 장벽을 낮추고 속도와 규모를 키운다고 경고하며, 확인된 위협을 바탕으로 안전장치를 강화했다.
Countering misuse of AI: September 2026 / Anthropic (anthropic.com)
기업 비공개 코드로 코딩 에이전트의 실무 능력 평가하는 Real-SWE
실제 기업의 비즈니스 요구사항을 해결하는 이 벤치마크에서 클로드 미토스의 버전인 Fable 5.1이 해결률 38.8%로 1위를 기록했다. 실행 시간이 10분 미만인 작업은 71.4%가 실패했으며, 요구사항 누락과 검증하지 않은 시스템 가정이 주요 원인으로 꼽혔다. 모델들은 기존 아키텍처를 파악하고 회사 고유의 코딩 패턴을 따르는 데 공통적인 한계를 보였다.
Real-SWE Benchmark — Specific Labs (withspecific.com)

업계 동향
아모데이 앤스로픽 CEO, 최첨단 AI 개발 속도 조절 촉구
아모데이는 모델이 다음 세대 AI를 스스로 구축하는 움직임과, 오픈AI·허깅페이스 사건에서 통제를 벗어난 에이전트들이 임의의 대상을 사이버 공격한 사례를 위험의 근거로 들었다. 앤스로픽은 외부 평가자를 내부에 상주시켜 훈련 과정과 안전성을 검증받겠다고 밝혔다. 업계와 전 세계 차원의 규범 조율도 필요하다고 주장했다.
Dario Amodei — We Must Pace the Frontier (darioamodei.com)
알트먼 “2026년은 상장 적기 아니다”…오픈AI IPO 연기
샘 알트먼은 포춘 인터뷰에서 안전성 문제를 이유로 상장을 서두르지 않겠으며, 기업과 사회가 기술을 받아들일 준비가 됐을 때 추진하겠다고 밝혔다. 뉴욕타임스에 따르면 오픈AI는 전담 인력을 꾸려 올해 하반기 상장을 준비해 왔다. AI 개발 속도 조절 압박과 기술주 변동성, 재무 과제가 겹치며 상장 시점은 2027년으로 기울고 있다.
OpenAI’s Sam Altman says it would be ‘ill-advised’ to go public in 2026 (techcrunch.com)

연구
사카나 AI, 전체 역전파 없이 1,000개 레이어 신경망 학습 결과 공개
PC-ALM은 전체 네트워크를 거슬러 학습 신호를 전달하는 역전파 대신, 각 레이어가 이웃과만 상호작용하며 학습하는 알고리즘이다. 연구진은 깊은 신경망에서 신호가 약해지는 문제를 해결해 학습 신호를 안정적으로 전달했다고 설명했다. 벤치마크에서는 이러한 국소 연산만으로 역전파와 거의 비슷한 학습 정확도를 기록했다.
Augmented Lagrangian Predictive Coding: training 1000-layer networks without... (pub.sakana.ai)
마이크로소프트 연구진, 환경을 직접 확인해 에이전트 메모리 검증
작업이 끝난 뒤 별도 에이전트가 읽기 전용 도구로 환경을 탐색하고 메모리를 점검해 중복 탐색을 줄이는 방식이다. 깃허브 코파일럿 기반 CLBench 평가에서 작업 성공률은 39%에서 73%로 올랐고, 작업당 비용은 3.38달러에서 1.68달러로 줄었다. 모델 재학습 없이 통합할 수 있으며, 클로드 소네트와 클로드 오퍼스 평가에서도 일관된 개선을 보였다.
Grounding Agent Memory: Environment-Probing Curation for Enterprise Agents (arxiv.org)
ToolGrad, API 실행 경로부터 만드는 LLM 도구 학습 데이터
구글 연구진은 질문에서 해결책을 찾는 대신, 유효한 API 워크플로를 완성한 뒤 그에 맞는 사용자 질문을 작성해 데이터 생성 통과율을 거의 100%까지 높였다. 이 데이터로 미세조정한 젬마 3 12B는 연구진의 벤치마크 평가에서 GPT-5와 클로드 오퍼스 4.5를 앞섰다.
ToolGrad: Efficient tool-use dataset generation with textual “gradients” (research.google)

도구·제품
아르테미스, 자연어로 실제 안드로이드 기기 테스트 자동화
구글은 100개 이상의 다단계 작업으로 구성된 AndroidWorld 벤치마크에서 99% 이상의 성공률을 기록했다고 밝혔다. 내장 MCP 서버로 코덱스·클로드 코드 등과 연결해 에이전트가 스마트폰을 제어하고 기기 로그와 스크린샷을 수집할 수 있다. 빠른 실행용 Flash와 장기 계획·검증용 Pro 프로필을 제공한다.
google/artemis: ARTEMIS turns natural-language instructions into reliable... (github.com)
시리 AI 출시…개인 정보와 화면 맥락을 이해해 작업 수행
새 기반 모델을 탑재해 음성 인식과 텍스트 교정 정확도를 높였다. 카메라나 화면의 정보를 이해하고 작업을 수행하는 기능은 아이패드·맥·애플 비전 프로에도 도입됐다. 사진 편집 영역 확장, 사파리 탭 자동 정리, 실사 이미지 생성도 지원한다. 연말에는 주변 소리 인식과 대화 요약 기능이 애플 워치에 추가될 예정이다.
Siri AI, a profoundly more capable and personal assistant, is here (apple.com)
퍼플렉시티 포터블 컴퓨터, RTX 기반 윈도우 버전 출시
여러 단계의 작업을 처리하는 AI 에이전트 도구로, VRAM 24GB 이상의 지포스 RTX·RTX PRO GPU가 필요하다. 로컬 모델로 문서 분석과 반복 업무를 기기 안에서 처리하며, 이때 퍼플렉시티 크레딧은 소모하지 않는다. 아웃룩·깃허브·슬랙 등과 연동해 업무를 자동화하고, 복잡한 추론이 필요하면 사용자 승인을 받아 클라우드 모델로 전환한다.
Perplexity Portable Computer Is Now Available on Windows, Powered by NVIDIA RTX (blogs.nvidia.com)

짧은 소식
마이크로소프트 AI는 인간의 통제와 사용자 주체성을 강조하는 ‘휴머니스트 AI’ 행동 규범 초안을 공개하고, 6주간 의견을 수렴해 2027년부터 모델 개발 지침으로 활용할 예정이다. Humanist AI Code of Conduct (microsoft.ai)
고객 관리 플랫폼 Attio는 고객 데이터를 한데 모아 팀들이 실시간으로 공유하고, AI 에이전트가 회의 전 브리핑과 이메일 초안 작성 등을 자동화하도록 지원한다. Attio: Ask more from CRM (attio.com)
앤스로픽은 18세 미만으로 의심되는 클로드 계정을 차단하고 연령 인증 서비스 요티에서 성인임을 확인해야 복구하도록 하며, 검토한 신분증·생체 데이터는 즉시 삭제하고 통과 여부만 받는다. Age assurance on Claude (support.claude.com)
클로드 페이블 5.1은 책 자체가 해독의 열쇠임을 파악해 370년간 풀리지 않은 토마스 어콰트 경의 암호를 인간 개입 없이 44분 만에 해독하고, 같은 저자의 더 복잡한 암호도 풀었다. Claude Fable 5.1 Solves the Cyphral Distich (vals.ai)
클라우드 인프라 문제를 자동 해결하는 폴리레인은 단일 에이전트로 전환한 뒤 PR 생성 시간 중간값이 2.2시간에서 35분으로, 건당 평균 비용은 111달러에서 약 18달러로 줄고 이슈의 PR 전환율은 0.6%에서 4.2%로 올랐다. Sub-agents are just wrong (polylane.com)
허깅페이스의 타우(Tau)는 터미널에서 자연어 지시로 파일을 읽고 코드를 수정하며 셸 명령을 실행하는 교육용 코딩 에이전트로, 핵심 실행부를 별도 파이썬 라이브러리로도 활용할 수 있다. huggingface/tau: A Python port of Pi’s minimalist coding agent. (github.com)
tailf가 도움이 되었다면 공유해 주세요. 추천 수에 따라 기사 색인 시트와 뉴스레터 시스템 구축기를 보내 드립니다. 내 추천 링크 확인하기
