핵심 소식
지출 관리 플랫폼 램프, AI 모델 라우터 ‘Router’ 공개
3년간 내부에서 검증한 이 서비스는 오픈AI, 앤스로픽, 엔비디아, xAI 등 주요 모델을 단일 API로 연결하며, 벤치마크·난이도 기반 라우팅 전략과 토큰 사용량·비용 추적 대시보드를 제공한다. 램프는 기존 지출 관리 제품군과의 시너지를 바탕으로 AI 추론 시장으로의 영역 확장을 본격화한다.
Ramp launches its own AI model router, called Router (techcrunch.com)
코딩 에이전트 개발사 풀사이드, 엔비디아와 60억 달러 라이선스 계약
엔비디아는 라이선스 계약과 별도로 프리머니 기업 가치 120억 달러를 인정하며 10억 달러를 추가 투자했다. 이 같은 대규모 딜의 구체적 조건은 뉴커머(Newcomer)가 단독 입수한 투자자 서한을 통해 공개됐다.
SOURCES: Poolside Strikes $6 Billion Licensing Deal with Nvidia & Raises $1... (newcomer.co)
골드만삭스, 콜센터·신입 직군에서 가시화되는 AI의 고용 충격
2022년 하반기 이후 AI 노출도가 높은 산업군의 구인 성장이 뚜렷이 둔화되었으며, 미국 콜센터 고용은 장기 추세 대비 39% 급감했다. 소프트웨어 퍼블리싱과 경영 컨설팅에서도 하락세가 관찰되며, 800여 개 직종 분석 결과 신입 직군의 고용 타격이 가장 큰 것으로 나타났다. 선진국의 AI 도입률이 15~20%에 이르면서 특정 산업과 연차에 대한 자동화 압력이 수치로 확인되고 있다.
Goldman studied where AI is squeezing labor markets. Here’s what it found (cnbc.com)
업계 동향
앤스로픽 매출 급등, 파트너사 간 엇갈리는 명암
월스트리트저널에 따르면 앤스로픽의 2분기 매출은 전 분기 대비 두 배 이상 증가한 반면, 오픈AI 성장률은 18%에 그쳤다. 앤스로픽에 컴퓨팅을 제공하는 구글·아마존은 반사이익이 기대되지만, 오픈AI와 대규모 계약을 맺은 오라클 등은 실적 우려로 주가가 하락했다. 다만 오픈 가중치 모델 확산으로 상호운용성이 커지고 있어 오픈AI의 패배를 단정하기는 이르다는 시각도 있다.
Stock winners and losers as Anthropic passes OpenAI as hottest AI upstart (cnbc.com)
AT&T, 앤스로픽 비용 절감 위해 오픈소스 모델 도입
상용 LLM 활용 규모가 커지며 발생한 막대한 비용이 엔터프라이즈 운영의 실질적 부담으로 작용하고 있다. 단일 벤더 API 의존도를 낮추고 오픈소스 생태계를 결합해 AI 인프라 지출을 통제하려는 전략적 움직임이다.
AT&T is Using Open Source Models to Curb Anthropic Bills (theinformation.com)
마이크론, 100억 달러 투자해 AI 메모리 연구소 설립
AI 인프라 확장에 따른 고대역폭 메모리 수요 급증에 대응하기 위한 10년 장기 투자다. 신규 시설은 HBM4·차세대 DRAM 및 데이터 병목을 완화할 새로운 컴퓨팅 아키텍처 연구에 집중한다. 삼성전자·SK하이닉스와의 기술 경쟁이 격화되는 가운데, 본사 소재지 보이시를 중심으로 연구 역량을 결집해 차세대 칩 시장의 주도권을 확보한다는 구상이다.
Micron Unveils $10 Billion AI Memory Research Lab in Boise (insideai.news)
연구
대규모 트랜스포머 학습을 위한 5가지 병렬화 기법과 통신 최적화 원리
클러스터 전체의 연산 처리량을 선형으로 높이려면 칩 간 통신 지연을 유효 연산 시간 안에 숨기는 것이 핵심이다. 데이터·텐서·파이프라인·전문가 병렬화와 FSDP 등 5가지 전략이 각각 네트워크 오버헤드를 컴퓨팅 클록 안에 감추는 원리를 하드웨어 지표와 함께 분석한다.
How to Parallelize a Transformer for Training — an explorable explanation (ezyang.github.io)
LMSYS, H20 GPU에서 딥시크 V4 프로 서빙 최적화 기법 공개
배치 크기 1 기준 H20-141GB 단일 노드에서 초당 271토큰 출력 속도를 달성해, 최신 B300(초당 383.7토큰)과의 격차를 1.42배 수준으로 좁혔다. 작업 부하와 서비스 목표에 맞춘 프리필·디코드 전용 다중 서빙 프로파일을 도입하고, 가중치·KV 캐시 압축 기법을 결합해 동시 처리 용량을 최대 10배 이상 확장했다.
Pushing the Limits of Serving DeepSeek-V4-Pro - LMSYS Org (lmsys.org)
가상 메모리 원리로 KV 캐시 낭비를 해결한 PagedAttention
기존 방식은 요청마다 최대 컨텍스트 공간을 미리 예약해 GPU 메모리의 최대 80%를 낭비했다. PagedAttention은 전체 공간을 고정 크기 블록으로 나누고 토큰 생성 시에만 동적 할당하여 캐시 활용률을 20~40%에서 96%까지 끌어올렸다. 동일 시스템 프롬프트를 쓰는 요청끼리는 Copy-on-write로 물리 블록을 공유해 추가 메모리 절감도 달성했다.
PagedAttention: Virtual Memory for the KV Cache — Nick Gustafson (thegustafson.com)
도구·제품
슬랙 코드, AI 에이전트와 팀이 함께 코딩하는 전용 채널
기존에는 개발자가 개별적으로 AI와 작업해 팀 맥락이 단절되는 한계가 있었다. 새 코드 채널에서는 비개발 직군도 에이전트의 코드 제안을 실시간으로 확인하고 피드백을 남길 수 있으며, 클로드·깃허브 코파일럿 등과 연동되고 슬랙의 기존 보안·권한 체계가 그대로 적용된다.
Introducing Slack Code: Agentic Coding for Teams (salesforce.com)
미스트랄 AI, 다단계 문서 탐색·검증 에이전틱 서치 출시
기존 단발성 RAG는 방대한 문서 내 특정 표나 주석에서 정보를 찾는 데 한계가 있었다. 새 시스템은 AI 모델이 검색·열람·탐색·읽기·패턴 찾기 5가지 도구를 직접 활용해 다단계로 자료를 분석·검증하며, 재무 문서 벤치마크(FinanceBench) 정답률이 3배가량 향상되면서 토큰 소비와 지연 시간은 오히려 줄었다. 파인튜닝 없이도 기저 모델의 추론 능력 향상에 따라 검색 품질이 함께 올라가는 구조다.
Introducing Agentic Search (mistral.ai)
퍼플렉시티, 소나 모델을 대체하는 에이전트 API 출시
‘Search as Code’ 아키텍처 기반으로 웹 검색·코드 샌드박스 등을 동적 파이프라인으로 구성하며, 기존 소나 모델은 모델·도구·토큰 예산이 최적화된 6개 프리셋으로 대체된다. 개발자는 프리셋을 통해 일관된 품질을 예측 가능한 비용으로 이용할 수 있으며, 기존 소나 모델은 9월 27일 지원이 종료된다.
Agent API: Build with LLMs, the Web, and Agents (perplexity.ai)
짧은 소식
코딩·장기 에이전트 워크플로 특화 익명 추론 모델 ‘Ox Alpha’가 100만 토큰 컨텍스트와 멀티모달 입력을 지원하며 오픈라우터에서 무료로 제공된다. Ox Alpha - API Pricing & Providers (openrouter.ai)
오픈AI가 프롬프트만으로 웹사이트를 생성·호스팅하고 데이터베이스·트래픽 분석까지 지원하는 ‘챗GPT 사이트’ 퍼블릭 베타를 유료 플랜 대상으로 공개했다. Sites (learn.chatgpt.com)
블록이 역할별 맞춤 에이전트와 폴더 연동, 다중 모델 전환을 하나의 캔버스 보드에 통합한 오픈소스 워크스페이스 ‘버드(Berd)’를 공개했다. Less chatting, more building. (berd.xyz)
AI Hero 설립자 맷 포콕이 코딩 에이전트의 흔한 실패를 방지하는 실전 스킬 세트를 공개해 깃허브에서 22만 개 이상의 별을 받았다. mattpocock/skills: Skills for Real Engineers. Straight from my .agents... (github.com)
피에르 컴퓨터 컴퍼니의 ‘코드 스토리지’는 저장소당 32TB·무제한 API를 지원하는 AI 에이전트 전용 Git 인프라로, Lovable·Bolt 등 주요 플랫폼이 활용 중이다. Code Storage by The Pierre Computer Company (code.storage)
슈퍼위스퍼가 음성 인식 텍스트의 추임새 제거·구두점 교정에 특화된 6억 파라미터 경량 모델 S1-미니를 공개했으며, 양자화 시 462MB로 노트북 CPU에서도 구동된다. superwhisper/s1-mini (huggingface.co)





