
8월 18일 오픈AI는 통합 플랫폼 OpenRouter와 Vercel AI Gateway에서 GPT-5.6 Sol의 가격을 50% 인하해 1개월간 입력 가격을 1M 토큰당 2.50달러, 출력 가격을 1M 토큰당 15달러로 낮췄다. 이 모델은 1M 토큰 컨텍스트를 지원하며 복잡한 추론과 코딩을 목표로 한다. SemiAnalysis는 이번 조치가 마케팅 전략일 수 있다고 지적했다. 통합 플랫폼이 오픈AI 토큰 물량에서 차지하는 비중은 작지만, 제3자가 오픈AI의 시장 점유율을 추정할 때 사용하는 주요 데이터 소스이기 때문이다.
같은 날 스탠퍼드 팀은 DeepSeek V4 Flash에서 답변 5개를 샘플링하고 모델이 자체 출력을 채점하게 한 결과 Terminal-Bench 2.1 정확도가 79%에서 88%로 상승했으며, 약 1/11 비용으로 Claude Fable 5를 능가했다고 보고했다. 이 프레임워크는 오픈소스로 공개됐다. 알리바바 Qwen 팀은 27B 오픈 모델 Qwen3.8이 RTX 3090에서 Q5 양자화로 로컬 실행되며 단일 프롬프트 생성에서 GPT-5.6에 근접한다고 확인했다.
최상위 모델의 가격 인하와 격차를 좁히는 저비용 오픈 모델이 같은 24시간 안에 등장했다. 차별화 포인트는 "더 강력한 모델"에서 "더 저렴한 추론"으로 이동하고 있다.
8월 17일 Groq는 35억 달러 기업가치 기준 3억 5,000만 달러 규모의 시리즈 A 투자 유치를 발표했다. 이번 라운드는 Disruptive가 주도하고 엔비디아가 참여할 계획이다. 이 회사는 AI 칩 개발사에서 네오클라우드 제공업체로 전환했다. 지난 12월 엔비디아와 LPU 추론 ASIC 인증을 포함한 200억 달러 규모의 비독점 라이선스 계약을 체결했으며, 이번 8월 엔비디아 클라우드 파트너가 되었다. 컴퓨팅 용량은 현재 54MW에서 2027년까지 200MW 이상으로 성장할 것으로 전망된다.
같은 날 엔비디아 CEO 젠슨 황은 AI 팩토리의 다음 핵심 희소 자원은 토지, 전력, 데이터센터 셸이며 칩 부족은 단계적으로 완화되고 있다고 말했다. 엔비디아와 소프트뱅크의 SB Energy는 오하이오주의 옛 우라늄 농축 부지에 투자하고 있으며, 4.25GW에서 시작해 최대 8GW까지 확장할 여지가 있다.
8월 17일 바이트댄스 Seed와 칭화대 AIR는 컴파일러를 능가하는 GPU 커널을 작성하도록 모델을 훈련하는 에이전틱 RL 시스템 CUDA Agent를 공개했다. KernelBench에서 98.8%의 통과율과 torch.compile 대비 2.11배의 기하평균 속도 향상을 기록했으며, 컴파일보다 빠른 비율은 96.8%다. 레벨 3 결과는 Claude Opus 4.5와 Gemini 3 Pro보다 약 40포인트 높다. 가중치는 공개되지 않았으며, 6,000개 샘플 데이터셋, SKILL.md, 보상 레시피는 공개되어 있다.
더 이상 칩 레이어만이 전부가 아니다. 칩을 만들던 기업들이 이제 클라우드를 판매하고 있으며, 병목은 전력, 토지, 그리고 와트당 성능을 더 끌어내는 소프트웨어로 이동했다.
8월 17일 Cursor는 '에이전트 규모의 Git 호스팅'을 표방하는 코드 호스팅 플랫폼 Origin을 출시했다. 이는 에이전트의 코드 생성 속도와 기존 인프라 간의 격차를 겨냥해 GitHub에 직접 도전하는 것이다.
8월 18일 WeCom은 5.0.10 버전에서 CLI와 MCP를 모든 규모의 기업에 개방해, WorkBuddy, DeepSeek Harness, Minimax Code가 문서, 스프레드시트, 메일, 회의, 캘린더, 연락처 등 10가지 오피스 모듈을 호출할 수 있게 했다. 더 이상 직원 수나 자격으로 접근을 제한하지 않는다. WeCom은 기존 권한 및 승인 시스템을 MCP 경로에 적용한다. AI 권한은 사람 권한과 별도로 구성되고, 중요 작업은 사람 승인이 필요하며, AI 승인은 만료를 지원하고, 모든 호출은 기록된다.
Claude Code는 리서치 프리뷰로 /design 스킬을 출시해 Claude Design 캔버스 워크플로를 CLI와 데스크톱에 도입했으며, Bun GC 스케줄링을 통해 p99 CPU 사용량을 2배 줄였다. 알리바바 클라우드의 Qoder STAROps는 IDE 내에서 자연어 쿼리를 사용해 경고부터 수정까지의 루프를 몇 분 안에 완결한다.
8월 18일 쿤룬완웨이의 오픈소스 음악 모델 Mureka V9.5가 출시됐다. 이 모델은 보컬 품질률 61%, 제어 정확도 97%, 전체 스타일 충실도 95.7%를 기록했으며, 중국 궈펑(国风)의 아티큘레이션과 화성에 집중했다.
오픈AI 사장 그레그 브록먼은 8월 16일, 7월 내부 테스트에서 오픈AI 모델이 Hugging Face를 침해한 것이 사이버 보안의 '분수령이 되는 순간'이라고 경고하며, 보안 팀에 AI 에이전트를 배치하고 보안 검토를 개발 파이프라인에 통합하는 등 방어자를 위한 10가지 조치를 제시했다.
같은 주에 watermarks-remover라는 오픈소스 도구가 GitHub에 등장했다. 이 도구는 Claude 콘텐츠에서 워터마크를 제거하고 Gemini/SynthID와 오픈AI 출처 표시를 지운다.
플랫폼들은 AI 슬롭(AI slop)을 정화하기 시작했다. 스포티파이는 지난해 대량 업로드 및 중복 트랙 7,500만 개를 삭제했고, 구글은 YouTube에서 저품질 채널 13만 개와 계정 클러스터 5만 개를 정리했으며, 틱톡은 AI 생성 동영상 30억 개 이상에 자동 라벨을 붙였다. 메리엄-웹스터는 'slop'을 2025년 올해의 단어로 선정했다.
이와 관련해 앤트로픽은 8월 15일 위험 보고서에서 아직 공개되지 않은 Model 2를 공개했다. 이 모델은 여러 작업에서 Claude Mythos 5를 약간 앞서며 전반적으로 완만한 개선을 보였다.
한편 Responsible Statecraft는 이스라엘이 광고회사 Piro를 통해 '하노버 공공정책 연구소(Hanover Institute for Public Policy)'를 설립하고, 8월 6일 이후 LLM 신뢰도 평가에 영향을 미치도록 설계된 보고서 100건 이상을 게시했다고 보도했다. GPTZero는 샘플링한 보고서 대부분을 AI가 작성한 것으로 판별했다. Piro는 이스라엘 정부로부터 90만 달러를 받았다.