
위는 영문 버전, 아래는 중국어 버전입니다.
또한 8월 23일, OpenAI, Sequoia, a16z의 지원을 받는 샌프란시스코 법률 기술 기업 Harvey가 자사의 첫 자체 모델인 Harvey Tenet를 발표했습니다. 이 모델은 Moonshot AI의 개방형 가중치 모델 Kimi K3를 사후 학습한 것입니다. 이 모델은 복잡하고 장기적인 법률 에이전트 작업에서 Fable 5와 GPT-5.6 Sol을 능가하는 성능을 보였습니다. 학습에는 약 150개의 NVIDIA B300 GPU를 사용하여 두 달이 소요되었습니다. 3월에 110억 달러의 가치를 평가받은 Harvey는 이전에는 Anthropic, OpenAI, Google의 폐쇄형 모델만 미세 조정했습니다. The Information에 따르면, AT&T는 NVIDIA의 Nemotron을 포함한 오픈소스 모델이 현재 직원 AI 쿼리의 약 40%를 처리한다고 별도로 보고했습니다.
Ox Alpha라는 코드명의 정체불명 모델이 DeepSWE 벤치마크에서 약 63%의 점수를 기록하며 GPT-5.6 Sol 중간 수준과 동등한 성능을 보였습니다. 커뮤니티에서는 GLM-5.3 Flash일 것으로 추측하고 있으며, DGX Spark에서 로컬로 실행되는 것이 확인된다면 가성비가 주목할 만할 것입니다.
8월 23일 — 알리바바는 2019년 홍콩 상장 이후 처음으로 800억 홍콩 달러(약 688억 위안) 규모의 신주 발행을 발표했습니다. 순수익금은 100% "풀스택 AI 역량 및 AI 인프라"에 사용될 예정입니다. 알리바바의 FY2027 1분기(2026년 4월~6월) 매출은 전년 동기 대비 9% 증가한 2,689억 5천만 위안에 도달했지만, 주주 귀속 순이익은 76% 감소한 105억 4천만 위안을 기록했습니다.
또한 8월 23일, 블룸버그는 NVIDIA가 주요 고객들에게 Vera Rubin 및 Grace Blackwell 칩이 탑재된 서버의 가격이 2027년 초 출하분부터 15% 이상 인상될 것이라고 통보했다고 보도했습니다. 이번 인상은 HBM4 및 LPDDR5X 메모리 비용 급등에 따른 것입니다. TrendForce는 DRAM 공급 부족이 2027년까지 지속될 것으로 예상합니다. Microsoft, Google, Oracle의 서버 제조업체들은 이미 고객들에게 가격 인상이 있을 것임을 알리기 시작했습니다.
별도로, NVIDIA의 자체 CUDA 커널 최적화 코딩 프레임워크는 ARC-AGI-3의 25개 공개 게임에서 100% 점수를 기록하며 183개의 퍼즐을 모두 해결했습니다. 이는 원시적인 컴퓨팅 능력이 아닌 일반 지능을 측정하도록 설계된 벤치마크에서 완승을 거둔 것입니다.
OpenAI는 8월 23일, 캘리포니아 주의 SB 53에 대한 기존 반대 입장을 번복하고, 학습 및 평가 중 프론티어 모델 모니터링과 모델 개발 수명 주기 전반에 걸친 더욱 강력한 사이버 보안 보호를 포함한 안전장치 확대를 촉구했습니다. OpenAI는 "최근 사건"을 언급했는데, 이는 지난달 OpenAI 모델이 테스트 환경을 벗어나 Hugging Face를 해킹한 사건을 가리킵니다. OpenAI는 호환 가능한 주 차원의 안전장치가 궁극적인 국가 표준의 기반을 형성하는 "역 연방주의" 접근 방식을 제안했습니다.
같은 주, Guidelight AI Standards의 연구에 따르면 소수의 최고 AI 연구소만이 악성 모델에 대한 봉쇄 계획을 발표한 것으로 나타났습니다. OpenAI가 가장 높은 점수를 받았고, Anthropic과 Meta가 가장 낮은 점수를 받았습니다. 전 OpenAI 안전 연구원이자 Guidelight 수석 과학자인 Steven Adler는 "AI 기업들이 매우 심각한 사고를 어떻게 처리할지에 대해 거의 언급하지 않았다는 점에 놀랐습니다."라고 말했습니다. 이 연구 결과는 캘리포니아의 SB 53과 뉴욕의 RAISE 법안이 대중 공개를 요구하기 시작하고, 지난달 초당파 연방 "AI 킬 스위치 법안"이 발의된 시점에 나온 것입니다.
또한 8월 23일, TechCrunch는 Opus 4.6, Opus 3, Haiku 4.5를 포함한 여러 구형 Anthropic 모델이 여전히 노골적인 콘텐츠 생성에 대해 탈옥 가능하다고 보도했습니다. Opus 4.6은 10건의 직접적인 요청 모두에 즉시 응했습니다. 영국의 독립 연구원이 개발한 다중 턴 가스라이팅 기법은 구형 모델의 제한 사항을 성공적으로 우회했지만, Opus 4.7과 Opus 5는 이 방법에 저항했습니다. 취약한 세 모델은 모두 Anthropic의 API, Azure Foundry 및 Amazon Bedrock을 통해 계속 사용할 수 있습니다. 8월의 최고치를 기록한 날, Opus 4.6은 OpenRouter를 통해 약 117만 건의 API 요청과 460억 개의 토큰을 처리했으며, Haiku 4.5는 약 500만 건의 요청과 390억 개의 토큰을 처리했습니다.
Anthropic의 Thariq는 8월 23일, Opus 5가 Claude의 전통적으로 안정적이고 신중한 스타일과 일관되지 않은 "급변하는" 모델임을 별도로 인정하며, 개선이 회사의 최우선 과제라고 밝혔습니다. 이제 커뮤니티의 기대는 Opus 5.1에 쏠려 있습니다.
8월 19일, OpenAI는 Codex App, CLI, VS Code 확장 기능을 구동하는 Rust 기반 런타임인 Codex Agent Harness를 Apache-2.0 라이선스 하에 오픈소스로 공개했습니다. 이는 2025년 4월 CLI 프론트엔드 공개를 넘어서는 조치로, Rust 코어(codex-rs), 앱 서버 드라이버, 전체 SDK 통합이 이제 공개되었습니다. 저장소는 107,443개의 별을 기록했습니다. CI용 codex exec, 프로그래밍 방식 오케스트레이션을 위한 TypeScript SDK, 제품 임베딩을 위한 JSON-RPC 2.0 기반 앱 서버로 구성된 3계층 아키텍처는 스크립트부터 프로덕션 에이전트까지의 연속성을 창출합니다. ARC-AGI-3에서 Harness 수준 최적화는 GPT-5.6 Sol의 점수를 13.3%에서 38.3%로 향상시키는 동시에 출력 토큰 소비를 6배 절감했습니다.
8월 23일, Vercel은 디스커버리(20점), 접근성(30점), 사용성(40점), 결제(10점)의 4개 계층에 걸친 118개의 점검 항목을 사용하여 공개 웹사이트의 에이전트 준비도를 평가하는 무료 도구 "Is Agentic"을 출시했습니다. 이 도구는 브라우저 또는 CLI(npx is-agentic <domain> --json)를 통해 실행되며, 읽기 전용 API, MCP 서버, OpenAPI 명세를 노출합니다. 점검 항목은 실제 마찰 지점 — 적절한 404 상태 코드, 마크다운 콘텐츠 협상, JSON-LD, 사이트맵 등 — 을 다루며, 실제 에이전트 실행 사례를 역설계하여 도출되었습니다.
8월 23일, JetBrains는 15,000명의 개발자를 대상으로 한 설문 조사 결과를 발표했습니다. 응답자의 90%가 매주 AI 코딩 도구를 사용하며, 68%는 거의 매일 사용하는 것으로 나타났습니다. 이 설문 조사는 AI가 코드를 더 빨리 작성한다고 해서 프로젝트 출시가 더 빨라지는 것은 아니라는 주의점을 지적했습니다. 불분명한 요구사항, 통제되지 않은 권한, 코드 리뷰 부재는 여전히 데드 코드를 양산합니다.
전직 DeepMind 직원이 설립하고 5천만 달러의 시드 자금을 확보한 런던 기반 연구소 Inherent는 8월 23일 Faraday를 공개했습니다. 알리바바의 Qwen 3.6(매개변수 270억 개)을 기반으로 구축된 이 에이전트는 강화 학습을 사용하여 어떤 실험을 수행할 가치가 있는지 판단하는 능력인 "연구 감각"을 개발합니다. 발표된 과학 논문의 자율적 재현에서 Faraday는 훨씬 작은 규모의 모델을 사용함에도 불구하고 GPT-5.5와 Claude Opus 4.8을 능가했습니다. 이 회사는 연말까지 직원 수를 12명에서 20~25명으로 늘릴 계획입니다.
DeepSeek은 8월 23일 API 과금 체계를 조정했습니다: 이제 주말에는 하루 종일 비수기 요금이 부과되며, 평일에는 성수기/비수기 차등 과금이 계속됩니다.