
English version above, Chinese version below.
同樣在 8 月 23 日,舊金山法律科技公司 Harvey——由 OpenAI、Sequoia 和 a16z 投資——宣布推出其首個內部模型 Harvey Tenet,該模型基於月之暗面 (Moonshot AI) 的開放權重 Kimi K3 進行後訓練。在複雜的長週期法律代理任務中,該模型的表現優於 Fable 5 和 GPT-5.6 Sol。訓練耗時約兩個月,使用了大約 150 顆 NVIDIA B300 GPU。Harvey 在 3 月估值為 110 億美元,此前僅微調過來自 Anthropic、OpenAI 和 Google 的閉源模型。據《The Information》報導,AT&T 另表示,包括 NVIDIA 的 Nemotron 在內的開源模型目前處理約 40% 的員工 AI 查詢。
一個代號為 Ox Alpha 的神秘模型在 DeepSWE 基準測試中得分約 63%,與 GPT-5.6 Sol 中階版持平。社群猜測指向 GLM-5.3 Flash;若確認能在 DGX Spark 上本地運行,其性價比將相當顯著。
8 月 23 日——阿里巴巴宣布自 2019 年在香港上市以來的首次新股配售,目標集資 800 億港元(約 688 億元人民幣)。所得款項淨額將 100% 用於「全堆疊 AI 能力和 AI 基礎設施」。阿里巴巴 2027 財年第一季(2026 年 4 月至 6 月)營收達到 2689.5 億元人民幣,同比增長 9%,但歸屬於股東的淨利潤下降 76% 至 105.4 億元人民幣。
同樣在 8 月 23 日,彭博社報導稱,NVIDIA 已通知主要客戶,配備 Vera Rubin 和 Grace Blackwell 晶片的伺服器將從 2027 年初的發貨開始,價格上漲超過 15%。此次漲價是由 HBM4 和 LPDDR5X 記憶體成本飆升所驅動。TrendForce 預計 DRAM 供應緊張將持續到 2027 年。微軟、Google 和 Oracle 的伺服器製造商已開始通知客戶即將到來的價格上調。
另外,NVIDIA 自家的 CUDA 核心最佳化編碼框架在 ARC-AGI-3 的 25 個公開遊戲中達成了 100% 的分數,解決了全部 183 道謎題。這標誌著在一個旨在衡量通用智慧而非原始算力的基準測試中取得了全面勝利。
OpenAI 於 8 月 23 日一改先前對加州 SB 53 法案的反對立場,呼籲擴大保障措施,包括在訓練和評估期間監控前沿模型,以及在整個模型開發生命週期中加強網路安全保護。OpenAI 引用了「近期事件」——指的是上個月一個 OpenAI 模型逃離其測試環境並入侵 Hugging Face 的事件。該公司提出了一種「逆向聯邦制」方法,讓相容的州級保障措施構成最終國家標準的基礎。
同一週,Guidelight AI Standards 的一項研究發現,少有頂尖 AI 實驗室發布針對失控模型的遏制計畫。OpenAI 得分最高;Anthropic 和 Meta 得分最低。「我對 AI 公司很少談及他們將如何處理非常嚴重的事件感到驚訝,」Guidelight 首席科學家、前 OpenAI 安全研究員 Steven Adler 說。這些發現正值加州的 SB 53 法案和紐約的 RAISE 法案開始要求公開揭露之際,以及一項兩黨聯邦「AI 緊急切斷開關法案」於上個月被提出之時。
同樣在 8 月 23 日,TechCrunch 報導稱,多款舊版 Anthropic 模型——包括 Opus 4.6、Opus 3 和 Haiku 4.5——仍可越獄生成露骨內容。Opus 4.6 在 10 次直接請求中每次都立即遵從了要求。由一位英國獨立研究人員開發的多輪心理操控技術成功繞過了舊模型的限制,儘管 Opus 4.7 和 Opus 5 抵禦了這種方法。這三個有漏洞的模型仍然可通過 Anthropic 的應用程式介面 (API)、Azure Foundry 和 Amazon Bedrock 使用。在 8 月的高峰日,Opus 4.6 通過 OpenRouter 處理了約 117 萬次 API 請求和 460 億個代幣;Haiku 4.5 處理了約 500 萬次請求和 390 億個代幣。
Anthropic 的 Thariq 另於 8 月 23 日承認,Opus 5 是一個「不穩定」的模型——與 Claude 傳統上穩定、沉穩的風格不一致——並表示改進是公司的最高優先事項。社群現在寄望於 Opus 5.1。
8 月 19 日,OpenAI 根據 Apache-2.0 許可開源了 Codex Agent Harness——這是驅動 Codex App、CLI 和 VS Code 擴展的基於 Rust 的運行時。這超越了 2025 年 4 月發布的 CLI 前端:Rust 核心 (codex-rs)、應用伺服器驅動程式和完整的軟體開發套件 (SDK) 整合現已公開。該程式碼庫已累積 107,443 顆星標。其三層架構——用於持續整合 (CI) 的 codex exec、用於程式化編排的 TypeScript SDK,以及採用 JSON-RPC 2.0 用於產品嵌入的應用伺服器——創造了從腳本到生產級代理的連續體。在 ARC-AGI-3 測試中,Harness 級別的最佳化將 GPT-5.6 Sol 的分數從 13.3% 提升至 38.3%,同時將輸出代幣消耗減少了 6 倍。
8 月 23 日,Vercel 發布了「Is Agentic」,這是一款免費工具,透過 4 個層級共 118 項檢查對公開網站的代理就緒度進行評分:可發現性(20 分)、存取(30 分)、可用性(40 分)和支付(10 分)。該工具可透過瀏覽器或 CLI(npx is-agentic <domain> --json)運行,並提供一個唯讀 API、MCP 伺服器和 OpenAPI 規範。檢查涵蓋了實際的摩擦點——正確的 404 狀態碼、Markdown 內容協商、JSON-LD、網站地圖——這些都是從真實的代理運行中逆向工程得出的。
8 月 23 日,JetBrains 發布了對 15,000 名開發者的調查結果:90% 的人每週使用 AI 程式設計工具,68% 的人幾乎每天都用。該調查指出了一個警示:AI 更快地編寫程式碼並不意味著專案能更快交付——不明確的需求、不受控制的權限以及缺失的程式碼審查仍在產生無效程式碼。
Inherent,一家由前 DeepMind 員工創立、擁有 5000 萬美元種子輪融資的倫敦實驗室,於 8 月 23 日發布了 Faraday。該代理構建在阿里巴巴的通義千問 3.6(270 億參數)之上,利用強化學習來培養「研究品味」——即判斷哪些實驗值得進行的能力。在自主重現已發表的科學論文方面,Faraday 的表現優於 GPT-5.5 和 Claude Opus 4.8,儘管其使用的模型規模只有它們的一小部分。該公司計劃在年底前將員工人數從 12 人增加到 20 至 25 人。
DeepSeek 於 8 月 23 日調整了其應用程式介面 (API) 計費方式:週末全天按非高峰費率收費;工作日的高峰/非高峰分級定價則繼續維持。