
上方為英文版本,下方為中文版本。
8 月 14 日,智譜 AI 發布了 GLM-5.3,沿用與 GLM-5.2 相同的基礎模型,完全依賴後訓練擴展。其程式設計能力在內部基準測試中提升了 50%,Terminal-Bench 3.0 從 4.6 躍升至 28.3,DeepSWE v1.1 從 46.2 提升至 66.9。智譜表示將在發布兩週後、待安全審查完成後開放模型權重。
此次發布正值一連串開源程式碼模型推出之際。DeepSeek 推出了 V4 Pro,一款 1.6T 參數的混合專家(MoE)模型,活躍參數為 49B,上下文長度達 1M token。在 LiveCodeBench 上得分 93.5,Codeforces 評分為 3206。阿里巴巴於 8 月 14 日晚間開源 Qwen3.8-27B,一款 270B 參數的原生多模態稠密模型,在程式設計與辦公任務上優於 Qwen3.7-Plus。阿里巴巴表示,Qwen 下載量已突破 30 億次,衍生模型超過 30 萬個,開源模型達 460 多個。
策略方向一致:三家均未更換基礎模型。提升來自後訓練與架構。GLM-5.3 在 Z.ai Code Bench 上每個任務僅使用 50,000 個輸出 token,而 Claude Opus 4.8 約使用 120,000 個,同時準確率達 31.4%,而 Opus 4.8 為 29.5%。
8 月 13 日晚間,DeepSeek 以 MIT 授權開源了 DeepSeek Harness,並未發布新模型。該框架將整個 Agent 骨架——主迴圈、狀態管理、工作階段儲存、任務排程、沙箱、事件、UI——拆分為可插拔元件,採用「一切皆為外掛」設計。它運行於自訂的 Cordis 外掛基礎之上,支援熱載入/卸載與回滾,並具備 Preset 作用域,可在單一處理程序中運行多個隔離的 Agent。
在 Harness 與 V4 Pro 組合發布的同一晚,榮耀於 8 月 15 日宣布 YOYO Claw(其「蝦腦」)現已運行 GLM-5.3,這是開放模型直接落地至消費者端的應用。趨勢清晰可見:模型分數正在趨同,差異化層級正轉向執行環境及包覆模型的工具鏈。
8 月 14 日,SpaceX 完成對 Cursor 的 600 億美元收購,這是史上最大規模的科技交易之一。Cursor 的部落格提到,此舉是為取得最大的圖形處理器(GPU)叢集以建構更低成本的模型。雙方已於 7 月共同推出 Grok 4.5 模型,並隨後推出 Grok 4.6;馬斯克告訴員工,人工智慧(AI)營收到 9 月時將超過 SpaceX 所有其他業務。
同一時期,輝達(Nvidia)正在重新評估其曝險。輝達持有約 210 億美元的 SpaceX 股權,這是在 SpaceX 合併後由其 xAI 持股轉換而來,且 SpaceX 的資料中心完全採用輝達產品。另據報導,輝達正在削減其對 OpenAI 俄亥俄州 10GW 專案的擔保——從 2,500 億美元下調至低於 1,200 億美元,僅涵蓋首個 5GW——而 OpenAI 的年化營收已突破 400 億美元,約為先前營收運行率的兩倍。Anthropic 曾於 5 月表示其營收運行率已突破 470 億美元,據報導正接近以 60 億美元收購 Decart,該公司的軟體能在晶片上更有效率地執行訓練與推論。
與此同時,Anthropic 執行長達里奧·阿莫迪於 8 月 14 日就 AI 監管議題發文,主張公平的制度化程序本身即可分散權力,且監管應約束前沿 AI 公司,同時為開放模型與小型參與者保留空間。
8 月 14 日的一篇報導詳細說明,北京協和醫院神經外科住院醫師金山木使用 OpenAI 的 GPT-5.6-Sol 在約 16 小時內證明了 Crouzeix 猜想——這是一道自 2004 年以來懸而未決的難題。猜想提出者米歇爾·克魯澤以及數學家亞歷克斯·湯森和安妮·格林鮑姆審閱了該手稿,並確認了該證明。此前最佳常數為 2.414,於 2017 年經過一週研討會後得出;克魯澤本人則於 2007 年證明了 11.08 這一常數。八天後,數學家埃米爾·洛里斯特和菲利克斯·施文寧格發表了一份五頁的獨立證明,採用不同方法,同樣由 ChatGPT 5.6 輔助完成。
輝達於 8 月 14 日為效率議題補上硬體環節,宣布 Spectrum-X CPO(共封裝光學)交換器進入全面量產——這是首款量產的每通道 200G 共封裝光學乙太網路交換器。功耗降至五分之一,雷射數量降至四分之一,AI 應用正常運行時間延長五倍。SN6810 在 2U 機箱中容納 128 個 800 Gb/s 連接埠(總計 102.4 Tb/s),供應鏈包括台積電、矽品、Lumentum 與鴻海。