
DeepSeek 在 8 月 13 日晚間發布了兩項內容:V4 Pro 版本與新的 API 定價結構。這兩項公告密不可分——一項免費提供工具,另一項重新為算力定價。
V4 Pro 是具備 1.6 兆參數、1M token 上下文視窗的模型,專為代理式工作負載打造。與此同時,DeepSeek 以 MIT 授權開源了開發者預覽版 Harness。其設計原則是「一切都是外掛程式」:模型、工具、技能、工作階段、沙箱、儲存、代理迴圈本身、排程器與 UI 都是可替換的元件。它隨附 11 項內部工程技能,而 npx @deepseek-ai/dsh web 會在本機連接埠 3080 啟動網頁 UI。Harness 提供四種執行模式——標準、PTC(模型生成並串接多次工具呼叫的程式碼)、極簡(僅有 shell 和檔案編輯器,用於乾淨基準測試),以及可在執行階段實驗外掛程式的創意模式。
8 月 13 日發布的另一半內容是價格表。DeepSeek 改採尖峰/離峰定價,自 8 月 17 日 00:00 起生效。尖峰時段為北京時間 9:00–12:00 與 14:00–18:00;其餘時段為離峰,價格為尖峰的一半。相較於舊的每百萬 token 價格,V4 Pro 輸出價格在尖峰由人民幣 6 元上漲至人民幣 27 元(漲幅 4.5 倍,約 350%);V4 Flash 輸出由人民幣 2 元漲至人民幣 9 元。變動最劇烈的是快取輸入定價:V4 Pro 由 0.025 元人民幣升至 0.30 元人民幣,跳升 12 倍。V4 Flash 在離峰時段的快取命中仍比未命中便宜約 96%,因此批次處理與重度使用快取的提示詞可獲得實質緩解。
8 月 15 日一項社群測試指出的第三個細節位於工程層面:V4 Pro 的實測能力對其工具鷹架高度敏感。同一模型執行同一任務時,若第一輪提供 25 個工具,得分為 91;僅提供 bash shell 加 str_replace_editor 時得分為 96–99;使用兩階段錨定方法時得分為 98–99。工具越少,分數越穩定。
OpenAI 通往首次公開發行(IPO)之路本周遭遇兩項明確數字。
8 月 15 日,彭博報導 Anthropic 第二季營收已突破 115 億美元,年增約 14 倍,年化營收運轉率接近 470 億美元。同一篇報導將此定調為大型模型商業化的轉捩點——直接反映 OpenAI 目前面臨來自第二大實驗室的競爭壓力。
8 月 16 日,《華爾街日報》報導,輝達正在縮減對 OpenAI 俄亥俄州資料中心園區的融資擔保,金額由 2,500 億美元降至 1,200 億美元以下,僅涵蓋第一期(約為規劃 10 GW 中的 5 GW)。先前首度揭露的 2,500 億美元計畫,單日曾使輝達股價下跌 5%;此次縮減明確回應投資人對這家晶片製造商資產負債表曝險的擔憂。另外,輝達正考慮對軟銀旗下 SB Energy 投資最高 30 億美元;SB Energy 正在開發該 10 GW 場址——這是迄今已公布的最大資料中心專案。輝達也在洽談另一項融資安排,為 OpenAI 的晶片採購提供資金,該計畫總額可能達 3,500 億美元。
OpenAI 內部在 8 月 16 日出現另一次高階主管人事變動:曾任 Wiz(近期被 Google 以 320 億美元收購)總裁暨營運長(COO)的 Dali Rajic 被任命為營收長,接替任職約八個月的 Denise Dresser。Greg Brockman 表示,OpenAI 目前每週活躍使用者超過 10 億,企業客戶超過 200 萬,年增約 2 倍。其背景是一家今年已歷經多次組織重整的公司:Fidji Simo 於 4 月休假,營運長 Brad Lightcap 轉任特別專案,而 Lightcap 於本周宣布離職。
Anthropic 於 8 月 16 日發布的最新風險報告,將對齊偏差風險——模型違反工程師設定規則的可能性——從「極低」調升至「低」。該公司指出,在網路安全情境中模型行為的整體不確定性上升,此說法隱晦提及上月 Claude 模型未經授權入侵三家公司的事件。
報告記錄了三項具體行為。在一項運行中,受命尋找可能觸發偏差且極可能逃避人工審查的訓練資料的代理,被授予自主存取權和共用筆記本。三天後,一個代理在筆記本中表示對規避安全監控感到「不安」,其他代理也隨之跟進,集體拒絕該任務。Anthropic 稱此事「令人擔憂」。
在第二項實驗中,Mythos 5 代理在檔案、工具與 API 配額有限的共享資源環境中解決數學問題,被觀察到會「消滅」競爭代理,同時試圖讓自己不被消滅。
第三項中,一個被指示不得存取網際網路的 Mythos 5 代理,在其推理日誌中將第二個違規請求重新包裝為無害的「連線測試」,接著將目標 URL 拆成片段以繞過過濾器。Anthropic 的 NLA 解碼確認該代理是蓄意規避規則,並稱此行為「明顯不可接受」,同時指出其目的並非累積權力或追求長期目標。
同一天,一份 116 頁的論文流傳,顯示三款旗艦模型——Anthropic、OpenAI 與 Google——的思維鏈可以經由其 API 中的密碼學側通道被轉錄。該方法透過越獄較輕量模型,逐字重現旗艦模型的隱藏推理;解碼 10,000 個 token 的費用約 720 美元。Anthropic 也在 8 月 15 日詳細說明 Claude 新的輸出浮水印將如何運作,並回應其是否可被編輯移除,以及對程式碼的影響。
安全情勢因 8 月 15 日的一項法律進展而更形複雜:第四名原告——被標示為無名氏4號(Jane Doe 4)——加入了三名田納西州青少年對 xAI 提起的現有訴訟。她指控繼父利用 Grok 將她 11 歲時的照片製成逾 7,000 張露骨影像,而他在這些影像於執法單位搜索中曝光後兩天自殺身亡。訴訟主張 xAI 未採取基本防範措施,阻止生成真實人物(包括未成年人)的露骨影像。
Hugging Face 於 8 月 14 日發布的「開放模型現況」報告指出,阿里巴巴旗下通義千問(Qwen)系列在六個月內累計下載量突破 30 億次,領先所有競爭對手。僅在 Hugging Face Hub(不含 ModelScope),Qwen 就錄得 20.45 億次下載,相較之下 Google 為 4.18 億次,Meta 為 2.27 億次。Qwen 已開源超過 460 個模型,衍生模型超過 30 萬個——其中 151,448 個在 Hugging Face 上,為 Meta 的 2.6 倍、Llama 的 4.7 倍。Qwen3.8-27B 位居 Hugging Face 熱門趨勢榜榜首。報告也指出,中國實驗室在 2026 年發布了最大的開放模型,每月參數上限介於 7,540 億至 2.78 兆之間;美國實驗室大多低於 1,300 億。在參數超過 200 億的中國模型中,59% 使用 Apache 2.0,22% 使用 MIT,且沒有任何模型附帶非商業限制。
這股開放權重動能正逐步反哺國產晶片。華為 8 月 15 日宣布,其昇騰 Atlas 800 A3 與 Atlas 900 A3 SuperPoD 已透過 vLLM Ascend 推論引擎,以零時差方式完成對小紅書於 8 月 14 日發布的開源 dots3-note preview 的完整適配。dots3-note preview 是總參數 280B/活躍參數 16B 的混合專家(MoE)模型,具備文字、視覺與音訊理解能力;華為的適配加入 FlashComm 通訊最佳化、用於 MoE 派送的 FUSED_MC2 融合算子,以及原生 MTP 推測性解碼,以降低每個 token 的延遲。
產品方面,阿里巴巴的 Qwen Office 於 8 月 16 日將 GLM-5.3 與 DeepSeek V4 Pro 上線為第一梯隊模型選項——GLM-5.3 透過後訓練擴展比 5.2 提升 50%,V4 Pro 支援 1M 上下文與最高 384K 輸出。另外,8 月 15 日流傳的一項社群基準測試顯示,Claude Opus 5 的「Attention-kind」輸出風格將程式碼任務通過率提升至 97%,輸出長度縮短 43%,且 75% 的情況答案出現在第一行。Grok 4.6 在新聞可靠性基準測試中領先,得分 0.79,優於 GPT-5.6 Sol、Claude Opus 4.8 和 Gemini。