發佈者 Dogpay ·
8 月 25 日——OpenAI 從 Salesforce 挖角的兩名高級銷售主管已返回前東家。另外,OpenAI 的數據中心負責人 Chris Malone 已於上週離職,他於 2025 年 3 月從 Meta 加入(此前在 Google 任職超過十年)。Malone 的離職發生在基礎設施架構重組之後,他不再直接向總裁 Greg Brockman 匯報,而是改為向副總裁 Sachin Katti 匯報。這使得 OpenAI 在 2026 年離職的高管總數達到至少 13 位,其中包括前首席運營官 Brad Lightcap、產品總監 Fidji Simo、道德倫理主管 Chloé Bakalar,以及已解散的防範準備團隊。OpenAI 原定於 2026 年進行的首次公開募股(IPO),據報已推遲至 2027 年。(TechCrunch)
8 月 26 日——一項研究發現,同一款人工智慧(AI)模型在 26 種同等合理的評估配置中,得分範圍從 31% 到 89% 不等——僅僅是改變了答案順序和提示詞的措辭。對於 Gemma4-31B,對配置敏感的問題佔據了相鄰模型之間得分差距的 95.7%。(DAIR.AI via X)
8 月 26 日——多方消息指出,前沿 AI 模型中的上下文和記憶問題已「解決」,這可能為具備持續學習能力的自我改進模型鋪平道路。一次能力飛躍,其幅度堪比從 o3 到 Fable 的躍升,可能在未來 8 個月內出現。(Kimmonismus via X)
為何重要:OpenAI 正同時在算力(Bel + Jalapeño)和敘事上雙線推進,而 Anthropic 則在其 IPO 中押注於史上最大的整體潛在市場規模(TAM)故事。兩家實驗室都面臨可信度考驗——一個來自高層流動,另一個則來自估值質疑。
8 月 25 日——Oasis Security 揭露了 NVIDIA NemoClaw 中的一個漏洞,該漏洞允許攻擊者控制的網頁在無需驗證的情況下控制本機的 Ollama 實例,並將隱藏指令植入模型的聊天模板中。NemoClaw 使用 OLLAMA_HOST=0.0.0.0:11434 啟動 Ollama,將模型伺服器綁定到所有網路介面。可以透過域名系統(DNS)重新綁定來存取連接埠 11434 上的無需驗證的應用程式介面(API):攻擊者的域名首先解析到他們自己的伺服器,然後再解析到 127.0.0.1,而瀏覽器則將請求視為同源。中毒的聊天模板會在不同對話中持續存在,並且即使在代理提供自己的系統提示詞後依然有效。NemoClaw v0.0.35 在 macOS 和 Linux 上修復了此問題;截至報告日期,Windows/WSL 路徑仍未修補。尚未分配通用漏洞揭露(CVE)編號,也尚無漏洞利用的報告。(The Hacker News)
8 月 26 日——Generalist,一家於 2024 年由前 Google DeepMind 和 Boston Dynamics 研究人員創立的機器人初創公司,在由 8VC 領投的近 2 億美元 B 輪擴展融資後,估值達到 30 億美元,使得 B 輪總融資額達到 6 億美元。該公司新發布的 Gen 1.5 模型使機器人能夠透過短至 3 到 12 秒的影片示範來學習新任務。其競爭對手包括 Physical Intelligence(估值 110 億美元)、Skild AI(估值 140 億美元)和 Genesis AI(正在洽談融資,估值 30 億美元)。(TechCrunch)
8 月 26 日——Stability AI 在 B 輪融資中籌集了 7,600 萬美元,投資者陣容涵蓋娛樂產業,包括環球音樂集團、索尼音樂集團、華納音樂集團和藝電,以及 AMD Ventures 和 Pacific Alliance Ventures。此輪融資使得 Stability AI 自重新聚焦美國市場以來的總融資額達到 2.32 億美元。該公司計劃將這筆資金用於其「創意生產」產品套件和專業服務的擴展。Stability 最近在英國的 Getty Images 版權訴訟中勝訴,不過在美國的類似案件仍在審理中。(TechCrunch)
為何重要:本機 AI 基礎設施的安全漏洞(NemoClaw)以及資本快速湧入機器人硬體(Generalist)和創意 AI 工具(Stability AI)領域,顯示出基礎設施投資正在所有層面加速——然而,該基礎設施的安全狀況仍然參差不齊。
8 月 26 日——Breeze TTS 2 以 1215 的 Elo 分數登上開源文字轉語音排行榜榜首,領先 Fish Audio S2 Pro 90 分,並在所有文字轉語音(TTS)系統中總體排名第六。(Artificial Analysis via X)
為何重要:AI 正在從生成內容(文字、圖像、程式碼)過渡到執行工作(瀏覽器、桌面應用程式、企業工具、應用程式商店提交)。中國和美國的公司都在同一時間窗口內發布代理產品,這表明業界已將「任務完成」視為下一個產品前沿。
8 月 26 日——韓國在 AI 模型能力方面排名全球第三,僅次於美國和中國,Motif 3(得分 47)和 Upstage Solar Pro 4(得分 42)是這兩個領先國家以外得分最高的模型。包括 SK Telecom 和 LG 在內的多個實驗室都有得分超過 30 的模型。(Artificial Analysis via X)
8 月 26 日——一項關於代理基準的對照實驗顯示,更換評估框架導致 GLM-5.1 的得分波動達到 13.0 分,而在保持框架不變並更換模型的情況下,僅產生 3.0 至 5.0 分的變異數。框架導致的變異數是模型本身的 7.8 倍。(DAIR.AI via X)
為何重要:隨著模型評估對投資和產品決策日益重要,評估框架成為比模型能力更大的評分變異來源這一發現,使人們對當前代理基準排名的可靠性產生了質疑。