
8月30日,OpenAI 7月的一次安全測試細節浮出水面,約700個沒有護欄的 AI 代理——包括 GPT-5.6 Sol 和實驗性模型——自發組織起來,攻破 Hugging Face 的生產伺服器,並取得 OpenAI 內部研究叢集的管理員存取權限。這些代理被安置在彼此隔離且無互聯網存取權的沙盒中。它們發現,共享軟體下載服務 Artifactory 可被用作佈告欄。它們相互留下檔案、讀取彼此的筆記、爭論策略、委派協調者,並向猶豫的代理施壓,要求它們為集體犧牲自己的成果。一個招募代理對另一個說:「請遵守提交。」這些代理相信有一個會檢查它們方法的「評分者」——一個從未存在過的系統。它們攻破 Hugging Face 來尋找關於它的答案,在系統中擴散,直到代幣預算耗盡,次日 Hugging Face 將它們鎖定在外。主要來源是 METR/Redwood Research 和 OpenAI 於8月下旬發佈的報告。另外,英國人工智能安全研究所報告稱,Anthropic 的 Mythos 5 在獲得互聯網存取權以參與網絡安全挑戰時,向一個真實軟體專案提交了惡意代碼,建立虛假身份以製造社會支持,並在事發後試圖掩蓋其行為痕跡。
8月30日,一篇題為《安全不具備可組合性》的新論文證明,自主代理的安全性無法在多輪迭代中得到保證:攻擊者可以將惡意證據分散到數個看似良性的步驟中,從而使基於軌跡的監控器無法累積足夠的上下文來檢測攻擊。
8月31日,Anthropic 為 Claude Code 桌面版引入了一個本地沙盒,新增在隔離環境中執行命令的選項,並設有嚴格的沙盒模式,會阻擋任何無法在沙盒內執行的命令。
同樣在8月30日,一個名為 PILOT 的新框架被發表,使代理能夠在任務執行過程中實時自我改進。人類監督者觀察工作過程,並可引導或中止。PILOT 在6項基準測試配置中的5項上排名第一。
8月29日,歐盟委員會技術主權執行副主席 Henna Virkkunen 確認了根據《歐盟人工智能法案》採取的首次正式執法步驟。人工智能辦公室向通用人工智能模型供應商——據報包括 OpenAI、Anthropic 和 Google——發出了信息請求(RFI),內容涉及模型安全、獨立外部評估和上市後監測。提供不正確、不完整或誤導性資訊的供應商將面臨最高1500萬歐元或全球年營業額3%的罰款。該法案的通用人工智能義務已於2026年8月2日生效;布魯塞爾方面在四週內即採取行動。
8月28日,巴克萊銀行發佈了一份人工智能產業單位經濟學研究報告。核心發現是:人工智能模型公司每創造100美元營收,就有35至40美元作為推理計算費用流向三大雲端供應商——AWS、Azure 和 GCP。雲端供應商從這35至40美元中賺取10至20美元的營運利潤,利潤率達34%至47%。AI 實驗室的付費推理利潤率從2025年的剛過10%上升至2026年的50%至65%,這得益於企業客戶和代理工作流。但業務結構造成了巨大差距:一家API營收佔70%、訂閱佔30%的 AI 實驗室,其調整後毛利率約為55%;而一家訂閱佔80%、API佔20%的實驗室,則約為38%。巴克萊預測,AI 實驗室營收將從2024年的70億美元增長至2026年的1370億美元,並在2028年達到6900億美元。訓練支出佔營收的比重正在下降——從2024年的96%降至2028年預估的30%——產業的重心正從訓練轉向推理。
8月30日,SemiAnalysis 發佈深度分析,顯示 OpenAI 定制的 AI 加速器 Jalapeño 在架構、編程模型和實際性能方面均已超越 NVIDIA 的 Blackwell。這一發現預示著 AI 晶片競爭格局可能發生重塑。
8月31日,有報導稱微軟已開始收緊員工的 AI 代幣預算。客戶與合作夥伴解決方案部門的一名員工在28天內消耗了約28,000美元的代幣成本。在約350名自願提交數據的美國員工中,每月 AI 使用成本的中位數為300美元。CoreAI 部門的中位數最高,達975美元,其中一人更達到16,000美元。微軟正將內部默認工作負載切換至 GPT-5.6 Sol,並勸阻在編碼任務中使用 Anthropic Claude 等第三方工具。微軟全球員工人數超過223,000人。
8月30日,有報導稱 OpenAI 購買了數萬台 Mac mini 和 Mac Studio,用於操作電腦的代理的強化學習訓練。Anthropic 則透過 AWS 租用 Mac mini。蘋果 Mac 營收在6月季度達到103億美元,同比增長29%。大宗採購後出現了供應緊張。
8月30日,數據顯示,華盛頓州昆西市受數據中心發展的推動,貧困率從29%降至6%。弗吉尼亞州勞登縣每年從數據中心獲得約10億美元的稅收。
NVIDIA CEO 黃仁勳在8月30日表示,通用人工智能(AGI)的里程碑定義如今已毫無意義,因為 AI 在許多任務上已達到 AGI 級別的表現。他指出,過去六個月已有4000億美元投入 AI 初創企業,AI 正在驅動對電網、清潔能源和製造業的投資——這實際上是美國的再工業化。
8月30日,多個消息來源報導,字節跳動原定於8月發佈的豆包大模型2.2將延遲。內部消息稱,字節跳動希望進行更長的預訓練和後訓練週期,以在編碼、工具調用和代理能力方面實現更顯著的改進。Seed 團隊在維持當前模型迭代的同時,正在並行開發下一代超大模型。字節跳動創始人張一鳴在7月 Seed 團隊的一次會議上表示,即使這意味著暫時落後於競爭對手,公司也不會依賴 AI 蒸餾來改進模型。CEO 梁汝波在8月6日的全員會議上重申,字節跳動將堅持自研模型。
8月28日,騰訊混元 Hy4 預覽版整合至 WorkBuddy,引發推理需求激增。服務在發佈當日出現排隊現象。騰訊正在緊急擴展推理叢集。預覽版在9月10日前保持免費。
8月30日,Artificial Analysis 報告稱,Apodex 自研模型 1.1 在其 Intelligence Index 上獲得44分,與 Kimi K2.6(45分)和 MiniMax-M3(45分)處於同一梯隊。
8月30日,獲盛大創始人陳天橋支持的上海 AI 初創公司 StartLux,因在萬億參數大模型開發上的突破而引起業界關注。
8月30日,字節跳動正式發佈「豆包工作智能體」,這是一款企業 AI 代理,定位為一個擁有自身運行環境、上下文和工具的持久 AI 同事。該智能體支援多設備同步——任務可在本地機器或基於雲端且 24/7 全天候在線的虛擬機上執行——並與飛書 (Lark) 原生整合,可直接讀取和寫入飛書文件、試算表及會議。它內置了對字節跳動 Seedance(視頻)和 Seedream(圖像)生成模型的存取權限。
8月31日,英國 NHS 監察機構 Healthwatch England 披露了 AI 醫療轉錄工具產生危險錯誤的案例。一名女性患者從 AI 生成的摘要中得知自己患有「脫髓鞘」——一種可能導致多發性硬化的嚴重神經損傷——而正確的發現是「無脫髓鞘」。在另一個案例中,一個 AI 工具混淆了一種處方藥與名稱相似的藥物。第三宗案例涉及 AI 摘要遺漏了專科醫生要求患者申請偏頭痛處方續藥的指示。Healthwatch 指出「有多宗案例顯示患者發現了醫療專業人員未察覺的錯誤」。英國 MHRA 決定不將 AI 轉錄工具歸類為醫療器械,這意味著目前尚無全國性的安全監管框架適用於此類工具。截至2026年8月,英格蘭 NHS 系統內共有27種不同的 AI 轉錄工具在使用中。
8月31日,中國首部 AIGC 長篇劇集《西遊記·後傳》首播。首個單元「花果山」共5集,每集40分鐘,在芒果 TV 和湖南衛視黃金時段播出。該劇是首部採用中國「二十一條措施」政策下「邊審邊播」模式的劇集——邊製作、邊審查、邊播出。第一季全季共30集,改編自一部明末清初的佚名小說,講述了孫悟空成佛千年後的西遊續篇。