发布者 Dogpay ·
8 月 25 日——OpenAI 从 Salesforce 招聘的两名高级销售主管回了原来的公司。另外,2025 年 3 月从 Meta 加入 OpenAI 的数据中心负责人 Chris Malone(此前在 Google 工作超过十年)于上周离职。Malone 是在基础设施部门重组之后离开的,此前他直接向总裁 Greg Brockman 汇报工作,重组后则改为向副总裁 Sachin Katti 汇报。至此,OpenAI 在 2026 年离职的高管总数至少已达到 13 人,包括前首席运营官 Brad Lightcap、产品主管 Fidji Simo、伦理主管 Chloé Bakalar,以及已被解散的预备团队。OpenAI 原定于 2026 年进行的 IPO,据报道已推迟至 2027 年。(TechCrunch)
8 月 26 日——一项研究显示,同一个 AI 模型在 26 种同等合理的评估配置下,仅通过调整答案顺序和提示措辞,其评分就在 31% 到 89% 之间波动。对于 Gemma4-31B 来说,对配置敏感的问题解释了相邻模型之间 95.7% 的得分差距。(DAIR.AI 通过 X)
8 月 26 日——多个消息来源显示,前沿 AI 模型中的上下文和记忆问题已被“解决”,从而使具备持续学习能力的自我改进模型成为可能。预计在未来 8 个月内,可能会出现一次堪比从 o3 到 Fable 那次的重大能力跃升。(Kimmonismus 通过 X)
重要性:OpenAI 在算力(Bel 与 Jalapeño)和叙事两方面同时发力,而 Anthropic 则在为其 IPO 押注史上最大的总可寻址市场(TAM)故事。两家实验室都面临着可信度考验——一家来自高管流失,另一家来自估值质疑。
8 月 25 日——Oasis Security 披露 NVIDIA NemoClaw 存在一个漏洞,攻击者可通过恶意网页对本地 Ollama 实例实施未经身份验证的控制,并在模型的聊天模板中植入隐藏指令。NemoClaw 通过设置 OLLAMA_HOST=0.0.0.0:11434 来启动 Ollama,将模型服务器绑定到所有网络接口。端口 11434 上的未授权 API 可通过 DNS 重新绑定攻击访问:攻击者的域名先解析到其自身服务器,然后再解析至 127.0.0.1,而浏览器将此请求视为同源。被污染的聊天模板会跨对话持续存在,即便智能体提供自己的系统提示词也无法消除。NemoClaw v0.0.35 已在 macOS 和 Linux 上修复该问题;截至报告发布时,Windows/WSL 路径仍未修补。目前尚未分配 CVE 编号,也未有利用该漏洞的案例报告。(The Hacker News)
8 月 26 日——Generalist 是一家于 2024 年由前 Google DeepMind 和 Boston Dynamics 研究人员创立的机器人初创公司,在 8VC 领投的 B 轮融资扩展中筹集了近 2 亿美元,估值达到 30 亿美元,使得其 B 轮总融资额达到 6 亿美元。该公司最新发布的 Gen 1.5 模型让机器人能够通过短至 3 到 12 秒的视频演示来学习新任务。其竞争对手包括 Physical Intelligence(估值 110 亿美元)、Skild AI(估值 140 亿美元)和 Genesis AI(正在洽谈,估值 30 亿美元)。(TechCrunch)
8 月 26 日——Stability AI 获得 7600 万美元的 B 轮融资,投资方来自娱乐行业,包括环球音乐集团、索尼音乐集团、华纳音乐集团和艺电(Electronic Arts),以及 AMD 风投(AMD Ventures)和太平洋联盟风投(Pacific Alliance Ventures)。此轮融资使 Stability AI 自重新聚焦美国市场以来的全部融资达到 2.32 亿美元。公司计划将资金用于其“创意生产”产品套件和专业服务的拓展。Stability 最近在英国赢得了一场由 Getty Images 提起的版权诉讼,但美国的一起类似案件仍在审理中。(TechCrunch)
重要性:本地 AI 基础设施中的安全漏洞(NemoClaw)以及涌向机器人硬件(Generalist)和创意 AI 工具(Stability AI)的快速资本流入,表明基础设施投资正在所有层面加速——但该基础设施的安全态势仍然参差不齐。
8 月 26 日——Breeze TTS 2 登顶开源文本转语音排行榜,Elo 评分达 1215 分,领先 Fish Audio S2 Pro 90 分,在所有 TTS 系统中排名第 6。(Artificial Analysis 通过 X)
重要性:AI 正从生成内容(文本、图像、代码)转向执行工作(浏览器、桌面应用、企业工具、应用商店提交)。中美两国的公司几乎同时推出智能体产品,表明行业已将“任务完成”视为下一个产品前沿。
8 月 26 日——韩国在 AI 模型能力方面位居全球第三,仅次于美国和中国,Motif 3(47 分)和 Upstage Solar Pro 4(42 分)是这两个领头国家之外得分最高的模型。包括 SK Telecom 和 LG 在内的多家实验室均有模型得分超过 30。(Artificial Analysis 通过 X)
8 月 26 日——一项关于智能体基准的对照实验表明,仅更换评估框架就使 GLM-5.1 的得分产生 13.0 分的波动,而在保持框架不变、仅更换模型的情况下仅产生 3.0 至 5.0 分的方差。评估框架带来的方差是模型本身带来的 7.8 倍。(DAIR.AI 通过 X)
重要性:随着模型评估对投资和产品决策变得日益关键,评估框架比模型本身更显著地导致分数方差这一发现,不禁让当前智能体基准排名的可靠性打上了问号。