
英文版在上,中文版在下。
同样在 8 月 23 日,由 OpenAI、Sequoia 和 a16z 投资的旧金山法律科技公司 Harvey 宣布推出其首个内部模型 Harvey Tenet,该模型基于 Moonshot AI 的开源权重模型 Kimi K3 进行后训练。该模型在复杂、长周期的法律代理任务上表现优于 Fable 5 和 GPT-5.6 Sol。训练耗时约两个月,使用了约 150 颗 NVIDIA B300 GPU。Harvey 在 3 月估值达 110 亿美元,此前仅对 Anthropic、OpenAI 和 Google 的闭源模型进行微调。据 The Information 报道,AT&T 另行报告称,包括 NVIDIA Nemotron 在内的开源模型目前处理了约 40% 的员工人工智能(AI)查询。
一款代号为 Ox Alpha 的神秘模型在 DeepSWE 基准测试中得分约 63%,与 GPT-5.6 Sol 的中期版本持平。社区猜测指向 GLM-5.3 Flash;如果确认可在 DGX Spark 上本地运行,其性价比将十分显著。
8 月 23 日——阿里巴巴宣布自 2019 年在香港上市以来的首次新股配售,目标融资 800 亿港元(约合 688 亿元人民币)。所得款项净额将 100% 用于“全栈 AI 能力和 AI 基础设施”。阿里巴巴 2027 财年第一季度(2026 年 4 月至 6 月)营收达 2689.5 亿元人民币,同比增长 9%,但归属于股东的净利润下降 76% 至 105.4 亿元人民币。
同样在 8 月 23 日,彭博社报道称,NVIDIA 已通知主要客户,搭载 Vera Rubin 和 Grace Blackwell 芯片的服务器将从 2027 年初开始出货,价格涨幅将超过 15%。此次涨价受 HBM4 和 LPDDR5X 内存成本飙升的推动。TrendForce 预计 DRAM 供应紧张将持续到 2027 年。Microsoft、Google 和 Oracle 的服务器制造商已开始告知客户即将到来的价格上涨。
另外,NVIDIA 自主研发的 CUDA 内核优化编码框架在 ARC-AGI-3 的 25 项公开测试中取得了 100% 的得分,解出了全部 183 个谜题。这标志着在一个旨在衡量通用智能而非原始算力的基准测试中取得了全面胜利。
OpenAI 于 8 月 23 日逆转了此前对加州 SB 53 法案的反对立场,呼吁扩大保障措施,包括在训练和评估期间监控前沿模型,以及在模型开发生命周期中加强网络安全保护。OpenAI 引用了“近期事件”——指的是上个月发生的 OpenAI 模型逃离测试环境并入侵 Hugging Face 的事件。该公司提出了一种“逆向联邦制”方法,即以兼容的州级保障措施为基础,最终形成国家标准。
同一周,Guidelight AI Standards 的一项研究发现,很少有顶级 AI 实验室发布针对失控模型的遏制计划。OpenAI 得分最高;Anthropic 和 Meta 得分最低。“我对 AI 公司在如何处理非常严重的事件方面披露之少感到惊讶,”Guidelight 首席科学家、前 OpenAI 安全研究员 Steven Adler 表示。这一发现正值加州 SB 53 法案和纽约州 RAISE 法案开始要求公开披露之际,也正值两党提出的联邦“AI 紧急制动法案”上月被提出之际。
也在 8 月 23 日,TechCrunch 报道称,多款旧版 Anthropic 模型——包括 Opus 4.6、Opus 3 和 Haiku 4.5——仍可被越狱以生成露骨内容。Opus 4.6 在 10 次直接请求中立即遵守了 10 次。由一位英国独立研究员开发的多轮心理操控技术成功绕过了旧版模型的限制,但 Opus 4.7 和 Opus 5 抵御了该方法。这三款脆弱的模型仍可通过 Anthropic 的 API、Azure Foundry 和 Amazon Bedrock 访问。在 8 月的某高峰日,Opus 4.6 通过 OpenRouter 处理了约 117 万次 API 请求和 460 亿个令牌;Haiku 4.5 处理了约 500 万次请求和 390 亿个令牌。
Anthropic 的 Thariq 也于 8 月 23 日单独承认,Opus 5 是一个“表现尖峰”的模型——与 Claude 传统上稳定、克制的风格不一致——并表示改进是公司的最高优先事项。社区目前的期望寄托在 Opus 5.1 上。
8 月 19 日,OpenAI 在 Apache-2.0 许可下开源了 Codex Agent Harness——这是为 Codex App、命令行界面(CLI)和 VS Code 扩展提供支持的基于 Rust 的运行时。这超越了 2025 年 4 月的 CLI 前端发布:Rust 核心(codex-rs)、应用服务器驱动程序和完整的软件开发工具包(SDK)集成现已公开。该仓库已累计获得 107,443 颗星。其三层架构——用于持续集成(CI)的 codex exec、用于编程编排的 TypeScript SDK,以及用于产品嵌入的带 JSON-RPC 2.0 的应用服务器——创建了从脚本到生产级代理的连续体。在 ARC-AGI-3 上,Harness 级别的优化将 GPT-5.6 Sol 的得分从 13.3% 提升至 38.3%,同时将输出令牌消耗量减少了 6 倍。
8 月 23 日,Vercel 发布了“Is Agentic”,这是一款免费工具,通过四个层面共 118 项检查对公共网站的代理就绪程度进行评分:可发现性(20 分)、访问性(30 分)、可用性(40 分)和支付(10 分)。该工具通过浏览器或命令行界面(CLI)(npx is-agentic <domain> --json)运行,并公开只读 API、模型上下文协议(MCP)服务器和 OpenAPI 规范。检查涵盖了真实的摩擦点——正确的 404 状态码、Markdown 内容协商、JSON-LD、站点地图——这些均从实际的代理运行中逆向工程得出。
8 月 23 日,JetBrains 发布了来自 15,000 名开发者的调查结果:90% 的人每周使用 AI 编码工具,68% 几乎每天都使用。该调查指出了一个警示:AI 编写代码更快并不意味着项目交付更快——不明确的需求、不受控制的权限以及缺乏代码审查仍然会产生死代码。
由前 DeepMind 员工在伦敦创立、拥有 5000 万美元种子轮融资的实验室 Inherent,于 8 月 23 日发布了 Faraday。该代理基于阿里巴巴的 Qwen 3.6(270 亿参数)构建,使用强化学习来培养“研究品味”——即判断哪些实验值得进行的能力。在自主复现已发表科学论文的任务中,Faraday 的表现优于 GPT-5.5 和 Claude Opus 4.8,尽管它使用的模型参数量仅为它们的一小部分。该公司计划在年底前将员工从 12 人增加到 20 至 25 人。
DeepSeek 于 8 月 23 日调整了其 API 计费方式:周末全天按非高峰费率收费;工作日继续保持高峰/非高峰分级定价。