
英文版在上,中文版在下。
8 月 14 日,智谱AI 发布了 GLM-5.3,其基础模型与 GLM-5.2 相同,完全依赖后训练扩展。其内部基准测试中编码能力提升 50%,Terminal-Bench 3.0 从 4.6 跃升至 28.3,DeepSWE v1.1 从 46.2 提升至 66.9。智谱表示将在发布两周后并在完成安全审查后开放权重。
此次发布恰逢一批开源代码模型相继推出。DeepSeek 发布了 V4 Pro,这是一款 1.6T 参数、49B 激活参数、1M token 上下文的 MoE 模型。它在 LiveCodeBench 上得分为 93.5,Codeforces 评分为 3206。阿里巴巴于 8 月 14 日晚开源了 Qwen3.8-27B,这是一款 270B 参数的原生多模态稠密模型,在代码和办公任务上优于 Qwen3.7-Plus。阿里巴巴报告称,Qwen 下载量已超过 30 亿次,衍生模型超过 30 万个,开源模型超过 460 个。
这一转向是一致的:三款模型均未更换基础模型。提升来自后训练与架构。GLM-5.3 在 Z.ai Code Bench 上每个任务仅使用 50,000 个输出 token,而 Claude Opus 4.8 约为 120,000 个,同时准确率达到 31.4%,Opus 4.8 为 29.5%。
8 月 13 日晚,DeepSeek 以 MIT 许可证开源了 DeepSeek Harness,没有发布新模型。该框架将整个智能体骨架——主循环、状态管理、会话存储、任务调度、沙箱、事件、UI——拆分为可插拔组件,采用“一切皆插件”设计。它运行在自定义的 Cordis 插件基础之上,支持热加载/卸载和回滚,并通过 Preset 作用域在单个进程中运行多个相互隔离的智能体。
在 Harness 与 V4 Pro 组合发布的同一晚,荣耀于 8 月 15 日宣布,YOYO Claw(其“虾脑”)现已运行 GLM-5.3,这是一次面向消费者端的开源模型直接落地。这一转变已经显现:模型评分正在趋同,差异化层面正转向运行时以及围绕模型的工具链。
8 月 14 日,SpaceX 完成了对 Cursor 的 600 亿美元收购,这是有记录以来规模最大的科技交易之一。Cursor 官方博客称,获得最大 GPU 集群的使用权有助于构建更低成本的模型。两家公司此前已于 7 月发布联合开发的 Grok 4.5 模型,随后又发布了 Grok 4.6;马斯克告诉员工,到 9 月 AI 收入将超过 SpaceX 所有其他业务。
同一时期,英伟达正在重新审视自身风险敞口。英伟达持有约 210 亿美元的 SpaceX 股份,该股份系 SpaceX 合并后由其 xAI 持仓转换而来;SpaceX 数据中心全部采用英伟达产品。另有报道指出,英伟达正在削减对 OpenAI 俄亥俄州 10GW 项目的担保——从 2500 亿美元降至 1200 亿美元以下,仅覆盖首个 5GW——同时 OpenAI 的年化收入已超过 400 亿美元,约为此前收入运行率的两倍。Anthropic 曾在 5 月表示其收入运行率已超过 470 亿美元,据传正接近以 60 亿美元收购 Decart;后者的软件可在芯片上更高效地运行训练与推理。
与此同时,8 月 14 日,Anthropic 首席执行官达里奥·阿莫迪就 AI 监管发文,认为公平的制度程序本身就能分散权力,且监管应约束前沿公司,同时为开放模型和小型参与者留出空间。
8 月 14 日的一篇报道详细介绍了北京协和医院神经外科住院医师金山木如何使用 OpenAI 的 GPT-5.6-Sol 在约 16 小时内证明了 Crouzeix 猜想——该问题自 2004 年以来一直悬而未决。猜想提出者米歇尔·克鲁泽以及数学家亚历克斯·汤森和安妮·格林鲍姆审阅了手稿并确认了这一证明。此前的最佳常数为 2.414,于 2017 年经过为期一周的研讨会后得出;克鲁泽本人则于 2007 年证明该常数为 11.08。八天后,数学家埃米尔·洛里斯特和费利克斯·施文宁格发布了一份五页的独立证明,采用不同方法,同样借助 ChatGPT 5.6 完成。
8 月 14 日,英伟达为效率叙事增加了硬件,宣布 Spectrum-X CPO 交换机全面投产——这是首款大规模量产的 200G/通道共封装光学以太网交换机。功耗降至五分之一,激光器数量降至四分之一,AI 应用正常运行时间延长五倍。SN6810 在 2U 机箱中容纳 128 个 800 Gb/s 端口(102.4 Tb/s),供应链涵盖台积电、矽品、Lumentum 和富士康。