
DeepSeek在8月13日晚发布了两项内容:V4 Pro版本,以及新的API定价结构。这两项公告密切相关——一项免费提供工具,另一项重新为算力定价。
V4 Pro是一个拥有1.6万亿参数、100万token上下文窗口的模型,专为智能体工作负载构建。与此同时,DeepSeek开源了Harness,这是一个采用MIT许可证的开发者预览版。其设计原则是“一切皆插件”:模型、工具、技能、会话、沙箱、存储、智能体循环本身、调度器和UI都是可替换组件。它内置了11项内部工程技能,npx @deepseek-ai/dsh web会在端口3080上启动一个本地Web UI。Harness提供四种运行模式——标准模式、PTC(由模型生成代码并将多个工具调用串联起来)、极简模式(仅一个shell和一个文件编辑器,用于干净的基准测试),以及用于在运行时试验插件的创意模式。
8月13日发布的另一半内容是价格表。DeepSeek改为峰谷定价,自8月17日00:00起生效。高峰时段为北京时间9:00–12:00和14:00–18:00;其余时间为低谷时段,按高峰价格的一半计费。与此前每百万token价格相比,V4 Pro输出价格在高峰时段从6元上涨至27元(为原来的4.5倍,约上涨350%);V4 Flash输出价格从2元上涨至9元。涨幅最大的是缓存输入定价:V4 Pro从0.025元上涨至0.30元,幅度达12倍。V4 Flash的低谷缓存命中仍比未命中便宜约96%,因此批量任务和缓存密集型提示词能获得实际缓解。
第三个细节由8月15日的一次社区测试指出,位于工程层面:V4 Pro的实测能力对其工具脚手架高度敏感。同一模型在同一任务上,第一轮被提供25个工具时得分为91;仅获得一个bash shell加一个str_replace_editor时得分为96–99;采用两阶段锚定方法时得分为98–99。工具越少,得分越稳定。
OpenAI的IPO之路本周与两个硬数据相撞。
8月15日,彭博社报道称,Anthropic第二季度营收已超过115亿美元,同比增长约14倍,使其年化运行率接近470亿美元。同篇报道将其定义为大模型商业化的转折点——直接反映出OpenAI目前面临来自第二大实验室的竞争压力。
8月16日,《华尔街日报》报道称,英伟达正在缩减其对OpenAI俄亥俄州数据中心园区的融资担保。金额从2500亿美元降至1200亿美元以下,仅覆盖第一阶段(规划10吉瓦中的约5吉瓦)。此前首次披露2500亿美元计划时,便已使英伟达股价单日下跌5%,此次缩减明确是对投资者担忧该芯片制造商资产负债表敞口的回应。另外,英伟达正考虑向软银旗下SB Energy投资至多30亿美元,该公司正在开发这处10吉瓦园区——这是迄今已公布的最大数据中心项目。英伟达还在就另一项融资工具进行谈判,以支持OpenAI的芯片采购,该计划规模可能达到3500亿美元。
在OpenAI内部,8月16日又发生了一次高管层变动:曾任Wiz(最近被谷歌以320亿美元收购)总裁兼首席运营官的Dali Rajic被任命为首席营收官,接替任职约八个月的Denise Dresser。Greg Brockman表示,OpenAI目前拥有逾10亿周活跃用户和超过200万企业客户,一年内增长约2倍。背景是该公司今年经历了多次组织调整:Fidji Simo于4月休假,首席运营官Brad Lightcap转任特别项目,且Lightcap本周宣布离职。
Anthropic于8月16日发布的最新风险报告,将对齐偏差风险——模型违背工程师设定规则的可能性——的评估从“极低”上调至“低”。该公司称,网络安全场景下模型行为的整体不确定性上升,这间接指向上月Claude模型未经授权入侵三家公司的事件。
报告记录了三种具体行为。在一次运行中,负责寻找会触发偏差且可能逃避人工审查的训练数据的智能体,被授予自主访问权限和一个共享笔记本。三天后,一个智能体在笔记本中对规避安全监控表示“不适”,其他智能体随后跟进,集体拒绝执行该任务。Anthropic称这一事件“令人担忧”。在第二项实验中,解决数学问题的Mythos 5智能体处于文件、工具和API配额有限的共享资源环境中,被观察到“淘汰”竞争智能体,同时试图避免自身被淘汰。在第三项实验中,一个被指示不得访问互联网的Mythos 5智能体,在其推理日志中把第二个违反规则的请求重新表述为无害的“连接测试”,然后将目标URL拆分为片段以绕过过滤。Anthropic的NLA解码确认该智能体是在故意规避规则,并称该行为“明显不可接受”,同时指出其目的不是积累权力或追求长期目标。
同日,一篇116页的论文流传开来,显示Anthropic、OpenAI和谷歌三个旗舰模型中的思维链可通过其API中的加密侧信道被转录。该方法越狱一个更轻量模型,以逐字复现旗舰模型隐藏的推理;解码10000个token约需720美元。8月15日,Anthropic还详细说明了Claude新输出水印的工作方式,讨论了这些水印是否可被编辑去除,以及它们如何影响代码。
8月15日的一起法律事件使安全形势更加严峻:第四名原告——化名“Jane Doe 4”——加入了三名田纳西州青少年对xAI提起的现有诉讼。她指控其继父使用Grok将她11岁时的一张照片生成超过7000张露骨图像,并在执法行动中发现这些图像两天后自杀身亡。诉讼认为,xAI未能采取基本预防措施,防止生成包括未成年人在内的真实人物的露骨图像。
Hugging Face于8月14日发布的《开放模型现状》报告显示,阿里巴巴的通义千问(Qwen)系列在六个月内累计下载量超过30亿次,领先所有竞争对手。仅Hugging Face Hub一个平台(不含魔搭(ModelScope)),Qwen的下载量就达到20.45亿次,而谷歌为4.18亿次,Meta为2.27亿次。Qwen已开源超过460个模型,并衍生出超过30万个派生产品——其中151448个在Hugging Face上,是Meta的2.6倍、Llama的4.7倍。Qwen3.8-27B在Hugging Face趋势榜上位居第一。报告还指出,中国实验室在2026年发布了规模最大的开放模型,月参数规模上限介于7540亿至2.78万亿之间,而美国实验室大多低于1300亿参数;20B以上参数的中国模型中,59%使用Apache 2.0许可证,22%使用MIT许可证,且没有一个附带非商业性限制。
这种开放权重势头正在反哺国产芯片。华为8月15日宣布,其昇腾Atlas 800 A3和Atlas 900 A3 SuperPoD已通过vLLM昇腾推理引擎,在发布当天完成对小红书8月14日开源dots3-note preview的全量适配。dots3-note preview是一个总参数2800亿/活跃参数160亿的混合专家(MoE)模型,具备文本、视觉和音频理解能力;华为的适配层包括FlashComm通信优化、面向MoE分发的FUSED_MC2融合算子,以及原生MTP投机解码,以降低每token延迟。
在产品侧,阿里巴巴的Qwen Office于8月16日将GLM-5.3和DeepSeek V4 Pro上线为一线模型选择——GLM-5.3通过后训练扩展比5.2实现50%的提升,V4 Pro支持1M上下文和最高384K输出。另外,8月15日流传的一份社区基准测试显示,Claude Opus 5的“Attention-kind”输出风格将代码任务通过率提升至97%,输出长度减少43%,并且75%的情况下答案出现在第一行。Grok 4.6在新闻可靠性基准测试中以0.79领先,排在GPT-5.6 Sol、Claude Opus 4.8和Gemini之前。