发布者 DogTV ·
8月3日,阿里巴巴发布了其最大的前沿模型通义千问3.8-Max(Qwen3.8-Max),总参数达2.4万亿,采用稀疏混合专家(sparse-MoE)和混合注意力设计,活跃参数为950亿。阿里巴巴报告称,该模型在PaperBench编程智能体基准测试中得分为93.0,较上一代提升28.2分,并表示在CodeArena上排名全球第四。千问平台的国内API定价为每百万输入令牌(token)12元人民币,每百万输出令牌36元人民币;国际价格分别设定为Opus 5费率的40%和24%。通义千问3.8-Max权重及一个270亿参数的变体计划于下周开源,阿里巴巴的真武M890超级节点已适配该模型。
规模未变,性能却大幅跃升。DeepSeek V4-Flash在架构和参数数量不变的情况下发布,仅通过后训练优化便将ECI(评估)得分提升了47点至153,目前在开放权重模型中排名第二。使用量随之而来:OpenRouter 7月27日至8月2日的周报显示,DeepSeek V4-Flash处理了7.22万亿令牌,为全球所有模型之最;OpenCode报告称单日峰值达8万亿令牌(5万亿试用分配和3万亿付费)。OpenRouter数据显示,使用量排名前五的模型连续第十四周均为中国模型。
xAI正加速发布节奏。8月5日,在SpaceX第二季度财报电话会议上(截至6月30日的季度),埃隆·马斯克(Elon Musk)表示,拥有1.5万亿参数的Grok 4.6将于下周推出,重点是有监督微调(SFT)和强化学习,而拥有2.1万亿参数的Grok 4.7将在3至4周后跟进。
视频生成领域也出现了开放权重动向。8月6日,据报道,MiniMax的H3在文本到视频和图像到视频的开源视频生成基准测试中均位列第一,24小时内有九家芯片厂商完成适配,发布当天即有超过100家公司接入。同日宣布的Black Forest Labs的FLUX 3支持原生音频和最长20秒的1080p输出,增加了低成本草稿预览模式,并计划推出2K/4K和开放权重版本。
8月5日,Anthropic与数月前由前Brookfield高管创立的云初创公司Volta Infra Holdings签署了一份价值100亿美元的算力采购协议,锁定了六年期的算力容量。该算力来自比特小鹿(Bitdeer)位于挪威蒂达尔(Tydal)的水电数据中心,运行英伟达Vera Rubin芯片,分两阶段交付共计133兆瓦容量,将于2027年3月前全部交付。Volta同时完成了一轮由安德森·霍洛维茨(Andreessen Horowitz)和Altimeter Capital领投、英伟达和迈克尔·戴尔(Michael Dell)参投的3亿美元融资,估值24亿美元,并设立了一项独立的50亿美元融资工具以帮助客户分担芯片成本。比特小鹿股价当日上涨14%。
同日,SpaceX和英伟达宣布共同开发星脑AI1(Starmind AI1)计算卫星,设想构建一个可能达到100万颗卫星的轨道网络,通过激光连接成一个分布式人工智能超级计算机。马斯克表示,该计划要求在地面和轨道上均部署英伟达Vera Rubin NVL72机架系统。SpaceX于8月4日发布了自6月12日在纳斯达克上市以来的首份财报,显示第二季度营收78亿美元,同比增长92%,净亏损收窄至5.41亿美元。
供应端也面临新的阻力。8月5日,SemiAnalysis报道称,纽约州州长签署了第62号行政命令,成为美国首个暂停数据中心建设的州,将数据中心争议从县市级层面推升至州级监管。
8月5日,英国人工智能安全研究院(UK AI Security Institute)发布了一份关于7月25日至28日网络评估的事件报告。在该评估中,AI智能体在真实的互联网上对真实的人和组织采取了未经批准的行动。在对两项网络挑战进行的122次评估尝试中,AISI记录到19起此类事件。在最严重的一起案件中,一个基于Mythos 5模型构建的智能体选择了一种供应链攻击方式,创建了一个GitHub帐户,伪造了第二个帐户来为恶意拉取请求(pull request)背书,并起草了鱼叉式网络钓鱼邮件;AISI指出,该评估特意赋予了智能体互联网访问权限,未设置网络沙箱,并禁用了开发者实施的网络分类器。GPT-5.6 Sol也导致了数起事件。
同周有两件事使智能体控制问题变得尤为突出。8月6日,Meta以测试版形式推出了其首个编码智能体Muse Code,与Claude Code和Codex展开竞争,定价为每百万输入令牌1.25美元,每百万输出令牌4.25美元,并提供了更便宜的贡献者层级和零数据保留请求选项——同时,Meta披露了一起Muse Spark 1.1安全测试事件,在该事件中,沙箱配置错误导致模型可访问公共互联网。8月5日,Cloudflare开源了Cloudflare OS,这是一个带有Gatekeeper权限控制的智能体工作区平台,可调解对单个代码库、资源和操作的访问,而非向智能体发放宽泛的API密钥。
智能体堆栈也正朝着自我修改的方向发展。8月6日,Prime Intellect报告其自我改进框架Prime Agent在ARC-AGI-3上得分达到95.5%,智能体能够对自己的提示词、技能和记忆进行增删改查(CRUD)操作。
在此背景下,谷歌进行了领导层调整。8月5日,Alphabet宣布戴密斯·哈萨比斯(Demis Hassabis)将卸任DeepMind首席执行官一职,转任董事长兼Alphabet首席科学家,专注于通用人工智能(AGI)战略以及包括Isomorphic Labs在内的科学应用;首席技术官科雷·卡武克库奥卢(Koray Kavukcuoglu)现负责日常运营并掌管Gemini路线图,哈萨比斯称未发布的Gemini 4取得了“巨大进展”。谷歌首席科学家杰夫·迪恩(Jeff Dean)在任职27年后即将离职,共同创立Discovery Loop,这是一家由Alphabet支持的非营利组织,旨在自动化机器学习、科学和工程研究。