国产芯片首次撑起国际模型 62 万亿 Token、MHS 让 AI 接管实验设备、Codex 连干 25 小时:大模型 8 月底三股'能干活'劲风

阅读: 479 评论: 0

标签:

8 月底的 AI 三件事:算力、物理、自主性同时跨过新门槛

2026 年 8 月 28 日一整天,三个看起来不相干的事件同时落地——智谱把 GLM-5.3-Flash 摆上 Hugging Face,一周前它以匿名身份在 OpenRouter 刷出 6 天 62 万亿 Token 的调用量,刷新平台历史纪录;Anthropic 公布模型硬件标准 MHS 的研究预览,让 Claude 接管卡内基梅隆大学的实验设备,把过去需要数周的设备集成压缩到 8 小时;OpenAI 在为 Codex 测试「持久模式」,让代码智能体单次开机连续工作 25 小时。

这三件事如果你只看技术细节,会以为 AI 行业又完成了一次迭代升级。但你如果把它们拼到一张地图上,会发现一个值得注意的事实:AI 行业这次同时跨过了三道不同的门槛——算力底座(国产芯片承接国际顶尖模型真实流量)、物理接口(统一协议让模型接管真实设备)、自主性(智能体跨会话长时间工作)。这不是某一项能力的优化,是 AI 在三个维度同时切换到「能干活」状态。

一、国产芯片第一次撑起国际顶尖模型的真实流量

先把视线放到 8 月 26 日晚上 10 点。智谱悄悄把一款叫 GLM-5.3-Flash 的多模态模型摆上了 Hugging Face,发布渠道 MIT 协议开源。一周前,这款模型以匿名身份「Ox Alpha」登陆 OpenRouter,中文社区后来给它起了个名字叫「牛来」,原因是模型代号 Ox 在英文里意为「牛」,加上国内同期走红的电影《牛来》,算是 AI 圈的一个巧合彩蛋。

它的匿名身份在 OpenRouter 上干了什么?6 天累计 62 万亿 Token 调用量,登顶平台单日模型用量历史纪录。OpenCode 平台上它还终结了 DeepSeek 连续 56 天的榜首纪录。更夸张的是 OpenRouter 公布的全平台调用量前五榜单——席位已全部被中国大模型占据。

真正让整个 AI 圈讨论的不是模型本身,是背后的算力底座。智谱官方披露:测试期间的全部线上流量和发布后的正式服务,由 10 万张国产芯片承接,供应商或来自华为、摩尔线程、海光。这 10 万张国产芯片在过去几年主要是「备用算力」——大模型公司通常优先采购英伟达 GPU,国产芯片在推理阶段用作弹性扩展开。但在 GLM-5.3-Flash 这个项目里,国产芯片第一次承担了国际顶尖模型的全部真实流量。

这件事为什么重要?两个数据点值得拎出来看。第一,半导体研究机构 SemiAnalysis 评论说,这是国产算力芯片首次大规模直接服务全球真实负载,以前没人敢把核心流量全押在国产芯片上——出一次稳定性问题就被全球开发者骂。第二,智谱在技术文档里写,调用超过 10 万张国产芯片集群,硬件效率及单 token 成本已经达到与主流英伟达 GPU 相当的水平

同夜,阿里没闲着。千问团队开源了 Qwen3.8-Flash,总参数 125B 但每次推理只激活 6B——这是一个典型的稀疏架构 MoE,训练成本相比上一代 Qwen3.7-Plus 骤降近九成。换算成钱,训练一个大模型的钱从「买套房」压到了「买台车」。推理端价格也同步下调——每百万 Token 输入 1 元、输出 3 元,是 DeepSeek-V4-Flash 的三分之一。

这种「同夜开源」节奏已经不是阿里、智谱的偶然巧合,更像是国产大模型公司在用集体表演宣示一件事:训练成本可以再降一档,国产算力可以承接真流量。8 月 28 日,腾讯混元又补了一记——Hy4 preview 上线,总参数 770B、激活 49B,上下文长度突破 1M。AI 大模型行情已经从「谁家参数大」转向「谁家跑得起」。

二、从屏幕到实验台,MHS 让模型接管真实设备

如果说国产芯片解决的是「算力从哪里来」,那 8 月 27 日 Anthropic 发布的 MHS(Model Hardware Standard,模型硬件标准)解决的则是「AI 怎么摸到真实世界」。

MHS 是 Anthropic 联合几家硬件厂商做的研究预览,目标是让 Claude 这一类大模型智能体用统一、安全的方式操控显微镜、机械臂、液体处理仪、激光器等真实设备。换句话说,AI 此前只能调用 API、读写数据库——但调用一台显微镜、一台移液机器人、一个激光发射器,过去没有任何标准可循。

卡内基梅隆大学做了一个验证性实验:用 MHS 把 Claude 接到一套生物实验室设备上,过去需要数周搭好的设备集成链路,缩短到约 8 小时,执行速度提升约 3 倍。8 小时对比过去数周,这不是简单的效率改进,是把生物实验室「AI 化」的门槛从博士级团队拉到了研究生级团队。

具体一点看 MHS 在做什么事情:药物筛选实验,传统流程是研究生手动配置 96 孔板、加样、读数。MHS 让 Claude 直接调度移液机器人完成加样、调度酶标仪读数、调度 LIMS 系统写记录,全程无需人工介入。量子计算实验室里,MHS 让 Claude 直接控制激光器完成校准——这一步过去需要专门的激光工程师。

这跟 8 月 23 日「具身 AI 学物理」的新闻不一样。学物理是模型能力层面的突破——AI 通过看视频就学会了把球扔进框里。MHS 是协议层面的突破——它给大模型和真实硬件之间搭了一座桥,让 AI 不必为每一种新设备重新训练控制模型,而是直接接入。

这件事对 Agent 智能体产业意味着什么?英伟达 8 月 26 日传出 129 亿美元收购 Hugging Face 的意向,紧接着 60 亿美元授权加 10 亿股权收编 AI 编程公司 Poolside。如果说 Hugging Face 是「模型仓库」,那 MHS 正在变成「硬件接口仓库」。等到模型-硬件接口变成标准件,具身智能从演示 demo 走向工厂、医院、实验室的速度,会比所有人预期的快。

三、Codex 持久模式 25 小时:智能体从对话助手升级为虚拟员工

第三件事不太起眼,但可能是过去一周最容易被低估的一条新闻。8 月 28 日,OpenAI 被曝正在为代码智能体 Codex 测试「持久模式」——AI 可以跨会话保存上下文、主动规划子任务,复杂开发任务最长可以连续工作 25 小时

25 小时是什么概念?把它折算成人类工作时间:假设一个人每天有效工作 6 小时,25 小时差不多等于 4 个工作日。也就是说,一个 Codex 智能体单次开机能够完成过去一个初级工程师一周的工作量——前提是它的判断力足够好、不犯大错。

这件事的潜台词是:智能体正在脱离「一问一答」的对话形态,变成「按计划跨会话完成长链路任务」的虚拟员工。判断它是不是「虚拟员工」有一个简单标准——它有没有持续记忆、能不能主动规划子任务、遇到意外会不会自主重试。25 小时连续工作意味着这三点 Codex 都做到了。

这种能力不是只有 OpenAI 在做。8 月 25 日字节跳动发布了「豆包工作」,同日阿里千问办公国际版(QwenWork)开启公测,腾讯 WorkBuddy 同步接入了 Hy4 preview。国内四家头部公司在 4 天之内全部入局 AI 办公 Agent。这背后是一个清晰的共识:B 端 AI 入口不再是「聊天框」,而是「能开电脑、能跨软件、能跨会话」的智能体。

不过 25 小时连续工作对底座模型提出了更高要求——传统 Transformer 架构在长上下文推理中容易出现注意力漂移问题。这意味着 Qwen3.8-Flash 这类稀疏 MoE 架构、Hy4 preview 这类长上下文模型,会在 Agent 时代变成「基础设施」。下一代大模型的竞争焦点不再是基准跑分,而是 Agent 跑完一整天任务的稳定性。

三股劲风合在一起:AI 大模型的「能干活」时代

把三件事串在一起看,AI 大模型行业正在从「单点能力竞赛」转向「端到端干活系统竞赛」。

国产芯片 8 月底集体承接国际顶尖模型真实流量,意味着模型公司不再需要为「算力被卡脖子」焦虑了——训练和推理的底座开始分散到国产供应链,硬件效率与 token 成本已经追平主流 GPU;Anthropic MHS 让大模型能用统一协议操控显微镜、激光器,意味着具身智能从演示 demo 变成了可复制的工程方案,未来一年内会有大量实验室和工厂把核心流程接入 AI 调度;OpenAI Codex 持久模式 25 小时,意味着智能体已经具备跨会话工作能力,B 端 AI 入口战争开始从「聊天」转向「干活」。

对南宁本地的 AI 公司来说,这三条信号合在一起意味着一个新机会窗口——做模型的不再卷参数,做应用的不再卷 demo,而是去卷「算力成本 + 硬件接口 + 持久任务可靠性」这三个组合指标的集成能力。这是广西本地化 AI 产业的实际跑道。哪天你能拿出一套「国产算力 + 行业硬件接入 + 24 小时稳定干活」的端到端方案,就跑通了 AI 2.0 时代。

上一篇 > 数博会词元500万亿开局撞上十五五工业化路线图:软件商三条线
下一篇 > 数字化转型行动方案三年路线图落地:30万家免费诊断与软件商三个卡位