扩散模型让Agent提速五倍、DeepSeek开源多模态视觉、阿里训练成本砍到九分之一:9月2日AI产业三条线

阅读: 525 评论: 0

标签:

一、扩散语言模型杀进端侧:Agent运行速度提升五倍

9月1日,扩散语言模型团队扩散智能DiffuSpace与亚洲智能体计算平台公司Acrab达成战略合作,双方联合测试结果显示:在端侧场景中,扩散语言模型(dLLM)可将Agent的运行速度提升约五倍,部分场景甚至达到十倍。

这条消息之所以值得关注,不在于数字本身,而在于它指向了一个根本性的技术路线分歧。

传统GPT类自回归模型采用"从左至右、逐个词元生成"的模式,一个词元接一个词元地产出结果。这种串行机制在云端数据中心问题不大,但在AI PC、智能汽车、机器人等端侧场景就成了瓶颈——芯片算力本来就有限,每次只生成一个词元,根本无法充分利用GPU的并行计算能力。

扩散语言模型换了一种思路。它借鉴图像生成领域的扩散机制,采用"全局生成+逐步修正":初始状态是一串全遮蔽的词元,每一步并行预测所有位置的概率,挑出最确信的一批固定下来,其余位置重新遮蔽、下一轮再修。走若干步后全部确定。

这种并行解码把延迟从O(n)降到了O(n/步数)。更重要的是,扩散模型的双向建模能力让Agent能同时看"前后文"做规划,这对代码补全、多步推理、表格填充等需要全局一致性的任务格外友好。

在Acrab的参考设计中,编程智能体已经成为核心测试场景之一:dLLM可以并行处理多个代码位置,显著提升代码生成和修改效率。另一个测试场景是视频剪辑智能体——需要同时处理图像、语音和文字等多模态信息,dLLM的全局建模能力恰好派上用场。

说实话,扩散语言模型目前还有明显短板:上下文长度偏短、质量依赖步数、主流推理框架还不支持这种自定义架构。但DiffuSpace与Acrab的合作是行业内扩散语言模型首次与端侧计算平台开展系统级协同适配,这意味着dLLM从论文走向产业的拐点可能真的来了。

谷歌、Inception、蚂蚁集团等企业今年都在加速布局dLLM。业内甚至出现了"扩散语言模型或将在两年内替代GPT类自回归模型"的判断。这个判断是不是过于乐观还不好说,但至少说明一点:大模型的竞争维度正在从"谁的参数更大"转向"谁的生成方式更高效"。

二、DeepSeek开源首款多模态模型:这双"眼睛"专供Agent干活

同样在9月1日,DeepSeek在Hugging Face上线了DeepSeek-V4-Flash-Vision-Exp,这是V4家族首款实验性多模态模型,采用MIT License开源。模型参数量达3050亿,基于V4-Flash-0731底座,在原有语言模型基础上接入视觉编码器和Aligner模块,经持续训练获得图像理解能力。

但DeepSeek给这个Vision版本划定的赛道很有意思:不做"看图说话",专攻多模态Agent。

传统多模态模型的核心能力是视觉问答——你给它一张图,它告诉你图里有什么。DeepSeek这次强调的是"多模态Agent能力",让Agent直接读取网页截图、软件界面、图表等视觉信息,再结合工具调用继续执行任务。换句话说,这双"眼睛"不是给人看的,而是给Agent用的。

从基准测试结果来看,加入视觉能力后纯文本Agent能力基本不受影响:Terminal Bench 2.1从82.7涨到83.9,DeepSWE从54.4涨到59.3,反而超过Claude Opus 4.8的58.0。多模态Agent提升更明显:ApexBench Pass@1达到36.5,Agents' Last Exam以27.3超过Opus 4.8的25.7,ZeroBench Pass@5也以35.0压过对手的34.0。

不过DeepSeek的措辞依然克制,只表示"多模态Agent能力接近Claude Opus 4.8",并没有宣称全面超越。在NL2Repo项目上,它的得分是57.7,远落后于Opus 4.8的69.7。

这次开源的内容相当完整:模型权重、Tokenizer、Prompt Encoding参考实现、最小化PyTorch推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections等核心模块。社区跟进也很迅速,Hugging Face页面上已经出现七个面向llama.cpp、LM Studio、Ollama的量化版本。

时间线上有个值得注意的细节:8月21日该模型先上线DeepSeek API,当时只能调用、不给权重;十天后权重才正式开放。这种"先卖API再开源"的节奏,透露出DeepSeek对其以API服务为主的商业定位。

如果把DeepSeek近期的动作串起来看,它正在组装一套完整的Agent技术栈:模型负责推理和工具调用,Harness管理持续任务执行,Vision让Agent直接读取计算机上的视觉信息。这次开源是补齐这块拼图的关键一步。

三、阿里Qwen3.8-Flash:训练成本砍到九分之一,API定价卷到每百万Token一元

8月26日晚,阿里通义千问团队发布并开源了Qwen3.8-Flash,官方将其定义为下一代Qwen4架构的技术预览版。这款模型的核心卖点可以用一句话概括:用九分之一的资源,训出了接近上一代Qwen3.7-Plus的能力。

具体参数:总参数量1250亿,但每个词元只激活约60亿参数。这得益于MoE(混合专家)架构——不像密集模型那样每个词元都要触碰全部参数,MoE只调用相关的"专家",计算开销大幅降低。此外还外挂了一个510亿参数的N-gram嵌入模块,相当于给模型配了一本轻量化的"记忆手册",只做查表寻址,不参与每一步词元运算。

注意力机制也做了革新:引入QSA(Qwen Sparse Attention)搭配GDN组成混合注意力架构,面对百万词元超长上下文,缓存命中率高的情况下速度最高提升八倍以上。

训练成本较前代骤降近九成,API定价更是直接卷到了每百万词元输入一元、输出三元——只有DeepSeek-V4-Flash忙时价格的三分之一。发布第二天阿里还补了一刀,降到输入0.8元、输出2.7元。

性能数据方面,Qwen3.8-Flash在多个Agent和多模态基准上表现亮眼:SWE-bench Pro智能体编程领先Opus 4.6达9.1分,JobBench专业办公任务超出近20分,AndroidWorld手机操作高22.5分,MathVision视觉数学高25.1分,ERQA具身智能领先31.5分。

同一天,智谱也上线了GLM-5.3-Flash,API定价仅为GLM-5.3的十分之一。Kimi、DeepSeek都在推高效MoE。行业比拼的重点,已经从"谁参数大"悄悄转向"谁更便宜、更能落地"。

对中小企业和开发者来说,这意味着什么?过去"试用顶级模型、上线降级小模型"的妥协可以歇了。一个60亿饭量的大模型,正在把词元焦虑变成历史。模型不再比谁的块头大,而是比谁用最少的电,干最多的活。

结语

把这三条线放在一起看,9月初的AI产业呈现出一个清晰的信号:大模型正在从"炫技阶段"进入"算账阶段"。

扩散语言模型用并行生成换延迟,DeepSeek用开源多模态降低Agent部署门槛,阿里用极致性价比重新定义API定价。三条路线殊途同归——都在回答同一个问题:怎么让AI真正便宜、好用、能落地。

对广西本地企业而言,这些技术进展意味着部署AI应用的门槛正在快速降低。无论是南宁大模型微调、南宁智能体开发,还是企业内部的数字化改造,现在都有更多高性价比的工具可选。技术普惠的时代,可能比我们想象的来得更快。

上一篇 > 训练成本砍到九分之一、端侧Agent提速五倍、六成500强要上Data Agent:9月2日AI产业三条线
下一篇 > 8月31日中小企业数字化新政解读:广西企业如何抓住补贴与合规窗口