视频生成闭源、KV缓存提速25倍、7B追平去年70B:AI效率拐点的三个信号

阅读: 451 评论: 0

标签:

三个信号,一个方向

2026年8月最后一周,AI行业冒出三个看似无关的消息。8月24日,阿里正式推出Wan3.0视频生成模型,能把一份幻灯片直接变成30秒的1080p视频,单条收费6美元——但模型权重不开放,连续第四代闭源。8月21日,英伟达研究团队在arXiv发表一篇论文,证明不同模型之间的KV缓存可以用一条线性方程直接搬运,切换速度提升最高25倍,校准成本不到50美元。同在这个月,7B参数的小模型做到了去年需要70B才能做到的事,显存需求降了九成,推理速度快了五倍。

三件事看起来各管各的,但放在一起看,指向同一个判断:AI的竞争重心已经从"谁的模型更大"彻底转向"谁的效率更高"。对开发者和企业来说,这不是好消息或坏消息——是游戏规则变了。

视频生成的开源分裂:Wan3.0闭源与LTX 2.5开源的同月对撞

先说Wan3.0。8月24日正式发布前,它已经从8月6日开始公测。能力确实硬:30秒视频一次生成,最高1080p,音频同步输出,上一代只能做15秒。最有意思的是输入端——不只是文字提示,还能直接喂文档、表格、幻灯片、PDF、网页链接,模型自己解析内容然后生成视频。阿里说公测期间已经用在短剧、广告、旅游推广和音乐视频制作上。定价按秒算,480p每秒0.05美元,720p每秒0.10美元,1080p每秒0.20美元,一条30秒1080p视频大约6美元。

但有个细节被大多数报道忽略了:Wan3.0没有开放权重。Hugging Face上Wan-AI组织最新的检查点还停在Wan 2.2,那是2025年7月发布的,Apache 2.0协议。从那以后,2.5、2.6、2.7、3.0连续四代全部闭源,只走API。一家曾经给开源社区贡献了视频生成主力工具的公司,花了四代时间把自己的旗舰模型变成纯服务。

跟它形成对照的是,8月11日另一家公司的LTX 2.5带着开放权重和商用许可发布,年收入1000万美元以下的公司免费。同一个月,同一个赛道,一个开源一个闭源,方向完全相反。

不过阿里也没完全关上开源的门。就在Wan3.0发布的同一天,阿里云PAI团队在Hugging Face上放出了三个SearchQwen搜索Agent模型——SearchQwen3-8B、SearchQwen2.5-7B和SearchQwen2.5-3B,前两个Apache 2.0,带真实权重。这些是垂直搜索场景的小模型,跟Wan3.0这种通用视频生成能力不在一个层级。

说实话,我觉得这不是矛盾,而是分层策略:通用能力收费养研发,垂直工具开源建生态。对阿里来说,视频生成是能直接变现的——广告、影视、旅游都是付费场景,6美元一条的成本对营销团队完全可接受。搜索Agent开源则能吸引开发者用阿里云的搜索后端,带动基础设施收入。但代价是什么?一个曾经依赖Wan 2.2构建工作流的独立开发者,现在面临一个选择:继续用去年7月的开源版本,还是迁移到闭源API接受"版本可能随时更新、行为不可复现"的规则。对需要给客户交付固定风格视频的团队来说,这个选择挺残酷的。

一条线性方程改写Agent经济学:英伟达的KV缓存跨模型传输

第二个信号来自英伟达。8月21日(论文8月4日上线arXiv),九人研究团队发表了一种跨模型KV缓存传输方法。原理说起来不复杂——用闭式岭回归拟合一个线性映射矩阵,把源模型的KV缓存直接转换成目标模型能用的格式,跳过重新预填充整个上下文的过程。

问题背景是这样的:多模型Agent系统里,编排器通常把简单任务交给小模型,复杂推理交给大模型。但每次切换时,大模型不能直接用小模型算过的KV缓存,得把整个对话历史从头重新预填充一遍。对话越长,这个重新计算的开销越大——32768个token的上下文,Qwen3 32B重新预填充需要6975毫秒。

英伟达的方法把这件事压缩到了277.6毫秒,提速25.1倍。准确率保留73到98个百分点不等(取决于模型对和任务类型)。校准过程只需要500条文本序列、每条1024个token,用最小二乘法闭式求解,不需要梯度下降,不需要GPU训练。离线校准一次花47到87分钟,算力成本不到50美元。

这个方法有限制:只适用于同族模型之间——Qwen3对Qwen3、Llama 3.1对Llama 3.1,因为需要共享注意力头数量和每头维度配置。不同架构之间(比如Llama到Qwen)还不能直接用。在线性映射效果不好的两个Ministral模型对上,研究者换了一个两层1024单元的多层感知机,把准确率从直线下降拉回到90个百分点以上。

说实话,这种工作不会出现在任何发布会的主角环节里。KV缓存、预填充、岭回归——这些词念出来听众只会看手机。但它改的是Agent系统的经济模型。之前多模型路由之所以贵,不是因为模型本身贵,而是每次切换都要付一次"重新理解整个对话"的税。英伟达CEO黄仁勋之前在CES上说KV缓存管理是系统性问题,运营商"真的在受KV缓存数据移动造成的网络流量之苦"。这篇论文说的是:不一定要靠新硬件解决,一条线性方程可能就够了。校准成本50美元,提速25倍——如果这个方法能集成进推理框架,长程多模型Agent的成本结构会直接变。

7B追平70B:小模型的效率拐点

第三个信号是趋势性的,不是单个产品。8月里,7B参数级别的模型做到了去年70B才能做到的事。显存需求降了九成,推理速度快了五倍。Meta在8月13日发布Muse Glimmer,30B开放权重模型,设计目标就是下载到个人电脑上本地跑,做编程、工具调用和Agent任务。阿里的Qwen3.8-27B在8月17日出现在Hugging Face上,Apache 2.0协议,27B稠密多模态模型,支持图像和视频理解,262144个token的上下文窗口,单卡就能跑Agent级别的编程工作流。第三方测试报告说它的表现跟一些闭源前沿模型相当——尽管参数量小得多。

这几件事的共同指向是:能力正在从云端向本地硬件迁移。去年需要调用API才能获得的能力,今年一张消费级显卡就能跑。去年要70B参数才够的质量,今年7B到30B就追上了。

这对企业意味着什么?当7B追平70B,问题就不是"要不要用AI"了,而是"要不要自己跑"。本地部署意味着数据不出内网、延迟更低、成本可控——对金融、医疗、政务这些对数据隐私敏感的场景,这个拐点的意义远超模型本身的参数变化。Meta的Muse Glimmer和阿里的Qwen3.8-27B都选了Apache 2.0协议,商用免费,说明开源方也认这个趋势——给企业足够低的门槛,让他们先把模型跑起来,生态自然形成。

效率拐点之后是什么

三个信号——视频生成的开源分裂、KV缓存的跨模型传输、小模型的参数追平——指向同一件事:AI正从"谁的模型更大"的时代切换到"谁的效率更高"的时代。

Wan3.0闭源说明,能直接变现的通用能力会越来越倾向收费。但同月LTX 2.5开源、同日SearchQwen开源又说明,开源路线不会消失,只是会往垂直场景下沉。英伟达的KV缓存传输说明,Agent系统的成本瓶颈不在模型本身,而在模型之间切换的"过路费"——一条线性方程能把过路费砍到原来的二十五分之一。7B追平70B说明,参数量不再是能力的硬门槛,部署方式才是。

对企业来说,效率拐点的真正含义是:选择变多了。不再是非得调闭源API、非得用云端算力、非得部署大参数模型。你可以用开源小模型本地跑敏感数据,用闭源API处理通用任务,用跨模型缓存让两者之间切换几乎零成本。这不是哪个厂商赢的问题——是整个使用方式的底层逻辑变了。至于这个变化对南宁做模型微调和智能体开发的团队意味着什么,我觉得很简单:门槛低了,能做的事多了,该动手了。

上一篇 > 8月22日国常会三连发撞上数据安全评估首周:B2B软件商的三条落地线