9月的AI行业有种"凌晨不打烊"的劲头。9月16日凌晨,谷歌突然放出Gemini 3.8 Live和它的深度思考版两款实时对话模型,官方说法很直白——这是自家目前最出色的对话式AI。同一天,努比亚与字节跳动联手打造的全球首款AI智能体手机正式开售,预约量冲破36万台。大洋彼岸的Anthropic则有点拧巴:开发者抓包发现Opus 5.2已悄悄灰度上线,英伟达、Palantir这些大客户却在限制使用Claude。我早上刷完这几组新闻的感受很直接:大模型的竞争,正在从"谁的模型跑分高"转向"谁用起来更便宜、更放心、更顺手"。挑三条最有信息量的主线聊聊。

谷歌Gemini 3.8 Live凌晨突袭:语音交互的定价战正式开打

谷歌这次的动作用"突袭"形容不为过。发布时间选在9月16日凌晨,一口气给出两个版本:标准版主打自然口语对话,深度思考版则在说话的同时完成多步推理。两款模型都支持全双工交互——用户可以随时打断,模型边说边在后台调用工具,还能自动切换语言。开发者侧的配套也齐了:语音助手可以在讲话过程中直接触发搜索、下单等动作,不用等对话结束。

价格是我认为更值得关注的部分。谷歌给Gemini 3.8 Live定的语音服务价格是每小时1.38美元,明显低于OpenAI同类产品,同时官方称其在语音对语音基准上保持领先。结合9月以来各家密集降价的大背景,实时语音交互的调用成本正在快速滑向"白菜价"。对做智能客服、电话外呼、语音助手的企业来说,这几乎是把过去按分钟计费的语音方案直接打穿。

同在近期举办的半导体行业展会上,谷歌宣布TPU系统已扩展至100万芯片级规模,并坦承电力供应成为AI基础设施扩张的核心瓶颈。谷歌首席技术官阿明·瓦赫达特的观点也值得留意:AI已经进入智能体时代,交互模式正在从"人对机器说话"转向"智能体与智能体自动化对话"。我其实觉得这句话比模型本身更有含金量——当机器之间的对话量超过人与人之间的对话量,语音模型的竞争逻辑就完全变了,比的不再是拟人度,而是吞吐和稳定性。

Anthropic一冷一热:Opus 5.2悄悄灰度,数据留存却惹恼大客户

Anthropic这几天贡献了一组很有戏剧性的对照。先说热的那面:有开发者抓包发现,在Claude编程助手里调用Opus 5时,请求实际已被路由到Opus 5.2——Anthropic大概率跳过了5.1版本,直接开启灰度测试。实测反馈是新版生成速度明显加快、输出更精简,不再中途要求用户"按继续",而是自动进入持续自我迭代的"严酷循环"完善代码。更激进的信息来自此前曝光的内部风险报告:Anthropic大部分代码已由尚未发布的内部新模型通过智能体方式写出,据称这类具备递归自我改进能力的模型可替代研究团队八成五的工作。

冷的那面是信任危机。据美国科技媒体报道,英伟达、Palantir、博思艾伦正在限制部分Anthropic模型的使用,其中Palantir直接要求Anthropic给出不可撤销的零数据留存承诺。矛盾点在于:Anthropic今年6月起对Fable 5、Mythos 5等前沿模型默认保留30天使用数据——虽然用途限定在安全监测而非训练,但对涉及敏感数据的客户来说,"默认保留"四个字就够紧张了。

Anthropic的应对是9月1日推出的企业前沿安全防护EFS:安全日志存入客户自有云账户,密钥与审核权归客户所有,今秋起分阶段上线。说实话,这个方案方向是对的——把"数据在谁手里"变成客户可验证的事实,而不是厂商的一句承诺。这件事给所有企业采购提了个醒:2026年选大模型,数据留存条款已经从合同附件变成了核心决策项。我在给南宁本地客户做AI方案咨询时,第一个问题也从"你想用模型做什么"变成了"你的数据允许放在哪里"。

国产多模态一天三响:语音登顶、视频实时编辑、全模态融资

把视线拉回国内,9月15日到16日,多模态赛道密集交卷。第一响来自阶跃星辰:StepAudio 3系列一口气上线五款模型,覆盖实时对话、语音识别、语音合成、音效生成和音乐创作。其中Realtime模型在Artificial Analysis对话动态榜以98.9分的综合成绩位居第一,语音推理准确率高达百分之九十九点七,原生支持全双工与异步工具调用;语音识别的非流式词错误率低至百分之一点七。这份成绩单意味着国产语音模型第一次在权威榜单上把国际大厂压在身后。

第二响是生数科技的Vidu S2,距离上一代S1仅69天。其视频实时编辑功能借助帧对齐稀疏注意力,可以对正在播放的视频流实时换风格、换装、换角色、换背景,运动轨迹不穿帮;数字人实时互动模型则升级到720P、每秒25到42帧的实时输出,还支持随时追加参考图。视频生成的竞争焦点,正在从"生成一段好看的片子"转向"边播边改"的实时能力。

第三响是智象未来发布首个原生全模态视频生成模型HiDream-O1-Video-1.0,公司同期官宣完成15亿元C轮融资,近三个月累计融资超21亿元,跻身独角兽行列。三天之内,语音、视频、全模态三条线都有国产厂商站上第一梯队。对行业的实际意义在于:多模态不再是巨头独享的能力,中小企业接入的门槛正在肉眼可见地降低。

三条主线的共同启示:竞争维度变了,采购逻辑也要跟着变

一天之内,语音定价战、数据信任战、多模态卡位战同时开打。我的判断有三点:其一,大模型的竞争维度已经分散,谷歌用价格打语音,Anthropic用速度换迭代,国产厂商用多模态找差异,单点跑分领先越来越难转化为商业胜势。其二,数据留存条款开始决定订单归属,合规能力正在成为大模型厂商的第二产品。其三,多模态与智能体终端的普及,会把AI落地的成本曲线继续往下压。对正打算引入AI的中小企业,我的建议始终是先想清楚数据放在哪里、谁来审核,再谈模型能力——工具再强,数据主权丢了,代价远比省下的订阅费高。