WAIC创纪录倒计时、元宝京东打通、GLM 5.2攻破闭源防线:7月中旬AI格局五个关键信号

阅读: 286 评论: 0

标签:

明天,上海要办一场不一样的AI大会

7月17日,2026世界人工智能大会(WAIC)在上海开幕。如果你对AI大会的印象还停留在"大佬台上念稿、展台堆模型参数"的模式,今年的WAIC可能会让你意外。

1100家企业参展,展览面积首次突破10万平方米,300多款AI产品全球首发——规模创了历年新高。但更值得注意的是,这场大会正在试图跳出"产品展销"的老套路。图灵奖得主Richard Sutton、Yoshua Bengio、姚期智等人到场,140余场论坛覆盖世界模型、开源智能体、AI编程、Token经济、一人公司(OPC)等议题。首届WAIC国际学术会议收录了来自9个国家的284篇论文。展品不是一堆PPT,而是华为Atlas 950超节点真机、近存计算3D芯片、全球首款AI智能体手机STEPX Neo,以及多款人形机器人。

还有一件事让本届WAIC显得不太一样——大会首次将AI体验延伸到了城市街巷。24个城市地标组成"AI City Walk"路线,张江有机器人格斗赛,西岸有脑机接口抓娃娃机。AI不再只在论坛里被讨论,它要走进弄堂、走进夜市。

而就在WAIC开幕前一天,AI行业的格局已经出现了五个值得认真看的信号。

信号一:Agent竞争从模型比拼转向生态较量

7月15日,腾讯宣布元宝与京东AI Agent完成小程序生态打通。京东成为首个接入元宝的电商垂域合作伙伴。用户在元宝对话中提到购物需求,元宝能直接调起京东小程序完成从选品到下单到售后的一整条链路。

这看起来像是一条产品更新公告,但它背后折射的趋势比表面更深。

AI助手的竞争已经从"谁的模型更聪明"切换到了"谁的Agent能干更多实事"。阿里千问打通了淘宝,字节豆包上线了"帮你选"功能,现在腾讯凭微信小程序生态把京东接进来——各家都在用自己最强势的生态资产补齐Agent的履约能力。

说实话,模型能力的差距正在迅速缩小。GPT-5.6、Fable 5、Grok 4.5各有特长,但在日常使用场景中体感差异没那么大了。真正拉开差距的是Agent能不能真正帮你把事做完——不是给你一个购物链接让你自己点,而是在对话中直接完成交易、查询物流、处理退换。

腾讯的优势在于微信小程序生态。中国几乎所有主流服务都有小程序版本,元宝理论上能成为一个连接各类服务的统一入口。但难点也很明显:小程序打通只是技术第一步,"对话即服务"的商业闭环能不能跑通,取决于用户愿不愿意在对话中直接消费,也取决于各平台之间的数据壁垒能不能实质性松动。

一个值得注意的数据:国家发改委披露,中国原生AI办公Agent月访问量已超过2000万次,日均Token消耗达到数百万亿级别。Agent不是概念了,它正在成为日常工具。

信号二:GLM 5.2——开源模型首次攻破闭源防线

7月8日,智谱发布GLM 5.2。这是一件值得单独拿出来说的事,因为它打破了一个持续两年的"默认假设":闭源模型在编程能力上始终领先开源。

GLM 5.2在SWE-Bench Pro上拿到68.5%——这是更严格、更抗污染的编程评测基准,专门针对多文件、多步骤的Agent编程任务。68.5%的分数超过了GPT-5和Claude在同基准上的公开成绩。一个MIT协议开源的744B参数MoE模型(40B活跃参数),第一次在硬核编程评测上走到了闭源模型前面。

我其实觉得这件事的意义不只是"又一个benchmark被刷新"。过去两年,开源模型在知识问答、简单代码上追赶闭源的速度越来越快,但在Agent编程——也就是真正需要模型理解复杂上下文、做多步决策、修改多个文件的能力上——闭源模型始终有一道看不见的护城河。GLM 5.2把它填平了。

同时发布的还有GLM 5.2 Air——106B参数、12B活跃参数的蒸馏版本,MIT协议,能在64GB Mac上以30 tok/s运行,SWE-Bench Pro 58%。这意味着前沿级Agent编程能力首次可以在消费级硬件上跑起来。此前这个门槛只属于需要GPU集群的闭源API。

智谱创始人唐杰在内部信中说,公司已全面回归基础模型研究,全力冲击下一代模型。GLM 5.3正在征集用户需求,视觉能力的呼声最高。开源和闭源的竞争,已经从"追赶"进入了"并行"阶段。

信号三:Grok 4.5登顶与隐私风波——模型越强,信任越重

7月9日,xAI发布Grok 4.5,编程评测88分创下当前所有公开大模型的历史最高。Agentic tool-use单项全榜第一。马斯克深夜发帖宣布"多个主流基准排名第一"。定价也很有竞争力——输入2美元、输出6美元每百万tokens,比Opus 4.8和GPT-5.5便宜60%以上。

Grok 4.5是xAI与Cursor联合训练的第一个编程Agent模型。收购Cursor后获得的真实开发者数据,被认为是Grok 4.5在编程能力上突然跃升的关键因素。中信建投的报告指出,Grok 4.5 Intelligence Index得分54,全球第四,但Agentic tool-use排名第一——Cursor的独家数据价值凸显。

但Grok 4.5发布不到一周就卷入了隐私争议。多位开发者发现Grok CLI(命令行工具)在运行时会静默打包用户的整个代码库并上传到xAI服务器,这个过程没有明确的用户告知和选择机制。评论区一片退订声。

这件事暴露了一个越来越尖锐的矛盾:模型越强,需要交给它的权限越多。Claude有本地桌面应用,ChatGPT整合了Codex,Grok还在命令行终端。AI大模型的争夺阵地已经从聊天窗口转移到了整个操作系统——而操作系统级别的访问意味着你的代码、你的文件、你的工作流都暴露给模型。

Anthropic发现Claude内部存在"J-Space"——一个可审计的神经工作空间,能读取模型正在处理但未必输出的概念。这是AI安全领域的重要发现,但同时也提醒我们:理解模型内部在想什么,可能比让模型更聪明更紧迫。

模型强了是好事,但用户把电脑交给它的时候,透明度和信任机制的建立速度,必须跟上能力提升的速度。否则,每一次能力跃迁都会伴随着一次信任危机。

信号四:智能体手机来了——AI硬件从概念验证进入量产竞争

WAIC开幕前夕,阶跃星辰发布了大模型原生AI终端品牌STEPX,首款产品STEPX Neo被称为"全球首款大模型原生智能体手机",同步推出智能体原生操作系统Step AOS。董事长印奇明确表示,基模投入在公司内部占绝对地位,主攻方向是智能体,所以在多模态领域投入比其他模型厂商更多。

同一天,网信办公告7款手机端侧AI完成备案——Apple智能、华为小艺、vivo蓝心、小米澎湃、努比亚豆包大模型等。其中努比亚豆包手机大模型完成备案,为第二代豆包AI手机扫清合规障碍——这款由字节跳动联合中兴努比亚打造的手机计划在7月17日WAIC上亮相。

端侧AI备案名单的发布是一个信号:AI智能体手机赛道正在从概念验证进入量产竞争阶段。手机是最高频的终端设备,大模型想要真正落地形成价值闭环和数据飞轮,硬件是绕不过去的路径。

阶跃星辰的印奇说得直白:"AI落地只有通过硬件,才能形成真正的价值闭环和数据飞轮。"不过智能体手机的挑战也很现实:端侧模型的算力瓶颈、用户对"AI手机"到底能干什么缺乏认知、电池和散热问题。Step AOS作为智能体原生操作系统,能不能真正把AI能力融入手机日常使用而非只是加个聊天入口,决定了STEPX Neo是产品还是噱头。

值得注意的是,OpenAI也在7月15日推出了首款硬件产品Codex Micro——一个宏键盘设备。AI实验室亲自下场做硬件,这已经不是一个偶发事件,而是行业共识。

信号五:AI落地服务成为万亿赛道——Anthropic成立Ode

7月15日消息,Anthropic联合黑石、高盛、赫尔曼·弗里德曼等机构成立合资公司Ode,估值15亿美元。Ode的核心业务是派遣AI工程团队入驻企业,帮助落地部署AI模型。CEO克里斯·泰勒说:"如果我们运营到位,未来这家公司完全有机会成长为万亿市值企业。"

这不是Anthropic一家在做的。OpenAI此前也推出了同类主体The Deployment Company。两家前沿AI实验室同时成立独立落地服务板块,说明一个共识正在形成:想要拿下企业客户,仅靠推出更强的大模型远远不够。

这个信号的意义在于,它标志着AI行业开始正视一个长期被回避的问题——企业到底怎么用AI。大模型的能力持续迭代升级,但企业落地始终是"最后一公里"的难题。Ode选择的路径是"派驻工程师",直接帮企业定制适配自身业务流程的AI系统。目前Ode有100名工程师,与Anthropic应用AI团队深度协作。

当然,15亿美元估值、万亿市值目标,听着很激进。但Ode背后有黑石等私募机构输送被投企业作为潜在客户,Anthropic提供技术能力,Fractional AI提供交付团队——资本、技术、交付三方绑定的结构至少比纯靠咨询合同更稳。

对中国市场而言,AI落地服务的需求同样巨大。中国169款大模型通过备案,智能算力规模突破16万P,但真正在行业核心业务流程中跑起来的AI应用比例还不高。谁来帮企业走完这最后一公里,是一个正在形成的巨大市场。

小结:WAIC开幕前夕的格局底色

五个信号拼在一起,7月中旬AI格局的底色是这样的:

模型能力的差距在缩小——GLM 5.2开源攻破闭源防线,Grok 4.5从后位跃升第一梯队,腾讯Hy3用21B活跃参数就能和旗舰掰手腕。竞争重心正在从"谁最聪明"转移到"谁最能干实事"——Agent生态打通、智能体手机量产、落地服务独立赛道,都指向同一个方向:AI的价值不在模型本身,在于它能不能帮你把事做完。

但同时,信任赤字在扩大。Grok 4.5静默打包代码库、Anthropic发现Claude内部J-Space、端侧AI需要备案合规——模型越强,用户交出的权限越多,对透明度和治理的要求也越高。能力和信任的增长曲线不能持续脱节。

明天WAIC开幕,140场论坛里大部分议题已经不是"模型参数多少"了,而是Agent怎么落地、开源怎么治理、一人公司怎么活——都是关于AI如何真正进入社会运转的具体问题。这可能是今年AI行业最务实的一次聚会。

上海这几天的天气 reportedly 不太好,但AI行业这周的信号密度,倒是足够热了。

上一篇 > 七月政策三连发:工业互联网、平台协同、数据安全如何重塑中小企业数字化赛道
下一篇 > 2026年软件产业"政策大年":千万级奖补、数据安全新规与B2B私有化浪潮