WAIC第二天Agent走进生产线、大模型竞争换了赛道:7月下旬AI格局五个关键信号

阅读: 166 评论: 0

标签:

WAIC第二天:风向从"模型比拼"转向"能办事"

7月18日,2026世界人工智能大会进入第二天。如果说开幕日的主旋律还是"谁首发了什么模型",那么第二天展会现场传递出的信号要务实得多——AI正在告别零散试点,通过智能体(Agent)这个载体,深度嵌入企业生产运营。我在现场转了一圈,最大的感受是:今年没有人再拿着跑分说事了,所有人都在聊"怎么让Agent真正干活"。

这个转变不是偶然的。过去两周,OpenAI、Anthropic、Google、Meta四家几乎同时亮出了旗舰模型,但它们强调的关键词高度一致——编程、Agent、工具调用、更低的成本。参数规模和基准测试分数退居二线。换句话说,大模型竞争的核心指标正在被悄悄换掉。一个由AI驱动的新生产力阶段,正在进入市场。

把WAIC现场的产业观察和7月中旬的模型竞争格局放在一起看,我梳理出五个值得关注的信号。

信号一:Agent从"能聊天"到"能办事",企业级落地进入深水区

今年WAIC最直观的变化,是展台上的Demo少了,真实业务案例多了。蜜度在大会期间一口气发布了三款面向垂直场景的AI智能体——DataQ数据分析与洞察智能体、模力通办公写作智能体、校对通编校审核智能体2.0,加上文修大模型V5.0,分别落地数据洞察、办公写作和内容审校三个场景。这背后是一个清晰的逻辑:企业需要的不是一个"什么都能聊"的模型,而是能理解行业规则、按专业流程完成任务的系统。

蜜度给出的技术路径是"垂直大模型+智能体+数据飞轮"——垂直大模型负责专业理解,智能体承担流程执行,场景运行反哺驱动迭代。这听起来不新鲜,但真正难的是把专业知识、行业规则转化为模型能稳定调用的能力,再嵌入实际工作流程。DataQ这个智能体让我印象比较深:它能自动完成数据接入、清洗、标注、分析到洞察输出的全流程,还打通了声誉、用户、市场等公域数据和工单、台账等私域数据。对于每天被海量数据淹没却难以转化为洞察的企业来说,这恰恰是痛点所在。

安永在大会期间也发布了两项成果:企业级多智能体协同工作平台"安永诣雅元核引擎2.0",以及"AI人才技能数字勋章"。安永中国主席陈凯的判断是——人工智能已从理论概念加速迈入规模化产业落地阶段。这话从一家咨询巨头的嘴里说出来,分量不轻。他们做的不只是看热闹,而是试图补齐产业智能化转型中的两个短板:多智能体协同决策,以及人才能力评价体系。

信号二:大模型竞争换了赛道,跑分不再是唯一标尺

7月9日,OpenAI的GPT-5.6系列正式全球开放。经历近两周安全审查后,它以三档定价亮相:旗舰版Sol定价每百万Token输入5美元、输出30美元;均衡版Terra折半;轻量版Luna再折半,已经接近智谱GLM-5.2的价格水平。GPT-5.6 Sol在Terminal-Bench 2.1上拿到88.8分,Coding Agent Index 80分领先所有模型,Token使用效率比前代提升54%。OpenAI CEO奥尔特曼特别强调的不是跑分,而是Sol在AI智能体编程任务中的效率提升。

但OpenAI的日子并不好过。Ramp 2026年5月AI指数显示,Anthropic在企业API市场份额上首次反超OpenAI,34.4%对32.3%。Claude Fable 5在SWE-Bench Pro编程评测上以80分大幅领先Sol的64.6%,FrontierMath高难度数学上87.8%对83%。更让OpenAI头疼的是,最大股东微软正在用自研模型悄悄替代其产品。全球大模型市场已形成"四巨头"格局:OpenAI约35%、Anthropic约25%、Google约20%、Meta约10%。OpenAI仍是最大玩家,但领先优势在收窄。

Google这边,Gemini 3.5 Pro在7月17日正式发布,比原计划推迟了两个月。原因是DeepMind放弃了原有基座,对Gemini 3.5 Pro进行全新预训练——在质量和速度之间主动选了前者。这个决策被外界解读为谷歌不愿在质量上妥协。

说实话,把这几家放在一起看,一个趋势已经很清楚了:大模型竞争的核心指标正在从"谁跑分高"转向"谁的Agent更好用、编程能力更强、成本更低"。Scaling Law没有失效,但"Scaling"的对象已经扩展到了整个智能系统——强化学习、推理时计算、上下文管理、工具调用、多Agent协作。Anthropic之所以能在企业市场反超,靠的不是跑分,而是安全对齐路线在企业客户中积累的合规口碑,加上编程和数学两个开发者核心场景的硬实力。

信号三:阿里云AgentNativeCloud,把Agent变成企业原生能力

WAIC第二天最重磅的发布之一,来自阿里云——AgentNativeCloud,翻译过来就是"智能体原生的云"。阿里云云原生应用平台负责人周琦的一句话点明了野心:"下一轮竞争,比的不是谁拥有更多Agent,而是谁能把Agent变成可控、可复用、可协作、会进化的组织资产。"

这套体系分了几层。基础设施层提供了面向Agent场景重新设计的Sandbox,具备原生接入能力、MicroVM/VM级强隔离,以及可缩容到0的长会话低成本与高并发弹性。平台层集成了AgentRun(一站式基础设施平台)、AgentTeams(多智能体治理协作)和AgentLoop(全栈观测与持续优化),围绕Agent生命周期加速构建、治理、评估与优化。Identity、Gateway、Policy等模块让每次操作可归属、每份资产可复用、每次迭代像微服务一样可控。

最让我感兴趣的是实际效果数据:15个Agent组成团队,7×24小时服务海量开发者,处理了85%的答疑量,运营支持时长降低90%,版本发布周期压缩至1天。这不是PPT上的设想,而是已经跑通的真实业务。

阿里云还同步推出了无影AgenticComputer——一个专为Agent设计的桌面级环境。说白了,就是给Agent配一台7×24小时不休眠的"数字工位",长任务不会因为笔记本合盖断网而中断。它提供完整的Windows/Linux桌面,企业现有软件无需改造即可直接运行,覆盖约80%的真实办公场景。安全方面对接6大企业身份源,7层安全闭环覆盖Agent运行时的7大类风险。运维层面单人即可管理千台规模,Token预算全局可视,运维人效提升10倍以上。钉钉等办公IM可以直接@Agent下发指令指挥云电脑——终端完成人机交互,云电脑完成自动执行。

这个产品逻辑我比较认同。Agent走进企业生产工作流,面临的是跨角色、跨系统的复杂需求:开发者关注构建部署速度,安全团队关心权限审计,业务团队在意效果量化,平台团队聚焦稳定性与成本。这不是换一个更强的模型就能解决的,需要端到端的完整方案。

信号四:老系统接口缺失,企业Agent落地的真实门槛

腾讯云副总裁吴运声在WAIC期间与媒体交流了近一个半小时,谈到了一个很少被公开讨论但极其现实的问题:企业部署智能体时,最突出的阻力不是组织流程、数据质量或ROI,而是智能体难以调用已有的信息化系统。

这个痛点太真实了。大量企业的数据和业务流程分散在ERP、CRM及其他老系统中,这些系统很多缺少成熟的API、MCP或CLI接口。企业要上Agent,得先补接口、改系统,Agent才能嵌入业务流程。这意味着Agent落地的成本和周期,很大程度上取决于企业IT历史包袱的轻重。

不过吴运声也提到一个积极变化:今年Agent Loop能力增强后,过去受限于检索和工作流能力的部分任务已经具备落地条件。腾讯云企业智能体相关客户需求和平台使用量今年同比至少翻倍增长。腾讯在WAIC上也密集发布了一波:具身智能方面,首席科学家张正友发布了Hy-Embodied-VLA-0.5、Hy-Embodied-VLM-1.0、Hy-Embodied-RxBrain-1.0三款具身模型,Tairos Agent具身智能体框架与Apexio智能体正式亮相;企业级智能体方面,企业级智能体开发平台ADP 4.0海外版发布,通用桌面智能体WorkBuddy App版本同步上线。

老系统这道坎其实揭示了一个被忽略的事实:现有企业系统多数是围绕人的操作习惯设计的,界面和输出结果主要服务于人。Agent要嵌入这些系统,本质上是把"为人设计的界面"翻译成"为AI设计的接口"。这不仅仅是技术问题,更是企业数字化基建的补课工程。谁的接口更完善,谁的Agent落地就更快。

信号五:给AI发工号——面壁智能开源StaffDeck,数字员工进入管理时代

如果说前面四个信号都在谈"怎么让Agent干活",那第五个信号谈的是"怎么管Agent"。量子位在WAIC报道中描述了一个让很多企业主感同身受的场景:每个看到AI Agent潜力的企业主都尝试过引入业务,希望24小时在线的"数字精英"帮忙降本增效,但现实往往是一顿操作猛如虎,一看落地全是Bug。Agent在PPT里无所不能,进真实业务就变成"职场巨婴"——流程混乱、回答没依据、今天改明天依旧犯。

面壁智能联合东北大学-面壁智能数据智能联合实验室、清华大学THUNLP实验室、OpenBMB与AI9Stars,在WAIC期间正式开源了数字员工全流程构建与管理平台——StaffDeck。它试图解决的正是当前Agent的底层基因缺陷:市面上绝大多数Agent底层依然是聊天机器人逻辑,没有流程的状态机,没有知识的溯源锁,没有自我迭代的闭环。StaffDeck不只让AI承接重复性任务,更试图把分散在人员、文档和业务系统中的知识、方法与流程,转化为可维护、可复用、可持续优化的组织能力。

这个方向我认为值得重视。当Agent从"试点项目"走向"组织资产",管理问题会变得比技术问题更棘手。你怎么给一个AI定KPI?怎么审计它的决策依据?怎么让它"吃一堑长一智"?怎么防止它在不同部门各干各的、重复造轮子?这些问题用传统的IT管理思路回答不了。StaffDeck给了一个开源的起点——把数字员工纳入正式的流程管理框架,而不是让它在各个业务系统里野蛮生长。

结语:竞争的下半场,比的是"复利"

把WAIC第二天的产业信号和7月中旬的模型竞争格局放在一起,我看到的是同一条主线:AI正在从"能聊天、能生成"的早期阶段,跨入"能办事、能执行"的深水区。模型层面,竞争指标从跑分转向编程、Agent和成本;产业层面,企业从"试点一个Agent"转向"把Agent变成组织资产"。

周琦说的一个词我觉得很准——"复利"。一个团队沉淀的Skill和策略可以被下一个场景复用,一次风险发现可以变成全局规则,一次效果优化可以惠及整个Agent群体。当Agent可以被持续构建、严格治理、稳定协作、不断进化,企业获得的就不只是效率提升,而是一套可规模化复制的智能生产力。

但这条路远没有走完。老系统接口的补课工程、数字员工的管理框架、跨系统协同的治理难题,每一个都是硬骨头。好消息是,今年的WAIC让我看到,行业已经开始正视这些问题,而不是用更炫的Demo把它们盖住。这种务实,比任何跑分都值得期待。

上一篇 > 数据安全新规倒计时与中小企业转型窗口:2026年三季度政策密集期解读
下一篇 > 智能体工业互联网开闸:八部门2.5万亿图景下中小企业的"智能平权"三条路径