阅读: 293 评论: 0 点赞: 0 发布时间:发布日期:2026-07-26 08:23:26
标签:AI大模型AgentOpenAIAnthropic开源模型
7月25日下午5点17分,OpenAI的API、ChatGPT和Codex三条产品线同时亮红灯。31个服务组件集体报错,整整1小时51分钟后才恢复正常。第三方监测更扎心:自7月9日以来,OpenAI已经连续17天没有出现过"完全正常"的日子。
这一幕发生在AI Agent被各路厂商吹上天的当口,格外讽刺。我们刚把越来越多的业务流程交给Codex写代码、交给ChatGPT做客服、交给API跑核心推理,结果基础设施自己先崩了一地。有人说这是"Agent时代的第一次集体停电",我倒觉得它更像一盆冷水——提醒我们:大模型竞赛的下半场,可能不再是比谁更聪明,而是比谁更稳、更省、更能真的干活。
就在OpenAI掉链子的同一天,Anthropic发布了新一代旗舰Claude Opus 5,定价和Opus 4.8一样,但复杂任务的完成率明显提升;加上Claude Code系统提示词被砍掉80%后性能不变,以及Poolside Laguna S 2.1等开源模型开始反击,7月末的AI格局正在发生几个值得细看的转向。
这次宕机不是单一服务挂了,而是API、ChatGPT、Codex三条线同时垮。对企业用户来说,这意味着什么?
如果你的CI/CD流水线依赖Codex自动生成代码并提交,那这一个多小时里,发布窗口可能被直接堵死;如果你的客服系统接的是OpenAI API,那高峰期用户的问题只能堆在队列里;如果你在跑一个长链路的Agent任务,比如让AI自动整理财报、写研究报告,那任务中断后恢复的成本可能比人手动重做还高。
更麻烦的是,这已经不是偶发事件。第三方监测显示OpenAI连续17天没有完全正常,说明其基础设施的稳定性正在系统性地承压。原因不难猜:用户量爆炸、Agent长任务占用资源、多产品线共享底层集群。当Codex这种需要持续上下文和长时运行的Agent服务规模化后,它对系统架构的要求和传统API调用完全不同。
我个人判断,这次事件会加速两个趋势:一是企业开始把"多云多模型容灾"从PPT里的架构图变成真实预算;二是Agent运行时的可观测性和任务断点续跑能力,会成为新的竞争高地。毕竟,一个会写代码但随时可能掉线的AI,和一个写得稍慢但能稳定交付的AI,企业最终会选择后者。
Anthropic在7月25日发布的Claude Opus 5,乍一看没有Fable 5那么惊艳。在CursorBench 3.2最高努力等级下,它距离Fable 5只差0.5%,但单任务成本只有后者的一半。输入5美元/百万Token、输出25美元/百万Token,价格和Opus 4.8持平。
但真正值得注意的不是跑分,而是它反复强调的"任务完成率"。Anthropic官方展示了一个案例:面对一张不能直接查看的机械零件图,Opus 5自己写计算机视觉处理流程,从原始像素里提取几何信息,最后重建出3D FreeCAD模型。同样条件下,其他模型连续尝试五次都没完成。
另一个案例更贴近日常开发:在一个真实的开源软件Bug修复任务中,Opus 5不仅找到根因,还修复了社区补丁遗漏的边界情况;而对比模型只修了表面症状就宣布完成。这种"把事情做完"的能力,比单纯在榜单上多几个百分点对企业更有价值。
搭配上90%的提示词缓存节省和50%的批处理折扣,Opus 5的打法很清晰:不跟你拼极限性能,而是在"单位美元能搞定多少复杂任务"这个维度上建立优势。说实话,这个方向我更看好——因为企业买单的逻辑从来不是"你是不是最聪明",而是"我花的钱能不能把活干成"。
随着Opus 5一起被披露的,是Claude Code系统提示词被删减了超过80%,但编码评估成绩没有下降。这件事听起来像技术细节,其实是一个挺大的范式信号。
过去一段时间,大家做Agent和复杂提示词时,普遍倾向于往上下文里塞尽可能多的信息:项目文档、历史记录、代码库结构、最佳实践、公司规范……好像Prompt越长,模型就越懂。但Anthropic现在给出的结论是:高绩效团队应该把CLAUDE.md控制在60行以内,用Skill承载特定任务上下文,让模型在需要时再加载。
他们甚至做了一个/doctor命令,自动帮用户给提示词"瘦身"。背后的逻辑是,过多的上下文会稀释模型的注意力,增加干扰,反而降低关键信息的提取效率。这跟软件开发里的"关注点分离"是一个道理——不是信息越多越好,而是信息在正确的时间出现才最好。
这个转变对企业落地尤其重要。很多公司做Agent时第一个动作就是整理一本厚厚的"企业知识库"往模型里塞,结果模型要么找不到重点,要么被过时的信息带偏。未来更可能的做法是:把大段知识切成可组合的Skill模块,让Agent根据当前任务动态调用。这会让Agent架构从"胖上下文"走向"轻上下文+模块化工具"。
闭源大厂互相较劲的同时,开源侧也没闲着。7月22日,Poolside发布了Laguna S 2.1,一个118B参数的MoE编程模型,每Token只激活8B参数,却能在Terminal-Bench 2.1的agent harness上拿到70.2%。更夸张的是,它的NVFP4量化版可以跑在单张NVIDIA DGX Spark或者Mac Studio上。
这意味着什么?意味着以后一台工作站就能跑一个接近前沿水平的代码Agent。对于不想把核心代码送到云端、或者对数据隐私敏感的企业来说,这种模型几乎是量身定做的。Poolside的融资也反映了资本的态度:NVIDIA领投,估值120亿美元,累计融资约20亿美元。他们把这个开源模型明确定位为"对抗中国AI实验室在编程助手领域扩张"的武器。
同一天,NVIDIA还发布了Nemotron-3 Embed系列嵌入模型,8B版本直接登顶RTEB检索榜,1B版本在保持紧凑体积的同时把错误率降低了27%。嵌入模型听起来没有生成模型那么性感,但它决定了RAG和Agent记忆的检索质量天花板。这个领域的突破,会让企业知识库问答、代码库检索、Agent长期记忆等场景变得更好用。
再加上OpenAI终于在7月下旬签署了由英伟达、微软、Meta牵头的《开放权重与美国AI领导力》公开信,签署方从25家增至35家,开源阵营的声量正在明显上升。Anthropic仍然缺席,但战场已经不只是闭源vs开源这么简单,而是"谁能先把自己的模型塞进企业的真实工作流"。
如果把7月末这几件事串起来看,AI大模型行业正在经历一次悄然的重心转移。
上半年的主角是参数、跑分和发布会;下半年的开场白变成了宕机、成本和落地。OpenAI的三线齐崩说明,再强的模型也扛不住基础设施的脆弱;Claude Opus 5和上下文工程的转向说明,企业更在意的是"能不能稳定地把事情做完";开源模型的精准卡位则说明,企业客户正在从"试用最新模型"转向"把AI放进真实环境"。
说句实话,我现在看到"最强模型"这类标题已经有点审美疲劳。真正决定下一个两年格局的,不是谁在某项评测上多拿了几分,而是谁能让Agent在长任务里不崩溃、在复杂任务里不偷懒、在企业系统里不出事。换句话说,AI竞争正在从"智力竞赛"变成"可靠性竞赛"。
对企业来说,这意味着选型标准要更新了:除了看跑分和价格,还要看服务的稳定性、模型的可解释性、任务中断后的恢复能力,以及数据能不能留在本地。热闹会过去,但最后留下来的,一定是那些能让人放心把活交给它的AI。