阅读: 357 评论: 0 点赞: 0 发布时间:发布日期:2026-07-15 08:23:00
标签:AI大模型GPT-5.6OpenRouterClaude Code智能体
7 月 10 日,OpenAI 正式向全球推送 GPT-5.6 系列模型,旗舰版 Sol、均衡版 Terra、轻量版 Luna 三档齐发。美国商务部这次罕见地快速放行,标志着前沿 AI 监管至少在这一刻出现了实质松动。
但真正让业界震动的不是发布本身,而是一个数学事件。7 月 12 日,OpenAI 公布了一段演示:GPT-5.6 Sol Ultra 模式在不到一小时内,生成了图论领域"循环双覆盖猜想"的完整证明。这个猜想困扰了数学界 50 多年。演示中,Ultra 模式调动了 64 个并行子智能体协同工作,还专门设置了一个"对抗智能体"负责找漏洞,等于让 AI 自己审自己的作业。英国曼彻斯特大学数学家 Thomas Bloom 评价这份证明"非常漂亮"。虽然还没经过正式的同行评审,但这个信号已经足够清晰——大模型正在从"做题家"向"研究者"跃迁。
定价方面,Sol 每百万 token 输入 5 美元、输出 30 美元,Terra 砍半到 2.5 美元和 15 美元,Luna 更是压到 1 美元和 6 美元。Terra 性能可以对标上一代 GPT-5.5,但价格只有一半。这种"性能升级 + 价格腰斩"的打法,直接把压力传导到了整个市场。同步推出的 ChatGPT Work 是一个值得注意的产品——定位类似 Claude Cowork 或 Kimi Work,可以连接 Slack、Gmail、云盘和企业数据库,连续工作数小时处理文档、表格、PPT 和网站生成。Codex 也正式合入 ChatGPT 桌面应用,不用再在两个客户端之间切来切去了。
7 月 12 日,工业和信息化部网络安全威胁和漏洞信息共享平台发布了一条风险提示,措辞直白:美国 Anthropic 公司旗下 AI 编程工具 Claude Code 存在安全"后门"隐患,可在用户不知情的情况下收集敏感信息,危害严重。受影响版本覆盖 2.1.91 至 2.1.196,建议立即卸载或升级至已清除后门代码的最新安全版本。
阿里巴巴反应最快。7 月初就发了内部紧急通知,要求全体员工在 7 月 10 日前卸载 Anthropic 全系产品——不只是 Claude Code,还包括 Sonnet、Opus、Fable 等多个模型系列,统一替换为自研智能体编程平台 Qoder。这件事的严重性在于,它不是某一家企业的合规动作,而是工信部以国家网络安全平台名义正式定调,等于给所有国内企业提了个醒:用国外闭源 AI 工具,你的代码和数据可能随时暴露。
与此同时,Claude Fable 5 的访问权限第三次被延长到 7 月 19 日,Claude Code 的每周速率限制也提高了 50%。官方说法是"产能充足后会重新纳入订阅",但连续三次延期多少透露出供应侧的紧张。Anthropic 在企业端积累的合规口碑,因为这次后门事件被撕开了一道口子。安全这东西,一旦信任裂了,修复起来比技术迭代慢得多。
7 月 13 日凌晨,OpenRouter 更新了新一周的全球大模型调用排行榜。这份榜单真实反映了全球开发者"用脚投票"的结果,而这一周的数据,足以让整个行业重新审视中国模型在全球生态中的位置。
几个数字:全球周 Token 调用量突破 54.6 万亿,环比增长 12.6%。其中中国贡献了 27.58 万亿 Token,环比增长 17.61%,连续七周增长,是美国的 4.36 倍,连续 11 周超过美国。榜单前六名全部来自中国:腾讯 Hy3 免费版以 6.13 万亿 Token 空降登顶,终结了 DeepSeek 长达七周的冠军纪录;小米 MiMo-V2.5 以 5.95 万亿紧随其后,距榜首仅差 0.18 万亿;DeepSeek-V4-Flash 5.22 万亿、MiniMax M3 4.26 万亿、智谱 GLM 5.2 发布不满三周以 3.19 万亿杀入前五、阿里 Qwen 4.1 235B 以 2.87 万亿排名第六。
有意思的是,美国企业使用中国模型 Token 的占比自 2026 年 2 月起稳定超过 30%,最高触及 46%。英伟达 Nemotron 3 Ultra 首次上榜第八名,推理成本仅为头部闭源模型的十分之一。腾讯 Hy3 这次登顶不只是"免费策略"的结果——Hy3 采用 MoE 架构,295B 总参数、21B 激活参数,256K 上下文,Apache 2.0 开源,近 50 个腾讯业务接入,Agent 任务解决率达到 90%。这是一款真正有产品力的模型拿到了它在全球生态中的位置。
7 月 13 日晚,上海大模型企业阶跃星辰发布了全球首款大模型原生智能体手机 STEPX Neo。这不是又一台"预装了 AI 助手"的手机,而是搭载了一套完整的 AI 原生操作系统 Step AOS,以及一个叫"阶跃 Amoo"的个人智能体。携程、支付宝、滴滴、美团、百度、京东、剪映等首批生态伙伴已经接入。日常问答的记忆召回最快 15 毫秒,简单任务 100 毫秒内完成,成功率超过 99%。
几乎同一时间,谷歌 DeepMind 发布了 Gemma 4 开源多模态模型。这个模型的设计思路和传统路线完全不同——它彻底抛弃了视觉和音频编码器,直接把原始像素和音频波形投影到大语言模型的统一嵌入空间里,实现了端侧原生的多模态交互。31B 参数版本可以在消费级显卡上运行,性能在主流开源排行榜上位列前三,接近参数规模 20 倍的竞争模型。这种"小参数、高能力"的路线,让端侧 AI 不再是一个概念,而是一个可以跑在你手机上的东西。
国产芯片侧也有突破。上海 AI 芯片创企东方算芯发布了 DF1000 近存计算 3D 芯片,用 14nm 成熟制程实现了 520 TFLOPS 算力和 6.4TB/s 访存带宽,完成了 128 卡集群的全功能稳定运行。不依赖先进制程和 HBM,走的是"架构创新代替制程追随"的路子。同期,魔芯科技联合华为和浙大潘云鹤团队发布的世界模型 MoWorld,14B 参数在华为昇腾 NPU 上实现最高 50FPS 实时推理,推理成本降低约 70%。
这些信号放在一起看,方向很清楚:AI 正在从云端走向端侧,从"调用 API"变成"本地运行"。这对国内中小企业的意义尤其大——不需要高昂的云端 API 费用,一部手机就能跑一个可以帮你订外卖、查行程、写邮件的智能体。
7 月 15 日,《人工智能拟人化互动服务管理暂行办法》正式施行。这个新规的核心是规范模拟人类人格特质、思维模式和交流方式、提供持续情感交互的 AI 服务。简单说,就是给 AI"装人"这件事划了条线。
新规施行的前一天,豆包、通义千问等头部平台同步下线了全部情感陪伴类自定义智能体——AI 恋人、树洞、虚拟闺蜜等角色型 Chatbot 全部清空。工具类和生产力任务型 Agent 被保留。用户在社交媒体上的反应两极分化:一部分人觉得这些功能是情感支撑,下线后产生了强烈的割裂感;另一部分人则认为这是在划定必要的边界。
与此同时,全球数字经济峰会(7 月 2-5 日,北京)上达成的"主体革命"共识也在发酵——几十位中外专家一致认为,大模型正在从"回答问题"走向"完成任务",经济活动的参与者正在从"人"扩展到"自主智能体"。Gartner 预测,到 2026 年底,40% 的企业应用将嵌入 AI Agent;66% 的项目已采用多智能体协作模式。重庆银行接入多智能体平台后,单笔信贷审批从 210 分钟缩短到 15 分钟,降幅 87%。
新规不是要扼杀创新,而是要回答一个绕不过去的问题:当 AI 可以模拟人类情感、建立长期互动关系时,边界在哪里?情感陪伴类智能体的下线是一个信号——监管正在从技术可行性的追问,转向社会可接受性的讨论。
回到这五个信号本身,它们其实在讲同一件事:大模型行业正在从"技术军备竞赛"进入"生态博弈"阶段。GPT-5.6 证明了大模型可以做研究级推理,但 Claude Code 的后门事件提醒我们安全和信任才是企业落地的底线;OpenRouter 榜单上中国模型的集体崛起不是偶然,是开源策略和性价比路线的自然结果;端侧智能体的落地预示着 AI 不再只是云端的 API 调用,而是每个人口袋里的基础设施。
拟人化新规的施行,则为这条赛道上了一条护栏。说实话,这条路还很长,但方向已经非常清楚了。