2026 年 9 月 10 日,AI 产业的消息密度被我从业十几年来最罕见的一次"同日三连发"打得有点闷。先是 OpenAI 宣布调用一万个协调型 AI 智能体,用 88 小时完成 Navier-Stokes 千禧难题的解析证明与 Lean 形式化;紧接着 Apple 召开秋季发布会,库克之后的特努斯首秀带来基于 Apple Intelligence 的全新 Siri AI;同日 Meta 在美国正式上线个人代理 Muse,并配套独立的云端安全虚拟机;京东则在云大会上甩出企业 AI 全家桶 JoyWork。下午还有 DeepSeek 把 Flash 系列输出价再砍百分之六十,OpenBMB 推出 MiniCPM5-2B 边缘模型,Inception 的 Mercury 2.5 扩散语言模型宣称每秒钟能吐 1107 个 token。
这三条主线看起来各管各的数学证明、终端、企业级、推理成本,但它们其实指向同一个底层逻辑:AI 正在从"会回答"跨过"会执行、再跨过"会证明"的门槛。我打算用今天的篇幅,把这三件事串起来聊聊,看看南宁的同行能从中抓到哪些产品化机会。
先说最重磅的那条主线。OpenAI 9 月 9 日通过官方页面宣布,借助新一代推理模型与一万个协调运行的 AI 智能体,在 88 小时内完成了 Navier-Stokes 千禧难题的解析证明,并把整个证明在 Lean 形式化系统中重写一遍。这道题我从读研那年起就反复在流体力学课本上看到,是克雷数学研究所七大千禧难题之一,悬了 90 年都没人能给出"光滑解在有限时间内崩溃"或"光滑解永远存在"的闭合回答。
关键不在"答案是什么",而在"怎么做"。一万个智能体显然不是用来看热闹的,它们各自承担不同的子任务:有的负责把原始证明草稿翻译成形式化语句,有的负责审查每一步推导是否引用了合法前提,有的负责检索文献库对比外部独立证明,还有的负责在 Lean 定理证明器里反复执行直到无 unproven 目标。整套机制像极了我们做大型软件项目时的"分布式编译+同行评审"流程,只不过把"人类审稿人"换成了另一群模型。
消息一出,菲尔兹奖得主 Jacob Tsimerman 几乎是同一周就宣布创办 Mathematical AI Safety Institute,目标是把 AI 用于数学证明这件事的安全边界全部形式化,避免出现"用未授权训练数据证明未授权猜想"这类新风险。这其实反映出业内更深层的不安:模型既然能解千禧难题,是不是也能批量伪造证明?Simon Willison 在他的分析里直接点出,"是否用过对家用户私聊数据训练"这种数据来源争议才是接下来要打的真正硬仗。
对南宁本地的 AI 团队来说,这条主线最大的启发不在"我们去复制一个千禧难题证明",而在"我们能不能用类似的多 Agent 协同机制,把当下的工程难题拆给模型来啃"。模型微调、数据清洗、长报告撰写这类高耗时任务,正是这套范式的天然舞台。
如果说主线一是"AI 能不能硬刚数学",那主线二就是"AI 能不能硬刚你的一天"。9 月 10 日这一天,三家头部公司几乎同时把"个人/企业 AI 全家桶"摆上了台面。
先看 Apple 这一头。新 Siri 基于 Apple Intelligence 升级,主打屏幕理解、图像识别和跨 App 操作,发布会上演示了"说一句指令,让 Siri 帮你把昨天那张发票截图整理成报销表并自动填进 Numbers"这种全流程场景。硬件层面,新机也首次支持 Apple Pencil,并搭载识别 AI 生成图像的 SynthID 标准。值得注意的是,官方明确标注"首发不支持中国大陆",国行用户需要等 iOS、macOS 27 系统后续推送。这意味着在南宁做企业级 AI 落地的同行,短期内还是要靠本土方案服务客户。
再看 Meta 的 Muse。它走的是另一条路线:默认你授权它接管 Gmail、日历、支付和智能家居。每个用户配一台独立的 Muse Secure VM 云虚拟机,即便你关掉 App 它也能在后台执行,Sentinel 系统负责审查敏感操作,必要时跟用户进行二次确认。订阅分每月 20 美元和 100 美元两档,扎克伯格明确表态"Muse 不是聊天机器人,是能替你下决策、订行程、买机票的代理",长期甚至会从代理促成的交易中抽取佣金。这等于把"AI 助理"这四个字直接拉到"AI 经纪人"层面。
第三家是京东,在 2026 京东云大会上甩出企业 AI 全家桶 JD JoyWork。它包含超级 AI 助手"万能博士"、AI 原生工作平台 JoyDesk、智能体平台 JoyAgent,以及接入京东自研大模型、多模态模型、语音模型、数字人模型以及京医千询、物流超脑、政务大模型、工业大模型等全套垂直行业模型,企业客户还能按需接入智谱、DeepSeek 等外部模型。
三家路线怎么对比?我列一下要点:
对南宁本地的同行来说,京东这套打法里藏着我们最该学习的几个点:一是把模型能力封装成可拼装的乐高,而不是做一个"全能力模型"硬扛;二是把垂直行业模型和通用模型做成路由层,让客户按需调用;三是把"AI 工作平台"这件事直接当成 SaaS 卖,而不是把模型当成 API 卖。这是中国企业接下来两年最现实的商业化路径。
第三条主线是技术派最关心的:扩散架构的大语言模型,正在悄悄成为下一代推理范式的候选者。
Inception 9 月 9 日正式发布 Mercury 2.5,主打"扩散式语言生成"——也就是说不按 token 顺序逐字预测,而是并行合成整段文本。官方数据显示 Mercury 2.5 在标准硬件配置下生成速度可达每秒 1107 个 token,上下文窗口拓展到 260K,并采用了较为激进的低价上市策略。我之前在产品公众号里写过,自回归大模型在数学推理、代码补全之外,长上下文摘要这一类任务上一直被吞吐卡脖子,扩散架构如果能把成本打到自回归模型的十分之一,企业 RAG、知识库、长报告批处理的成本结构会被重写。
同一天,OpenBMB(面壁智能)也推出了 MiniCPM5-2B,主打终端侧部署。它在 Artificial Analysis Intelligence Index 4B 以下参数赛道拿到了第一名 23 分,Agentic Index 也拿下 20 分,原生支持 vLLM、SGLang、llama.cpp 三大主流推理框架。这意味着开发者既可以在数据中心用英伟达卡跑高并发,也能直接用 Mac M 系列芯片或消费级显卡跑本地小模型。
第三件事是 DeepSeek 把 Flash 系列的输出价直接砍掉百分之六十,闲时每百万 token 输出定价压到 4 元,输入缓存命中 0.02 元,未命中 1 元。公告里同步预告 V4.1 Flash 性能、费用、速度全面超过 V4 Pro,所有 V4 Pro 请求会在 V4.1 正式发布后自动路由到新版本。也就是说,9 月 10 日中午十二点之后,V4 Pro 事实上变成了一条 V4.1 Flash 的影子路线,定价策略清晰得不像临时决定。
把这三件事串起来看,趋势就清楚了:推理侧正在以"扩散模型 + 边缘小模型 + 极致低价"三条腿走路。对南宁做模型微调的客户来说,最该抓住的机会是——把现有的企业内部数据按"短任务→边缘 MiniCPM、长任务→V4.1 Flash、批量推理→Mercury 2.5"做分层路由,单次调用的综合成本能再砍百分之四十以上。千万不要把预算压在一个"全能力大模型"上,性价比会越来越糟糕。
把这一天的三件事串起来,我看到的底层信号其实是"AI 的三个梯度同时在加速"。
第一梯度是能力跃迁,从会回答到会证明,OpenAI 把多智能体协同推到数学证明这个天花板最高的位置;第二梯度是场景接管,从会聊天到会代理,Siri、Muse、JoyWork 三家同台把"AI 工作平台"这件事正式变成可计费产品;第三梯度是成本结构,从"按 token 计费"到"按任务 SLA 计费",扩散模型、边缘模型、降价策略三管齐下,把单次推理成本压到原有水平的几分之一。
具体到广西本地,南宁同行眼下能落地的优先级,我自己的排序是这样的:第一,先用京东 JoyWork 这类全家桶做企业试点,把模型可插拔的概念打进客户认知;第二,对长文本批处理、知识库重建这类任务,提前规划向 V4.1 Flash 或者 Mercury 2.5 这类新型推理架构迁移;第三,把模型微调的能力拆细,按场景封装成标准 SKU 卖,而不是按"工时 + 模型 API 成本"算账。
南宁大模型这盘棋,正在从"拼参数"彻底转向"拼路由、拼工作流、拼场景深度"。这一天三条主线摆在一起,算是把这个转向的最强信号给点明了。