阅读: 188 评论: 0 点赞: 0 发布时间:发布日期:2026-07-27 08:23:55
标签:AI大模型Kimi K3DeepSeekClaude Opus 5开源AI
今天是7月27日。按月之暗面的承诺,Kimi K3的完整模型权重会在UTC时间零点——也就是北京时间今天早上八点——在HuggingFace上公开下载。2.8万亿参数,Modified MIT许可,权重文件1.4TB。人类历史上参数量最大的开源模型,从今天起可以免费拿走。
同一天,彭博社报道DeepSeek暂停了740亿美元估值的第二轮融资。直接原因说出来有点荒诞:创始人梁文锋对第一轮投资者会议上泄露的言论不满,一怒之下叫停了谈判。而就在两天前的7月24日,DeepSeek V4稳定版刚正式上线,旧API别名全部停用。
再往前推三天,Claude Opus 5在7月24日发布后48小时,多家独立评测机构交出了成绩单:Frontier-Bench超过自家旗舰Fable 5,IMO 2026数学奥赛满分42/42,但代码审查精度只有26.4%——"更多推理不一定更好"。
三件事撞在同一天附近,不是巧合。它们恰好标记了AI大模型竞争的三个关键变量:开源能走多远、资本还信不信、半价能不能打仗。
先说K3开源这件事本身。2.8万亿参数,896个专家中每个token激活16个,MXFP4量化下权重文件约1.4TB。Modified MIT许可意味着商用基本没有限制,月之暗面还同步贡献了vLLM KDA prefill cache实现——这是他们自研的混合线性注意力方案,能让长文本缓存的内存消耗大幅下降。
但开源社区等的不只是权重文件。独立测试机构已经跑出了月之暗面官方benchmark里没提的数字:K3的幻觉率高达51%。这个数字如果在大规模开发者自部署后被验证,会直接影响企业用户的信任度。一个能写代码但有一半概率编造事实的模型,在生产环境里是定时炸弹。
更尖锐的争议来自白宫。7月23日前后,白宫科技政策办公室主任Michael Kratsios公开指控月之暗面通过大规模隐蔽蒸馏Anthropic的Fable模型来训练K3,声称他们开发了一套复杂的内部平台在不同接入方式间切换以逃避检测。月之暗面方面没有正面回应这个指控。
说实话,蒸馏这件事在AI行业从来不是秘密——大家都从彼此的模型输出里学东西。但白宫级别的公开指控,把技术争议上升到了地缘政治层面。如果后续有实质性制裁措施,K3的开源红利可能被政治风险对冲。
对企业用户的实际影响:K3权重开源后,自部署意味着数据不再经过第三方服务器,这是API永远给不了的数据主权保障。但1.4TB的显存需求意味着只有多卡服务器节点才能跑——单张H100的80GB显存远远不够。
DeepSeek这轮融资暂停的故事,说到底是一个创始人公关意识的问题。
先理一下时间线。5月底,DeepSeek完成首轮外部融资,总额510亿人民币(约74亿美元),投后估值近4000亿人民币。腾讯、宁德时代、京东、网易、IDG资本等参投,国家人工智能产业投资基金战略跟投。创始人梁文锋通过直接持股和员工持股平台合计控制约84%的股权。
7月,DeepSeek启动第二轮融资,目标投前估值约710亿美元(约5000亿人民币)。按这个估值,DeepSeek的市值将超过大部分上市AI公司。然后,7月25日,彭博社报道融资暂停。
原因很"梁文锋":第一轮投资者会议上的一些言论被泄露到社交媒体上,梁文锋对报道内容不满,口头通知部分投资者暂停谈判。彭博的报道强调,谈判仍然开放,DeepSeek可能后续恢复融资。同时路透社此前报道DeepSeek已开始为上交所科创板IPO做准备。
我其实觉得这件事暴露的不只是创始人的脾气。它说明中国头部AI公司在资本市场的定价权正在形成——DeepSeek不是"求人给钱",而是"我决定什么时候拿钱、拿多少"。740亿美元的估值如果最终确认,意味着一家成立三年的公司在不含上市公司壳价值的情况下,市值已经超过了不少老牌科技公司。
产品侧,V4稳定版7月24日已上线。V4-Pro(1.6万亿参数/490亿激活)和V4-Flash(2840亿参数/130亿激活)成为新默认,旧API别名正式停用。Artificial Analysis同口径评测显示,K3完成一次加权评测任务平均花费0.94美元,V4 Pro仅约0.04美元——相差约23.5倍。DeepSeek瞄准的从来不是性能天花板,而是成本地板。
Claude Opus 5发布后48小时,评测数据终于铺开了。Anthropic的定位很清楚:用Opus 4.8同款价格($5/$25),拿到接近Fable 5($10/$50)的性能。半价,追前沿。
先看好消息。BuildFast的评测显示,Opus 5在Frontier-Bench v0.1上得分43.3%,超过了自家旗舰Fable 5的33.7%——这有点反直觉,便宜的反而更强。ARC-AGI-3新问题解决得分30.2%,是GPT-5.6 Sol Max(7.8%)的近四倍。IMO 2026数学奥赛,满分42/42。Vellum的分析指出,Opus 5在自动化基准(AutomationBench 26.0%)和浏览任务(BrowseComp 90.8%)上全面领先。
但CodeRabbit的代码审查测试给了一个不太好看的结论。他们发现"更多推理不一定产生更好的审查结果"——Opus 5在默认配置下确实找到了最多问题,但精度降到了26.4%,一次审查生成了110条nitpick(吹毛求疵的意见)。换句话说,它很勤快,但不太靠谱。
这其实指向一个更深层的问题:大模型的"推理努力"参数(reasoning effort)不是万能旋钮。调高了,模型会花更多时间想,但想多了反而开始过度解读、无中生有。GPT-5.6 Sol在DeepSWE编程和HealthBench Pro上仍然领先Opus 5,说明不同任务的最优配置不一样。
对企业的实际启示:别被"半价追前沿"冲昏头。Opus 5在知识工作和浏览任务上确实强,但如果你要的是精准的代码审查或医疗分析,它可能不是最优选择。价格是选模型的起点,不是终点。
除了K3和DeepSeek,开源生态还有几个值得注意的新变量。
第一,Poolside在7月21日发布了Laguna S 2.1。118B总参数,8B激活,MoE架构,在Terminal-Bench上以75.2%击败DeepSeek V4 Pro的74.8%——而体积只有V4 Pro的十四分之一。更关键的是,量化后能在单张80GB GPU上运行。OpenMDW-1.1许可,商用基本无限制。
这件事的意义在于:它打破了"大模型才能打"的迷思。Poolside用RLCEF(代码执行反馈强化学习)训练,让模型在训练过程中真正运行代码来学习,而不是简单模仿代码模式。118B的体量击败1.6万亿参数的V4 Pro,说明训练方法论可能比参数规模更重要。
第二,谷歌Gemini主力模型跌出全球前十。Artificial Analysis智能指数v4.0榜单上,Gemini 3.6 Flash排在第11位。前十名被Claude全系、GPT-5.6全系、Kimi K3、Grok 4.5、GLM-5.2和Muse Spark 1.1占据。旗舰版Gemini 3.5 Pro再次缺席,谷歌在Pro层级上已经落后一代。
谷歌也不是没有动作。Gemini 3.6 Flash内置了计算机操控能力(OSWorld 83.0%),知识截止从2025年1月跳到了2026年3月——14个月的跨度,意味着大量新的网络事件进入了模型的参数记忆。输出价格从$9降到$7.50,生成同等内容所需的token数还减少了17%。同时谷歌确认Gemini 4预训练已经开始,称之为"最具野心的预训练运行"。
但从"发布即领先"到"追赶者"的身份转变,对谷歌的AI叙事是一个结构性打击。当你的主力商用模型排不进前十,客户选型的时候你就很难出现在shortlist上。
第三,中国开源模型在全球的渗透速度在加快。Hugging Face上中国开源模型的月下载占比已达41%,首次超过美国的36.5%。OpenRouter数据显示,过去一年中国大模型在全球市场的token消耗占比增长了421%,今年初已逼近三成。阿里通义千问系列占全球开源模型下载量的50%以上,累计接近10亿次。
第一,开源模型已经摸到了性能天花板。K3在Arena编程榜登顶、Poolside S 2.1在Terminal-Bench击败V4 Pro,这些不是实验室数字,是独立评测的真实结果。但"开源等于便宜"的等式正在松动——K3的API定价已经接近闭源同级模型,1.4TB的部署门槛也不是小公司能扛的。企业选型时要算总账:API调用成本加数据隐私需求加部署硬件成本。
第二,成本分化正在加剧。K3单次评测任务0.94美元,V4 Pro只要0.04美元;Opus 5半价追Fable 5,但Fable 5的价格是Opus 5的两倍。不同模型之间的成本差距可以达到23倍以上。对高频调用场景来说,选错模型的代价不是"贵一点",而是"贵一个数量级"。
第三,推理努力不是越多越好。Opus 5的代码审查精度降到26.4%说明,盲目调高推理参数反而会产生更多噪音。企业部署时应该按任务类型调优:知识工作和浏览任务可以放心用高推理模式,代码审查和医疗分析需要找到精度和召回的平衡点,而不是一味追求"想更多"。
7月27日这个节点,K3开源权重落地、DeepSeek融资按暂停键、Opus 5评测定调、Poolside用小模型打大模型——四件事指向同一个结论:AI大模型的竞争,已经从"谁更强"变成了"谁更会用"。