Article
Kimi K3:我更在意它愿不愿意承认自己还不够好

大模型发布这件事,最近已经有点像看赛车刷圈速。
新的参数,新的榜单,新的上下文长度。每一项都能写成很大的数字,配上很满的图表。看久了,人的反应会变得迟钝:好,知道了,又快了一点。
Kimi K3 也有足够让人停一下的数字。2.8 万亿参数、原生视觉、100 万 token 上下文。月之暗面把它放在“开放的 3T 级模型”这个位置上,目标很明确:长时间写代码、做知识工作、推理。这些词都不新,但堆到同一个模型上,分量还是不一样。
我对它的第一反应却不是“终于有个更大的开源模型了”。反而是发布说明里那几句不那么像发布会的话。
官方直接写了:K3 的整体表现仍然落后于最强的闭源模型;它在任务里可能太主动,遇到一点模糊的意图就替用户做决定;在使用体验上,和顶级闭源模型也还有距离。
这当然不是谦虚。做过 agent 的人都知道,“太主动”有时比“没做完”更麻烦。
一个模型停在那里等你确认,最多是耽误时间。另一个模型自信地替你往下走,改了不该改的文件、选了不该选的方案,甚至把一句含糊的话理解成授权,后面要花的时间通常更多。能力变强之后,边界感反而变成一件更具体的事。不是提示词里写一句“请谨慎”,而是它到底会不会在该停的时候停下来。
K3 的技术路线也挺有意思。它不是单纯把模型做大,而是在注意力结构和 MoE 的稀疏激活上继续挤效率。官方给出的说法是,在 Stable LatentMoE 下,896 个专家里每次激活 16 个;相较 K2,整体 scaling efficiency 约提升 2.5 倍。用户未必需要记住这些名词,但可以把它理解成一件朴素的事:模型公司也开始认真算账了。不是只问还能烧多少卡,而是问同一份算力到底能换来多少有用的判断。
100 万 token 也一样。它最吸引人的地方,不是终于可以把一座图书馆塞进对话框。真正难的是,东西塞进去之后,模型还记不记得自己在做什么。
长上下文并不自动等于长任务。一个任务持续几小时,往往不是因为材料多,而是因为中间有选择:先改哪一处,哪条日志值得信,哪些问题需要回头问人。模型如果只会把旧内容留在窗口里,它更像一个容量很大的收纳箱。能把前面的约束带着往下做,知道什么时候暂停、什么时候交还控制权,才比较接近我们想象中的工作伙伴。
Kimi K3 把“长周期 coding”放在很显眼的位置,我觉得这比任何单项 benchmark 都更值得观察。代码 agent 走到今天,短任务已经不稀奇了。写一个页面、补一个函数、跑一次测试,很多模型都能给出像样的第一稿。真正拉开差距的,是连续工作之后还会不会跑偏:前面定下的接口有没有忘,修一个 bug 有没有顺手拆掉别的东西,发现信息不够时会不会硬猜。
这些问题听上去不够酷,也不适合做海报。但用过的人都知道,它们决定了工具最终是“偶尔很惊艳”,还是“真的敢交给它一段下午”。
我还没把 K3 扔进一个足够长的真实项目里,所以现在谈结论太早。官方说完整权重会在 7 月 27 日前释出,技术报告也会随后公开。到那时,比起再看一轮营销图,我更想看两件事:社区能不能把它稳定地跑起来,以及普通人能不能在不写一大段防呆规则的情况下,把它放进真实工作流。
模型越大,大家越容易讨论它像不像人。我反而觉得,接下来更该讨论的是它像不像一个靠谱的同事。
不是永远抢着回答的那种。是知道自己会什么,也知道什么时候该停下来问一句的那种。
文中参数、架构与发布时间信息来自 Kimi K3 官方发布页,发布页注明完整权重计划于 2026 年 7 月 27 日前释出。