
这不是一张普通的排行榜,而是Next.js亲自出题、在真实开发环境里打出来的成绩单。
2026年7月17日,Vercel首席执行官吉列尔莫·劳赫(Guillermo Rauch)公布了公司自研的Next.js评估结果。月之暗面(Moonshot AI)的Kimi K3,以92%的任务成功率、199.89秒的完成时间,击败了Anthropic的Claude Fable 5和OpenAI的GPT 5.6 Sol,在这项针对真实编程场景的基准测试中拿下首位。
劳赫在公告中明确强调,这是开源模型首次在该基准测试中取得领先,并将其定性为一个"值得公开强调的信号"。
同样的准确率,更短的时间,差距就藏在这里
这次测试的数字,乍看之下不那么戏剧性,三款顶级模型的成功率都是92%,差距几乎不存在。但时间栏的数字,把故事讲清楚了。
Kimi K3搭配OpenCode框架完成任务,用时199.89秒。Claude Fable 5在Claude Code框架内运行,耗时233.93秒。GPT 5.6 Sol在Codex框架内运行,用时231.83秒。
也就是说,Kimi K3在完成同等质量任务的情况下,比两个顶级闭源对手快了大约15%到17%。
在编程助手的实际使用场景中,速度不是可有可无的指标,它直接影响开发者的工作节奏和工具切换意愿。更快的响应,意味着更流畅的人机协作循环,这一点在多步骤代理任务中尤为明显。
这项评估的设计本身,也值得特别说明。Next.js评估并非一个人为构造的合成题库,而是Vercel面向真实开发工作流设计的测试套件,覆盖从编写全新组件到将旧代码库迁移至更新框架规范的各类任务。所有参赛模型都在Claude Code、Codex、Cursor、OpenCode等真实编程环境中运行,而非在隔离的聊天窗口里回答问题。这种设计让测试结果更贴近开发者的日常体验,也更难被刷分技巧操控。
排名靠后的数据同样值得关注。GPT 5.5 Pro的成功率和Kimi K3相同,但完成每项任务平均耗时771.63秒,是大多数同类模型的三倍以上。用同样的时间成本换同样的准确率,这个性价比上的差距,在大规模生产部署中会被急剧放大。
一份文档,让所有模型都涨了四个百分点
这次评估还有一个细节,低调但意味深长。
Vercel在测试中为部分模型配置了AGENTS.md文件,这是一份书面说明,向AI代理介绍代码库的结构规范和约定。加上这份文档后,Kimi K3、GLM 5.2、Claude Opus 4.8、Grok 4.5等几乎所有模型的成功率都从92%跃升至96%,提升幅度相当一致。
唯一的例外是GPT 5.6 Sol,加上AGENTS.md后成绩依然停在92%,没有变化。
这个现象指向一个值得深思的分歧:大多数模型对外部上下文文档的依赖度较高,提供清晰的代码库说明能显著改善其表现;而GPT 5.6 Sol似乎更多依赖自身对代码库的推断能力,对外部指引的响应不那么敏感。这两种设计思路,代表了当前AI编程助手的两条不同技术路线,各有其适用场景和局限性。
劳赫也坦言,即便是最强的模型,在无人协助的情况下成功率仍只有92%,有文档辅助时也只能到96%,没有任何模型达到100%。这个上限,是目前整个行业在复杂真实任务上共同面对的天花板,与具体的模型选择无关。
Kimi从K2到K3:中国开源AI的追赶轨迹
这次测试结果,放在月之暗面过去一年的产品节奏里看,会更有意思。
Kimi K2在一年多前发布时,就被业界定位为当时最强大的开源模型,在SWE-Bench Pro等主流编程评测中与顶级闭源模型并驾齐驱。此后的K2.5、K2.6、K2.7 Code版本持续迭代,每个版本都在缩小与OpenAI、Anthropic之间的能力差距。如今K3在Vercel的真实开发场景评测中拿下第一,是这条追赶曲线的最新标注点。
更具战略意义的背景是:Kimi K3是一个开放权重模型,开发者可以直接调用或部署,无需支付昂贵的API调用费用,也不受单一供应商的平台约束。当一个开源模型在真实编程任务上与最好的闭源系统持平甚至更快,开发者在工具选择上的逻辑就会发生改变。
劳赫选择公开强调这一结果,并非偶然,他看到的,是开源AI的竞争力正在从"够用"变成"更优"的那个临界点。


