Kimi K3 发布当天,我拿它和 GPT-5.6-Luna、Claude Sonnet 5 跑了 5 轮硬核编程题——有一类多步推理任务排名和官方宣传完全反过来
上周三 Kimi K3 发布朋友圈被刷屏了。Moonshot 官方宣传说推理能力大幅跃升我当天晚上就把moonshotai/kimi-k3、openai/gpt-5.6-luna、anthropic/claude-sonnet-5三个模型拉到同一套测试框架里跑了一遍。结论先放这儿在单步推理LeetCode Hard 独立题上三者差距没有官方宣传那么夸张K3 和 GPT-5.6-Luna 基本打平但在多步代码修复这个维度上排名和 Moonshot 官方 benchmark 展示的完全反过来——K3 平均需要 4.2 轮才能修到通过GPT-5.6-Luna 只要 2.1 轮Claude Sonnet 5 是 2.8 轮。换句话说如果你的工作流是让 AI 反复改 bug 直到 CI 通过K3 目前并不是最优选。⚠️ 以上轮次数据基于我自用的一套固定测试集有 3 个 bug 的 300 行 Python共 20 组 case测试代码和 bug 样本暂未公开读者目前无法独立复现。如有需要我会整理后发 GitHub届时补链接。评测维度我选了 5 个维度温度全部设为 0每个维度跑 20 组 caseLeetCode Hard 通过率随机抽取 20 道题题目来源和具体编号见文末说明多轮代码修复轮次给一段有 3 个 bug 的 300 行 Python看几轮能全修对长上下文召回准确率在 80K token 上下文中插入 5 个关键事实问答召回首 token 延迟P50 / P95通过 统一网关调用排除网络差异单次调用成本按 ofox 模型目录 2026 年 7 月 3 日价格快照计算原始页面截图存档于文末 关于第 1 维度LeetCode 题目编号和来源已记录在本地但考虑到版权问题未全文转载如需复现请参考文末的题号列表自行获取原题。第 4 点我本来想直连各家官方 API 测但三个厂商链路不一样延迟对比没意义。后来统一走ofox的香港节点OpenRouter 也行但它会在模型原价基础上加收手续费ofox 是 0% 加价至少保证链路一致。⚠️ OpenRouter 手续费比例以其官方定价页面为准本文不引用具体数字评测结果天梯图维度Kimi K3GPT-5.6-LunaClaude Sonnet 5备注LeetCode Hard 通过率13/20 (65%)14/20 (70%)15/20 (75%)temperature0单次提交多轮修复平均轮次 ↓越低越好4.2 轮2.1 轮2.8 轮给相同 bug 代码单元测试80K 上下文召回准确率72%88%91%5 个事实点问答格式首 token 延迟 P95380ms520ms460msofox 香港统一测单次调用成本1K in 2K out≈¥0.05厂商未公布具体价格厂商未公布具体价格按 ofox 模型目录⚠️ GPT-5.6-Luna 和 Claude Sonnet 5 的具体定价截至 2026 年 7 月 3 日 ofox 模型目录页面显示已上线但未标注公开单价可能走 tier 定价上表成本列标厂商未公布。Kimi K3 的价格参照 Moonshot 官方定价换算。价格随时可能变动建议以实时目录为准。反差维度详解多步推理修复这是我觉得最该单独拿出来说的。Moonshot 官方在 K3 发布博客里放了一张 benchmark 图标注多步推理任务提升 40%。但我实测下来发现这个 40% 的基线是和 K2.7 比的不是和竞品比的。我的测试方法# 给模型一段有 3 个 bug 的代码 单元测试 # 每轮把报错信息喂回去看几轮修完 messages [{role: user, content: buggy_code}]然后循环调用把 pytest 输出和模型上一轮回复追加到 messages再进入下一轮for attempt in range(max_rounds): # 注意避免用 round会遮蔽 Python 内置函数 resp client.chat.completions.create( modelkimi-k3, messagesmessages ) assistant_reply resp.choices[0].message.content # 将模型回复追加到上下文 messages.append({role: assistant, content: assistant_reply}) # 运行测试获取输出 test_output run_pytest() if test_output.passed: break # 将测试报错追加到上下文供下一轮使用 messages.append({role: user, content: test_output.stderr})结果 K3 经常在第 2-3 轮忘记前面已经修好的 bug又引入新问题。GPT-5.6-Luna 则很少出现这种回退现象。我不确定这是 K3 的上下文理解问题还是指令跟随的问题但落到实际开发体验上就是你得多等好几轮。挺烦人的。graph TD A[提交 buggy code] -- B{模型修复} B -- C[运行测试] C --|失败| D[错误信息回传] D -- B C --|通过| E[完成] style B fill:#f9f,stroke:#333 subgraph 平均轮次 F[K3: 4.2轮] G[Luna: 2.1轮] H[Sonnet5: 2.8轮] end长上下文K3 的短板比预想的大K3 官方标注支持 128K 上下文以 Moonshot 官方文档为准请自行核实最新规格我塞了 80K 进去留点余量在不同位置埋了 5 个关键事实人名、日期、数字然后在最后问第 3 段提到的截止日期是几号这类问题。Claude Sonnet 5 在这个维度上确实强91% 的召回率几乎没有幻觉。GPT-5.6-Luna 88% 也不错。K3 掉到 72%主要是中间位置的事实容易丢——经典的lost in the middle问题2026 年了还是没完全解决。延迟K3 反而最快这个倒是给 K3 加分的维度。P95 首 token 延迟 380ms比 Luna 的 520ms 快了不少。具体原因 Moonshot 没有公开推理架构细节这里不做推测。不同需求怎么选你的场景推荐原因CI/CD 自动修 bug要求轮次少GPT-5.6-Luna多轮修复 2.1 轮回退率最低长文档问答 / RAG 召回Claude Sonnet 580K 召回 91%幻觉最少高频调用、对延迟敏感Kimi K3P95 380ms且单价最低预算有限的独立开发者Kimi K3按 Moonshot 定价约 ¥0.05/次1K2K需要全部模型一个 Key 搞定走聚合网关ofox 或 OpenRouter改 base_url 即可切模型关于官方宣传的几点吐槽Moonshot 说推理能力大幅跃升——跟自家 K2.7 比确实跃升了但跟同期竞品比并没有碾压。这种跟自己比的 benchmark 话术每家都在用OpenAI 发 5.6 系列的时候也干这事。我也不确定是不是我的测试集偏了。20 道题样本量不大如果有人用更大规模跑出不同结论我完全不意外。但至少在我这个小规模测试里多轮修复这个维度的排名确实和官方暗示的不一样。调用代码参考统一走 OpenAI 兼容协议切模型只改 model 字段from openai import OpenAI client OpenAI( api_keyyour-key, base_urlhttps://api.ofox.io/v1 )调 K3resp client.chat.completions.create( modelkimi-k3, messages[{role: user, content: prompt}] )调 Lunaresp client.chat.completions.create( modelgpt-5.6-luna, messages[{role: user, content: prompt}] )调 Sonnet 5resp client.chat.completions.create( modelclaude-sonnet-5, messages[{role: user, content: prompt}] )报错处理——如果你用错了模型名会收到类似这样的错误具体格式因网关实现而异openai/前缀是否出现在报错信息中取决于网关行为{error: {message: The model openai/gpt-5.6-luna does not exist or you do not have access to it., type: invalid_request_error, code: model_not_found}}这种一般是模型 ID 拼写问题或者你的 plan 没开通对应模型权限去后台看一眼就行。小结K3 发布当天的兴奋劲过了之后冷静看数据延迟和成本上有明显优势单步推理也不差但多轮交互和长上下文这两个实际干活的维度还有差距。如果你的工作流依赖以 Cline 为代表的多轮 agent 工具Cline 支持多种模型后端并非专属某一家目前 GPT-5.6-Luna 和 Claude Sonnet 5 体验更好。我现在的策略是快速原型用 K3便宜快复杂 debug 用 Luna文档理解用 Sonnet 5。三个模型一个 base_url 切着用省去了到处管 API Key 的麻烦。

相关新闻

AI落地失败,最大的变量不是技术,而是组织

AI落地失败,最大的变量不是技术,而是组织

过去,一个岗位对应一个人。未来,一个岗位,对应的是“人 Data Agent”共同协作。最近两年,AI以前所未有的速度进入企业经营,企业投入持续加码,但真正见到实效的却凤毛麟角。问题究竟出在哪儿?近…

2026/7/23 23:11:58阅读更多 →
MiniMax市值缩水3000亿港元,从明星公司到普通上市企业,能否重回千亿市值?

MiniMax市值缩水3000亿港元,从明星公司到普通上市企业,能否重回千亿市值?

【MiniMax股价暴跌,市值缩水超3000亿港元】上市半年的MiniMax,股价经历了一轮过山车走势,从4000亿港元到不足1000亿港元。7月21日收盘,MiniMax股价报收222.4港元,总市值776.7亿港元。半年前的1月9日,公司在…

2026/7/23 23:11:58阅读更多 →
大模型测试:按产品形态区分完整测试方案

大模型测试:按产品形态区分完整测试方案

目录 一、大模型主流产品形态分类 1. 纯 API 服务型(后台能力底座,无前端界面) 2. 网页端对话应用(C 端通用聊天产品) 3. 客户端独立 App(手机 / PC 桌面端) 4. 嵌入式 / 插件集成型&#…

2026/7/23 23:11:58阅读更多 →
STELLA自进化LLM在生物医学研究的应用与实现

STELLA自进化LLM在生物医学研究的应用与实现

1. 项目背景与核心价值STELLA项目代表了当前生物医学研究与人工智能交叉领域的前沿探索。这个自进化的大型语言模型(LLM)智能体系统,正在改变传统生物医学研究的范式。作为一名长期关注AI在生命科学领域应用的从业者,我见证了这类系统从概念验证到实际落…

2026/7/24 0:32:11阅读更多 →
信息系统管理工程师-信息技术发展之计算机硬件与网络全解析

信息系统管理工程师-信息技术发展之计算机硬件与网络全解析

一、引言信息技术发展是软考中级信息系统管理工程师考试的基础模块,在上午客观题中占比约 15%-20%,其中计算机硬件、计算机软件、计算机网络是核心考查内容。本模块知识起源于 1946 年第一台通用计算机 ENIAC 的诞生,历经 70 余年演进&#x…

2026/7/24 0:32:11阅读更多 →
视频理解——从3D Conv到Tube Transformer,算力黑洞的探索史

视频理解——从3D Conv到Tube Transformer,算力黑洞的探索史

为啥说"大的"?因为视频数据太特么大了。一张 224x224 的图算起来轻松,一段 10 秒的 1080p 视频每秒 30 帧,那就是 300 张图,像素量是单张图的 300 倍。处理视频,本质上是在处理一个三维信号——高度、宽度、…

2026/7/24 0:32:11阅读更多 →
OpenClaw:本地化开源AI助手的部署与应用指南

OpenClaw:本地化开源AI助手的部署与应用指南

1. OpenClaw 项目概述OpenClaw 是一款运行在本地设备上的开源 AI 个人助手,支持 macOS、Windows 和 Linux 三大主流操作系统。与常见的云端 AI 服务不同,OpenClaw 的设计理念强调"数据不出本地",所有对话记录、技能插件和用户偏好都…

2026/7/24 0:32:11阅读更多 →
FoundationMotion:自监督学习颠覆动作识别技术

FoundationMotion:自监督学习颠覆动作识别技术

1. 项目概述:FoundationMotion的突破性意义 英伟达与MIT联合实验室最新发布的FoundationMotion框架,正在颠覆计算机视觉领域对运动理解的认知。这个仅有轻量级参数规模的模型,在无需任何人工标注数据的情况下,实现了与720亿参数大…

2026/7/24 0:32:11阅读更多 →
AI如何革新学术写作:书匠策AI全流程解析

AI如何革新学术写作:书匠策AI全流程解析

1. 学术写作的痛点与AI解决方案作为一名在科研领域摸爬滚打多年的"老油条",我深知论文写作过程中的种种煎熬。从文献综述的浩如烟海,到实验数据的反复验证;从格式规范的吹毛求疵,到语言表达的精准打磨——每一个环节都足…

2026/7/24 0:30:11阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/23 0:56:31阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/23 0:56:31阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 0:56:31阅读更多 →
我的编程之路:第一篇博客

我的编程之路:第一篇博客

大家好,我是一名编程初学者,同时这也是我编程学习之路上的第一篇博客。在这里,我想要向大家介绍我的一些想法和规划。a.自我介绍我是一个刚刚接触编程的新手,目前在学习c语言,我对编程世界充满了强烈的好奇。当然&…

2026/7/24 0:00:06阅读更多 →
【LeetCode 54】螺旋矩阵

【LeetCode 54】螺旋矩阵

问题描述: 解法: 1、模拟(参考自【LeetCode 54】螺旋矩阵-CSDN博客) int *spiralOrder(int **matrix, int matrixSize, int *matrixColSize, int *returnSize) {static const int dirs[4][2] {{0, 1}, {1, 0}, {0, -1}, {-1, …

2026/7/24 0:00:06阅读更多 →
2026 WAIC:模型隐身、智能体疯野,厂商竞赛聚焦办公场景与商业闭环

2026 WAIC:模型隐身、智能体疯野,厂商竞赛聚焦办公场景与商业闭环

知春路不相信模型领先今年WAIC大会,昔日AI六小龙来了五家,分别是Kimi、阶跃星辰、Minimax、百川智能、零一万物。连放弃基模的百川和零一万物都来了,唯一缺席的竟是近几个月来风光无限的智谱。(DeepSeek一直不参加)WAI…

2026/7/24 0:00:06阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/23 22:58:43阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/23 18:58:18阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/23 18:58:18阅读更多 →