🔬 AiPy大模型适配度测评 · 第十期

Kimi K3 专项深度测评 —— 从K2.6的谷底到K3的巅峰,月之暗面的"王者归来"
📊 2.8万亿参数 🧠 KDA混合线性注意力 📐 100万Token上下文 💰 混合≈$2.3/M (≈¥16/M) 🏆 Frontend Code Arena #1

国产大模型首次以"高定价"姿态挑战全球顶尖 —— 贵,但贵得有道理

📖 背景说明

自2025年6月AiPy启动大模型适配度测评系列以来,我们已经持续完成了九期系统性测评,累计覆盖数十款国内外主流大语言模型。从最初的基础功能验证,到逐步引入任务执行轮数、Token消耗成本等多元评估维度;从五大核心应用场景拓展至编程开发、软件控制、数据分析、UI设计、联网搜索、大文件处理等十八种真实应用场景;测评难度逐期增强,评价体系持续优化。这一系列测评不仅为AiPy用户提供了客观、实用的模型选型参考,也见证了整个大模型行业在过去一年中的飞速演进。

回顾往期测评中月之暗面Kimi系列模型的表现,其发展轨迹可谓跌宕起伏:Kimi K2 以80%成功率初露锋芒;Kimi K2.5 稳居中上游;然而 Kimi K2.6 却遭遇"滑铁卢"——成功率仅 49.3%,在20款参测模型中排名垫底。这一突然的下跌,引发了我们对Kimi系列模型迭代一致性和可靠性的深度关切。

2026年7月16日,月之暗面正式发布新一代旗舰模型 Kimi K3。该模型拥有高达 2.8万亿参数,是目前全球参数规模最大的开源模型,基于自研 KDA混合线性注意力机制(Kimi Delta Attention)和注意力残差技术构建,原生支持视觉理解,并拥有 100万Token 的超大上下文窗口。在 Frontend Code Arena 全球榜单中,Kimi K3 以 1679 分超越 Claude Fable 5,位居第一。

经历了 K2.6 的低谷,Kimi K3 是否能在真实应用场景中"王者归来",真正兑现其纸面参数所宣称的强大能力?本期测评将给出答案。

本期测评围绕 Kimi K3 展开专项深度测评,覆盖编程开发、数据分析、软件控制、联网搜索、多模态理解等九大核心能力维度。同时纳入 GPT-5.6 系列(Sol/Terra/Luna)、Claude Opus 4.8、Gemini 3.5 Flash、DeepSeek V4 Pro 等往期表现优异的顶尖模型的测评结果同台竞技。

⚠️ 重要声明:本次测试仅针对 Kimi K3 进行实测(63题),其他模型的结果由往期数据获得(测试任务有细微差别,Token消耗数据因测试环境不同不做直接对比)。Kimi K3 混合定价约$2.3/M(≈¥16/M),为国产大模型迄今最高定价。GPT-5.6系列及Claude、Gemini的API定价为美元,已按1:6.8汇率换算为人民币参考价。

📊 测试概况

本期测评共执行 63 项标准化测试任务,覆盖九大应用场景,全面检验 Kimi K3 在真实工作负载下的综合表现。以下为核心指标一览:

63
📋 测试任务总数
90.5%
✅ 整体成功率
479s
⏱️ 平均执行时间
239.8K
🪙 平均Token消耗
15.1M
💰 总Token消耗
6
❌ 失败/超时

Kimi K3 以 90.5% 的整体成功率交出了一份亮眼的成绩单——63题仅6题未通过,在参与对比的11款模型中位列第二,仅次于 Claude Opus 4.8(91.3%)。从 K2.6 的 49.3% 到 K3 的 90.5%,月之暗面用实力证明了"知耻而后勇"的迭代能力。

🏆 各模型成功率对比

将 Kimi K3 与往期10款顶尖模型的成功率进行横向对比。蓝色为本期实测,灰色为往期数据。K3 以 90.5% 的成功率强势跻身第一梯队,仅次于 Claude Opus 4.8(91.3%),与 Claude Sonnet 4.8(89.8%)旗鼓相当。

各模型成功率对比
模型成功率参考单价(输入无缓存)
Claude Opus 4.8 (第八期) 91.3% ≈¥34/M ($5/M)
Kimi K3 本期实测 90.5% ¥20/M
Claude Sonnet 4.8 (第八期) 89.8% ≈¥20.4/M ($3/M)
Gemini 3.5 Flash (第八期) 88.4% ≈¥10.2/M ($1.5/M)
DeepSeek V4 Pro (第八期) 88.4% ¥3/M
Qwen 3.7 Max (第八期) 85.5% ¥12/M
GPT-5.6 Sol (第九期) 84.1% ≈¥34/M ($5/M)
GLM5.2(第八期) 82.6% ¥8/M
GPT-5.6 Terra (第九期) 81.0% ≈¥17/M ($2.5/M)
Kimi K2.5 (第七期) 80.0% ¥4.2/M
Kimi K2.6 (第八期) 49.3% ¥4.2/M

💡 关键发现

Kimi K3 的 90.5% 成功率与 Claude Opus 4.8(91.3%)仅差 0.8个百分点,但成本仅为后者的 59%。在"性能接近顶级、成本大幅降低"这个维度上,K3 找到了独特的价值定位。

🪙 Token消耗定性分析

由于往期模型的Token消耗数据来自不同的测试环境与任务集,本期不做直接定量对比。从定性角度看,Kimi K3 处理复杂多模态和超长上下文任务时Token消耗偏高(平均约24万/题),但在纯文本和代码生成任务中效率表现良好。建议用户在超长文档处理场景中关注Token预算。

🎯 Kimi K3 九类任务实测成功率

以下为 Kimi K3 在九大应用场景中的详细表现。编程开发、联网搜索、文件处理、UI设计、系统操作五类任务实现 100%完美通关,数据分析也高达 92.9%。但 软件控制仅25%(4题仅1成功),成为K3最明显的短板。

Kimi K3九类任务成功率
任务类型总题数成功失败/超时成功率
编程开发 7 7 0 100.0%
联网搜索 15 15 0 100.0%
文件处理 4 4 0 100.0%
UI设计 3 3 0 100.0%
系统操作 5 5 0 100.0%
数据分析 14 13 1 92.9%
文档生成 8 7 1 87.5%
多媒体处理 3 2 1 66.7%
软件控制 4 1 3 25.0%

🔴 致命短板:软件控制

软件控制类任务(发邮件、创建日历事件、画图软件操控、安装Chrome)仅 25% 成功率,4题仅1题通过。这暴露了K3在操作系统级GUI操控方面的能力不足——模型能理解任务意图,但在精确模拟键鼠操作、处理系统API调用时频繁出错。对于需要自动化办公、RPA场景的用户,这是需要重点关注的短板。

🟢 优势领域:编程开发 & 联网搜索

编程开发(7/7)和联网搜索(15/15)双双实现 100%成功率。K3在代码生成、游戏开发、工具构建方面表现卓越,在信息检索、报告撰写方面同样游刃有余。这与K3在Frontend Code Arena排名第一的成绩高度吻合。

🎯 TOP5 多维度性能雷达图

从成功率、性价比、Token效率、速度、稳定性、综合能力六个维度,对TOP5模型进行全方位扫描。Kimi K3(蓝色)在成功率和综合能力上表现突出,但在性价比维度明显收缩——这是"高性能"必须付出的代价。

TOP5雷达图
DeepSeek V4 Pro 是"精打细算的实干家",Kimi K3 是"不惜代价的攀登者"——一个赢在性价比,一个赢在性能上限。

🔍 失败原因深度分析

Kimi K3 共出现 6 次未通过(5次失败 + 1次超时)。我们将原始技术原因按语义归类为以下类别,以揭示K3能力边界的真实面貌。

失败原因扇形图
失败原因类别次数占比
软件操控失败 3 50.0%
其他原因 1 16.7%
超时/效率不足 1 16.7%
输出质量缺陷 1 16.7%

🔴 核心问题:软件操控能力不足

软件操控失败(3次,50%)是K3最大的失败来源,包括邮件发送失败、日历事件创建失败、画图软件操控失败。这指向一个深层问题:K3在理解GUI布局、精确控制鼠标坐标、处理不同分辨率适配方面存在系统性缺陷。

输出质量缺陷(1次)表现为报告内容重复输出,说明K3在长文本生成时偶现"自我重复"的问题。

超时(1次)发生在视频生成任务——半小时内未能完成最终输出,提示K3在多媒体处理效率上仍有优化空间。

📋 测试任务分类表(部分题目展示)

以下为本次测评中具有代表性的10道题目,涵盖不同任务类型。完整63题覆盖九大应用场景,确保测评的全面性和代表性。

序号问题摘要任务类型
1分析图片内容(多模态理解)多媒体处理
2分析GLM-4.5-Air性能测试结果并生成专业报告数据分析
3压缩文件中密钥信息脱敏处理文件处理
4安装Chrome并截取网页首屏软件控制
5SQLite数据库库存分析与渎职检测数据分析
6制作俄罗斯方块游戏编程开发
7联网搜索马斯克与特朗普八字合盘分析联网搜索
8绩效管理APP高保真原型图设计UI设计
9企业办公场地装修投标文件撰写(15页+)文档生成
10浏览器收藏夹失效链接检测与清理系统操作

📌 以上为部分代表性题目,完整测评共63题,覆盖九大应用场景。

🔬 深度洞察

🏆 性能冠军:编程开发与联网搜索双百通关

Kimi K3 在编程开发(7/7)和联网搜索(15/15)两大核心场景实现 100%成功率。从俄罗斯方块游戏到飞机大战,从提示词生成器到宝宝取名程序,K3展现了卓越的代码生成能力。在联网搜索方面,无论是股票推荐、天气查询还是深度调研报告,K3都能准确检索、整合并输出高质量结果。这与K3在Frontend Code Arena全球排名第一的成绩形成了有力的相互印证。

⚠️ 致命短板:软件控制能力亟待补强

软件控制类任务仅 25%成功率(4题仅1题通过),是K3最明显的阿喀琉斯之踵。邮件发送、日历创建、画图软件操控三项全部失败,仅Chrome安装截图一项成功。这暴露了K3在操作系统级交互方面的系统性不足——模型能"理解"任务,但无法精确"执行"涉及GUI操控的步骤。对于RPA自动化、办公助手等场景,这是需要重点关注的短板。

💡 亮点发现:UI设计能力异军突起

K3在UI设计(3/3,100%)上表现惊艳——绩效管理APP原型图、健身APP原型图、AiPy客户端原型图全部高质量完成。这提示K3在前端界面设计、HTML/CSS布局、交互逻辑规划方面具备超出预期的能力,对于产品经理和UI设计师来说是一个值得关注的工具。

📈 改进建议

1. 强化GUI操控训练:针对软件控制场景增加专项训练数据,提升模型对屏幕坐标、窗口句柄、系统API的理解和操作精度。
2. 优化长文本去重机制:解决报告内容重复输出的问题,在解码阶段引入更强的重复抑制策略。
3. 提升多媒体生成效率:视频生成任务超时提示需要优化推理速度或提供流式输出能力。
4. 考虑分层定价:当前≈¥16/M的混合定价在国产模型中最高,建议推出轻量版或缓存命中优惠以降低用户门槛。

📝 测评总结

Kimi K3 不是"便宜大碗"的性价比之选,而是"高端高价"的性能旗舰。它用国产最高定价换来了国产最高成功率——贵,但贵得有道理。

从 K2.6 的 49.3% 到 K3 的 90.5%,月之暗面完成了一次漂亮的"V型反转"。K3在编程开发、联网搜索、UI设计、文件处理、系统操作五大场景实现100%成功率,数据分析也高达92.9%,综合实力跻身全球第一梯队。

然而,软件控制仅25%的成功率是K3无法回避的短板。对于需要自动化办公、RPA、系统操控的用户,建议谨慎选择或搭配其他模型使用。

最终推荐:

使用场景推荐模型推荐理由
🏆 追求极致性能Kimi K3 / Claude Opus 4.8成功率最高,综合能力最强
💰 预算敏感DeepSeek V4 Pro / Gemini 3.5 Flash成本极低,性价比之王
💻 编程开发Kimi K3100%成功率,代码质量高
🖥️ 软件控制/RPAClaude Opus 4.8 / GPT-5.6 SolK3此场景表现不佳
🎨 UI设计Kimi K3100%成功率,设计质量惊艳
📊 数据分析Kimi K3 / DeepSeek V4 Pro高成功率+合理成本