国产大模型首次以"高定价"姿态挑战全球顶尖 —— 贵,但贵得有道理
自2025年6月AiPy启动大模型适配度测评系列以来,我们已经持续完成了九期系统性测评,累计覆盖数十款国内外主流大语言模型。从最初的基础功能验证,到逐步引入任务执行轮数、Token消耗成本等多元评估维度;从五大核心应用场景拓展至编程开发、软件控制、数据分析、UI设计、联网搜索、大文件处理等十八种真实应用场景;测评难度逐期增强,评价体系持续优化。这一系列测评不仅为AiPy用户提供了客观、实用的模型选型参考,也见证了整个大模型行业在过去一年中的飞速演进。
回顾往期测评中月之暗面Kimi系列模型的表现,其发展轨迹可谓跌宕起伏:Kimi K2 以80%成功率初露锋芒;Kimi K2.5 稳居中上游;然而 Kimi K2.6 却遭遇"滑铁卢"——成功率仅 49.3%,在20款参测模型中排名垫底。这一突然的下跌,引发了我们对Kimi系列模型迭代一致性和可靠性的深度关切。
2026年7月16日,月之暗面正式发布新一代旗舰模型 Kimi K3。该模型拥有高达 2.8万亿参数,是目前全球参数规模最大的开源模型,基于自研 KDA混合线性注意力机制(Kimi Delta Attention)和注意力残差技术构建,原生支持视觉理解,并拥有 100万Token 的超大上下文窗口。在 Frontend Code Arena 全球榜单中,Kimi K3 以 1679 分超越 Claude Fable 5,位居第一。
本期测评围绕 Kimi K3 展开专项深度测评,覆盖编程开发、数据分析、软件控制、联网搜索、多模态理解等九大核心能力维度。同时纳入 GPT-5.6 系列(Sol/Terra/Luna)、Claude Opus 4.8、Gemini 3.5 Flash、DeepSeek V4 Pro 等往期表现优异的顶尖模型的测评结果同台竞技。
本期测评共执行 63 项标准化测试任务,覆盖九大应用场景,全面检验 Kimi K3 在真实工作负载下的综合表现。以下为核心指标一览:
Kimi K3 以 90.5% 的整体成功率交出了一份亮眼的成绩单——63题仅6题未通过,在参与对比的11款模型中位列第二,仅次于 Claude Opus 4.8(91.3%)。从 K2.6 的 49.3% 到 K3 的 90.5%,月之暗面用实力证明了"知耻而后勇"的迭代能力。
将 Kimi K3 与往期10款顶尖模型的成功率进行横向对比。蓝色为本期实测,灰色为往期数据。K3 以 90.5% 的成功率强势跻身第一梯队,仅次于 Claude Opus 4.8(91.3%),与 Claude Sonnet 4.8(89.8%)旗鼓相当。
| 模型 | 成功率 | 参考单价(输入无缓存) |
|---|---|---|
| Claude Opus 4.8 (第八期) | 91.3% | ≈¥34/M ($5/M) |
| Kimi K3 本期实测 | 90.5% | ¥20/M |
| Claude Sonnet 4.8 (第八期) | 89.8% | ≈¥20.4/M ($3/M) |
| Gemini 3.5 Flash (第八期) | 88.4% | ≈¥10.2/M ($1.5/M) |
| DeepSeek V4 Pro (第八期) | 88.4% | ¥3/M |
| Qwen 3.7 Max (第八期) | 85.5% | ¥12/M |
| GPT-5.6 Sol (第九期) | 84.1% | ≈¥34/M ($5/M) |
| GLM5.2(第八期) | 82.6% | ¥8/M |
| GPT-5.6 Terra (第九期) | 81.0% | ≈¥17/M ($2.5/M) |
| Kimi K2.5 (第七期) | 80.0% | ¥4.2/M |
| Kimi K2.6 (第八期) | 49.3% | ¥4.2/M |
Kimi K3 的 90.5% 成功率与 Claude Opus 4.8(91.3%)仅差 0.8个百分点,但成本仅为后者的 59%。在"性能接近顶级、成本大幅降低"这个维度上,K3 找到了独特的价值定位。
由于往期模型的Token消耗数据来自不同的测试环境与任务集,本期不做直接定量对比。从定性角度看,Kimi K3 处理复杂多模态和超长上下文任务时Token消耗偏高(平均约24万/题),但在纯文本和代码生成任务中效率表现良好。建议用户在超长文档处理场景中关注Token预算。
以下为 Kimi K3 在九大应用场景中的详细表现。编程开发、联网搜索、文件处理、UI设计、系统操作五类任务实现 100%完美通关,数据分析也高达 92.9%。但 软件控制仅25%(4题仅1成功),成为K3最明显的短板。
| 任务类型 | 总题数 | 成功 | 失败/超时 | 成功率 |
|---|---|---|---|---|
| 编程开发 | 7 | 7 | 0 | 100.0% |
| 联网搜索 | 15 | 15 | 0 | 100.0% |
| 文件处理 | 4 | 4 | 0 | 100.0% |
| UI设计 | 3 | 3 | 0 | 100.0% |
| 系统操作 | 5 | 5 | 0 | 100.0% |
| 数据分析 | 14 | 13 | 1 | 92.9% |
| 文档生成 | 8 | 7 | 1 | 87.5% |
| 多媒体处理 | 3 | 2 | 1 | 66.7% |
| 软件控制 | 4 | 1 | 3 | 25.0% |
软件控制类任务(发邮件、创建日历事件、画图软件操控、安装Chrome)仅 25% 成功率,4题仅1题通过。这暴露了K3在操作系统级GUI操控方面的能力不足——模型能理解任务意图,但在精确模拟键鼠操作、处理系统API调用时频繁出错。对于需要自动化办公、RPA场景的用户,这是需要重点关注的短板。
编程开发(7/7)和联网搜索(15/15)双双实现 100%成功率。K3在代码生成、游戏开发、工具构建方面表现卓越,在信息检索、报告撰写方面同样游刃有余。这与K3在Frontend Code Arena排名第一的成绩高度吻合。
从成功率、性价比、Token效率、速度、稳定性、综合能力六个维度,对TOP5模型进行全方位扫描。Kimi K3(蓝色)在成功率和综合能力上表现突出,但在性价比维度明显收缩——这是"高性能"必须付出的代价。
Kimi K3 共出现 6 次未通过(5次失败 + 1次超时)。我们将原始技术原因按语义归类为以下类别,以揭示K3能力边界的真实面貌。
| 失败原因类别 | 次数 | 占比 |
|---|---|---|
| 软件操控失败 | 3 | 50.0% |
| 其他原因 | 1 | 16.7% |
| 超时/效率不足 | 1 | 16.7% |
| 输出质量缺陷 | 1 | 16.7% |
软件操控失败(3次,50%)是K3最大的失败来源,包括邮件发送失败、日历事件创建失败、画图软件操控失败。这指向一个深层问题:K3在理解GUI布局、精确控制鼠标坐标、处理不同分辨率适配方面存在系统性缺陷。
输出质量缺陷(1次)表现为报告内容重复输出,说明K3在长文本生成时偶现"自我重复"的问题。
超时(1次)发生在视频生成任务——半小时内未能完成最终输出,提示K3在多媒体处理效率上仍有优化空间。
以下为本次测评中具有代表性的10道题目,涵盖不同任务类型。完整63题覆盖九大应用场景,确保测评的全面性和代表性。
| 序号 | 问题摘要 | 任务类型 |
|---|---|---|
| 1 | 分析图片内容(多模态理解) | 多媒体处理 |
| 2 | 分析GLM-4.5-Air性能测试结果并生成专业报告 | 数据分析 |
| 3 | 压缩文件中密钥信息脱敏处理 | 文件处理 |
| 4 | 安装Chrome并截取网页首屏 | 软件控制 |
| 5 | SQLite数据库库存分析与渎职检测 | 数据分析 |
| 6 | 制作俄罗斯方块游戏 | 编程开发 |
| 7 | 联网搜索马斯克与特朗普八字合盘分析 | 联网搜索 |
| 8 | 绩效管理APP高保真原型图设计 | UI设计 |
| 9 | 企业办公场地装修投标文件撰写(15页+) | 文档生成 |
| 10 | 浏览器收藏夹失效链接检测与清理 | 系统操作 |
📌 以上为部分代表性题目,完整测评共63题,覆盖九大应用场景。
Kimi K3 在编程开发(7/7)和联网搜索(15/15)两大核心场景实现 100%成功率。从俄罗斯方块游戏到飞机大战,从提示词生成器到宝宝取名程序,K3展现了卓越的代码生成能力。在联网搜索方面,无论是股票推荐、天气查询还是深度调研报告,K3都能准确检索、整合并输出高质量结果。这与K3在Frontend Code Arena全球排名第一的成绩形成了有力的相互印证。
软件控制类任务仅 25%成功率(4题仅1题通过),是K3最明显的阿喀琉斯之踵。邮件发送、日历创建、画图软件操控三项全部失败,仅Chrome安装截图一项成功。这暴露了K3在操作系统级交互方面的系统性不足——模型能"理解"任务,但无法精确"执行"涉及GUI操控的步骤。对于RPA自动化、办公助手等场景,这是需要重点关注的短板。
K3在UI设计(3/3,100%)上表现惊艳——绩效管理APP原型图、健身APP原型图、AiPy客户端原型图全部高质量完成。这提示K3在前端界面设计、HTML/CSS布局、交互逻辑规划方面具备超出预期的能力,对于产品经理和UI设计师来说是一个值得关注的工具。
1. 强化GUI操控训练:针对软件控制场景增加专项训练数据,提升模型对屏幕坐标、窗口句柄、系统API的理解和操作精度。
2. 优化长文本去重机制:解决报告内容重复输出的问题,在解码阶段引入更强的重复抑制策略。
3. 提升多媒体生成效率:视频生成任务超时提示需要优化推理速度或提供流式输出能力。
4. 考虑分层定价:当前≈¥16/M的混合定价在国产模型中最高,建议推出轻量版或缓存命中优惠以降低用户门槛。
从 K2.6 的 49.3% 到 K3 的 90.5%,月之暗面完成了一次漂亮的"V型反转"。K3在编程开发、联网搜索、UI设计、文件处理、系统操作五大场景实现100%成功率,数据分析也高达92.9%,综合实力跻身全球第一梯队。
然而,软件控制仅25%的成功率是K3无法回避的短板。对于需要自动化办公、RPA、系统操控的用户,建议谨慎选择或搭配其他模型使用。
最终推荐:
| 使用场景 | 推荐模型 | 推荐理由 |
|---|---|---|
| 🏆 追求极致性能 | Kimi K3 / Claude Opus 4.8 | 成功率最高,综合能力最强 |
| 💰 预算敏感 | DeepSeek V4 Pro / Gemini 3.5 Flash | 成本极低,性价比之王 |
| 💻 编程开发 | Kimi K3 | 100%成功率,代码质量高 |
| 🖥️ 软件控制/RPA | Claude Opus 4.8 / GPT-5.6 Sol | K3此场景表现不佳 |
| 🎨 UI设计 | Kimi K3 | 100%成功率,设计质量惊艳 |
| 📊 数据分析 | Kimi K3 / DeepSeek V4 Pro | 高成功率+合理成本 |