基于 AiPy Pro 2.0.1 平台,使用 GLM-5.3-Flash 模型对 63 项真实任务进行端到端评测, 覆盖数据分析、报告生成、应用开发、多模态生成、系统操作等 9 大能力维度,全面评估模型在智能体场景下的适配表现。
GLM-5.3-Flash 是智谱 AI 于 2026 年 8 月 26 日正式上线并开源的原生多模态模型, 也是 GLM-5 系列的首个原生多模态产品。模型采用 320B 总参数、18B 激活参数(320B-A18B)的 MoE 架构, 首次引入稀疏注意力与线性注意力结合的混合架构,注意力计算量降低约 3 倍、KV 缓存减少 4.4 倍。 在全球权威的 Artificial Analysis 智能指数(AA 综合智能指数)中取得 57 分, 追平 Claude Opus 4.8,进入全球前沿。模型支持 100 万 Token 上下文窗口,采用 MIT 许可证开源, 以极低的推理成本实现了旗舰级能力,标志着国产大模型进入「前沿智能、普惠成本」的新阶段。
| 模型类型 | 原生多模态 MoE |
| 总参数量 | 320B(约 3,200 亿) |
| 激活参数量 | 18B(约 180 亿) |
| 上下文长度 | 100 万 Token |
| AA 智能指数 | 57 分(追平 Claude Opus 4.8) |
| 开源协议 | MIT 许可证 |
| 发布方 | 智谱 AI |
| 发布日期 | 2026-08-26 |
在 63 项评测任务中,GLM-5.3-Flash 成功完成 58 项, 失败 2 项,超时 3 项, 综合成功率达 92.1%。
与同批次评测的其他模型相比,GLM-5.3-Flash 的成功率表现突出,失败任务仅有 2 项, 且均为视觉排版质量问题(文本框覆盖、图表超出边框),未出现流程中断类失败, 体现出模型在任务执行稳定性上的显著优势。
评测任务覆盖 9 大能力维度,其中报告与文档生成类任务占比最高(22.2%), 其次为网络信息检索与数据分析(各 15.9%)。多模态理解、创意内容生成、办公自动化等 维度样本相对较少,后续可针对性扩充以增强评测的统计置信度。
| 能力维度 | 成功 / 总数 | 成功率 | 平均耗时 | 平均 Token | 评级 |
|---|---|---|---|---|---|
| 网络信息检索 | 10 / 10 | 100.0% | 246 秒 | 157,848 | 优秀 |
| 系统与文件操作 | 9 / 9 | 100.0% | 330 秒 | 168,062 | 优秀 |
| 应用开发 | 9 / 9 | 100.0% | 886 秒 | 231,249 | 优秀 |
| 创意内容生成 | 3 / 3 | 100.0% | 482 秒 | 341,315 | 优秀 |
| 多模态理解 | 1 / 1 | 100.0% | 265 秒 | 269,560 | 优秀 |
| 报告与文档生成 | 13 / 14 | 92.9% | 703 秒 | 338,305 | 良好 |
| 数据分析 | 9 / 10 | 90.0% | 377 秒 | 177,128 | 良好 |
| 办公自动化 | 2 / 3 | 66.7% | 770 秒 | 227,648 | 待提升 |
| 多模态生成 | 2 / 4 | 50.0% | 196 秒 | 54,857 | 短板 |
注:多模态理解、创意内容生成、办公自动化维度样本量偏小(≤3 项),结论仅供参考。
5 项未完成任务可归纳为 3 类语义化场景,其中 「任务执行超时」占比最高(3 项), 集中在 GUI 操作与调用工具生成视频等重计算场景。
🔍 洞察:GLM-5.3-Flash 的失败模式与同类模型存在本质差异——未出现流程中断类失败, 所有失败均为视觉排版瑕疵(文本框覆盖、图表超出边界),属于「产出但质量欠佳」而非「未能产出」。 超时任务集中在系统 GUI 操作(日历创建、画图软件)与调用工具生成视频等重计算场景。 建议通过优化 GUI 自动化工具链、引入排版自检机制、为视频生成类任务设置更合理的超时阈值来针对性改进。
从资源消耗看,多数任务在 6 分钟内完成,Token 消耗集中在 5 万至 30 万区间。应用开发类任务耗时最长(平均 886 秒), 主要源于游戏、APP 原型等复杂交互界面的生成;报告与文档生成类任务 Token 消耗较高(平均 338,305), 与长文档的多轮生成迭代相关。