基于 AiPy Pro 2.0.1 平台,使用 Qwen3.8-Flash 模型对 63 项真实任务进行端到端评测, 覆盖数据分析、报告生成、应用开发、多模态生成、系统操作等 9 大能力维度,全面评估模型在智能体场景下的适配表现。
Qwen3.8-Flash 是阿里通义千问团队于 2026 年 8 月 26 日正式发布的多模态 MoE(混合专家)模型, 作为下一代 Qwen4 架构的技术预览版,采用 GDN+QSA 混合注意力、门控残差、N-gram 嵌入及 Muon 优化器等创新架构。 模型在 DeepSWE 1.1、SWE-bench Pro、CoWorkBench、AndroidWorld、MathVista 等多项权威基准上表现优异, 性能超越 Opus 4.6、接近 Opus 4.8,训练成本较前代骤降近 90%,推理成本每百万 Tokens 输入低至 1 元人民币, 标志着国产大模型在架构效率与成本控制上的双重突破。
| 模型类型 | 多模态 MoE(混合专家) |
| 主模型参数量 | 125B(约 1,250 亿) |
| N-gram Embedding | 51B |
| 每 Token 激活参数 | 6B |
| 原生上下文长度 | 262K(可扩展至 1M) |
| 发布方 | 阿里巴巴 · 通义千问 |
| 发布日期 | 2026-08-26 |
在 63 项评测任务中,Qwen3.8-Flash 成功完成 51 项, 失败 12 项,综合成功率达 81.0%。
从任务类型分布看,评测覆盖了数据分析(14 项)、网络信息检索(10 项)、报告与文档生成(10 项)、 系统与文件操作(9 项)、应用开发(9 项)等核心场景,样本结构均衡,能够较全面地反映模型在 AiPy 智能体平台上的综合适配能力。
评测任务覆盖 9 大能力维度,其中数据分析类任务占比最高(22.2%), 其次为网络信息检索与报告文档生成(各 15.9%)。多模态理解、创意内容生成、办公自动化等 维度样本相对较少,后续可针对性扩充以增强评测的统计置信度。
| 能力维度 | 成功 / 总数 | 成功率 | 平均耗时 | 平均 Token | 评级 |
|---|---|---|---|---|---|
| 网络信息检索 | 10 / 10 | 100.0% | 119 秒 | 275,245 | 优秀 |
| 创意内容生成 | 3 / 3 | 100.0% | 118 秒 | 102,260 | 优秀 |
| 多模态理解 | 1 / 1 | 100.0% | 30 秒 | 43,251 | 优秀 |
| 报告与文档生成 | 9 / 10 | 90.0% | 274 秒 | 1,304,792 | 良好 |
| 数据分析 | 11 / 14 | 78.6% | 193 秒 | 549,781 | 中等 |
| 应用开发 | 7 / 9 | 77.8% | 274 秒 | 224,105 | 中等 |
| 多模态生成 | 3 / 4 | 75.0% | 531 秒 | 215,398 | 中等 |
| 系统与文件操作 | 6 / 9 | 66.7% | 165 秒 | 196,661 | 待提升 |
| 办公自动化 | 1 / 3 | 33.3% | 352 秒 | 383,460 | 短板 |
注:多模态理解、创意内容生成、办公自动化维度样本量偏小(≤3 项),结论仅供参考。
12 项失败任务的原因可归纳为 4 类语义化场景,其中 「流程中断,未产出结果文件」占比最高(9 项), 是当前最突出的适配短板。
🔍 洞察:失败任务高度集中在需要操作系统 GUI 交互(如邮件客户端发送、日历创建事件、 画图软件绘图)或复杂多步骤流程(如投标文件撰写、宝宝取名程序)的场景。 这类任务往往涉及外部应用的图形界面控制或长链条的中间状态管理,模型在「发起操作」与「确认完成」之间 存在衔接断层,导致流程中断或仅产出中间产物。建议通过增强 GUI 自动化工具链、引入步骤级校验机制来针对性优化。
从资源消耗看,多数任务在 3 分钟内完成(占比约 60%),Token 消耗集中在 5 万至 50 万区间。报告与文档生成类任务 Token 消耗显著偏高(平均超 130 万), 主要源于长文档的生成与多次迭代;多模态生成类任务耗时最长(平均 531 秒),与调用工具生成视频、 音频等重计算操作直接相关。