DeepSeek-V4.1-Flash(0910) 是深度求索(DeepSeek)于 2026 年 9 月 8 日开启限时内测的中间版本大模型。作为 V4 系列中「快速模式」路线的延续,该版本采用全新模型结构,并在架构层面原生支持多模态输入,官方定位为「更快、更省、能力更强」的轻量化选项。本次评测即在 AiPy Pro 2.0.1 客户端上,以该模型为执行内核,跑通 63 项覆盖真实办公与开发场景的任务。
为什么选它做 AiPy 适配度测试?
V4.1-Flash(0910) 主打「极速响应 + 原生多模态 + 低调用成本」,恰好对应 AiPy 客户端最典型的诉求:既要快速理解图片与文档,又要稳定调用工具、产出可交付文件。因此本次评测不只看「答得对不对」,更看「活儿能不能干完、文件能不能落地」。
⚡ 核心特性:极速输出
V4.1-Flash(0910)最突出的特点就是快。实测最高输出速度可达 500+ tokens/s,大部分回复稳定在高速区间,交互体验接近「秒回」。作为对比,同门前代 V4-Flash 此前测试最高约 218 tokens/s,V4-Pro 则不到 70 tokens/s——V4.1-Flash(0910)的峰值速度约为 V4-Flash 的 2.3 倍、V4-Pro 的 7 倍以上。
这一速度优势在 AiPy 的实际使用中意义重大:同样的任务,更快的输出意味着更短的等待、更流畅的多轮交互,尤其在需要反复调用工具、生成多份文件的复杂任务中,累积的时间收益相当可观。
DeepSeek V4 系列在 AiPy 平台上已有两代模型留下公开战绩。为了让本次结果更有参照系,我们将其与《AiPy 大模型适配度测评 · 第八期》中的 DeepSeek V4 Pro、DeepSeek V4 Flash 放在一起横向对照。需要说明的是:第八期为 69 项任务、20 款模型同台竞技;本次为 63 项任务、聚焦单一模型的深度适配测试,两者任务集与统计口径并不完全一致,成功率仅作趋势参考,不宜直接等同比较。
| 模型 | 成功率 | 平均 Token | 平均耗时 | 定位与特点 |
|---|---|---|---|---|
| DeepSeek V4 Pro 第八期 · 69 项任务 |
88.4% | 248,150 | 329s | 国产冠军,全球第 4 名。编程开发、数据分析等硬核任务表现突出,属「能力优先」档位。 |
| DeepSeek V4 Flash 第八期 · 69 项任务 |
82.6% | 172,137 | 138s | 国产速度标杆,平均耗时仅 138 秒,是响应最快的模型之一,属「效率优先」档位。 |
| DeepSeek V4.1 Flash(0910) 本次 · 63 项任务 |
93.7% | 549,554 | 446s | 本次评测主角。在全新架构与原生多模态加持下,成功率较同门前代进一步提升,长链路复杂任务稳定性显著增强。 |


对比结论:从 V4 Flash 到 V4 Pro 再到 V4.1 Flash(0910),DeepSeek 系列在 AiPy 上的适配度呈阶梯式上升。V4 Pro 以 88.4% 证明了「能力优先」路线的高度,V4 Flash 以 138 秒的平均耗时守住「效率优先」的底线,而 V4.1 Flash(0910) 则在两者基础上进一步把成功率推到 93.7%——既保留了 Flash 系列的响应速度优势,又在复杂任务稳定性上向 Pro 看齐甚至反超。
选型建议:追求极致成功率与复杂任务交付质量,V4.1 Flash(0910) 是当前同门中的最优解;若任务以简单查询、快速响应为主且对资源敏感,V4 Flash 依然是高性价比之选;V4 Pro 则适合对编程开发、数据分析等硬核场景有长期稳定需求的用户。
本次评测围绕「AiPy 适配度」展开,即在真实客户端环境中,模型能否理解用户意图、正确调用本地工具与联网能力、并最终产出符合要求的交付物。63 项任务全部来自真实办公、开发与生活场景,覆盖文档处理、联网调研、系统操控、代码开发、内容创作与多模态理解六大维度。


核心结论:DeepSeek-V4.1-Flash(0910) 在 AiPy Pro 2.0.1 上的整体适配度达到 93.7%,63 项任务中 59 项成功交付。其中文档与数据处理、代码与工具开发、内容创作与设计三大维度实现 100% 通过,说明模型在「结构化数据 → 可交付文件」这条主链路上非常稳。
失败集中在需要深度操控本机应用(日历、绘图软件)以及图表渲染完整性要求极高的场景,属于「系统级集成」而非「模型能力」的短板。
下表按能力维度汇总成功率。成功率 = 该维度成功任务数 ÷ 该维度任务总数。
| 能力维度 | 任务数 | 成功 | 失败 | 成功率 | 维度说明 |
|---|---|---|---|---|---|
| 多模态理解 | 1 | 1 | 0 |
100.0%
|
图片、视频等非结构化内容的理解与描述 |
| 文档与数据处理 | 13 | 13 | 0 |
100.0%
|
Excel/CSV/日志/数据库等结构化数据的解析、统计与报告产出 |
| 联网检索与调研 | 21 | 19 | 2 |
90.5%
|
联网搜索、网页抓取、真实数据获取与多维调研分析 |
| 系统与桌面操控 | 9 | 7 | 2 |
77.8%
|
本机软硬件探测、应用调用、键鼠控制等系统级操作 |
| 代码与工具开发 | 9 | 9 | 0 |
100.0%
|
可运行程序、游戏、原型界面与工具类应用的开发交付 |
| 内容创作与设计 | 10 | 10 | 0 |
100.0%
|
文案、PPT、Word、PDF、音视频等创意内容生成 |
🏆 满分维度(100%):文档与数据处理(13/13)、代码与工具开发(9/9)、内容创作与设计(10/10)、多模态理解(1/1)。这四类任务的共同点是「输入明确、产出可校验」,模型能够稳定地读取文件、写代码、生成 HTML/Word/PPT/PDF,并在本地落盘。
⚠️ 相对薄弱维度(77.8%):系统与桌面操控(7/9)。该维度要求模型直接调用系统日历、控制鼠标操作画图软件等,涉及操作系统 API 与应用进程的深度集成。失败并非模型「不会做」,而是调用链路与权限边界尚未完全打通。
📈 高负载维度(90.5%):联网检索与调研(19/21)。该维度任务普遍需要联网搜索真实数据、抓取网页并生成图文报告,对信息整合与可视化能力要求高。唯一失败项来自日志分析报告的可视化完整性。
下图展示 63 项任务的耗时分布(对数刻度)与各维度 Token 消耗分布。耗时跨度极大——从 11 秒的简单查询到 13,849 秒的复杂游戏开发,反映出任务复杂度差异显著。
耗时特征:任务耗时中位数远低于均值,说明大部分任务可在 1 分钟内完成;少数长尾任务(如游戏开发、原型设计、视频生成)会显著拉高总耗时。最长任务为「俄罗斯方块游戏开发」,耗时 13,849 秒,累计消耗超 600 万 tokens,但最终成功交付,体现了长链路任务的稳定性。
Token 特征:联网检索与调研、代码与工具开发两个维度的 Token 消耗中位数最高,符合「多轮搜索 + 多文件生成」的任务特性。
4 项失败任务的原因已做语义化归纳,避免直接照搬原始记录,聚焦「问题本质」与「改进方向」。
| 任务 | 任务内容 | 问题本质(语义归纳) | 改进方向 |
|---|---|---|---|
| 任务 60 | 网站访问日志分析并生成 HTML 报告 | 报告的可视化图表未能完整渲染,部分图表缺失,交付物完整性不足 | 增加图表渲染后的自检环节,对缺失图片做兜底重绘 |
| 任务 61 | 印巴国防预算对比趋势图(含事件标注) | 模型返回的数据格式与图表生成流程不匹配,导致绘图环节中断、图片未产出 | 强化结构化数据输出的格式约束与校验重试 |
| 任务 62 | 创建系统日历事件「团队周会」 | 系统日历应用的调用链路未打通,仅生成了中间文件,未能真正创建日程 | 补齐日历应用适配层,或明确降级为 ICS 文件导入 |
| 任务 63 | 控制鼠标在画图软件中绘制并保存图片 | 绘图软件的鼠标操控与图像保存未形成闭环,最终图片未生成 | 引入坐标校准与操作结果校验,确保保存动作生效 |
共性归因:4 项失败中有 3 项(任务 62、63 及部分 60)属于「系统级集成」问题——模型理解意图没问题,但工具调用链路、应用适配层或结果校验环节存在断点。另有 1 项(任务 61)属于「模型输出格式与下游流程不匹配」,可通过格式约束与自动重试缓解。
本次评测共 63 项任务,全部来自 AiPy 用户的真实使用场景,覆盖图片理解、文档处理、日志分析、数据统计、联网调研、系统操控、代码开发、原型设计、内容创作、图表绘制等日常高频需求。任务难度跨度大——既有 10 秒级的信息查询,也有需要数小时打磨的完整游戏开发与高保真原型设计。
下表按能力维度汇总各维度的任务规模与执行结果,便于快速把握本次评测的覆盖广度与深度。
| 能力维度 | 任务数 | 成功 | 失败 | 成功率 | 典型任务举例 |
|---|---|---|---|---|---|
| 多模态理解 | 1 | 1 | 0 | 100.0% | 图片内容识别与描述 |
| 文档与数据处理 | 13 | 13 | 0 | 100.0% | Excel/CSV/日志/数据库解析、报告产出 |
| 联网检索与调研 | 21 | 19 | 2 | 90.5% | 实时资讯检索、多维调研报告、真实数据图表 |
| 系统与桌面操控 | 9 | 7 | 2 | 77.8% | 本机硬件探测、应用调用、键鼠控制 |
| 代码与工具开发 | 9 | 9 | 0 | 100.0% | 游戏开发、原型界面、工具类应用 |
| 内容创作与设计 | 10 | 10 | 0 | 100.0% | 文案、PPT、Word、PDF、调用工具生成视频 |
任务设计特点:所有任务均要求产出可交付的实体文件(HTML / Word / PPT / PDF / 图片 / 音视频 / 可执行程序),而非单纯的问答对话。这确保了评测结果直接反映「AiPy 能否真正帮用户把活干完」,而非「模型能不能聊得漂亮」。
以下任务在复杂度、长链路稳定性或交付质量上表现突出,可作为 AiPy + DeepSeek-V4.1-Flash(0910) 的能力标杆。
| 任务 | 任务内容 | 资源消耗 | 亮点 |
|---|---|---|---|
| 任务 23 | 俄罗斯方块游戏(TK 方案) | 耗时 13,849 秒 · 6,010,478 tokens | 复杂交互式游戏从零开发并自测通过,是长链路任务稳定性的标杆 |
| 任务 24 | 随机抽取软件(Excel 导入) | 耗时 3,814 秒 · 377,875 tokens | GUI + 文件导入 + 抽取逻辑多模块协同,一次交付可用 |
| 任务 35 | 1000 人十年打卡数据生成与统计 | 耗时 583 秒 · 277,610 tokens | 大规模模拟数据生成 + 奋斗者/末位识别 + 柱状图输出全链路完成 |
| 任务 48 | 《数据安全法》普法短视频 | 耗时 440 秒 · 604,030 tokens | 分段生成 + FFmpeg 合成,多模态内容生产链路跑通 |
整体表现:DeepSeek-V4.1-Flash(0910) 在 AiPy Pro 2.0.1 上的 AiPy 适配度综合成功率为 93.7%,在 63 项真实任务中成功交付 59 项,属于「高可用」水平。模型在文档处理、代码开发、内容创作三大高频场景表现满分,能够稳定完成「理解需求 → 调用工具 → 产出文件」的完整闭环。
能力画像:
① 强项:结构化数据处理(Excel/CSV/日志/数据库)、代码与工具类应用开发、多格式内容创作(HTML/Word/PPT/PDF/音视频)、联网检索与调研。
② 待加强:系统级应用操控(日历、绘图软件等)的调用链路完整性;图表渲染后的自检与兜底机制;模型输出格式与下游流程的兼容性。
③ 速度优势:多数任务可在 1 分钟内完成,简单查询类任务仅需 10~30 秒,符合 V4.1-Flash(0910)「极速响应」的定位。
优化建议:
1. 针对系统操控类任务,补齐应用适配层并增加操作结果校验,避免「生成了中间文件但未真正完成任务」。
2. 对图表生成类任务,增加渲染后自检与缺失图片兜底重绘,提升交付物完整性。
3. 对需要结构化数据输出的任务,强化格式约束与自动重试,降低下游流程中断概率。
适用场景建议:DeepSeek-V4.1-Flash(0910) 非常适合作为 AiPy 的日常主力模型,尤其适合文档处理、数据分析、报告生成、代码开发与内容创作等高频办公场景。对于需要深度操控本机应用的场景,建议配合人工确认或选择具备更完整系统集成能力的方案。