DeepSeek V4.1 Flash 的主要变化
V4.1 Flash 是一个全新的模型系列,而非 V4 Flash 的微调版本。DeepSeek 重构了架构,并在 45 万亿多模态 token 上从零开始训练,使得该 Flash 级别模型在多数 Agent 基准测试中超越了 V4 Pro。
因果编码器-解码器 MoE
这是一个 552B 的混合专家架构(MoE),分为 20 层编码器和 20 层解码器。读取 Prompt 时仅激活 8B 参数,生成回答时激活 16B 参数,这也是为何如此庞大的模型仍能保持在 Flash 价格区间的原因。
Agent 编程能力超越 V4 Pro
DeepSeek 报告显示:Terminal-Bench 2.1 得分为 90.6(V4 Flash 为 82.7,V4 Pro 为 87.9);DeepSWE 得分为 74.2(对比 54.4 和 62.7);Codeforces Rating 达到 3471。在 Terminal-Bench 3.0 上,得分更是从 7.6 跃升至 30.0。
原生视觉训练,非外挂拼接
全新的 DeepSeek-ViT 编码器从预训练第一步就与文本模型联合训练。V4 Flash 仅支持纯文本,其视觉变体只是实验性质。现在屏幕截图、图表和照片可直接与 Prompt 放在同一请求中发送。
KV Cache 体积仅 1/4,支持 1M 上下文
压缩稀疏注意力机制和 FP4 KV 存储将全局缓存缩减至每 token 约 890 字节,大约仅为 V4 Flash 的四分之一。这使得 1M token 上下文窗口能在维持 Flash 级成本的同时,在独立测试中达到每秒 214 个 token 的速度。
DeepSeek V4.1 Flash 对比 V4 Flash
在 DeepSeek 官方,迁移已自动完成:官方模型 ID 现为 deepseek-flash,仍指定 deepseek-v4-flash 的请求也会由 V4.1 提供服务。而在 AIReiter 上,两者仍保持为独立模型,方便您固定选用任意版本。
激活参数更少,跑分反而更高
V4 Flash 对每个 token 激活 13B 参数。V4.1 Flash 在 Prefill 阶段激活 8B、在 Decode 阶段激活 16B,但在 DeepSeek 公布的所有 Agent 基准测试中均超越了前者。请勿将较小的 Prefill 参数量误认为是降级。
思考模式现已默认常开
V4 Flash 提供了离散的思考模式选项。V4.1 Flash 采用连续推理力度(Reasoning Effort)且默认设为 High。在此线路上,即便请求中禁用了思考模式,依然会返回推理过程;请相应合理规划 max_tokens 预算。
图像输入已成为基础模型的一部分
如果您之前在使用 V4 Flash 时需要将截图路由至独立的视觉接口,V4.1 Flash 现在单次调用即可同时处理。请在标准 content 数组中以 base64 data URI 形式发送图片;此路由不支持拉取远程图片 URL。
输出官方价格翻倍,缓存价格保持不变
官方输出价格从每百万 token $0.28 调整为 $0.60。缓存命中输入价格仍保持在 $0.003 左右。具有长稳定前缀和短回答的工作负载成本与此前基本一致;长文本生成场景的成本则有所上升。
何时建议保留 V4 Flash
当您有固定的评测套件、客户端无法在工具调用循环中处理 reasoning_content,或者受限于严格的单 token 输出预算而未准备好迁移时,可保留 V4 Flash。除上述情况外,建议在新业务中直接使用 V4.1 Flash。
DeepSeek V4.1 Flash API 定价
全天统一费率,无波峰溢价
三种 token 计费项的价格均约为 DeepSeek 官方闲时(Off-peak)费率的四分之三。此线路无高峰期时段限制,因此在北京工作时间运行的任务与夜间运行享有相同价格。实时价格数据可在 Playground 上方查看。
实际节省成本的优势所在
相比官方高峰期费率,AIReiter 的价格仅为约 38%;相比闲时费率则约为 75%。如果您的业务流量主要集中在欧美白天(即 DeepSeek 的高峰期),实际节省幅度将远超字面体现。
推理 token 按输出计费
此线路无法关闭思考模式,且 V4.1 Flash 在高推理力度下输出较为详尽。独立测试显示,在相同任务集下其输出 token 量约为同类模型的两倍。请务必将 max_tokens 设置为能够容纳推理过程加最终回答的数值。
缓存命中是最便宜的计费项
缓存命中的输入 token 费用仅约为未命中 token 的 2%。对于在每一轮都重复发送相同系统提示词和工具架构的 Agent 循环,缓存读取构成了账单的主要部分,也是 V4.1 Flash 最具性价比的场景。
何时使用 DeepSeek V4.1 Flash,以及何时不宜使用
适用于代码编写与终端 Agent
多文件编辑、测试-修复循环、CI 日志排查以及计算机使用(computer-use)任务,是其相比 V4 Flash 和 V4 Pro 性能提升最为显著的场景。长工具调用轨迹可直接容纳于 1M 上下文窗口中,无需分块处理。
适用于屏幕截图和图表分析
从 UI 截图中进行 OCR 识别、读取图表或检查渲染页面,均可与代码问题放入同一个请求中直接处理。无需调用第二个模型,也不会产生额外的账单费用。
仅在需要兼容性时使用 V4 Pro
DeepSeek 在发布 V4.1 Flash 后仍保留 V4 Pro 服务是应客户要求,而非因其得分更高。仅当合同要求或基准评测版本冻结需要时,才建议继续使用 Pro。
请勿将其用作百科全书
该基础模型在 SimpleQA-Verified 上的得分落后 V4 Pro 约 13 分。如果进行无检索的事实查询,请通过自有文档为模型补充事实依据,或选择针对知识召回优化过的模型。
与 GLM-5.3 Flash 进行价格对比
GLM-5.3 Flash 是 AIReiter 上的另一款多模态 Flash 模型,其输出价格更低。如果任务是 Agent 循环或代码仓库作业,请选择 V4.1 Flash;若面对大批量的提取与分类任务,请选择 GLM-5.3 Flash。
调用 DeepSeek V4.1 Flash API
本页面上的 Playground 与 API 共享同一个模型 ID。集成时最容易导致客户端报错的一条规则,是工具循环中对推理内容(reasoning)的处理方式。
在 Playground 中发送真实的 Agent 任务
粘贴报错日志、代码差异(diff)和问题。观察包含推理过程的输出 token,并在将其接入系统前确认回答质量。图像输入功能可通过 API 使用。
POST /api/v1/chat/completions
使用模型 "deepseek-v4-1-flash"、AIReiter API 密钥以及标准的 Chat Completions 请求体。支持流式传输。如果您的技术栈采用 Anthropic Messages 协议,/api/v1/messages 端点同样接受该模型 ID。
存在 tools 时务必回传 reasoning_content
只要请求中包含 tools 数组,之前每一次 assistant 轮次都必须带回其 reasoning_content,包括未发起工具调用的轮次。遗漏该字段将返回 HTTP 400。正是这一规则曾导致数个 Agent 框架在 V4 上报错,且该规则目前依然生效。
在 content 数组中附带图像 (API)
使用带有 base64 data URI 的 image_url 字段。支持 PNG、JPEG、GIF 和 WebP 格式。该路由不会抓取远程图片 URL,因此请内联传入字节数据。当图像作为问题的背景上下文而非提问主体时,请将文本部分置于前面。
DeepSeek V4.1 Flash API 常见问题
模型 id、定价、V4 Flash 迁移、图像输入以及导致报错的推理规则说明。
/ 01DeepSeek V4.1 Flash API 的模型 ID 是什么?
在 AIReiter 上请使用 deepseek-v4-1-flash。其内部标识键为 chat-deepseek-v4-1-flash。在 DeepSeek 官方直接调用时,官方 ID 为 deepseek-flash,且旧版的 deepseek-v4-flash ID 现在也同样由 V4.1 Flash 提供服务。
/ 02DeepSeek V4.1 Flash 如何计费?
DeepSeek 官方在非高峰时段的标价为每百万 token 输入 $0.15、输出 $0.60、缓存命中输入 $0.003,在工作日高峰时段三者均翻倍。AIReiter 则全天候实行统一费率,比官方非高峰价低约 25%,比高峰价低约 62%。当前路由价格已展示在 Playground 上方。
/ 03V4.1 Flash 是否优于 V4 Pro?
在 DeepSeek 发布的 Agent 和代码基准测试中,答案是肯定的:Terminal-Bench 2.1 得分为 90.6 对比 87.9,DeepSWE 得分为 74.2 对比 62.7。V4 Pro 在 GPQA Diamond 和知识召回方面仍然领先。DeepSeek 自身目前已将新用户路由至 Flash。
/ 04与 V4 Flash 相比有什么不同?
采用全新的编码器-解码器架构,激活参数为 8B 至 16B(原为 13B),支持原生图像输入、始终开启的思考推理、针对 1M 窗口缩减至四分之一大小的 KV cache,并在各项 Agent 基准测试中均有大幅提升。官方输出标价也从 $0.28 上涨至 $0.60。
/ 05我可以关闭思考过程吗?
在此路由上不可行。发送禁用思考的请求仍会返回 reasoning_content,且 reasoning_effort 不会被转发。建议改用 max_tokens 和严谨的提示词来控制成本。
/ 06它支持接收图像吗?
支持,可通过 API 传入。V4.1 Flash 原生支持视觉能力,并已在此路由上完成验证。可在 image_url 部分中以 base64 data URI 形式发送 PNG、JPEG、GIF 或 WebP;不支持抓取远程 URL。本页面的 Playground 目前仅支持纯文本。
/ 07为什么我的工具调用循环会收到 HTTP 400 错误?
您遗漏了较早 assistant 消息中的 reasoning_content。当存在 tools 数组时,DeepSeek 要求在之前所有的 assistant 轮次中都包含 reasoning 字段,即使是没有工具调用的轮次也不例外。请将其保存并在后续请求中原样传回。
/ 08适用的上下文和输出限制是多少?
DeepSeek 文档说明其拥有 1M token 的上下文窗口和最大 384K 的输出。Playground 默认输出 8192 个 token;对于较长的 Agent 运行任务可调高此限制,并请注意推理 token 也会计入其中。
/ 09我应该调用哪个端点?
POST https://aireiter.com/api/v1/chat/completions 是该模型的主要协议接口。对于 Anthropic 风格的客户端,使用相同的 id 调用 POST https://aireiter.com/api/v1/messages 同样有效。
/ 10在集成之前我可以先体验吗?
可以。本页面上的 Playground 运行与 API 相同的模型 id 和路由,因此您在此处看到的 token 计数与行为表现与 API 返回的结果一致。