AIREITER
DeepseekText Chat

DeepSeek V4.1 Flash

DeepSeek V4.1 Flash API 价格低于 DeepSeek 官方定价,无高峰期加价。支持 1M 上下文、原生图像输入,具备顶尖的 Agent 编程跑分。立即体验或调用 API。

输入官方 $0.15 每 100 万 TokensAIReiter $0.1127 每 100 万 Tokens输出官方 $0.60 每 100 万 TokensAIReiter $0.4507 每 100 万 Tokens缓存读取官方 $0.003 每 100 万 TokensAIReiter $0.0022 每 100 万 Tokens
使用 API 运行

输入

输出

Example
Generated in
9.3 seconds
输入 Token
184
输出 Token
1471
Tokens per second
158.17 tokens / second
Time to first token
-

模型详情

在 Playground、API 请求和内部工作流中使用相同的模型 key。

模型 ID
deepseek-v4-1-flash
供应商
Deepseek
协议
OpenAI Chat Completions · Anthropic Messages
上下文窗口
1,000,000 Token
最大输出
384,000 Token
输入 Token
11.27 credits / 1M Token
输出 Token
45.07 credits / 1M Token
缓存读取
0.225 credits / 1M Token
缓存写入
-

DeepSeek V4.1 Flash 的主要变化

V4.1 Flash 是一个全新的模型系列,而非 V4 Flash 的微调版本。DeepSeek 重构了架构,并在 45 万亿多模态 token 上从零开始训练,使得该 Flash 级别模型在多数 Agent 基准测试中超越了 V4 Pro。

因果编码器-解码器 MoE

这是一个 552B 的混合专家架构(MoE),分为 20 层编码器和 20 层解码器。读取 Prompt 时仅激活 8B 参数,生成回答时激活 16B 参数,这也是为何如此庞大的模型仍能保持在 Flash 价格区间的原因。

Agent 编程能力超越 V4 Pro

DeepSeek 报告显示:Terminal-Bench 2.1 得分为 90.6(V4 Flash 为 82.7,V4 Pro 为 87.9);DeepSWE 得分为 74.2(对比 54.4 和 62.7);Codeforces Rating 达到 3471。在 Terminal-Bench 3.0 上,得分更是从 7.6 跃升至 30.0。

原生视觉训练,非外挂拼接

全新的 DeepSeek-ViT 编码器从预训练第一步就与文本模型联合训练。V4 Flash 仅支持纯文本,其视觉变体只是实验性质。现在屏幕截图、图表和照片可直接与 Prompt 放在同一请求中发送。

KV Cache 体积仅 1/4,支持 1M 上下文

压缩稀疏注意力机制和 FP4 KV 存储将全局缓存缩减至每 token 约 890 字节,大约仅为 V4 Flash 的四分之一。这使得 1M token 上下文窗口能在维持 Flash 级成本的同时,在独立测试中达到每秒 214 个 token 的速度。

DeepSeek V4.1 Flash 对比 V4 Flash

在 DeepSeek 官方,迁移已自动完成:官方模型 ID 现为 deepseek-flash,仍指定 deepseek-v4-flash 的请求也会由 V4.1 提供服务。而在 AIReiter 上,两者仍保持为独立模型,方便您固定选用任意版本。

激活参数更少,跑分反而更高

V4 Flash 对每个 token 激活 13B 参数。V4.1 Flash 在 Prefill 阶段激活 8B、在 Decode 阶段激活 16B,但在 DeepSeek 公布的所有 Agent 基准测试中均超越了前者。请勿将较小的 Prefill 参数量误认为是降级。

思考模式现已默认常开

V4 Flash 提供了离散的思考模式选项。V4.1 Flash 采用连续推理力度(Reasoning Effort)且默认设为 High。在此线路上,即便请求中禁用了思考模式,依然会返回推理过程;请相应合理规划 max_tokens 预算。

图像输入已成为基础模型的一部分

如果您之前在使用 V4 Flash 时需要将截图路由至独立的视觉接口,V4.1 Flash 现在单次调用即可同时处理。请在标准 content 数组中以 base64 data URI 形式发送图片;此路由不支持拉取远程图片 URL。

输出官方价格翻倍,缓存价格保持不变

官方输出价格从每百万 token $0.28 调整为 $0.60。缓存命中输入价格仍保持在 $0.003 左右。具有长稳定前缀和短回答的工作负载成本与此前基本一致;长文本生成场景的成本则有所上升。

何时建议保留 V4 Flash

当您有固定的评测套件、客户端无法在工具调用循环中处理 reasoning_content,或者受限于严格的单 token 输出预算而未准备好迁移时,可保留 V4 Flash。除上述情况外,建议在新业务中直接使用 V4.1 Flash。

DeepSeek V4.1 Flash API 定价

DeepSeek 官方在非高峰时段的定价为每百万 token 输入 $0.15、输出 $0.60、缓存命中输入 $0.003,并在工作日 UTC 时间 01:00 至 04:00 及 06:00 至 10:00 期间将三项价格翻倍。AIReiter 则全天候实行统一费率:比官方非高峰价低约 25%,比高峰价低约 62%。
01

全天统一费率,无波峰溢价

三种 token 计费项的价格均约为 DeepSeek 官方闲时(Off-peak)费率的四分之三。此线路无高峰期时段限制,因此在北京工作时间运行的任务与夜间运行享有相同价格。实时价格数据可在 Playground 上方查看。

02

实际节省成本的优势所在

相比官方高峰期费率,AIReiter 的价格仅为约 38%;相比闲时费率则约为 75%。如果您的业务流量主要集中在欧美白天(即 DeepSeek 的高峰期),实际节省幅度将远超字面体现。

03

推理 token 按输出计费

此线路无法关闭思考模式,且 V4.1 Flash 在高推理力度下输出较为详尽。独立测试显示,在相同任务集下其输出 token 量约为同类模型的两倍。请务必将 max_tokens 设置为能够容纳推理过程加最终回答的数值。

04

缓存命中是最便宜的计费项

缓存命中的输入 token 费用仅约为未命中 token 的 2%。对于在每一轮都重复发送相同系统提示词和工具架构的 Agent 循环,缓存读取构成了账单的主要部分,也是 V4.1 Flash 最具性价比的场景。

何时使用 DeepSeek V4.1 Flash,以及何时不宜使用

DeepSeek 现已将 Flash 定位在质量、成本和速度上均超越 V4 Pro。选择其他模型的仅存理由主要在于知识召回与客户端兼容性,而非底层核心能力。
01

适用于代码编写与终端 Agent

多文件编辑、测试-修复循环、CI 日志排查以及计算机使用(computer-use)任务,是其相比 V4 Flash 和 V4 Pro 性能提升最为显著的场景。长工具调用轨迹可直接容纳于 1M 上下文窗口中,无需分块处理。

02

适用于屏幕截图和图表分析

从 UI 截图中进行 OCR 识别、读取图表或检查渲染页面,均可与代码问题放入同一个请求中直接处理。无需调用第二个模型,也不会产生额外的账单费用。

03

仅在需要兼容性时使用 V4 Pro

DeepSeek 在发布 V4.1 Flash 后仍保留 V4 Pro 服务是应客户要求,而非因其得分更高。仅当合同要求或基准评测版本冻结需要时,才建议继续使用 Pro。

04

请勿将其用作百科全书

该基础模型在 SimpleQA-Verified 上的得分落后 V4 Pro 约 13 分。如果进行无检索的事实查询,请通过自有文档为模型补充事实依据,或选择针对知识召回优化过的模型。

05

与 GLM-5.3 Flash 进行价格对比

GLM-5.3 Flash 是 AIReiter 上的另一款多模态 Flash 模型,其输出价格更低。如果任务是 Agent 循环或代码仓库作业,请选择 V4.1 Flash;若面对大批量的提取与分类任务,请选择 GLM-5.3 Flash。

调用 DeepSeek V4.1 Flash API

本页面上的 Playground 与 API 共享同一个模型 ID。集成时最容易导致客户端报错的一条规则,是工具循环中对推理内容(reasoning)的处理方式。

01

在 Playground 中发送真实的 Agent 任务

粘贴报错日志、代码差异(diff)和问题。观察包含推理过程的输出 token,并在将其接入系统前确认回答质量。图像输入功能可通过 API 使用。

02

POST /api/v1/chat/completions

使用模型 "deepseek-v4-1-flash"、AIReiter API 密钥以及标准的 Chat Completions 请求体。支持流式传输。如果您的技术栈采用 Anthropic Messages 协议,/api/v1/messages 端点同样接受该模型 ID。

03

存在 tools 时务必回传 reasoning_content

只要请求中包含 tools 数组,之前每一次 assistant 轮次都必须带回其 reasoning_content,包括未发起工具调用的轮次。遗漏该字段将返回 HTTP 400。正是这一规则曾导致数个 Agent 框架在 V4 上报错,且该规则目前依然生效。

04

在 content 数组中附带图像 (API)

使用带有 base64 data URI 的 image_url 字段。支持 PNG、JPEG、GIF 和 WebP 格式。该路由不会抓取远程图片 URL,因此请内联传入字节数据。当图像作为问题的背景上下文而非提问主体时,请将文本部分置于前面。

DeepSeek V4.1 Flash API 常见问题

模型 id、定价、V4 Flash 迁移、图像输入以及导致报错的推理规则说明。

/ 01

DeepSeek V4.1 Flash API 的模型 ID 是什么?

在 AIReiter 上请使用 deepseek-v4-1-flash。其内部标识键为 chat-deepseek-v4-1-flash。在 DeepSeek 官方直接调用时,官方 ID 为 deepseek-flash,且旧版的 deepseek-v4-flash ID 现在也同样由 V4.1 Flash 提供服务。

/ 02

DeepSeek V4.1 Flash 如何计费?

DeepSeek 官方在非高峰时段的标价为每百万 token 输入 $0.15、输出 $0.60、缓存命中输入 $0.003,在工作日高峰时段三者均翻倍。AIReiter 则全天候实行统一费率,比官方非高峰价低约 25%,比高峰价低约 62%。当前路由价格已展示在 Playground 上方。

/ 03

V4.1 Flash 是否优于 V4 Pro?

在 DeepSeek 发布的 Agent 和代码基准测试中,答案是肯定的:Terminal-Bench 2.1 得分为 90.6 对比 87.9,DeepSWE 得分为 74.2 对比 62.7。V4 Pro 在 GPQA Diamond 和知识召回方面仍然领先。DeepSeek 自身目前已将新用户路由至 Flash。

/ 04

与 V4 Flash 相比有什么不同?

采用全新的编码器-解码器架构,激活参数为 8B 至 16B(原为 13B),支持原生图像输入、始终开启的思考推理、针对 1M 窗口缩减至四分之一大小的 KV cache,并在各项 Agent 基准测试中均有大幅提升。官方输出标价也从 $0.28 上涨至 $0.60。

/ 05

我可以关闭思考过程吗?

在此路由上不可行。发送禁用思考的请求仍会返回 reasoning_content,且 reasoning_effort 不会被转发。建议改用 max_tokens 和严谨的提示词来控制成本。

/ 06

它支持接收图像吗?

支持,可通过 API 传入。V4.1 Flash 原生支持视觉能力,并已在此路由上完成验证。可在 image_url 部分中以 base64 data URI 形式发送 PNG、JPEG、GIF 或 WebP;不支持抓取远程 URL。本页面的 Playground 目前仅支持纯文本。

/ 07

为什么我的工具调用循环会收到 HTTP 400 错误?

您遗漏了较早 assistant 消息中的 reasoning_content。当存在 tools 数组时,DeepSeek 要求在之前所有的 assistant 轮次中都包含 reasoning 字段,即使是没有工具调用的轮次也不例外。请将其保存并在后续请求中原样传回。

/ 08

适用的上下文和输出限制是多少?

DeepSeek 文档说明其拥有 1M token 的上下文窗口和最大 384K 的输出。Playground 默认输出 8192 个 token;对于较长的 Agent 运行任务可调高此限制,并请注意推理 token 也会计入其中。

/ 09

我应该调用哪个端点?

POST https://aireiter.com/api/v1/chat/completions 是该模型的主要协议接口。对于 Anthropic 风格的客户端,使用相同的 id 调用 POST https://aireiter.com/api/v1/messages 同样有效。

/ 10

在集成之前我可以先体验吗?

可以。本页面上的 Playground 运行与 API 相同的模型 id 和路由,因此您在此处看到的 token 计数与行为表现与 API 返回的结果一致。