AIREITER
DeepseekText Chat

DeepSeek V4.1 Flash

DeepSeek V4.1 Flash API 低於 DeepSeek 官方定價,無尖峰時段加價。支援 1M 上下文、原生圖片輸入、頂尖 Agent 編程評分。立即體驗或呼叫 API。

输入官方 $0.15 每 100 萬 TokensAIReiter $0.1127 每 100 萬 Tokens输出官方 $0.60 每 100 萬 TokensAIReiter $0.4507 每 100 萬 Tokens缓存读取官方 $0.003 每 100 萬 TokensAIReiter $0.0022 每 100 萬 Tokens
使用 API 執行

輸入

輸出

Example
Generated in
9.3 seconds
輸入 Token
184
輸出 Token
1471
Tokens per second
158.17 tokens / second
Time to first token
-

模型詳情

在 Playground、API 請求與內部工作流程中使用相同的模型鍵。

模型 ID
deepseek-v4-1-flash
供應商
Deepseek
協定
OpenAI Chat Completions · Anthropic Messages
上下文視窗
1,000,000 Token
最大輸出
384,000 Token
輸入 Token
11.27 credits / 1M Token
輸出 Token
45.07 credits / 1M Token
快取讀取
0.225 credits / 1M Token
快取寫入
-

DeepSeek V4.1 Flash 的全新改變

V4.1 Flash 是一個全新的模型系列,而非 V4 Flash 的微調版本。DeepSeek 重構了架構,並在 45 兆多模態 token 上從頭開始訓練,Flash 等級目前在大多數 Agent 基準測試中均超越了 V4 Pro。

因果編碼器-解碼器 MoE

由 552B 混合專家模型構成,分為 20 層編碼器與 20 層解碼器。讀取提示詞時僅活化 8B 參數,產生回答時活化 16B 參數,這也是為何規模如此龐大的模型仍能保持在 Flash 價格區間。

Agent 編程能力超越 V4 Pro

DeepSeek 官方報告顯示,Terminal-Bench 2.1 得分為 90.6(V4 Flash 為 82.7,V4 Pro 為 87.9),DeepSWE 得分為 74.2(相較於 54.4 與 62.7),Codeforces 評分達 3471。在 Terminal-Bench 3.0 上,分數更從 7.6 大幅躍升至 30.0。

原生視覺訓練,非外掛模組

全新的 DeepSeek-ViT 編碼器從預訓練第一步起就與文本模型共同訓練。V4 Flash 僅支援純文字,其視覺變體僅屬實驗性質。現在螢幕截圖、圖表與照片可直接與提示詞放在同一個請求中傳送。

1M 上下文僅需四分之一大小的 KV 快取

壓縮稀疏注意力機制與 FP4 KV 儲存將全域快取縮減至每 token 約 890 位元組,約為 V4 Flash 的四分之一。這使得 1M token 窗口能以 Flash 級別的成本運行,並在獨立測試中達到每秒 214 個 token。

DeepSeek V4.1 Flash 與 V4 Flash 比較

DeepSeek 官方已自動完成遷移:官方 ID 現為 deepseek-flash,仍指定 deepseek-v4-flash 的請求將由 V4.1 提供服務。在 AIReiter 上,兩者仍為獨立模型,方便您依需求固定使用任一版本。

更少的活化參數,更高的評分表現

V4 Flash 在每個 token 活化 13B 參數。V4.1 Flash 在 Prefill 階段活化 8B、Decode 階段活化 16B,但在 DeepSeek 公布的每一項 Agent 基準測試中依然超越前者。請勿將較小的 Prefill 參數視為降級。

思考模式現已預設開啟

V4 Flash 提供離散的思考模式。V4.1 Flash 則採用連續推理程度(reasoning effort)且預設為 high。在此路由中,即使請求設定為停用思考,仍會回傳推理過程;請相應規劃 max_tokens 預算。

圖片輸入已整合為基礎模型的一部分

若您過去在搭配 V4 Flash 時需將截圖轉發至獨立的視覺端點,現在 V4.1 Flash 可在單次呼叫中同時處理兩者。請在標準 content 陣列中以 base64 data URI 形式發送圖片;此路由不支援抓取遠端圖片 URL。

輸出官方定價翻倍,快取費用維持不變

官方輸出定價從每百萬 token $0.28 調升至 $0.60。快取命中(Cache-hit)輸入仍維持在約 $0.003。具有較長固定前綴且回答簡短的工作負載成本與以往相近;產生大量文字的工作負載成本則會增加。

在以下情況下建議保留 V4 Flash

若您有固定的評測套件、用戶端無法在工具調用循環中處理 reasoning_content,或是受限於嚴格的單一 token 輸出預算而尚未準備好遷移。否則,建議所有新專案直接採用 V4.1 Flash。

DeepSeek V4.1 Flash API 計費方式

DeepSeek 官方在離峰時段的定價為每百萬 Token 輸入 $0.15、輸出 $0.60,以及快取命中輸入 $0.003;在平日 01:00 至 04:00 及 06:00 至 10:00 UTC 尖峰時段,這三項價格皆翻倍。AIReiter 全天候採用單一固定費率計費:約比離峰官方定價低 25%,比尖峰定價低 62%。
01

全天統一單一費率

三項 token 計費項目約為 DeepSeek 離峰費率的四分之三。此路由沒有尖峰時段限制,因此在白天上班時段運行的任務與在夜間運行的費用完全相同。即時數據顯示於 Playground 上方。

02

實際節省成本之處

相較於官方尖峰費率,AIReiter 的價格約為 38%;相較於離峰費率則約為 75%。如果您的流量主要集中在歐美白天時段(即 DeepSeek 尖峰時段),實際節省的差距將比標題所示更加顯著。

03

推理 token 會以輸出計費

此路由無法關閉思考模式,且 V4.1 Flash 在 high effort 設定下輸出較為詳細。獨立測試顯示,在相同的任務集上,其輸出 token 數量約為同類模型的兩倍。設定 max_tokens 時請務必同時涵蓋推理過程與最終回答。

04

快取命中是成本最低的項目

快取命中(cache-hit)輸入 Token 的費用約為快取未命中(cache-miss)Token 的 2%。對於在每一輪對話中都重新發送相同系統提示詞與工具架構(tool schema)的 Agent 迴圈而言,快取讀取佔據了大部分帳單費用,這也是 V4.1 Flash 最具性價比的優勢所在。

何時該使用 DeepSeek V4.1 Flash —— 以及何時不該使用

DeepSeek 目前在品質、成本與速度方面均將 Flash 定位在 V4 Pro 之上。選擇其他模型的剩餘理由僅在於知識召回與用戶端相容性,而非核心能力。
01

適用於程式編寫與終端 Agent

多檔案編輯、測試與修復迴圈、CI 日誌排查以及電腦操作(computer-use)任務,是相較於 V4 Flash 與 V4 Pro 提升幅度最大的場景。長篇工具呼叫軌跡(tool traces)可直接放入 1M 上下文視窗中,無需分塊切片。

02

適用於螢幕截圖與圖表分析

從 UI 擷取畫面中進行 OCR、讀取圖表或檢查渲染後的頁面,都能直接與程式碼問題一同包含在同一個請求中。無需呼叫第二個模型,也不會產生額外帳單。

03

僅在需要相容性時使用 V4 Pro

DeepSeek 在推出 V4.1 Flash 後仍保留 V4 Pro 服務,是因為客戶需求,而非其評分更高。若您的合約或固定的評估基準(eval)有硬性要求,請繼續使用 Pro。

04

請勿將其當作百科全書使用

基礎模型在 SimpleQA-Verified 基準測試中落後 V4 Pro 約 13 分。若要在沒有檢索增強的情況下查詢事實,請使用您自己的文件為模型提供依據(grounding),或選擇專為資訊檢索調優的模型。

05

與 GLM-5.3 Flash 價格比較

GLM-5.3 Flash 是 AIReiter 上的另一款多模態 Flash 模型,其輸出價格更便宜。當任務涉及 Agent 迴圈或程式庫處理時,請選擇 V4.1 Flash;若是大量資料擷取與分類任務,則推薦選擇 GLM-5.3 Flash。

呼叫 DeepSeek V4.1 Flash API

本頁面的 Playground 與 API 共用同一個模型 ID。最容易導致用戶端串接出錯的整合規則,是在工具迴圈中處理 reasoning 的方式。

01

在 Playground 中測試真實的 Agent 任務

貼上失敗日誌、diff 與問題。觀察包含推理過程(reasoning)的輸出 Token,並在正式串接前確認回答品質。圖片輸入可透過 API 使用。

02

POST /api/v1/chat/completions

使用模型 "deepseek-v4-1-flash"、AIReiter API 金鑰以及標準的 Chat Completions 請求內文。支援串流傳輸(Streaming)。若您的架構支援 Anthropic Messages 格式,/api/v1/messages 亦支援相同的模型 ID。

03

使用工具時須完整回傳 reasoning_content

每當請求包含 tools 陣列時,先前所有助理輪次(assistant turn)都必須帶回其 reasoning_content,即使未發起工具呼叫的輪次也不例外。若遺漏則會回傳 HTTP 400。這項規則曾在 V4 上導致多個 Agent 框架出現異常,目前依然適用。

04

在 content 陣列中附加圖片(API)

使用帶有 base64 data URI 的 image_url 欄位。支援 PNG、JPEG、GIF 與 WebP 格式。此路由不會抓取遠端圖片 URL,因此請直接以內嵌位元組方式傳遞。當圖片是問題的背景脈絡而非主體時,請將文字部分置於前方。

DeepSeek V4.1 Flash API 常見問題

Model id、計費方式、V4 Flash 遷移、圖片輸入,以及會導致錯誤回傳的 reasoning 規則。

/ 01

DeepSeek V4.1 Flash API 的模型 ID 是什麼?

在 AIReiter 上請使用 deepseek-v4-1-flash。內部識別碼為 chat-deepseek-v4-1-flash。在 DeepSeek 官方直接呼叫時,官方 ID 為 deepseek-flash,而舊版的 deepseek-v4-flash ID 目前也由 V4.1 Flash 提供服務。

/ 02

DeepSeek V4.1 Flash 如何計費?

DeepSeek 官方在離峰時段的定價為每百萬 Token 輸入 $0.15、輸出 $0.60,以及快取命中輸入 $0.003,三者在平日尖峰時段皆翻倍。AIReiter 全天候採單一固定費率計費,約比離峰官方定價低 25%,比尖峰定價低 62%。目前的路由價格顯示於 Playground 上方。

/ 03

V4.1 Flash 比 V4 Pro 更好嗎?

在 DeepSeek 發布的 Agent 與程式碼基準測試中,確實如此:Terminal-Bench 2.1 為 90.6 對比 87.9,DeepSWE 為 74.2 對比 62.7。V4 Pro 在 GPQA Diamond 及知識召回上仍保持領先。DeepSeek 本身目前已將新使用者導流至 Flash。

/ 04

與 V4 Flash 有何不同?

採用全新的 encoder-decoder 架構,活躍參數為 8B 至 16B(而非 13B)、原生圖片輸入、常開推理(always-on reasoning)、1M 視窗僅需四分之一大小的 KV cache,且在各項 agent 基準測試中均有大幅提升。官方輸出牌價亦從 $0.28 調漲至 $0.60。

/ 05

我可以關閉思考功能嗎?

此路由無法關閉。即使發送停用 thinking 的請求,仍會返回 reasoning_content,且 reasoning_effort 不會被轉發。建議改用 max_tokens 與嚴謹精簡的 prompt 來控制成本。

/ 06

它支援圖片輸入嗎?

支援,可透過 API 輸入。V4.1 Flash 原生支援視覺功能,並已在此路由上通過驗證。請在 image_url 欄位中以 base64 data URI 形式發送 PNG、JPEG、GIF 或 WebP;系統不會主動抓取遠端 URL。本頁面的 playground 目前僅支援純文字。

/ 07

為什麼我的 tool-calling 迴圈會收到 HTTP 400?

因為您遺漏了先前 assistant 訊息中的 reasoning_content。當存在 tools 陣列時,DeepSeek 要求先前的每一個 assistant 回合都必須包含 reasoning 欄位,即使該回合沒有進行 tool call 也是如此。請將其儲存並原樣傳回。

/ 08

有哪些上下文和輸出限制?

DeepSeek 官方記載支援 1M token 的上下文視窗以及 384K 的最大輸出。Playground 預設為 8192 個輸出 token;若要執行長時間的 agent 任務請調高此上限,並請注意 reasoning token 也會計入其中。

/ 09

我應該呼叫哪個 endpoint?

POST https://aireiter.com/api/v1/chat/completions 是此模型的主要接口。針對 Anthropic 風格的客戶端,POST https://aireiter.com/api/v1/messages 亦可搭配相同的 id 使用。

/ 10

我可以在整合前先試用嗎?

可以。本頁面上的 playground 運行與 API 相同的 model id 與路由,因此您在此處看到的 token 計算與行為表現與 API 返回的結果完全一致。