AIREITER
DeepseekText Chat

DeepSeek V4.1 Flash

DeepSeek公式定価より安価でピーク時間帯の割増なしのDeepSeek V4.1 Flash API。1Mコンテキスト、ネイティブ画像入力、最高峰のエージェントコーディングスコア。プレイグラウンドで試すか、API経由でご利用ください。

入力公式 $0.15 100万トークンあたりAIReiter $0.1127 100万トークンあたり出力公式 $0.60 100万トークンあたりAIReiter $0.4507 100万トークンあたりキャッシュ読み取り公式 $0.003 100万トークンあたりAIReiter $0.0022 100万トークンあたり
APIで実行

入力

出力

Example
Generated in
9.3 seconds
入力 Token
184
出力 Token
1471
Tokens per second
158.17 tokens / second
Time to first token
-

モデル詳細

Playground、APIリクエスト、社内ワークフローで同じモデルキーを使用してください。

モデル ID
deepseek-v4-1-flash
プロバイダー
Deepseek
プロトコル
OpenAI Chat Completions · Anthropic Messages
コンテキストウィンドウ
1,000,000 トークン
最大出力
384,000 トークン
入力 Token
11.27 credits / 100万トークン
出力 Token
45.07 credits / 100万トークン
キャッシュ読み取り
0.225 credits / 100万トークン
キャッシュ書き込み
-

DeepSeek V4.1 Flashの主な変更点

V4.1 FlashはV4 Flashの再調整版ではなく、完全に新しいモデルファミリーです。DeepSeekはアーキテクチャを再構築し、45兆のマルチモーダルトークンでゼロからトレーニングを行いました。その結果、Flashクラスでありながら、ほとんどのエージェントベンチマークでV4 Proを上回るスコアを記録しています。

因果的エンコーダー・デコーダーMoE

20層のエンコーダーと20層のデコーダーに分割された552BのMixture of Experts(MoE)モデル。プロンプト読み込み時のアクティブパラメータはわずか8B、回答生成時は16Bに抑えられており、この規模のモデルでありながらFlash価格帯を維持しています。

V4 Proを凌駕するエージェントコーディング性能

DeepSeekの報告によると、Terminal-Bench 2.1ではV4 Flashの82.7、V4 Proの87.9に対して90.6を記録。DeepSWEでは54.4、62.7に対して74.2、Codeforcesレーティングは3471を達成しました。Terminal-Bench 3.0では7.6から30.0へと飛躍的な向上を遂げています。

後付けではなく最初から組み込まれたビジョン機能

新しいDeepSeek-ViTエンコーダーは、事前学習の最初のステップからテキストモデルと共同でトレーニングされています。V4 Flashはテキスト専用でビジョン版は実験的なものでしたが、本モデルではスクリーンショット、グラフ、写真をプロンプトと同じリクエストに含めて送信できます。

1Mコンテキスト対応、KVキャッシュサイズを4分の1に削減

圧縮スパースアテンションとFP4 KVストレージにより、グローバルキャッシュを1トークンあたり約890バイト(V4 Flashの約4分の1)に削減。これにより、1MトークンのコンテキストウィンドウをFlashの低コストで、さらに独自テストで毎秒214トークンという高速処理を実現しています。

DeepSeek V4.1 Flash vs V4 Flash

DeepSeek公式ではすでに移行が完了しており、公式IDはdeepseek-flashとなり、deepseek-v4-flashと指定されたリクエストもV4.1で処理されます。AIReiterでは両モデルが分離して提供されているため、どちらか一方に固定して利用することができます。

より少ないアクティブパラメータで、より高いスコアを実現

V4 Flashはすべてのトークンで13Bのパラメータをアクティブ化します。一方、V4.1 Flashはプリフィル時に8B、デコード時に16Bをアクティブ化しつつ、DeepSeekが公開したすべてのエージェントベンチマークで従来版を上回っています。プリフィル時の数値が小さいことをダウングレードと捉えないでください。

思考プロセス(Thinking)が常時有効に

V4 Flashでは個別の思考モードが提供されていましたが、V4.1 Flashでは連続的な推論エフォートが採用され、デフォルトで「high」に設定されています。本ルートでは、thinkingを無効にして送信されたリクエストでも推論が出力されるため、max_tokensの予算設定にはご注意ください。

ベースモデルに画像入力を標準統合

V4 Flashの利用時にスクリーンショットを別のビジョンエンドポイントにルーティングしていた場合でも、V4.1 Flashなら1回の呼び出しで両方を処理できます。画像は標準のcontent配列にbase64データURIとして送信してください(本ルートではリモート画像URLの取得は行いません)。

出力定価は2倍に、キャッシュ費用は据え置き

公式の出力価格は100万トークンあたり0.28ドルから0.60ドルに改定されました。キャッシュヒット時の入力は0.003ドル前後で据え置かれています。プレフィックスが長く固定され回答が短いワークロードでは従来とほぼ同等のコストですが、出力が長くなる生成ではコストが増加します。

V4 Flashを引き続き使用すべきケース

固定された評価スイートがある場合、ツールループ内でreasoning_contentを処理できないクライアントを使用している場合、またはトークンあたりの厳格な出力予算があり移行準備が整っていない場合です。それ以外の場合は、V4.1 Flashで新規開発を始めることをお勧めします。

DeepSeek V4.1 Flash APIの料金

DeepSeekの定価(100万トークンあたり)は、オフピーク時に入力$0.15、出力$0.60、キャッシュヒット入力$0.003で、平日の01:00〜04:00および06:00〜10:00 UTCにはこれら3つすべてが2倍になります。AIReiterは24時間いつでも単一の一律料金で請求し、オフピーク定価より約25%安く、ピーク時定価より約62%安価です。
01

終日一律の定額料金

3種類のトークン料金はそれぞれDeepSeekのオフピーク料金の約4分の3で請求されます。本ルートにはピーク時間帯の設定がないため、北京の営業時間中に実行されるジョブも夜間と同じ料金で利用できます。最新の料金はプレイグラウンド上部に表示されています。

02

実際のコスト削減効果

公式のピーク料金と比較すると、AIReiterの価格は約38%です。オフピーク時と比較しても約75%となります。トラフィックがDeepSeekのピーク時間帯にあたる欧米の日中がメインである場合、見た目の数字以上のコスト削減効果が得られます。

03

推論トークンは出力として課金される

本ルートでは思考(Thinking)を無効化できず、V4.1 Flashは高エフォート時に詳細な推論を出力します。第三者テストでは、同じタスクセットにおいて同等モデルの約2倍の出力トークン数が記録されました。max_tokensには推論と思考回答の両方を考慮した値を設定してください。

04

キャッシュヒットが最も低コストな項目

キャッシュヒットした入力トークンのコストは、キャッシュミス時のトークンの約2%です。ターンごとに同じシステムプロンプトやツールスキーマを再送信するエージェントループでは、キャッシュ読み取りが請求の大半を占めるため、V4.1 Flashが最もコスト効率を発揮します。

DeepSeek V4.1 Flashを使うべき場面、使うべきでない場面

DeepSeekは現在、Flashを品質、コスト、速度の面でV4 Proよりも上位に位置づけています。他のモデルを選ぶ理由が残るとすれば、それは純粋な能力の差ではなく、知識の想起やクライアントの互換性によるものです。
01

コーディングやターミナルエージェントに活用

複数ファイルの編集、テストと修正のループ、CIログのトリアージ、コンピューター操作(computer-use)タスクなどは、V4 FlashやV4 Proに対して公表されている性能向上が最も顕著な領域です。長いツールのトレースも、チャンク分割することなく1Mウィンドウに収まります。

02

スクリーンショットやグラフの解析に活用

UIキャプチャからのOCR、チャートの読み取り、レンダリングされたページの確認などを、コードに関する質問と同じリクエストに直接含めることができます。別のモデルを用意する必要も、追加の請求が発生することもありません。

03

V4 Proは互換性維持のためだけに使用

DeepSeekがV4.1 Flashのリリース後もV4 Proの提供を継続しているのは、スコアが高いからではなく顧客からの要望があったためです。契約や固定された評価環境(eval)で必要な場合のみ、Proを使い続けてください。

04

百科事典のような用途には不向き

ベースモデルのSimpleQA-Verifiedスコアは、V4 Proより約13ポイント下回っています。検索(RAG)を行わない事実確認には、独自のドキュメントでグラウンディングするか、想起(recall)向けに調整されたモデルを選択してください。

05

価格面でGLM-5.3 Flashと比較検討

GLM-5.3 FlashはAIReiterで利用できるもう1つのマルチモーダルFlashモデルであり、出力料金がより安価に設定されています。エージェントループやリポジトリ作業などのタスクにはV4.1 Flashを、大量のデータ抽出や分類にはGLM-5.3 Flashをお選びください。

DeepSeek V4.1 Flash APIの呼び出し

このページのプレイグラウンドとAPIは共通のモデルIDを使用します。クライアント側で最も問題が起きやすい統合ルールは、ツールループ内での推論(reasoning)の処理方法です。

01

プレイグラウンドで実際のエージェントタスクをテスト

エラーログを差分(diff)や質問と一緒に貼り付けてみてください。推論(reasoning)を含む出力トークンを確認し、本番実装する前に回答の品質を検証できます。画像入力はAPI経由で利用可能です。

02

POST /api/v1/chat/completions

モデル名に「deepseek-v4-1-flash」を指定し、AIReiter APIキーと標準のChat Completionsリクエストボディを使用します。ストリーミングにも対応しています。お使いの環境がAnthropic Messagesに対応している場合は、/api/v1/messagesでも同じIDが利用可能です。

03

ツール使用時はreasoning_contentを含めて往復させる

リクエストにtools配列が含まれる場合は、ツール呼び出しを行わなかったターンも含め、以前のすべてのアシスタントターンのreasoning_contentを含めて送信する必要があります。これを省略するとHTTP 400が返されます。これはV4で複数のエージェントフレームワークに不具合を生じさせたルールであり、引き続き適用されます。

04

content配列に画像を添付(API)

base64データURIを持つimage_urlパートを使用します。PNG、JPEG、GIF、WebPに対応しています。このルートではリモートの画像URLは取得されないため、バイトデータをインライン化してください。画像自体が質問の主題ではなく文脈(コンテキスト)である場合は、テキストパートを先頭に配置してください。

DeepSeek V4.1 Flash APIに関する質問

モデルID、料金、V4 Flashからの移行、画像入力、エラーの原因となる推論ルールについて。

/ 01

DeepSeek V4.1 Flash APIのモデルIDは何ですか?

AIReiterではdeepseek-v4-1-flashを使用します。内部キーはchat-deepseek-v4-1-flashです。DeepSeek公式では正式なIDはdeepseek-flashであり、旧バージョンのdeepseek-v4-flash IDも現在はV4.1 Flashによって提供されています。

/ 02

DeepSeek V4.1 Flashの料金体系はどうなっていますか?

DeepSeekの定価(100万トークンあたり)は、オフピーク時に入力$0.15、出力$0.60、キャッシュヒット入力$0.003で、平日のピーク時間帯にはこれら3つすべてが2倍になります。AIReiterは常時一律の料金で請求し、オフピーク定価より約25%安く、ピーク定価より約62%安価です。現在のルート料金はプレイグラウンドの上に表示されています。

/ 03

V4.1 FlashはV4 Proよりも優れていますか?

DeepSeekが公開したエージェントおよびコーディングのベンチマークにおいては上回っています。Terminal-Bench 2.1では87.9に対して90.6、DeepSWEでは62.7に対して74.2を記録しています。GPQA Diamondや知識想起では依然としてV4 Proが優勢です。現在、DeepSeek自体も新規ユーザーをFlashへルーティングしています。

/ 04

V4 Flashとの違いは何ですか?

13Bの代わりに8B〜16Bのアクティブパラメータを備えた新しいエンコーダ・デコーダアーキテクチャ、ネイティブの画像入力、常時有効な推論(reasoning)、1Mウィンドウ向けに4分の1のサイズとなったKVキャッシュ、そしてすべてのエージェントベンチマークにおける大幅な性能向上が挙げられます。公式の出力定価も0.28ドルから0.60ドルへと引き上げられました。

/ 05

思考(thinking)機能をオフにすることはできますか?

このルートではオフにできません。思考を無効にして送信されたリクエストでもreasoning_contentが返され、reasoning_effortは転送されません。コストを抑えるには、max_tokensと簡潔なプロンプトを使用してください。

/ 06

画像入力には対応していますか?

はい、API経由で対応しています。V4.1 Flashではビジョン機能がネイティブに組み込まれており、このルートでも検証済みです。PNG、JPEG、GIF、またはWebPをimage_urlパート内のbase64データURIとして送信してください。リモートURLの取得は行われません。なお、このページのPlaygroundは現在テキストのみに対応しています。

/ 07

ツール呼び出し(tool-calling)のループでHTTP 400が発生するのはなぜですか?

以前のassistantメッセージからreasoning_contentが除外されているためです。tools配列が存在する場合、DeepSeekはツール呼び出しを行わないターンも含め、過去のすべてのassistantターンにreasoningフィールドを含めることを必須としています。この値を保存し、変更せずにそのまま送り返してください。

/ 08

どのようなコンテキスト制限や出力制限が適用されますか?

DeepSeekの仕様書では、1Mトークンのコンテキストウィンドウと最大384Kの出力が記載されています。Playgroundのデフォルト出力は8,192トークンです。長時間のagent実行時にはこの値を引き上げてください。また、推論トークンもこの上限にカウントされることにご注意ください。

/ 09

どのエンドポイントを呼び出す必要がありますか?

このモデルの主要なエンドポイントは POST https://aireiter.com/api/v1/chat/completions です。Anthropicスタイルのクライアント向けには、同じidで POST https://aireiter.com/api/v1/messages も利用可能です。

/ 10

統合する前にお試し利用はできますか?

はい。このページのPlaygroundはAPIと同じモデルIDおよびルートで動作しているため、ここで確認できるトークン数や動作はAPIが返すものと同一です。