DeepSeek V4.1 Flashの主な変更点
V4.1 FlashはV4 Flashの再調整版ではなく、完全に新しいモデルファミリーです。DeepSeekはアーキテクチャを再構築し、45兆のマルチモーダルトークンでゼロからトレーニングを行いました。その結果、Flashクラスでありながら、ほとんどのエージェントベンチマークでV4 Proを上回るスコアを記録しています。
因果的エンコーダー・デコーダーMoE
20層のエンコーダーと20層のデコーダーに分割された552BのMixture of Experts(MoE)モデル。プロンプト読み込み時のアクティブパラメータはわずか8B、回答生成時は16Bに抑えられており、この規模のモデルでありながらFlash価格帯を維持しています。
V4 Proを凌駕するエージェントコーディング性能
DeepSeekの報告によると、Terminal-Bench 2.1ではV4 Flashの82.7、V4 Proの87.9に対して90.6を記録。DeepSWEでは54.4、62.7に対して74.2、Codeforcesレーティングは3471を達成しました。Terminal-Bench 3.0では7.6から30.0へと飛躍的な向上を遂げています。
後付けではなく最初から組み込まれたビジョン機能
新しいDeepSeek-ViTエンコーダーは、事前学習の最初のステップからテキストモデルと共同でトレーニングされています。V4 Flashはテキスト専用でビジョン版は実験的なものでしたが、本モデルではスクリーンショット、グラフ、写真をプロンプトと同じリクエストに含めて送信できます。
1Mコンテキスト対応、KVキャッシュサイズを4分の1に削減
圧縮スパースアテンションとFP4 KVストレージにより、グローバルキャッシュを1トークンあたり約890バイト(V4 Flashの約4分の1)に削減。これにより、1MトークンのコンテキストウィンドウをFlashの低コストで、さらに独自テストで毎秒214トークンという高速処理を実現しています。
DeepSeek V4.1 Flash vs V4 Flash
DeepSeek公式ではすでに移行が完了しており、公式IDはdeepseek-flashとなり、deepseek-v4-flashと指定されたリクエストもV4.1で処理されます。AIReiterでは両モデルが分離して提供されているため、どちらか一方に固定して利用することができます。
より少ないアクティブパラメータで、より高いスコアを実現
V4 Flashはすべてのトークンで13Bのパラメータをアクティブ化します。一方、V4.1 Flashはプリフィル時に8B、デコード時に16Bをアクティブ化しつつ、DeepSeekが公開したすべてのエージェントベンチマークで従来版を上回っています。プリフィル時の数値が小さいことをダウングレードと捉えないでください。
思考プロセス(Thinking)が常時有効に
V4 Flashでは個別の思考モードが提供されていましたが、V4.1 Flashでは連続的な推論エフォートが採用され、デフォルトで「high」に設定されています。本ルートでは、thinkingを無効にして送信されたリクエストでも推論が出力されるため、max_tokensの予算設定にはご注意ください。
ベースモデルに画像入力を標準統合
V4 Flashの利用時にスクリーンショットを別のビジョンエンドポイントにルーティングしていた場合でも、V4.1 Flashなら1回の呼び出しで両方を処理できます。画像は標準のcontent配列にbase64データURIとして送信してください(本ルートではリモート画像URLの取得は行いません)。
出力定価は2倍に、キャッシュ費用は据え置き
公式の出力価格は100万トークンあたり0.28ドルから0.60ドルに改定されました。キャッシュヒット時の入力は0.003ドル前後で据え置かれています。プレフィックスが長く固定され回答が短いワークロードでは従来とほぼ同等のコストですが、出力が長くなる生成ではコストが増加します。
V4 Flashを引き続き使用すべきケース
固定された評価スイートがある場合、ツールループ内でreasoning_contentを処理できないクライアントを使用している場合、またはトークンあたりの厳格な出力予算があり移行準備が整っていない場合です。それ以外の場合は、V4.1 Flashで新規開発を始めることをお勧めします。
DeepSeek V4.1 Flash APIの料金
終日一律の定額料金
3種類のトークン料金はそれぞれDeepSeekのオフピーク料金の約4分の3で請求されます。本ルートにはピーク時間帯の設定がないため、北京の営業時間中に実行されるジョブも夜間と同じ料金で利用できます。最新の料金はプレイグラウンド上部に表示されています。
実際のコスト削減効果
公式のピーク料金と比較すると、AIReiterの価格は約38%です。オフピーク時と比較しても約75%となります。トラフィックがDeepSeekのピーク時間帯にあたる欧米の日中がメインである場合、見た目の数字以上のコスト削減効果が得られます。
推論トークンは出力として課金される
本ルートでは思考(Thinking)を無効化できず、V4.1 Flashは高エフォート時に詳細な推論を出力します。第三者テストでは、同じタスクセットにおいて同等モデルの約2倍の出力トークン数が記録されました。max_tokensには推論と思考回答の両方を考慮した値を設定してください。
キャッシュヒットが最も低コストな項目
キャッシュヒットした入力トークンのコストは、キャッシュミス時のトークンの約2%です。ターンごとに同じシステムプロンプトやツールスキーマを再送信するエージェントループでは、キャッシュ読み取りが請求の大半を占めるため、V4.1 Flashが最もコスト効率を発揮します。
DeepSeek V4.1 Flashを使うべき場面、使うべきでない場面
コーディングやターミナルエージェントに活用
複数ファイルの編集、テストと修正のループ、CIログのトリアージ、コンピューター操作(computer-use)タスクなどは、V4 FlashやV4 Proに対して公表されている性能向上が最も顕著な領域です。長いツールのトレースも、チャンク分割することなく1Mウィンドウに収まります。
スクリーンショットやグラフの解析に活用
UIキャプチャからのOCR、チャートの読み取り、レンダリングされたページの確認などを、コードに関する質問と同じリクエストに直接含めることができます。別のモデルを用意する必要も、追加の請求が発生することもありません。
V4 Proは互換性維持のためだけに使用
DeepSeekがV4.1 Flashのリリース後もV4 Proの提供を継続しているのは、スコアが高いからではなく顧客からの要望があったためです。契約や固定された評価環境(eval)で必要な場合のみ、Proを使い続けてください。
百科事典のような用途には不向き
ベースモデルのSimpleQA-Verifiedスコアは、V4 Proより約13ポイント下回っています。検索(RAG)を行わない事実確認には、独自のドキュメントでグラウンディングするか、想起(recall)向けに調整されたモデルを選択してください。
価格面でGLM-5.3 Flashと比較検討
GLM-5.3 FlashはAIReiterで利用できるもう1つのマルチモーダルFlashモデルであり、出力料金がより安価に設定されています。エージェントループやリポジトリ作業などのタスクにはV4.1 Flashを、大量のデータ抽出や分類にはGLM-5.3 Flashをお選びください。
DeepSeek V4.1 Flash APIの呼び出し
このページのプレイグラウンドとAPIは共通のモデルIDを使用します。クライアント側で最も問題が起きやすい統合ルールは、ツールループ内での推論(reasoning)の処理方法です。
プレイグラウンドで実際のエージェントタスクをテスト
エラーログを差分(diff)や質問と一緒に貼り付けてみてください。推論(reasoning)を含む出力トークンを確認し、本番実装する前に回答の品質を検証できます。画像入力はAPI経由で利用可能です。
POST /api/v1/chat/completions
モデル名に「deepseek-v4-1-flash」を指定し、AIReiter APIキーと標準のChat Completionsリクエストボディを使用します。ストリーミングにも対応しています。お使いの環境がAnthropic Messagesに対応している場合は、/api/v1/messagesでも同じIDが利用可能です。
ツール使用時はreasoning_contentを含めて往復させる
リクエストにtools配列が含まれる場合は、ツール呼び出しを行わなかったターンも含め、以前のすべてのアシスタントターンのreasoning_contentを含めて送信する必要があります。これを省略するとHTTP 400が返されます。これはV4で複数のエージェントフレームワークに不具合を生じさせたルールであり、引き続き適用されます。
content配列に画像を添付(API)
base64データURIを持つimage_urlパートを使用します。PNG、JPEG、GIF、WebPに対応しています。このルートではリモートの画像URLは取得されないため、バイトデータをインライン化してください。画像自体が質問の主題ではなく文脈(コンテキスト)である場合は、テキストパートを先頭に配置してください。
DeepSeek V4.1 Flash APIに関する質問
モデルID、料金、V4 Flashからの移行、画像入力、エラーの原因となる推論ルールについて。
/ 01DeepSeek V4.1 Flash APIのモデルIDは何ですか?
AIReiterではdeepseek-v4-1-flashを使用します。内部キーはchat-deepseek-v4-1-flashです。DeepSeek公式では正式なIDはdeepseek-flashであり、旧バージョンのdeepseek-v4-flash IDも現在はV4.1 Flashによって提供されています。
/ 02DeepSeek V4.1 Flashの料金体系はどうなっていますか?
DeepSeekの定価(100万トークンあたり)は、オフピーク時に入力$0.15、出力$0.60、キャッシュヒット入力$0.003で、平日のピーク時間帯にはこれら3つすべてが2倍になります。AIReiterは常時一律の料金で請求し、オフピーク定価より約25%安く、ピーク定価より約62%安価です。現在のルート料金はプレイグラウンドの上に表示されています。
/ 03V4.1 FlashはV4 Proよりも優れていますか?
DeepSeekが公開したエージェントおよびコーディングのベンチマークにおいては上回っています。Terminal-Bench 2.1では87.9に対して90.6、DeepSWEでは62.7に対して74.2を記録しています。GPQA Diamondや知識想起では依然としてV4 Proが優勢です。現在、DeepSeek自体も新規ユーザーをFlashへルーティングしています。
/ 04V4 Flashとの違いは何ですか?
13Bの代わりに8B〜16Bのアクティブパラメータを備えた新しいエンコーダ・デコーダアーキテクチャ、ネイティブの画像入力、常時有効な推論(reasoning)、1Mウィンドウ向けに4分の1のサイズとなったKVキャッシュ、そしてすべてのエージェントベンチマークにおける大幅な性能向上が挙げられます。公式の出力定価も0.28ドルから0.60ドルへと引き上げられました。
/ 05思考(thinking)機能をオフにすることはできますか?
このルートではオフにできません。思考を無効にして送信されたリクエストでもreasoning_contentが返され、reasoning_effortは転送されません。コストを抑えるには、max_tokensと簡潔なプロンプトを使用してください。
/ 06画像入力には対応していますか?
はい、API経由で対応しています。V4.1 Flashではビジョン機能がネイティブに組み込まれており、このルートでも検証済みです。PNG、JPEG、GIF、またはWebPをimage_urlパート内のbase64データURIとして送信してください。リモートURLの取得は行われません。なお、このページのPlaygroundは現在テキストのみに対応しています。
/ 07ツール呼び出し(tool-calling)のループでHTTP 400が発生するのはなぜですか?
以前のassistantメッセージからreasoning_contentが除外されているためです。tools配列が存在する場合、DeepSeekはツール呼び出しを行わないターンも含め、過去のすべてのassistantターンにreasoningフィールドを含めることを必須としています。この値を保存し、変更せずにそのまま送り返してください。
/ 08どのようなコンテキスト制限や出力制限が適用されますか?
DeepSeekの仕様書では、1Mトークンのコンテキストウィンドウと最大384Kの出力が記載されています。Playgroundのデフォルト出力は8,192トークンです。長時間のagent実行時にはこの値を引き上げてください。また、推論トークンもこの上限にカウントされることにご注意ください。
/ 09どのエンドポイントを呼び出す必要がありますか?
このモデルの主要なエンドポイントは POST https://aireiter.com/api/v1/chat/completions です。Anthropicスタイルのクライアント向けには、同じidで POST https://aireiter.com/api/v1/messages も利用可能です。
/ 10統合する前にお試し利用はできますか?
はい。このページのPlaygroundはAPIと同じモデルIDおよびルートで動作しているため、ここで確認できるトークン数や動作はAPIが返すものと同一です。