AIREITER

Hy3 vs DeepSeek V4 Flash:価格、コンテキスト、開発者の実使用レビュー

最終更新日: 2026-07-29 11:46:21

コーディングエージェントのコンテキストが概ね150Kトークン以内に収まるなら、同程度の入力単価でより賢く使えるHy3が有力だ。一方、長時間セッションや大規模リポジトリを扱う場合、あるいは本番で高い並行処理性能が必要な場合は、DeepSeek V4 Flashに分がある。Hy3にはない1Mトークンのコンテキスト、明示されたキャッシュヒット時の$0.0028、そして2,500リクエストの同時実行上限を備えるからだ。これがhy3 vs deepseek v4 flashの結論を先にまとめたものとなる。以下では、2026年7月14日に確認したDeepSeek公式ドキュメントとOpenRouterの掲載価格、第三者ベンチマーク、Hacker NewsやRedditで両者を日常的に使う開発者の報告をもとに判断する。

似た規模でも、設計思想は別物

Tencentは2026年7月6日にHy3の正式版をリリースした。4月23日から公開されていたプレビュー版の後継にあたる。Tencentの発表によれば、総パラメータ数295B、アクティブパラメータ数21BのMixture-of-Expertsモデルで、リクエストごとに必要な推論量をモデル自身が判断する「高速・低速のハイブリッド思考」を採用する。コンテキスト長は最大256Kトークン。重みはApache 2.0で公開され、APIはTencent Cloud TokenHubで提供される。

DeepSeek V4 Flashは、V4ファミリーの高速ティアとして2026年4月に登場した。Artificial Analysisによると、こちらもオープンウェイトのMoEで、総パラメータ数は284B、アクティブは13B。MITライセンスで公開されている。目標は異なり、1Mトークンという長大なコンテキストを低コストで扱うことに重点を置く。thinkingとnon-thinkingの両モードをサポートし、デフォルトはthinking。最大出力は384Kトークンだ。

パラメータ規模だけを見れば近い。しかし、狙っているところは違う。Hy3はトークン当たりの推論品質にリソースを振り、Flashはコンテキスト長、キャッシュ効率、スループットを重視する。実運用で現れる差の多くは、この設計方針の違いに由来する。

仕様(2026-07-14確認)Hy3DeepSeek V4 Flash
パラメータ総数295B / アクティブ21B総数284B / アクティブ13B
コンテキストウィンドウ256K1M(最大出力384K)
推論高速・低速のハイブリッド思考thinking + non-thinkingモード
ライセンスApache 2.0MIT
リリース2026年7月6日(プレビューは4月23日)2026年4月
公式APITencent Cloud TokenHubapi.deepseek.com(OpenAI + Anthropic形式)

ベンチマークから読み取れること

Artificial Analysis Intelligence Index v4.1では、Hy3が41、DeepSeek V4 Flashは高努力の推論モードで37となっている。この指標での4ポイント差は無視できない。Flashと、その一段下のモデル群との距離におおむね相当する。ただし、明確なクラス差と呼べるほどではない。両モデルとも「非常に有能だが、最先端ではない」領域に位置する。

Intelligence IndexでHy3が41、DeepSeek V4 Flashが37と示されたArtificial Analysisの比較カード

ただし、このスコアを過信する前に押さえておきたい点が2つある。

まず、エージェント型コーディングのベンチマークでは、両モデルともより厳しい評価になる。Hacker Newsのローンチスレッドでは、あるコメント投稿者がHy3のDeepSWE結果を掘り起こしている。Hy3は28%で、最大努力設定のGPT-5.4は52%だった。中国勢のこの2モデルは、最先端のエージェント型コーディングモデルに迫っているわけではない。上位モデルと競うというより、互いに比較される位置づけだ。

もう1つは、両社が公表するベンチマーク表には通常どおり慎重であるべきということだ。Hy3のローンチ数値にはHNスレッドで即座に「benchmaxxed」との批判が出た。DeepSeekの表も、自社が実施を選んだ評価しか載せていない。判断の軸にすべきなのは前出の第三者データであり、そこから見えるのは「Hy3のほうがやや賢いが、価格とコンテキスト次第で選択は逆転するほど差は小さい」ということだ。

料金比較で見るべきは表示価格ではない

2026年7月14日に確認した2つの料金表は、分けて考える必要がある。DeepSeekは公式APIドキュメントで、正確なトークン単価を公開している。一方Tencentは、Hy3正式版についてこれに相当する英語の料金表を公開していない。プレスリリースでは、Hy3プレビューのTokenHubにおける入力価格を100万トークン当たり約$0.18としている。そのため、以下のHy3列にはOpenRouterの掲載料金を使っている。公式の一次価格ではなく、マーケットプレイス上の価格だ。

100万トークン当たりHy3(OpenRouterマーケットプレイス)DeepSeek V4 Flash(公式API)
入力$0.14$0.14(キャッシュミス)
キャッシュ済み入力$0.035$0.0028(キャッシュヒット)
出力$0.58$0.28
キャッシュ済み入力100万トークン当たり$0.0028と記載されたDeepSeek公式料金表

通常の入力価格は同じだ。差が決定的になるのは、残る2行である。

キャッシュヒット時の価格差は大きい

DeepSeekのキャッシュヒット価格はキャッシュミス時の50分の1で、OpenRouter上のHy3のキャッシュ済み料金と比べても12.5分の1だ。もっとも、この2つのキャッシュ料金は厳密に同条件ではない。DeepSeekは公式API料金であり、Hy3はOpenRouterの基盤プロバイダーがキャッシュ読み出しに設定する料金だからだ。それでも、現時点で実際に支払う単価として見るべき数字ではある。エージェントを動かすなら、ここがこの記事で最も重要な数値になる。エージェントのループでは、システムプロンプト、ツール定義、ファイル内容、会話履歴といった増大していく同じコンテキストをターンごとに再送する。40ターンのセッションでは、入力トークンの大半が繰り返しになる。キャッシュヒット率90%なら、Flashの実効入力単価は100万トークン当たり$0.14から約$0.017まで下がる。Hy3は約$0.045となる。十分安価ではあるものの、なお約3倍であり、セッションが長くなるほど差は広がる。

Hy3は出力トークンの単価が重い

両者は推論モデルであり、thinkingに使うトークンも出力として課金される。Hy3の出力料金は$0.58で、Flashの$0.28の2倍を超える。長い推論連鎖を生成するたび、Hy3ではおおむね倍の費用がかかる計算だ。FlashにはHy3にない逃げ道もある。整形、抽出、単純な編集といった機械的な処理ではnon-thinkingモードに切り替え、不要な推論コストを止められる。モード切り替えの実際については、deepseek-v4-flash-vs-deepseek-v4-proの比較で詳しく扱っている。

無料で試せるのはHy3

Hy3には明確な利点が1つある。OpenRouterには、レート制限付きながら実際に無料で使えるtencent/hy3:freeが掲載されている。導入前のモデル評価という点では、無料APIティアを持たないFlashより試しやすい。4月時点のチェックポイントで問題なければ、Hy3プレビューも$0.063/$0.21で提供されており、正式版より安い。

256Kコンテキストが生む見えにくいコスト

Hy3の256Kコンテキストは、一見すると十分に思える。だが実際のコードベースを相手にエージェントを動かすと事情は変わる。r/hermesagentのRedditユーザーは、同じハーネスで両モデルを運用し、Hy3を「コンテキストサイズ以外はほぼ同じだが、頻繁な圧縮が必要」と表現した。圧縮は単なる手間ではない。要約のために出力トークンを消費し、細部を捨て、プロンプトキャッシュも無効にする。その後の再構築ではキャッシュミス料金を支払うことになる。

セルフホストでは、この差が構造的なものになる。V4アーキテクチャのスパースアテンション設計、DeepSeekがlightning indexerと呼ぶ仕組みは、Hy3の従来型アテンションと比べてKVキャッシュを大幅に軽量化する。ベンチマークではなく個人の報告ではあるが、HNスレッドに出ている数値は印象的だ。DGX Spark 2台で両方を動かしたという投稿者は、DeepSeek V4 Flashでは3MトークンのKVキャッシュを併存させられたのに対し、Hy3をFP4に量子化した場合は約130Kトークンだったと報告している。別の投稿者は、llama.cppがindexerを完全サポートすれば、Flashのフル1Mコンテキストに必要なRAMは約6GBになるはずだと見積もった。Flashは積極的な量子化にも耐える実績があり、同じスレッドの複数ユーザーは2ビットでも一貫性を保つと報告する。Hy3では、まだ同様の結果は示されていない。

用途が200Kトークンを大きく下回るなら、この問題は実質的に無関係だ。その場合、Hy3のIntelligence Indexでの4ポイントの優位性を追加コストなしで得られる。逆に超えるなら、コンテキスト税は積み上がる。圧縮が増え、キャッシュ無効化が増え、セッション当たりのメモリ消費も増える。

ローンチ後に出てきた実使用の声

ベンチマーク表より参考になるのは、コーディングエージェントに両モデルを組み込んだ開発者が語る性格の違いだ。

同じHacker Newsスレッドで、Anthropicのサブスクリプションを解約し、DeepSeek V4 FlashとProを日常利用に切り替えた後でHy3を試したユーザーは、Flashについてこう述べている。速度は優秀だが、「完全に誤ったメンタルモデルを組み立て、間違った方向へ突っ走ることが多い」。定期的な軌道修正と履歴の圧縮が必要になるという。そのユーザーの経験では、Hy3は「そこまで高速ではないが、今のところはるかに安定して筋道を維持する」ようで、コンテキストが伸びたときの劣化も少ない。他の投稿者からも、同規模のモデルとしてはHy3の世界知識と文章品質がFlashより優れるという評価が出ていた。

一方、純粋なコーディング出力ではRedditの意見はFlash寄りだ。r/LLMDevsでの同一タスク比較では、「DeepSeek V4 Flash > Hy3 > GLM」と順位付けされつつ、Hy3も「実用的なコーディングワークフローで有望」と評価されている。r/opencodeでは、日常的なエージェント作業にはFlashで「十分すぎる」という声が繰り返し見られる。

運用面の実績も考慮したい。Hy3はローンチ需要がTencentの提供能力を上回った。HNスレッドでは強いレート制限の報告があり、OpenRouterの公開利用ランキングを追っているユーザーの1人は、同モデルが1カ月以内に首位から8〜9位へ落ちたことを指摘し、その下落を直接この制限に帰している。対照的にDeepSeekは、公式APIにおけるFlashの同時実行上限を2,500リクエストと明記している。これはV4 Proに許可する数の5倍だ。本番トラフィックを処理するなら、片方は公表されたキャパシティ保証を持ち、もう片方には混雑の履歴がある。

用途別の選び方

  • 150Kトークン前後までのエージェント型コーディング:Hy3。推論品質が高く、タスクから逸れにくいという報告があり、入力単価もFlashの通常価格と同等だ。256K上限ではなく150Kを目安にするのは、エージェントのコンテキストは急速に増えるため、圧縮が始まる前に余裕を確保したいからだ。
  • 長時間セッション、大規模リポジトリ、大量文書に対するRAG:通常はFlashが適している。1Mのウィンドウと50倍のキャッシュ割引は別のコスト水準であり、Hy3の圧縮オーバーヘッドは知能面の優位を食いつぶす。
  • 高トラフィックの本番API:Flash。2,500という明示された同時実行数、安定した提供実績、大量かつ安価な呼び出しに使えるnon-thinkingモードがある。
  • 文章作成、調査、世界知識を問うタスク:Hy3。コミュニティの報告とAAの知識評価はいずれも、この規模ではHy3を優位としている。
  • ローカル環境への展開:多くのハードウェアではFlash。KVキャッシュの効率と量子化耐性について現場からの証拠が多い。ローンチスレッドで引用されたTencent自身のHy3提供ガイダンスは、H20クラスGPUを8枚としている。
  • 導入前の評価:Hy3の無料OpenRouterティアなら、費用をかけずに試せる。この比較を含め、ベンチマーク表をそのまま信じる前に、自分のタスクで動かして確認するのがよい。

利用できるサービスと接続先

DeepSeek V4 Flash:公式APIはOpenAI形式のエンドポイント(api.deepseek.com)とAnthropic形式のエンドポイント(api.deepseek.com/anthropic)を提供している。ベースURLを変更するだけで、Claude互換ツールに組み込みやすい。同じ料金ページには移行期限も記載されている。旧モデル名のdeepseek-chatとdeepseek-reasonerは2026年7月24日に非推奨となり、それぞれFlashのnon-thinkingモードとthinkingモードへマッピングされる。OpenRouterでも$0.09/$0.18で利用でき、公式料金よりわずかに安い。ただし、公式APIのキャッシュヒット料金は使えない。

Hy3:一次提供元はTencent Cloud TokenHubだ。OpenRouterでは正式版、より安いプレビューチェックポイント、無料ティアを利用できる。SiliconFlowはローンチ時のプロモーションを提供している。GPUを用意できるなら、Apache 2.0の条件でセルフホストも可能だ。Hy3 API setup guideでは、キーの取得から最初の呼び出しまでを解説している。

FAQ

Hy3は無料で使える?

一部は無料で利用できる。OpenRouterには、レート制限付きのtencent/hy3:freeがゼロコストで掲載されている。またTencentのコンシューマー向け製品であるYuanbaoとimaでも、Hy3は無料で使われている。本番向けにTokenHubまたはOpenRouterの有料ティアを利用する場合は、トークン単位の従量課金となる。

Hy3はTencent Hunyuanと同じもの?

はい。Hy3はTencentのHunyuanモデル系列の第3世代で、Tencentは現在このブランドを「Tencent Hy」としている。プレビュー版は2026年4月23日、正式版は2026年7月6日にリリースされた。

コーディングではHy3とDeepSeek V4 Flashのどちらが優秀?

タスクの形によってコミュニティ評価は分かれる。同一タスクでのReddit比較ではFlashの生出力がHy3より上位だった一方、長時間セッションのエージェント利用者はHy3のほうが安定してタスクを追えると報告している。短くスコープが明確なタスクではFlashの速度が有利だ。脱線のコストが大きい数時間規模のエージェントセッションでは、コンテキストが256Kの枠内に十分収まる限り、Hy3が向く。

DeepSeek V4 Flashはローカルで動かせる?

可能であり、Hy3より実用的に動かしやすい。重みはMITライセンスで、アーキテクチャのKVキャッシュは非常に軽い。約96GBのRAMを持つマシンで2ビット量子化しても、利用可能な品質が出るというユーザー報告がある。

hy3 vs deepseek v4 flashの価格比較が分かりにくいのはなぜ?

少なくとも4つの料金表があるからだ。Tencent TokenHub、OpenRouterにあるHy3正式版とプレビュー版の掲載、そしてキャッシュヒット料金を別途設定するDeepSeek公式APIである。自分のトラフィックパターンにおける実効単価を比べるべきだ。エージェントのワークロードではキャッシュ済み入力が大半を占めやすく、その領域ではDeepSeekの$0.0028を上回るのは難しい。

結論

現時点で得られる第三者データを見る限り、モデルとしてより強いのはHy3で、サービスとしてより強いのはDeepSeek V4 Flashだ。本番APIワークロードでは、Flashを標準の選択肢とする。キャッシュの経済性、コンテキスト長、公表された同時実行数は相乗的に効くため、ベンチマークの4ポイント差では覆しにくい。プロンプトごとの推論品質をスケールより重視するならHy3を選びたい。まずは無料ティアで、自分のタスクに対する結果を確かめるのがよい。

関連記事