Hy3 與 DeepSeek V4 Flash:價格、上下文、真實回饋

最近更新: 2026-07-14 13:26:06

如果你的工作負載是一個維持在大約 150K tokens 上下文內的 coding agent,Hy3 是更聰明的模型,而且每個 input token 的成本大致相同。如果你的 sessions 很長、你的 repo 很大,或你在 production 中需要高 concurrency,DeepSeek V4 Flash 會在 Hy3 無法匹敵的三個數字上勝出:1M-token context window、文件記載的 $0.0028 cache-hit 價格,以及 2,500-request concurrency 上限。這就是 hy3 vs deepseek v4 flash 決策的簡短版本。其背後的證據:pricing 已於 2026 年 7 月 14 日根據 DeepSeek 的官方 docs 與 OpenRouter 的即時 listings、第三方 benchmark data,以及 Hacker News 和 Reddit 上開發者在每日同時運行兩者後的回報進行確認。

兩種模型,兩種不同的押注

Tencent 於 2026 年 7 月 6 日發布了最終版 Hy3,升級了自 4 月 23 日起上線的預覽版。根據該公告,這是一個 Mixture-of-Experts 模型,總參數為 295B、啟用參數為 21B,建立在 Tencent 所稱的混合快慢思考之上:模型會針對每個請求決定要投入多少推理。上下文長度最高可達 256K tokens。權重以 Apache 2.0 開放,API 則運行於 Tencent Cloud TokenHub。

DeepSeek V4 Flash 於 2026 年 4 月推出,作為 V4 家族的快速層。它同樣是一個 open-weights MoE(總計 284B、啟用 13B,根據 Artificial Analysis),但採用 MIT 授權,並針對不同目標進行調校:以低成本提供 1M tokens 的上下文。它支援 thinking 和 non-thinking 兩種模式(thinking 為預設),最大輸出為 384K tokens。

參數數量看起來相似,但設計目標並不相同。Hy3 將其預算投入到每個 token 的推理品質;Flash 則把預算投入到上下文長度、快取效率與吞吐量。以下大多數實際差異都可追溯到這種分工。

規格(已驗證 2026-07-14)Hy3DeepSeek V4 Flash
參數295B total / 21B active284B total / 13B active
上下文視窗256K1M (384K max output)
推理Hybrid fast/slow thinkingThinking + non-thinking modes
授權Apache 2.0MIT
發布2026年7月6日(預覽版 4月23日)2026年4月
官方 APITencent Cloud TokenHubapi.deepseek.com (OpenAI + Anthropic formats)

基準測試實際顯示的內容

在 Artificial Analysis Intelligence Index v4.1 上,Hy3 以 41 分對 37 分勝出,在高努力的推理模式下針對 DeepSeek V4 Flash。該指數上相差四分確實是一道明顯差距,大致相當於 Flash 與其下一層級模型之間的距離,但這並不是一個級別上的差異。兩個模型都落在「非常有能力,但還不是前沿」這個區間。

Artificial Analysis comparison cards showing Hy3 at 41 and DeepSeek V4 Flash at 37 on the Intelligence Index

在你過度重視該分數之前,先注意兩個注意事項。

首先,agentic coding 基準對這兩個模型都講述了一個更嚴峻的故事。一位評論者在 Hacker News 發布討論串中挖出了 Hy3 的 DeepSWE 結果:28%,而 GPT-5.4 在最大努力下為 52%。這兩個中國模型都離前沿的 agentic coding 還很遠;它們彼此競爭,而不是與排行榜頂端競爭。

其次,對於兩家公司發布的供應商基準測試表,請一律保持標準的懷疑態度。Hy3 的發表數字在 HN 討論串中立刻引來了「benchmaxxed」的指控,而 DeepSeek 自己的表格也只涵蓋了它選擇執行的那些評測。上面那些第三方數字才是我會依據的,而它們顯示:Hy3 稍微更聰明一些,而且差距小到價格與上下文就可能改變決策。

定價:標價只是個干擾因素

兩份價格表,於 2026 年 7 月 14 日查核,且應分開保留。DeepSeek 在其 API 文件中公布了精確的第一方每 token 價格。Tencent 沒有為最終版 Hy3 公布等效的英文費率表——其新聞稿將 Hy3 preview 的輸入價格列為 TokenHub 上每百萬 tokens 約 $0.18——因此下方的 Hy3 欄位使用 OpenRouter 列出的費率,這是市集價格而非第一方價格。

每 1M tokensHy3 (OpenRouter marketplace)DeepSeek V4 Flash (first-party API)
輸入$0.14$0.14(cache miss)
輸入,已快取$0.035$0.0028(cache hit)
輸出$0.58$0.28
DeepSeek official pricing table showing $0.0028 per 1M cached input tokens

輸入價格相同。決定因素在另外兩列。

快取命中倍數

DeepSeek 的 cache-hit 價格比其 cache-miss 價格便宜 50 倍,且比 OpenRouter 上 Hy3 的 cached rate 便宜 12.5 倍。(請注意,這兩種 cache rate 並不嚴格等同——DeepSeek 的是 first-party API 價格,Hy3 的則是 OpenRouter 的底層提供者對 cache reads 收取的費用——但它們就是你今天實際會支付的費率。)如果你在跑 agents,這一點比本頁上的任何其他數字都更重要。agent loop 會在每一輪重新送出同一份不斷增長的 context——system prompt、tool definitions、file contents、conversation history。在一個 40-turn session 中,你的 input tokens 絕大多數都是重複的。在 90% 的 cache-hit rate 下,Flash 的有效 input 價格會從每百萬 tokens $0.14 降到約 $0.017。Hy3 的則降到約 $0.045——仍然便宜,但幾乎貴了 3 倍,而且 session 持續越久,差距就越大。

輸出 token 是 Hy3 成本變高的地方

兩者都是推理模型,這表示兩者都會將思考 token 以輸出計費。Hy3 的 $0.58 輸出費率比 Flash 的 $0.28 高出一倍多,因此每一段延伸的推理鏈對 Hy3 使用者來說,成本大約是兩倍。Flash 也有一個 Hy3 所沒有的洩壓閥:對於機械性任務(格式化、擷取、簡單編輯)切換到非思考模式,並停止為你不需要的推理付費。deepseek-v4-flash-vs-deepseek-v4-pro 的分析說明了這種模式切換在實務上如何運作。

免費方案

Hy3 的一個真正優勢:OpenRouter 列出了 tencent/hy3:free 變體,零成本,雖然有速率限制但確實可用。若要在投入之前先評估模型,這點比 Flash 更好,因為 Flash 沒有免費 API 級別。Hy3 preview 也仍標示為 $0.063/$0.21——低於正式發布的價格——如果你能接受 4 月的檢查點。

上下文視窗稅

Hy3 的 256K context 聽起來很多,直到你把 agent 用在真實 codebase 上。r/hermesagent 的一位 Reddit 使用者在同一個 harness 中執行這兩個模型,稱 Hy3「幾乎一模一樣,除了 context size,所以需要頻繁 compaction。」Compaction 不只是個不便:每一輪 compaction 週期都會消耗 output tokens 來做摘要、丟失細節,並使你的 prompt cache 失效,這表示你得付出 cache-miss rate 來重新建立它。

如果你自行架設,這個差距就會變得結構性。V4 架構的稀疏注意力設計(DeepSeek 稱這個機制為 lightning indexer)讓它的 KV cache 比 Hy3 的傳統注意力輕得多。這些是單一使用者的回報,而非基準測試,但 HN 討論串中的數字很驚人:有位評論者在一對 DGX Sparks 上同時執行兩者,回報說能在 DeepSeek V4 Flash 旁邊容納 3M tokens 的 KV cache;相較之下,將 Hy3 量化到 FP4 時大約只能容納 130K tokens。另一位估計,一旦 llama.cpp 完全支援該 indexer,Flash 的完整 1M context 只需要大約 6GB 的 RAM。Flash 也有成功承受激進量化的紀錄:同一討論串中的幾位使用者回報,即使在 2-bit 下它仍能保持連貫,而這點目前尚未在 Hy3 上得到證明。

如果你的使用情境始終遠低於 200K tokens,這整個部分不會花你任何費用,而 Hy3 的四個額外智慧點數是免費的。如果超過了,context tax 就會持續累積:更多壓縮、更多快取失效、每個 session 需要更多記憶體。

自推出以來的現場報告

我發現最有用的訊號並不在任何基準測試表中,而是在開發者把兩個模型都放進程式開發代理中運行時所描述的性格差異。

同一個 Hacker News 討論串中的一位使用者,在取消 Anthropic 訂閱後把 DeepSeek V4 Flash 和 Pro 當作日常使用,接著又試了 Hy3,對 Flash 的描述是這樣的:速度很快,但「經常建立起完全錯誤的心智模型,然後一路衝向錯誤的方向」,需要定期修正與歷史壓縮。就他們的經驗來說,Hy3「沒那麼快,但到目前為止似乎更能可靠地保持在正確軌道上」,而且隨著上下文變長,表現退化也較少。同一串中的其他人則稱讚 Hy3 的世界知識和行文品質,在這個規模下都比 Flash 更好。

Reddit 上的情況則對原始程式碼輸出呈現相反的傾向。r/LLMDevs 中的一篇同任務比較將「DeepSeek V4 Flash > Hy3 > GLM」排在前面,同時仍稱 Hy3「對實際編碼工作流程很有前景」。在 r/opencode 中,反覆出現的看法是,Flash 對日常 agent 工作來說「綽綽有餘」。

此外,還有營運表現紀錄可供衡量。Hy3 的上線需求超過了 Tencent 的服務能力:HN 討論串中的使用者回報遭遇嚴重的速率限制,而一位追蹤 OpenRouter 公開使用排名的人指出,該模型在一個月內從第一名跌至第 8–9 名,並將下滑直接歸因於這些限制。相較之下,DeepSeek 在其官方 API 中記載 Flash 的併發上限為 2,500 個請求——是其對 V4 Pro 所允許數量的五倍。對於正式生產流量來說,其中一家供應商已公布容量保證,另一家則有壅塞紀錄。

如何選擇

  • 代理編碼,會話低於約 150K tokens:Hy3。推理品質更高,較能持續專注於任務,而且輸入成本與 Flash 的標價相同。(之所以是 150K 而不是完整的 256K,是因為代理上下文成長很快,而你希望在 compaction 啟動前保留一些餘裕。)
  • 長會話、大型倉庫、在大型文件上做 RAG:Flash 通常更合適。1M 視窗加上 50 倍的快取折扣是不同的成本級別,而 Hy3 的 compaction 額外開銷會吃掉它的智慧優勢。
  • 高流量生產 API:Flash。文件記載可達 2,500 並發、穩定的服務歷史,以及用於廉價批量呼叫的 non-thinking 模式。
  • 寫作、研究、世界知識任務:Hy3。社群回報和 AA 知識評測在這個規模下都更偏好它。
  • 本地部署:大多數硬體選 Flash。它的 KV cache 效率和量化韌性有更多實務證據;Tencent 在發布串中引用的 Hy3 官方服務建議是八張 H20 等級 GPU。
  • 在投入前先評估:Hy3 的免費 OpenRouter 等級版試用成本為零。在相信任何人的基準表之前,先把你自己的任務跑一遍,包括這一份。

在哪裡執行它們

DeepSeek V4 Flash官方 API 同時提供 OpenAI 格式(api.deepseek.com)與 Anthropic 格式(api.deepseek.com/anthropic)的端點,這表示只要變更 base-URL,就能直接接入相容 Claude 的工具鏈。請注意同一個定價頁面上的遷移截止日期:舊的 deepseek-chatdeepseek-reasoner 模型名稱將於 2026 年 7 月 24 日停止支援,分別對應 Flash 的非思考與思考模式。OpenRouter 的價格為 $0.09/$0.18,略低於官方費率,但不包含官方 API 的快取命中定價。

Hy3:Tencent Cloud TokenHub 是第一方路由。OpenRouter 提供最終正式版、較便宜的預覽檢查點,以及免費方案。SiliconFlow 已提供上線促銷。如果你有 GPU,自行架設可在 Apache 2.0 授權下運作。Hy3 API 設定指南會帶你完成取得金鑰並發出第一次呼叫的流程。

常見問題

Hy3 可以免費使用嗎?

部分是。OpenRouter 列出了速率受限的 tencent/hy3:free 方案,費用為零,而 Tencent 的消費者產品(Yuanbao、ima)則免費使用 Hy3。透過 TokenHub 或 OpenRouter 付費方案取得的 production API 存取則按 token 計費。

Hy3 和 Tencent Hunyuan 是同一個嗎?

是的 — Hy3 是 Tencent 的 Hunyuan 模型系列的第三代,Tencent 現在將其品牌命名為「Tencent Hy」。預覽版於 2026 年 4 月 23 日推出,最終版本則於 2026 年 7 月 6 日發布。

Hy3 和 DeepSeek V4 Flash 哪個更適合寫程式?

依任務類型區分的社群結果。相同任務的 Reddit 比較中,Flash 的原始輸出排名高於 Hy3;而長時間會話的 agent 使用者則回報 Hy3 更能可靠地保持在正軌上。短小、範圍明確的任務偏向 Flash 的速度;多小時的 agent 會話中,若偏離軌道會付出代價,則偏向 Hy3,只要你的 context 能舒適地維持在其 256K 視窗內。

我可以在本機執行 DeepSeek V4 Flash 嗎?

是的,而且比 Hy3 更實際。權重採用 MIT 授權,架構的 KV cache 異常輕量,而且使用者回報即使在約 96GB RAM 的機器上使用 2-bit 量化,也能達到可用的品質。

為什麼 hy3 與 deepseek v4 flash 的價格比較這麼令人困惑?

因為至少有四種價格表:Tencent TokenHub、OpenRouter 的 Hy3 final 和 preview 列表,以及 DeepSeek 官方 API 與其獨立的 cache-hit rate。請根據你自己的流量模式比較實際有效價格:cached input 主導 agent 工作負載,而在這一點上,DeepSeek 的 $0.0028 費率很難被超越。

結論

Hy3 是在現有第三方證據中更強的模型;DeepSeek V4 Flash 是更強的服務。對於生產 API 工作負載,Flash 是我的預設選擇:它的快取經濟性、上下文視窗,以及公開的並發能力,會以四分的基準測試領先無法抵銷的方式相互疊加。當每次提示的推理品質比規模更重要時,就選 Hy3——而且先試用它的免費方案,因為用自己的任務來檢查它不會花你任何成本。

相關閱讀