AIREITER

Hy3 vs DeepSeek V4 Flash:價格、上下文與實測回饋

最近更新: 2026-07-29 11:47:58

若你的工作負載是上下文大致不超過 150K tokens 的程式代理,Hy3 會是更聰明的選擇,輸入 token 單價也與對手相當。但當對話拉長、程式庫變大,或要在線上環境支撐高併發時,DeepSeek V4 Flash 則靠三個 Hy3 無法比擬的數字勝出:1M-token 上下文視窗、明確標示為 $0.0028 的快取命中價格,以及 2,500 requests 的併發上限。這就是 hy3 vs deepseek v4 flash 的簡短結論。以下判斷依據包括:2026 年 7 月 14 日核對的 DeepSeek 官方文件與 OpenRouter 即時報價、第三方基準測試,以及 Hacker News 和 Reddit 開發者每天實際同時使用兩者後的回報。

同為 MoE,設計取向卻不同

Tencent 在 2026 年 7 月 6 日發布正式版 Hy3,取代自 4 月 23 日起開放的預覽版。根據公告,這是一款擁有 295B 總參數、21B 啟用參數的 Mixture-of-Experts 模型,核心是 Tencent 所稱的混合式快慢思考:模型會依每次請求自行決定投入多少推理。上下文上限為 256K tokens,權重以 Apache 2.0 開源,API 則透過 Tencent Cloud TokenHub 提供。

DeepSeek V4 Flash 在 2026 年 4 月推出,是 V4 系列中的高速版本。同樣是開放權重的 MoE 模型,依 Artificial Analysis 資料為 284B 總參數、13B 啟用參數;不過它採 MIT 授權,優先目標也不同:以低成本處理 1M tokens 上下文。它同時支援 thinking 與 non-thinking 模式,預設為 thinking,最大輸出可達 384K tokens。

兩者的參數規模看似接近,但資源分配方向完全不同。Hy3 把重點放在每個 token 的推理品質;Flash 則把重心放在上下文長度、快取效率與吞吐量。後面大多數實務差異,都是從這個分野延伸而來。

規格(核對於 2026-07-14)Hy3DeepSeek V4 Flash
參數295B 總計 / 21B 啟用284B 總計 / 13B 啟用
上下文視窗256K1M(最大輸出 384K)
推理機制混合式快慢思考Thinking + non-thinking 模式
授權Apache 2.0MIT
發布時間2026 年 7 月 6 日(預覽版 4 月 23 日)2026 年 4 月
官方 APITencent Cloud TokenHubapi.deepseek.com(OpenAI + Anthropic 格式)

基準測試真正透露了什麼

在 Artificial Analysis Intelligence Index v4.1 中,Hy3 取得 41 分,DeepSeek V4 Flash 在高 effort 推理模式下為 37 分。在這項指數上相差 4 分確實有意義,大致相當於 Flash 與下一級模型之間的距離,但還不足以稱為跨級差距。兩者都屬於「能力很強,但非前沿」的區間。

Artificial Analysis 比較卡片,顯示 Hy3 Intelligence Index 為 41,DeepSeek V4 Flash 為 37

不過,在解讀這個分數前,有兩點要先留意。

首先,代理式程式開發基準對兩款模型的評價都更嚴苛。Hacker News 的發布討論串中,有留言者找出 Hy3 的 DeepSWE 成績:28%,而 GPT-5.4 在最高 effort 下為 52%。這兩款中國模型都還談不上接近前沿代理式程式能力;它們是在彼此競爭,不是在挑戰排行榜頂端模型。

其次,兩家公司自行發布的 benchmark 表格都應抱持基本懷疑。Hy3 的發布數據在 HN 討論中立刻被質疑「benchmaxxed」,DeepSeek 的自家表格也只涵蓋它選擇執行的評測。上述第三方數據才是較適合當作判斷錨點的資訊:Hy3 確實稍微更聰明,但差距小到價格與上下文能力足以改變最終選擇。

定價關鍵不在牌價

以下是兩份在 2026 年 7 月 14 日核對的價目表,必須分開看。DeepSeek 在 API 文件中提供精確的第一方每 token 定價;Tencent 則沒有公布正式 Hy3 對應的英文費率表,新聞稿僅提到 Hy3 預覽版在 TokenHub 的輸入價格約為每百萬 tokens $0.18。因此,下方 Hy3 欄位採用 OpenRouter 列出的價格,這是聚合平台價格,而不是第一方報價。

每 1M tokensHy3(OpenRouter 聚合平台)DeepSeek V4 Flash(第一方 API)
輸入$0.14$0.14(快取未命中)
快取輸入$0.035$0.0028(快取命中)
輸出$0.58$0.28
DeepSeek 官方定價表,顯示快取輸入每 1M tokens 為 $0.0028

輸入牌價完全一樣,真正拉開差距的是另外兩列。

快取命中的成本差距

DeepSeek 的快取命中價格是未命中價格的 1/50,也是 OpenRouter 上 Hy3 快取價格的 1/12.5。兩種快取費率並非嚴格可直接對照:DeepSeek 是第一方 API 價格,Hy3 則取決於 OpenRouter 底層供應商對快取讀取的收費;但這就是目前實際會支付的費率。對代理工作流而言,這比本文任何一個數字都更重要。代理每輪都會重送持續膨脹的上下文,包括 system prompt、工具定義、檔案內容與對話歷史。在 40 輪對話中,絕大多數輸入 tokens 都是重複內容。若快取命中率為 90%,Flash 的有效輸入成本會從每百萬 tokens $0.14 降至約 $0.017;Hy3 則降至約 $0.045。兩者都很便宜,但 Hy3 仍接近 3 倍,且對話越長,差距越大。

Hy3 的輸出成本更高

兩者都是推理模型,因此 thinking tokens 都會計為輸出並收費。Hy3 的輸出費率為 $0.58,超過 Flash 的 $0.28 兩倍,所以每段較長的推理鏈,Hy3 使用者大致都要付出兩倍成本。Flash 還有 Hy3 沒有的彈性:面對格式化、資訊擷取、簡單修改等機械性任務,可切換至 non-thinking 模式,避免為不需要的推理付費。deepseek-v4-flash-vs-deepseek-v4-pro 的比較文章說明了這個模式切換在實務上的運作方式。

免費方案

Hy3 有一項實在優勢:OpenRouter 列出 tencent/hy3:free 變體,雖然有速率限制,確實不收費。若想在正式投入前先評估模型,這比沒有免費 API 方案的 Flash 更有利。Hy3 預覽版目前也仍以 $0.063/$0.21 上架,低於正式版;若能接受 4 月的 checkpoint,這也是另一個選項。

256K 上下文帶來的隱性成本

256K 上下文乍看很夠用,但讓代理面對真實程式庫時,情況很快就不同。r/hermesagent 的一名 Reddit 使用者在同一套 harness 中測試兩者後表示,Hy3「除了上下文大小幾乎一樣,所以經常要 compaction」。Compaction 不只是麻煩:每次壓縮都得消耗輸出 tokens 來生成摘要、丟失細節,還會使 prompt cache 失效,必須以快取未命中價格重新建立。

自行部署時,這個落差會變成架構層面的問題。V4 架構採用稀疏注意力設計,DeepSeek 將該機制稱為 lightning indexer,讓它的 KV cache 比 Hy3 傳統注意力架構輕得多。這些是單一使用者回報,不是正式 benchmark,但該 HN 討論串中的數字相當鮮明:有留言者在一對 DGX Sparks 上同時運行兩款模型,表示 DeepSeek V4 Flash 可容納 3M tokens KV cache,而量化至 FP4 的 Hy3 約只能容納 130K tokens。另有人估計,等 llama.cpp 完整支援 indexer 後,Flash 的完整 1M 上下文應只需約 6GB RAM。Flash 也已展現出承受激進量化的能力:同一討論串多位使用者稱它即使降至 2-bit 仍維持連貫,這一點尚未在 Hy3 身上獲得同樣證明。

如果你的使用情境始終遠低於 200K tokens,本節的問題根本不會造成成本,Hy3 多出的 4 個 intelligence points 便可直接享有。但只要超過這個範圍,上下文稅就會持續累積:更多 compaction、更多快取失效,以及每個 session 更高的記憶體需求。

上市後的開發者實戰觀察

最有參考價值的訊號不在 benchmark 表格,而是開發者將兩者放進 coding agent 後,所描述的使用特性差異。

同一個 Hacker News 討論串中,有使用者取消 Anthropic 訂閱、改以 DeepSeek V4 Flash 與 Pro 作為日常主力,之後再測 Hy3。他形容 Flash 速度出色,但「經常建立完全錯誤的心智模型,接著一路往錯的方向衝」,需要定期修正與壓縮歷史。相較之下,依其經驗,Hy3「沒那麼快,但目前看來更能穩定維持正確方向」,而且隨著上下文增長,品質衰退較少。討論串中也有其他人認為,以這個模型規模來看,Hy3 的世界知識與文字品質都優於 Flash。

但若看純粹的程式輸出,Reddit 的風向較偏向 Flash。r/LLMDevs 的同題比較將結果排為「DeepSeek V4 Flash > Hy3 > GLM」,同時仍稱 Hy3「很有潛力,適合實用的程式開發工作流」。在 r/opencode,反覆出現的看法則是 Flash 對日常代理工作已經「綽綽有餘」。

營運紀錄同樣值得納入考量。Hy3 上市需求一度超過 Tencent 的服務能力:HN 討論串使用者回報嚴重 rate limiting;另有追蹤 OpenRouter 公開使用量排行的人指出,模型在一個月內從榜首跌至第 8、9 名,並將下滑直接歸因於這些限制。反觀 DeepSeek,官方 API 明確標示 Flash 的併發上限為 2,500 requests,是 V4 Pro 的五倍。若是正式環境流量,一家供應商公布了容量保證,另一家則已有壅塞紀錄。

該怎麼選

  • 代理式程式開發、session 低於約 150K tokens:選 Hy3。它的推理品質較高、較能維持任務方向,輸入成本也與 Flash 的牌價相同。之所以抓 150K 而非完整 256K,是因為代理上下文膨脹很快,應在 compaction 開始前保留緩衝空間。
  • 長對話、大型程式庫、針對大型文件的 RAG:Flash 通常更合適。1M 視窗加上 50 倍快取折扣,屬於不同的成本級距,而 Hy3 的 compaction 額外負擔會吃掉它的智慧優勢。
  • 高流量正式 API:選 Flash。它有明確記載的 2,500 併發能力、穩定的服務紀錄,以及適合低成本大量呼叫的 non-thinking 模式。
  • 寫作、研究與世界知識任務:選 Hy3。社群回報與 AA 的知識評測,在這個模型規模上都較偏向它。
  • 本地部署:多數硬體情況下選 Flash。它的 KV cache 效率與量化韌性有更多實戰證據;Tencent 在發布討論串中引用的 Hy3 自家服務建議,則是八張 H20 等級 GPU。
  • 投入前先評估:Hy3 的 OpenRouter 免費層可直接試用。先用自己的任務測過,再決定要相信誰的 benchmark 表格,包括本文的表格。

可在哪裡使用

DeepSeek V4 Flash:官方 API同時提供 OpenAI 格式(api.deepseek.com)與 Anthropic 格式(api.deepseek.com/anthropic)端點,因此只要更換 base URL,就能接入 Claude 相容工具。也要注意同一頁定價文件中的遷移期限:舊有 deepseek-chat 與 deepseek-reasoner 模型名稱將在 2026 年 7 月 24 日棄用,分別對應 Flash 的 non-thinking 與 thinking 模式。OpenRouter 提供的價格是 $0.09/$0.18,略低於官方費率,但沒有官方 API 的快取命中定價。

Hy3:Tencent Cloud TokenHub 是第一方途徑。OpenRouter 提供正式版、較便宜的預覽 checkpoint 以及免費層;SiliconFlow 曾推出上市促銷。若有足夠 GPU,也可依 Apache 2.0 自行部署。Hy3 API setup guide 介紹如何取得金鑰並完成第一次呼叫。

常見問題

Hy3 可以免費使用嗎?

部分可以。OpenRouter 列出限速的 tencent/hy3:free 免費層;Tencent 的消費者產品 Yuanbao 與 ima 也可免費使用 Hy3。不過,透過 TokenHub 或 OpenRouter 付費方案進行正式 API 存取,仍會按 token 計費。

Hy3 和 Tencent Hunyuan 是同一個模型嗎?

是。Hy3 是 Tencent Hunyuan 模型線的第三代,Tencent 現在將其品牌稱為「Tencent Hy」。預覽版於 2026 年 4 月 23 日推出,正式版則在 2026 年 7 月 6 日發布。

Hy3 和 DeepSeek V4 Flash,哪個更適合寫程式?

社群結果會隨任務型態而分歧。同題 Reddit 比較中,Flash 的原始輸出排名高於 Hy3;但長 session 的代理使用者則認為 Hy3 更能穩定維持正確方向。短小、範圍明確的任務較適合 Flash 的速度;若是持續數小時的代理 session,且偏離任務的代價很高,則 Hy3 更有吸引力,前提是上下文能舒適地維持在其 256K 視窗之內。

DeepSeek V4 Flash 能在本地執行嗎?

可以,而且比 Hy3 更具實用性。其權重採 MIT 授權,架構的 KV cache 異常輕量,使用者也回報在約 96GB RAM 的機器上,即使進行 2-bit 量化仍有可用品質。

為什麼 hy3 vs deepseek v4 flash 的價格比較這麼複雜?

因為至少有四份價格表:Tencent TokenHub、OpenRouter 的 Hy3 正式版與預覽版列表,以及有獨立快取命中費率的 DeepSeek 官方 API。應比較符合自身流量模式的有效價格:代理工作負載主要由快取輸入構成,而 DeepSeek 的 $0.0028 費率在這一點上很難擊敗。

結論

依現有第三方證據,Hy3 是能力更強的模型;DeepSeek V4 Flash 則是更強的服務。若是正式 API 工作負載,我會預設選 Flash:它的快取經濟性、上下文視窗與公開併發能力會彼此疊加,足以抵銷 4 分 benchmark 領先的優勢。只有在單次 prompt 的推理品質比規模更重要時,我才會優先考慮 Hy3;而且先試它的免費層即可,因為用自己的任務驗證不需要花錢。

延伸閱讀