Hy3 vs DeepSeek V4 Flash:定价、上下文、真实反馈

最后更新: 2026-07-14 13:25:53

如果你的工作负载是一个始终低于大约 150K tokens 上下文的编码代理,Hy3 是更聪明的模型,而且每个输入 token 的成本也大致相同。如果你的会话持续时间很长、仓库很大,或者你在生产环境中需要高并发,那么 DeepSeek V4 Flash 会在 Hy3 无法匹敌的三个数字上胜出:1M-token 上下文窗口、已公开的 $0.0028 缓存命中价格,以及 2,500 请求的并发上限。这就是 hy3 vs deepseek v4 flash 决策的简短版本。其背后的证据:价格于 2026 年 7 月 14 日根据 DeepSeek 的官方文档和 OpenRouter 的实时列表、第三方基准测试数据,以及 Hacker News 和 Reddit 上开发者在每天同时运行两者后给出的反馈进行了核实。

两个模型,两种不同的押注

腾讯于 2026 年 7 月 6 日发布了最终版 Hy3,升级了自 4 月 23 日起一直在线的预览版。根据该公告,它是一个 Mixture-of-Experts 模型,总参数量为 295B,激活参数为 21B,围绕腾讯所称的混合快慢思考构建:模型会针对每个请求决定投入多少推理。上下文长度最高可达 256K tokens。权重以 Apache 2.0 开源,API 运行在腾讯云 TokenHub 上。

DeepSeek V4 Flash 于 2026 年 4 月发布,作为 V4 系列的快速档位。它同样是一个开源权重的 MoE(总计 284B,激活 13B,据 Artificial Analysis),但采用 MIT 许可,并针对不同目标进行了优化:以低成本提供 1M tokens 的上下文。它支持思考和非思考两种模式(思考模式为默认),最大输出为 384K tokens。

参数数量看起来相似,但设计目标并不相同。Hy3 将预算花在每个 token 的推理质量上;Flash 则将预算花在上下文长度、缓存效率和吞吐量上。下面大多数实际差异都可追溯到这一分工。

规格(已验证 2026-07-14)Hy3DeepSeek V4 Flash
参数总计 295B / 活跃 21B总计 284B / 活跃 13B
上下文窗口256K1M(最大输出 384K)
推理混合快速/慢速思考思考 + 非思考模式
许可证Apache 2.0MIT
发布时间2026年7月6日(预览版 4月23日)2026年4月
官方 APITencent Cloud TokenHubapi.deepseek.com(OpenAI + Anthropic 格式)

基准测试实际展示的内容

在 Artificial Analysis Intelligence Index v4.1 上,Hy3 在高努力推理模式下得分 41,对比 DeepSeek V4 Flash 的 37 分。该指数上的四分差距确实是实质性的,约相当于 Flash 与低一个档次模型之间的距离,但这并不是一个级别上的差异。两个模型都处于“非常有能力,但还不是前沿”这一档。

Artificial Analysis comparison cards showing Hy3 at 41 and DeepSeek V4 Flash at 37 on the Intelligence Index

在你过于看重该分数之前,有两个注意事项。

首先,agentic coding benchmarks 对这两款模型讲述的是一个更严酷的故事。一位评论者在 Hacker News 发布线程中翻出了 Hy3 的 DeepSWE 结果:28%,而 GPT-5.4 在 maximum effort 下为 52%。这两款中国模型都还远未接近前沿的 agentic coding;它们是在彼此竞争,而不是与排行榜顶端竞争。

其次,应对这两家公司发布的基准测试表保持常规怀疑。Hy3 的发布数据在 HN 讨论串中立刻招致了“benchmaxxed”的指责,而 DeepSeek 自己的表格也只覆盖了它选择运行的评测。上面的第三方数据才是我会重点参考的,它们表明:Hy3 稍微更聪明一些,而且差距小到价格和上下文就可能改变选择。

定价:标价只是个干扰项

两份价格表,已于 2026 年 7 月 14 日核查,且建议分开保留。DeepSeek 在其 API 文档中公布了精确的第一方按 token 计费价格。Tencent 没有为最终版 Hy3 发布对应的英文费率表——其新闻稿称 Hy3 preview 的输入价格在 TokenHub 上约为每百万 token 0.18 美元——因此下方 Hy3 栏使用的是 OpenRouter 列出的费率,这是市场价格而非第一方价格。

每 1M tokensHy3(OpenRouter marketplace)DeepSeek V4 Flash(first-party API)
输入$0.14$0.14(cache miss)
输入,已缓存$0.035$0.0028(cache hit)
输出$0.58$0.28
DeepSeek official pricing table showing $0.0028 per 1M cached input tokens

输入价格相同。决定取决于另外两行。

缓存命中倍率

DeepSeek 的 cache-hit 价格比其 cache-miss 价格便宜 50 倍,比 OpenRouter 上 Hy3 的 cached rate 便宜 12.5 倍。(请注意,这两个 cache rate 并不完全等同——DeepSeek 的是 first-party API 价格,Hy3 的则是 OpenRouter 底层 providers 对 cache reads 收取的费用——但它们就是你今天实际会支付的费率。)如果你运行 agents,这一点比本页上的任何其他数字都更重要。一个 agent loop 会在每一轮重新发送相同且不断增长的 context——system prompt、tool definitions、file contents、conversation history。在一个 40-turn session 中,你的 input tokens 中绝大多数都是重复内容。在 90% 的 cache-hit rate 下,Flash 的有效 input 价格会从每百万 tokens $0.14 降至约 $0.017。Hy3 则降至约 $0.045——依然便宜,但几乎贵了 3 倍,而且 session 持续越久,这个差距就越大。

输出 token 是 Hy3 成本变高的地方

两者都是推理模型,这意味着它们会将思考 tokens 按输出计费。Hy3 的 $0.58 输出费率是 Flash 的 $0.28 的两倍多,因此每条延长的推理链对 Hy3 用户来说大约要贵一倍。Flash 还有一个 Hy3 所没有的“泄压阀”:对于机械性任务(格式化、提取、简单编辑),切换到非思考模式,停止为你不需要的推理付费。deepseek-v4-flash-vs-deepseek-v4-pro 的解析说明了这种模式切换在实践中如何运作。

免费版

Hy3 的一个真正优势:OpenRouter 列出了一个零成本的 tencent/hy3:free 变体,虽然有速率限制,但是真实可用。对于在正式投入前评估模型来说,这一点比 Flash 更好,因为 Flash 没有免费的 API 层级。Hy3 preview 目前仍标价 $0.063/$0.21——低于最终版本的价格——如果你可以接受 4 月的检查点。

上下文窗口税

Hy3 的 256K 上下文听起来已经很充足,直到你把一个 agent 用在真实代码库上。r/hermesagent 里的一个 Reddit 用户在同一个 harness 中运行两个模型后,称 Hy3“几乎完全一样,只是上下文大小不同,所以需要频繁压缩。”压缩远不只是个麻烦:每个压缩周期都会消耗输出 token 来做摘要、丢弃细节,并使你的 prompt cache 失效,这意味着你要付出 cache-miss 的代价来重建它。

如果你自己托管,这种差距就会变得很有结构性。V4 架构的稀疏注意力设计(DeepSeek 将这一机制称为 lightning indexer)使其 KV cache 比 Hy3 的传统注意力轻得多。这些都是单个用户的报告,而不是基准测试,但 HN 讨论串中的数字非常鲜明:一位同时在一对 DGX Sparks 上运行两者的评论者报告称,在 DeepSeek V4 Flash 旁边还能容纳 300 万 tokens 的 KV cache,而 Hy3 量化到 FP4 时只能容纳大约 13 万 tokens。另一位估计,一旦 llama.cpp 完全支持该 indexer,Flash 的完整 100 万上下文只需要大约 6GB 内存。Flash 还有在激进量化下依然存活的记录:同一讨论串中的几位用户报告称,即使在 2-bit 下它仍然保持连贯,而这一结果尚未在 Hy3 上得到展示。

如果你的用例始终远低于 200K tokens,那么整个部分对你来说完全不花一分钱,而且 Hy3 的额外四个 intelligence points 也是免费的。如果超过这个范围,context tax 就会不断累积:更多的 compaction、更多的 cache invalidation、每个 session 需要更多的 memory。

自上线以来的现场报告

我发现的最有用信号并不在任何基准测试表里。它是开发者在编码代理中同时运行这两个模型时所描述的性格差异。

同一条 Hacker News 讨论串中的一位用户,在取消 Anthropic 订阅后将 DeepSeek V4 Flash 和 Pro 作为日常主力,随后又尝试了 Hy3,他这样描述 Flash:速度很快,但“经常会构建出一个完全错误的心智模型,然后朝着错误的方向一路狂奔”,需要定期纠正和进行历史压缩。就他们的体验而言,Hy3“没有那么快,但到目前为止,它似乎更可靠地保持在正确轨道上”,而且随着上下文变长,性能退化更少。同一讨论串中的其他人也称赞 Hy3 的世界知识和行文质量在这个规模下都优于 Flash。

Reddit 上的情况在原始编码输出方面则更偏向另一边。r/LLMDevs 中的一项同任务对比将“DeepSeek V4 Flash > Hy3 > GLM”排在前面,同时仍称 Hy3 “在实际编码工作流中很有前景”。在 r/opencode 中,反复出现的看法是,Flash 对日常 agent 工作来说“绰绰有余”。

还有一个需要权衡的运营记录。Hy3 的发布需求超过了腾讯的服务能力:HN 线程中的用户报告了严重的速率限制,而一位跟踪 OpenRouter 公共使用排名的人指出,该模型在一个月内从榜首跌至第 8–9 位,并将这一下降直接归因于这些限制。相比之下,DeepSeek 在其官方 API 中记录了 Flash 的 2,500 请求并发上限——这是其对 V4 Pro 允许值的五倍。对于生产流量,这两家供应商中,一家公布了容量保证,另一家则有拥塞历史。

如何选择

  • Agent 编码,少于约 150K tokens 的会话:Hy3。推理质量更高,更能专注于任务,且输入成本与 Flash 的标价相同。(之所以是 150K 而不是完整的 256K,是因为 agent 上下文增长很快,而在压缩机制启动前你需要留出余量。)
  • 长会话、大型仓库、对大文档进行 RAG:Flash 通常更合适。1M 窗口加上 50x 缓存折扣属于不同的成本级别,而 Hy3 的压缩开销会消耗掉它的智能优势。
  • 高吞吐量生产 API:Flash。公开文档显示支持 2,500 并发,服务历史稳定,并且有 non-thinking 模式可用于低成本批量调用。
  • 写作、研究、世界知识类任务:Hy3。社区反馈和 AA 知识评测在这个规模下都更偏向它。
  • 本地部署:多数硬件选择 Flash。它的 KV cache 效率和量化鲁棒性有更多实战证据;腾讯在发布线程中引用的 Hy3 官方服务建议是八张 H20 级 GPU。
  • 在正式采用前先评估:Hy3 的免费 OpenRouter 套餐可供免费试用。在相信任何人的基准表之前,先用你自己的任务跑一遍,包括这份表。

在哪里运行它们

DeepSeek V4 Flash官方 API 同时提供 OpenAI 格式(api.deepseek.com)和 Anthropic 格式(api.deepseek.com/anthropic)端点,这意味着只需更改 base URL,就能接入与 Claude 兼容的工具。请注意同一定价页面上的迁移截止日期:旧的 deepseek-chatdeepseek-reasoner 模型名称将于 2026 年 7 月 24 日弃用,分别映射到 Flash 的非思考和思考模式。OpenRouter 的价格为 $0.09/$0.18,略低于官方费率,但不包含官方 API 的缓存命中定价。

Hy3:Tencent Cloud TokenHub 是第一方渠道。OpenRouter 提供最终发布版、更便宜的预览检查点以及免费层。SiliconFlow 提供了上线促销活动。如果你有 GPU,自托管可在 Apache 2.0 下运行。Hy3 API setup guide 会逐步介绍如何获取密钥并发起第一次调用。

常见问题

Hy3 可以免费使用吗?

部分如此。OpenRouter 列出了一个限速的 tencent/hy3:free 级别,零成本,而腾讯的消费级产品(元宝、ima)则免费使用 Hy3。通过 TokenHub 或 OpenRouter 的付费层获得生产环境 API 访问则按 token 计费。

Hy3和腾讯混元是一样的吗?

是的——Hy3 是腾讯 Hunyuan 模型系列的第三代,腾讯现将其品牌命名为 “Tencent Hy”。预览版于 2026 年 4 月 23 日发布,最终版本于 2026 年 7 月 6 日发布。

对于编码来说,Hy3 还是 DeepSeek V4 Flash 更好?

按任务类型划分的社区结果。相同任务的 Reddit 对比中,Flash 的原始输出排名高于 Hy3,而长会话的 agent 用户则反映 Hy3 更能可靠地保持在正确轨道上。简短、范围明确的任务更偏向 Flash 的速度;多小时的 agent 会话中,一旦偏离轨道代价很高,则更偏向 Hy3,前提是你的上下文能舒适地保持在其 256K 窗口内。

我可以在本地运行 DeepSeek V4 Flash 吗?

是的,而且比 Hy3 更实用。权重采用 MIT 许可证,架构的 KV cache 异常轻量,用户反馈即使在约 96GB RAM 的机器上使用 2-bit 量化也能获得可用的质量。

为什么 hy3 与 deepseek v4 flash 的价格对比如此令人困惑?

因为至少有四个价格表:Tencent TokenHub、OpenRouter 的 Hy3 final 和 preview 列表,以及 DeepSeek 带有独立缓存命中率的官方 API。请根据你自己的流量模式比较有效价格:缓存输入主导了 agent 工作负载,而这正是 DeepSeek 的 $0.0028 费率很难被超越的地方。

结论

Hy3 是基于现有第三方证据更强的模型;DeepSeek V4 Flash 是更强的服务。对于生产环境的 API 工作负载,Flash 是我的默认选择:它的缓存经济性、上下文窗口和公开的并发能力以一种四分的基准领先所无法抵消的方式叠加起来。当每次提示的推理质量比规模更重要时,选择 Hy3 —— 并且先试试它的免费套餐,因为用你自己的任务来检验它不花一分钱。

相关阅读