如果你已经在用 Fugu-Ultra 跑任务,2026 年 7 月 24 日上线的这次更新可以先用一句话概括:价格没变,底层模型更新了,Sakana 称最高可提升 7.9 分。真正值得细看的,是这项基准测试宣传究竟说明了什么、又没说明什么,以及为什么部分用户不宜直接无脑切换。
Fugu-Ultra 并不是通常意义上的单一模型,而是 Sakana Fugu 的最高档位。它是一个编排层:你只需发起一次 API 调用,系统便会将任务分发给一组前沿模型,为它们安排规划、执行、验证等角色,最后再整合成一个答案。具体机制可参考 Sakana 官方 Fugu 页面;下文涉及的定价、基准测试和可用性信息,也均以该页面为来源。
Fugu-Ultra v1.1 到底更新了什么
v1.1 的核心变化,是替换为更新一批的前沿底层模型。Sakana 将其定位为一次能力刷新,而非重做整套系统:编排机制不变,实际执行任务的模型池升级,三个档位也仍是 Fugu、Fugu-Ultra 和 Fugu-Cyber。
按照 Sakana 在发布公告中的说法,v1.1 相比 v1.0 最高提升 7.9 分,提升最明显的是 ProgramBench 和 Terminal Bench 2.1。这两项都是偏智能体、多步骤编程任务的测试集,单一模型往往容易在长流程中失去上下文主线,恰好是多模型编排想要解决的问题。因此,提升方向本身是合理的。不过,具体提升幅度来自 Sakana 自身的说法,下面会说明目前哪些部分可核实、哪些尚无法核实。
看基准测试前,先了解公开数据的缺口
以下是 Sakana 目前公开的 Fugu-Ultra 基准测试成绩:
在将“+7.9 分”视为既定事实前,有两点需要注意。
公开的基准表并未按版本拆分。表中只有 Fugu-Ultra 的成绩,没有将 v1.0 和 v1.1 并排列出,因此支撑 7.9 分这一数字的各项测试差值无法公开验证。当前可见的 SWE-Bench Pro 73.7、Terminal Bench 2.1 82.1、LiveCodeBench 93.2,也与此前 v1.0 版本已公布的数字相同。换言之,现有公开表格尚未呈现这次宣称的提升。
此外,公告中被点名为主要增益来源的 ProgramBench,根本没有出现在公开成绩卡中。
这不代表 Sakana 的说法一定有误。但若你会基于量化指标选择模型,更严谨的结论应当是:最高提升 7.9 分目前仍属于厂商声明。在 Sakana 发布可验证的差值前,应先用自己的任务集进行测试,而不是直接引用这一提升数字。
价格和使用方式都没变
v1.1 没有调整定价。Fugu-Ultra 的价格仍为每百万输入 token 5 美元、每百万输出 token 30 美元;单次请求上下文超过 272K 后,价格升至 10 美元 / 45 美元;缓存输入则为每百万 token 0.50 美元。每月 20 美元、100 美元和 200 美元的订阅套餐也继续保留。至于算上编排开销后的实际成本,可查看我们持续更新的 Sakana Fugu 定价与 API 指南,其中按档位进行了拆解。
新版本的模型 ID 为 fugu-ultra-v1.1,此前版本为 fugu-ultra-20260615。另有一项地区限制:Sakana 表示,在完成 GDPR 合规工作前,Fugu 暂不向欧盟/欧洲经济区提供服务。
从 v1.0 切到 v1.1,值不值得?
对多数使用场景而言,这次切换风险不高。价格、端点和请求格式都没变,只要更换模型 ID 即可。如果你调用的是未带版本号的 fugu-ultra 别名,那么很可能已经自动使用 v1.1,无需自行改动。
例外是对可复现性的要求。如果你有意固定使用 fugu-ultra-20260615,比如用于回归测试、维护中的基准测试,或输出必须保持稳定的场景,那么 v1.1 不是一次“免费升级”,而是一次行为变化。模型池刷新可能影响路由决策和最终输出,而 Sakana 尚未发布迁移差异说明。此时更稳妥的做法是继续固定旧 ID,先让 v1.1 跑过自己的评测集,确认表现可靠后再迁移。
Fugu 与普通 API 网关有什么区别
能通过一个端点访问多种前沿模型的服务并不只有 Fugu,因此有必要先弄清楚:它的价格究竟买到了什么。
Fugu 是编排层,会决定调用哪些模型、如何整合结果。一项任务可能会分发至多个模型执行,因此单任务的实际成本通常高于基础 token 单价。对于真正复杂、需要多步推进的任务,这种额外开销是有价值的。
但如果你的需求更接近“稳定、低价地调用一个强模型”,路由网关会是更简单的选择。像 OpenRouter 这类服务,可通过一个端点接入许多模型,且没有编排加价;AIReiter 等平台则提供低于官方标价的直接 Claude 和 GPT API 访问。判断方法很简单:如果你说不出某项任务中单一模型会稳定失败、而多模型协作能解决的问题,那么你大概率正在为并不需要的编排能力付费。
常见问题
Fugu-Ultra v1.1 真的比 v1.0 更强吗?
Sakana 称其最高提升 7.9 分,主要集中在 ProgramBench 和 Terminal Bench 2.1 等智能体编程测试集上。但目前没有公开的逐项基准表用于比较两个版本,因此在依赖这一数字前,最好先在自己的任务上确认实际增益。
如何继续使用旧版 v1.0?
在请求中固定模型 ID fugu-ultra-20260615,而不要使用 fugu-ultra-v1.1 或未带版本号的 fugu-ultra 别名。该别名会跟随最新版本,因此保留它不变会切换至 v1.1。
Sakana Fugu 是开源的吗?
部分开源。其方法和配套代码已公开,Sakana 在 TRINITY 工作中介绍了这套编排方式;但托管服务本身,以及决定调用哪些模型的 Conductor 路由系统并未开源。你可以了解其工作原理,但无法自行部署生产级编排器。
欧盟地区能使用 Fugu-Ultra v1.1 吗?
暂时不能。Sakana 表示,在推进 GDPR 和欧盟特定合规工作期间,Fugu 暂不在欧盟/欧洲经济区提供服务。
v1.1 的价格有变化吗?
没有。它与 v1.0 采用相同费率:每百万 token 输入 5 美元、输出 30 美元、缓存输入 0.50 美元;上下文超过 272K 后,则采用 10 美元 / 45 美元的更高档位。
