如果你目前已經透過 Fugu-Ultra 跑工作負載,2026 年 7 月 24 日上線的更新可以先濃縮成一句話:價格沒變,底層模型換新,Sakana 宣稱最高可提升 7.9 分。不過,比起直接看這個數字,更值得留意的是公開 benchmark 到底能佐證什麼,以及為何有些使用者不應該不經測試就切換。
Fugu-Ultra 並不是一般定義下的單一模型,而是 Sakana Fugu 的最高階方案。它是一層編排系統:你只送出一次 API 請求,系統就會將工作分派給多個前沿模型,分別擔任規劃、執行或驗證等角色,最後再整合成一份結果。定價、benchmark 與服務可用性等資訊,均可在 Sakana 官方 Fugu 頁面查閱。
Fugu-Ultra v1.1 換了哪些內容?
v1.1 的核心是更新底層採用的前沿模型。Sakana 將它定位為一次升級,而非整套系統重做:編排機制不變,實際執行工作的模型池更新,三個方案層級 Fugu、Fugu-Ultra、Fugu-Cyber 也都維持原樣。
Sakana 在發布公告中最醒目的說法,是相較 v1.0 最多提升 7.9 分,其中 ProgramBench 與 Terminal Bench 2.1 的進步最顯著。兩者都是多步驟、代理式的程式開發測試;單一模型在這類任務中容易中途失焦,正是編排系統理應發揮價值的場景。因此改善方向並不難理解,但幅度仍是 Sakana 自己提出的數字,以下會說明目前能與不能驗證的部分。
公開跑分看得到什麼,少了什麼?
以下是 Sakana 目前公開的 Fugu-Ultra 成績:
在把 +7.9 視為定論前,有兩點需要先知道。
公開 benchmark 表格沒有依版本拆分。表上列的是 Fugu-Ultra 的分數,並沒有把 v1.0 與 v1.1 並列,因此無法核對構成 7.9 分的各項 benchmark 差距。目前看得到的 SWE-Bench Pro 73.7、Terminal Bench 2.1 82.1、LiveCodeBench 93.2,也與先前公布的 v1.0 版本數字相同;換句話說,現有表格尚未直接呈現所稱的提升。
此外,公告中特別點名進步顯著的 ProgramBench,根本沒有出現在公開成績表中。
這不代表 Sakana 的說法一定有誤。但若你是根據數字選模型,較嚴謹的做法是將「最高提升 7.9 分」視為廠商宣稱,在 Sakana 公開差異數據之前,先用自己的任務驗證,而不是直接引用這個增幅。
價格與存取方式都沒變
v1.1 沒有調整價格。Fugu-Ultra 每百萬 input tokens 為 $5、每百萬 output tokens 為 $30;單次請求的 context 超過 272K 後,則提高為 $10 / $45。cached input 的價格是每百萬 $0.50。每月 $20、$100 與 $200 的訂閱方案也原封不動。若想了解計入編排額外成本後的實際費用,可參考我們持續更新、逐級整理的 Sakana Fugu 定價與 API 指南。
新版 model ID 是 fugu-ultra-v1.1,前一版則為 fugu-ultra-20260615。另有一項地區限制:Sakana 表示,Fugu 在推進 GDPR 合規期間,尚未於 EU/EEA 提供服務。
該從 v1.0 切到新版嗎?
對多數使用情境來說,切換風險不高。價格、endpoint 與請求格式都不變,只要更換 model ID 即可。如果你使用的是未帶版本號的 fugu-ultra alias,沒有做任何改動的情況下,很可能已經在使用 v1.1。
例外是重視可重現性的情境。若你刻意固定 fugu-ultra-20260615,例如用於 regression suite、自行維護的 benchmark,或輸出必須保持穩定的工作流程,那麼 v1.1 不是單純的免費升級,而是行為上的變更。更新後的模型池可能改變路由方式與輸出結果,而 Sakana 並未公布 migration diff。建議先保留固定的 ID,以自己的 eval set 測試 v1.1,確認表現穩定後再遷移。
Fugu 和一般 API gateway 差在哪?
能透過單一 endpoint 使用多個前沿模型的服務不只 Fugu,因此有必要弄清楚這個價格實際買到了什麼。
Fugu 是編排層:它會決定呼叫哪些模型,以及如何整合結果。一個任務可能同時分派給多個模型,所以每項任務的實際成本會高於基礎 token 單價。若工作本身確實複雜、需要多步驟處理,這樣的取捨是合理的。
但如果你的需求更接近「穩定且低成本地呼叫一個強模型」,routing gateway 會是更簡單的選擇。像 OpenRouter 這類服務,可在同一個 endpoint 後提供多種模型,卻不需要支付編排加價;AIReiter 等平台則提供低於定價表的直接 Claude 和 GPT API 存取。判斷方式其實很直接:如果你說不出哪種任務會讓單一模型穩定失敗、但能靠協作解決,大概就不需要為編排付費。
常見問題
Fugu-Ultra v1.1 真的比 v1.0 好嗎?
Sakana 宣稱最高提升 7.9 分,主要集中在 ProgramBench、Terminal Bench 2.1 等代理式程式開發測試。目前沒有公開的逐項 benchmark 表格可直接比較兩個版本,因此在依賴這個數字前,應先用自己的任務確認增益。
如何繼續使用舊版 v1.0?
在請求中固定使用 model ID fugu-ultra-20260615,而非 fugu-ultra-v1.1 或無版本號的 fugu-ultra alias。該 alias 會追蹤最新版本,因此保留它就會移至 v1.1。
Sakana Fugu 是開源的嗎?
部分是。其方法與支援程式碼已公開,Sakana 也在 TRINITY 工作中說明了編排方式;不過託管服務,以及決定呼叫哪些模型的 Conductor 路由機制並未開源。你可以了解它如何運作,但無法自行託管正式環境的編排器。
可以在 EU 使用 Fugu-Ultra v1.1 嗎?
目前還不行。Sakana 表示,在完成 GDPR 與 EU 專屬合規作業前,Fugu 尚未在 EU/EEA 提供服務。
v1.1 的價格有變嗎?
沒有。它的費率與 v1.0 相同:每百萬 tokens 的 input 為 $5、output 為 $30、cached 為 $0.50;context 超過 272K 時,價格提高為 $10 / $45。
