Sakana Fugu 不是一個新的基礎模型。它是一個多代理協調層,位於一個相容 OpenAI 的端點之後(model ID fugu-ultra-20260615),會將你的請求路由到最適合處理它的底層前沿模型。這個差異對定價很重要:每個 token 的標示價格並不是你的真實成本,因為 Fugu 也會針對幕後進行的協調工作收費。如果你正在評估它用於正式生產環境,應將協調開銷與報價費率分開預算。
Fugu 實際上是什麼:一個編排層,而不是模型
Sakana AI 由《Attention Is All You Need》共同作者 Llion Jones 與前 Google Brain 研究總監 David Ha 創立。他們將這個產品命名為「魚群」(*sakana*)的概念:一群魚的表現優於任何單一條魚;而河豚(fugu)則是唯一一種每一步都必須正確,否則就會致命的魚類。這個隱喻正是他們的主張:與其把一切都押在單一模型的弱點上,不如由 Fugu 協調多個模型。
有兩個層級。Fugu 是用於編碼和聊天式任務的日常版本。Fugu Ultra 則是為更困難、需要多步驟處理的工作而打造,適用於單一模型在長時間會話中容易偏離或遺漏上下文的那類任務。在底層,聚合層會進行矛盾偵測、信心加權、思路鏈保留,以及具領域感知的路由,然後只交給你一個答案,而不是多個需要你自行整合的結果。
定價:頁面上的數字不一定就是你實際要付的數字
以下是 Fugu Ultra 的公開 token 定價,已與 Sakana 的官方頁面核對:
| 層級 | 輸入 | 輸出 | 快取輸入 |
|---|---|---|---|
| 標準上下文(≤272K tokens) | $5 / M tokens | $30 / M tokens | $0.50 / M tokens |
| 擴展上下文(>272K tokens) | $10 / M tokens | $45 / M tokens | $1.00 / M tokens |
訂閱方案每月 $20(Standard)、每月 $100(Pro,使用量為 10 倍),以及每月 $200(Max,使用量為 20 倍)。在 2026 年 7 月底前註冊,Sakana 目前針對任何方案提供第二個月免費,若您計劃在本季測試,現在鎖定相當值得。
Base Fugu(非 Ultra)會依據參與的 agent 數量而有不同的定價:當只有單一 agent 處理任務時,您支付的是該底層模型的標準費率;當多個 agent 協同作業時,Sakana 表示它絕不會將各模型費用逐一疊加——您是按所使用的最高階模型費率計費,而不是所有模型費用的總和。
沒有人幫你估算的編排成本
定價頁面沒有把這件事說清楚,所以這裡直接算給你看。假設你交給 Fugu Ultra 一個任務;如果只用一次 GPT-5.5 呼叫來做,成本會是 $0.03(10K 輸入 tokens、2K 輸出 tokens,按 GPT-5.5 自己的費率計算)。但 Fugu Ultra 不會只跑一次;它可能會在內部把同等於同一個 prompt 的工作分派給 2-3 個候選模型,執行矛盾檢查,然後才回傳整合後的答案。如果這樣只多出一輪完整的輸入+輸出 tokens,並且按 Fugu Ultra 的費率計費,那麼原本看起來標價 $0.03 的工作,實際上大約會變成 $0.08-$0.12。單次請求這點差異幾乎可以忽略。但如果每個月把它用在幾千次生產環境呼叫上,標示費率與實際帳單之間的差距,就會成為足以讓你的預算預測失準的那一筆費用。
實際重點:不要只根據每個 token 的費率來估算 Fugu Ultra 的成本。在試點期間追蹤已完成任務的成本——實際每張已解決工單或每個已合併 PR 的美元花費——而不是每次呼叫的 token 數,並將其與你目前單一模型架構在相同完成工作量下的成本進行比較。
基準測試:Fugu Ultra vs Claude Fable 5 vs GPT-5.5
| 基準測試 | Fugu Ultra | Fugu | Claude Fable 5 | GPT-5.5 |
|---|---|---|---|---|
| SWE-Bench Pro | 73.7 | 59.0 | — | — |
| LiveCodeBench | 93.2 | 92.9 | 89.8 | 85.3 |
| TerminalBench 2.1 | 82.1 | 80.2 | — | — |
| GPQA-Diamond | 95.5 | 95.5 | — | — |
| Humanity's Last Exam | 53.3 | — | 介於 44.3-53.3 範圍內 | 介於 44.3-53.3 範圍內 |
Sakana 自己的說法——而且早期第三方報導也支持這一點——是差距會在漫長、混亂、真實世界的工作流程中擴大,而不是只在孤立的基準測試中。在程式碼審查方面,據報導 Fugu Ultra 能抓到 GPT-5.5 漏掉的錯誤,並提供更完整的答案;這與你對一個在回覆前會交叉比對多個模型輸出,而不是一次就定案的系統所預期的表現一致。如果你想更完整地了解 GPT-5.5 與較新的 GPT-5.6 等級相比表現如何,或是 Claude Fable 5 與 Anthropic 自家的 Mythos 系列相比如何,那些分析會更深入地逐一探討每個模型。
如何存取:直接 API,或透過聚合器
Fugu 以 OpenAI 相容的 API 形式提供,而 Sakana 的官方頁面也列出了對 OpenRouter、Vercel、OpenCode、Creao 和 Merge 的正式支援——因此,如果你已經透過其中一個路由流量,加入 Fugu 只是一次設定變更,而不是新的整合。
在直接連接到 Sakana 之前,有兩件事需要知道:
- EU/EEA 存取尚未開放。 Sakana 在其自己的定價頁面上直接說明了這一點,並將其描述為持續中的合規工作,且未提供時間表。沒有已確認的替代方案;某個聚合器是否能繞過此限制,取決於該聚合器的基礎設施所在位置,而 Sakana 對此也沒有公布任何資訊,因此不要因為你是透過第三方就假設問題已解決。
- 帳單是透過 Sakana 自己的儀表板處理,與你目前用於 Claude、GPT 或 Gemini 呼叫的任何系統分開——如果你已經在同時管理多個模型供應商,就會多一張發票需要對帳。
由於 Fugu 與 OpenAI 相容,將它加入現有設定通常只需要在你目前使用的任何 client 中,替換 base URL 和 model 字串;你的 request/response 處理不需要做任何其他變更。這也是為什麼像 AIReiter 這類已經位於 Claude、GPT 和 Gemini 之前的 aggregators,可以在不要求你修改整合程式碼的情況下新增一個 model。
您應該使用它嗎?
當準確性比延遲或成本可預測性更重要時,Fugu Ultra 就很合理——例如長時間執行的程式編寫任務、原本需要你手動交叉比對兩到三個模型的研究工作流程,或任何接近單一模型能夠可靠獨立完成極限的事情。
當你需要即時回應、任務簡單到單一個優秀的模型就已經能準確完成,或者你的預算已固定、無法承受上文所述的協調波動時,就跳過它。對於大量、低複雜度的呼叫,單一個精心挑選的模型幾乎總是更便宜且更可預測。
常見問題
Sakana Fugu 是免費的嗎?
不。Fugu Ultra 的價格為標準上下文下每 100 萬輸入 token 5 美元、每 100 萬輸出 token 30 美元,或可透過訂閱方案開始於每月 20 美元。Sakana 目前正在為 2026 年 7 月底前註冊的使用者推出第二個月免費促銷活動。
Sakana Fugu 是開源的嗎?
Sakana 尚未將 Fugu 的權重或編排程式碼以開源形式發布。它僅能透過其託管的相容 OpenAI API 存取。
Fugu 在 OpenRouter 上可用嗎?
是的,這是 Sakana 正式列出的五個平台之一(另外還有 Vercel、OpenCode、Creao 和 Merge),所以如果你已經在其中任何一個平台上完成設定,就不需要直接擁有 Sakana 帳號也能試用。
在這個脈絡中,「Fugu」是什麼意思?
Fugu 是河豚,一道在正確處理時無害、處理不當時則很危險的料理。Sakana 特別選用這個名字,就是因為它那種非黑即白的特性:協調層的整體設計目標,就是要抓住單一模型本可能放過的那一個錯誤。
結論
基準測試的提升是真實的,而且它們在雜亂的多步驟工作中比在單獨的測試執行中更明顯。大多數對 Fugu 的報導忽略了一點:定價頁面上的數字並不是在加入協調開銷後你實際會被收取的費用,所以請將報價費率視為底線,而不是估算值,並且在你承諾預算之前,先以已完成任務成本進行試行。
