OpenAI 現在有三個名稱帶有「fast」或「ultra」的選項,但真正宣稱可達每秒 750 個 token 的只有一個。2026 年 8 月 13 日公布的 OpenAI Ultrafast mode,是一項新的 API 服務層級:它透過 Cerebras 的晶圓級晶片運行 GPT-5.6 Sol,速度最高可達 Standard 的 14 倍。問題在於,這項服務目前僅限受邀客戶,OpenAI 也尚未公布價格;因此,今天能直接付費使用的最快層級,仍是每百萬 token 輸入/輸出各 $10/$60 的 Fast mode。
別把三種速度選項混為一談:ultra、Fast mode 與 Ultrafast
購買 GPT-5.6 Sol 時,眼前有三個與速度相關的名稱,但它們指的其實是完全不同的東西。以下一次釐清。
| 名稱 | 本質 | 取得方式 | Sol 價格(每 1M token) | 標示速度 |
|---|---|---|---|---|
ultra 推理設定 | 將子代理與更多運算資源投入單一任務的推理/工作模式 | Codex 設定,並非可單獨購買的 API 層級 | 沒有獨立費率;會快速消耗用量額度 | 設計上較慢 |
| Fast mode | API 處理層級,於 2026 年 7 月 30 日由 Priority 更名而來 | 在任何 API 請求中加入 service_tier="fast" | 短上下文輸入 $10/輸出 $60 | 最高可達 Standard 的 2.5 倍 |
| Ultrafast mode | 由 Cerebras 驅動、專供 GPT-5.6 Sol 的 API 層級,於 2026 年 8 月 13 日預覽推出 | 限量預覽,僅開放部分客戶 | 未公開 | 最高可達 Standard 的 14 倍 |
這三者追求的方向其實相反:ultra 是一種以速度換取更完整成果的子代理工作模式;Ultrafast mode 則是在同一模型上追求純粹的解碼速度。Fast mode 位於兩者之間,是可付費購買的低延遲升級方案,OpenAI 在其 Fast mode 頁面另有完整說明。
8 月 13 日的預覽版,實際公布了哪些內容?
官方公告明確確認了五件事:Ultrafast 首先在 OpenAI API 推出;僅運行 GPT-5.6 Sol;處理速度最高可達 Standard 的 14 倍,輸出速度最高每秒 750 個 token;底層由 Cerebras 提供支援;並以限量預覽形式提供給一小群客戶,包括 Jane Street、Podium、Basis 與 Rogo。
不過,對買方真正關鍵的四項資訊仍然缺席:每 token 價格、模型 ID、速率限制,以及延遲 SLA。公告中也沒有列出具名的效能測試基準。
OpenAI 提出的展示案例,是讓 Ultrafast 與 Standard Sol 根據同一段提示詞建構 3D 倉庫模擬器並排比較。Rogo 的 Alex Wang 用一句話概括其訴求:「Ultrafast 讓複雜的金融研究感覺像是即時互動。」
從 2.5 倍到 14 倍,速度差距能換來什麼?
先說一個衡量上的注意事項:750 tokens/sec 是標示的輸出吞吐量;Fast mode 的數字則是 SLA 下限。兩者相關,但不是完全相同的指標。以 750 除以 14 推算,Standard Sol 的解碼速度約為每秒 54 個 token。換算下來,生成 10,000 個 token 在 Standard 約需 186 秒;在 Fast mode 的 Enterprise SLA 下限每秒 80 個 token 時,最長 125 秒;Ultrafast 則約為 13 秒。
| 工作負載 | Standard(約 54 tok/s,推算值) | Fast mode(SLA ≥80 tok/s) | Ultrafast(標示 750 tok/s) |
|---|---|---|---|
| 生成 10,000 個 token | 約 186 秒 | ≤125 秒 | 約 13 秒 |
| 5 輪代理迴圈,每輪 1,000 個 token | 約 93 秒 | ≤63 秒 | 約 7 秒 |
r/AIToolsPerformance 上流傳的數據將這些比較歸因於 Artificial Analysis 與 Cerebras:Ultrafast 的速度是 Claude Fable 5 的 11 倍,也是 Fast mode 上 Opus 4.8 的 5 倍;完整跑完 2,500 題 Humanity's Last Exam,Ultrafast 需時 11 小時 11 分鐘,Fable 5 則需 78 小時 27 分鐘。這些數據全由廠商提出,目前尚無獨立複測結果。
預覽版之外,沒人知道 Ultrafast 要多少錢
Ultrafast 的公開定價目前不存在。公告沒有提到任何費率,社群也立刻注意到這個空白;正如一位 r/AIToolsPerformance 發文者所說:「這篇部落格沒說的是價格。預覽版之外,沒人知道它要花多少錢。」
目前能作為參考的,只有 GPT-5.6 Sol 已知的每百萬 token 價格階梯:
| 層級 | 輸入(短上下文) | 輸出(短上下文) | 輸入(長上下文 >272k) | 輸出(長上下文) | 快取輸入 |
|---|---|---|---|---|---|
| Standard | $5.00 | $30.00 | $10.00 | $45.00 | $0.50 |
| Fast mode | $10.00 | $60.00 | $20.00 | $90.00 | $1.00 |
| Ultrafast | 未公開 | 未公開 | 未公開 | 未公開 | 未公開 |
Sol 的 Fast mode 收費正好是 Standard 的 2 倍;但公開資訊不足以據此推估 Ultrafast 的價格,因為費率可能往任何方向調整,例如 OpenAI 曾在 7 月 30 日調降 Terra/Luna 的價格。Fast mode 的細則也會影響延遲預算:若每分鐘超過 100 萬 token,且在不到 15 分鐘內將流量提高超過 50%,超出的請求會無提示降回 Standard,回傳 service_tier="Default",並按 Standard 費率計費。
目前怎麼取得 Ultrafast 存取權?
Ultrafast 採邀請制,沒有公開候補名單。OpenAI 表示,預覽計畫會隨著「容量增加」而擴展,並在公告頁提供接收存取權更新的訂閱入口;而 7 月的報導指出,早期 Sol 存取權當時僅涵蓋約 20 個組織。
這套基礎設施並非首次出現。OpenAI 與 Cerebras 的合作關係可追溯至 2026 年 1 月 14 日,預留了 750 MW 的晶圓級運算容量;同一批硬體上的 GPT-5.3-Codex-Spark 也已超過每秒 1,000 個 token。
邀請函還沒到前,如何先把輸出速度拉高?
所有 API 客戶目前都能使用 Fast mode,啟用方式只要改一個參數:
- 在
/v1/responses或/v1/chat/completions的請求中加入service_tier="fast"。 - 舊有的
service_tier="priority"值仍可繼續使用;既有模型會繼續在用量儀表板中顯示priority,GPT-5.6 之後的模型則會顯示fast。 - 若要將整個專案預設為 Fast,請至 Project settings -> Default Service Tier -> Fast。
| 支援 Fast mode 的模型 | 每 1M 價格(輸入/輸出) | 延遲 SLA |
|---|---|---|
| GPT-5.6 Sol | $10 / $60 | >80 tok/s |
| GPT-5.6 Terra | $4 / $24 | >70 tok/s |
| GPT-5.6 Luna | $0.40 / $2.40 | >100 tok/s |
三者之中,Luna 的 SLA 下限最高。讀取快取可降低 90% 的輸入成本;Standard Sol 的快取輸入費率為 $0.50/M,TTL 約為 30 分鐘。因此,不論使用哪個層級,維持較長的工作階段都比每次重新發送請求划算。若想以真實流量測試這些層級,可透過 GPT-5.6 API endpoint 在同一介面使用全部三種模型。
常見問題
Ultrafast mode 可在 ChatGPT 或 Codex 中使用嗎?
不行。Ultrafast 首先在 OpenAI API 推出,公告未提供 ChatGPT 或 Codex 上線日期。
在 Cerebras 上運行 GPT-5.6 Sol,會改變輸出品質嗎?
OpenAI 將 Ultrafast 定位為同一個 GPT-5.6 Sol 的更快服務方式,而非另一個模型。目前唯一的品質說法,是 Cerebras 報告的 GDP-Val 速度提升 5.6 倍且品質不下降;尚無獨立基準測試重現此結果。
Ultrafast mode 有延遲 SLA 嗎?
目前沒有公開 SLA。Fast mode 為 Enterprise 客戶提供 >80 tokens/sec 的 p50 SLA 與 99.9% 可用性;Ultrafast 在預覽期間則沒有公布 SLA。
哪些模型支援 Ultrafast mode?
只有 GPT-5.6 Sol。Terra 與 Luna 支援 Fast mode,但不在 Ultrafast 預覽計畫之內。
Ultrafast mode 會收多少錢?
目前沒有官方數字。Fast mode 相比 Standard Sol 的已公布 2 倍溢價,是唯一可參考的基準。