您能用 GPT-6 Luna 做什麼
GPT-6 Luna 是 GPT-6 系列中快速且低成本的層級。有四個關鍵特性會改變您的架構設計方式,而這些都不會寫在行銷文案中。
輸出成本為輸入成本的 5 倍
每 1M 輸入 Token 僅需 $0.03,而每 1M 輸出 Token 為 $0.15。長 Prompt 幾乎免費,但長回答不然。限制最大輸出 Token 數對帳單的影響遠大於精簡 Prompt。
1M 上下文視窗在 272K 設有計費門檻
上下文視窗為 1,050,000 個 Token,但輸入超過 272K Token 會使整個請求重新計價(輸入 2 倍、輸出 1.5 倍),而不只是超出部分。一個 280K Token 的 Prompt 費用比兩個 140K 的請求還要高。
在回答前進行推理
在我們的測試中,7.2 至 7.4 秒的總回應時間中,第一個串流 Token 需耗時 5.0 至 5.6 秒。串流並無法掩蓋這個延遲。若您需要文字更快顯示在螢幕上,請降低推理強度(reasoning effort),而非限制輸出長度上限。
無需 Schema 即可維持結構化輸出
使用純文字提示要求輸出包含四個特定欄位的 JSON,它便精準在代碼區塊中返回這四個 Key,無需定義 Schema、無需 Function 定義,亦無需重試。上述範例即為未經編輯的原始回應。
GPT-6 Luna 定價
輸入 Tokens
每 1M Tokens 為 $0.03,對比 OpenAI 官方的 $0.10。
輸出 Tokens
每 1M Tokens 為 $0.15,對比 OpenAI 官方的 $0.50。
快取輸入讀取
每 1M Tokens 為 $0.003,對比 OpenAI 官方的 $0.01。
長上下文層級
超過 272K 輸入 Tokens 的請求遵循 OpenAI 本身的加價規則:輸入 2 倍、輸出 1.5 倍。
GPT-6 Luna 應用情境
客服分流:每 1,000 張工單僅需 $0.05
每張工單只需一次呼叫,即可生成摘要並標註嚴重程度、產品領域、受影響版本與優先級標籤。重新處理 50,000 張待辦工單約僅需 $2.30。
透過快取前綴進行批次資料豐富化
批次作業會在每一列重複相同的指令。只要保持該前綴的位元組完全一致,重複部分的讀取費用即為每 1M $0.003(而非 $0.03)——整個執行過程的輸入成本僅需十分之一。
作為 Router 後方的預設層級
將所有請求預先發送至 Luna,僅在未通過檢查時才升級至更高階模型。由於 Sol 的成本約為 20 倍,將 95% 流量保留在 Luna 的 Router 方案,成本約為全 Sol 流程的十分之一——升級的那 5% 流量佔了剩餘帳單的一半。
保持整份文件在 272K 門檻以下
報告、逐字稿與合約皆適用於 1M 視窗,但建議將單次請求的輸入 Tokens 控制在 272K 以下以避免 2 倍加價計費。將內容分塊並控制在此門檻以下,通常比單次大型呼叫更划算。
如何使用 GPT-6 Luna
Luna 專為大規模處理而設計,因此請以實際運行方式進行測試:使用真實記錄,並搭配規模化時可負擔的參數設定。
貼上一筆真實記錄
請使用真實的工單、逐字稿或文件,而非簡化的示範 prompt。Luna 的潛在問題通常在於混亂的輸入內容,而非高難度的推理。
調低參數,而非調高
建議從低 reasoning effort 與嚴格的 max completion tokens 開始。輸出的價格是輸入的 5 倍,因此輸出上限是決定帳單金額的關鍵槓桿。
計算 Token 總數
查看回覆下方回報的使用量,乘以每日處理量,即可在撰寫任何整合程式碼之前估算出每月成本。
使用 GPT-6 Luna API 進行建置
在批次整合中,重要的不是第一次呼叫,而是第一萬次:每筆記錄的成本、快取行為,以及當其中一列失敗時的處理方式。
隨插即用的 Model ID
只需將現有相容 OpenAI 的客戶端指向 gpt-6-luna,無需更改其他任何內容。Streaming、系統 prompt 和 JSON 格式輸出均與上游完全一致。
快取 Prefix 在此發揮最大效益
批次作業在每一列都會重複相同的指令。快取讀取的費用為每 100 萬 token 0.003 美元,而全新輸入為 0.03 美元,因此建立穩定的 prompt 前綴結構非常划算。
每次回覆的成本核算
每次回覆都會回報輸入、輸出、快取讀取量以及消耗的額度,因此 Pipeline 可以記錄每筆記錄的單位效益,而不是等到收到發票才發現。
無需重新架構即可升級至 GPT-6 Sol
Sol 與 Luna 共用同一個端點、金鑰與餘額,因此將困難的資料列路由到旗艦級模型只需更換 model-ID,無需進行第二次系統整合。
GPT-6 Luna vs GPT-6 Sol vs GPT-5.6 Luna
GPT-6 Luna - 每 1,000 張工單約 $0.05
在 AIReiter 上每 100 萬 token 的輸入為 $0.03、輸出為 $0.15,相較於 OpenAI 官方的 $0.10 與 $0.50。這是最具性價比的 GPT-6 級別,也是讓單筆記錄自動化成本計算切實可行的選擇。
GPT-6 Sol - 每 1,000 張工單約 $0.91
每 100 萬 token 的輸入為 $0.60、輸出為 $3.00,約為 Luna 的 20 倍。當任務需要旗艦級推理時物有所值;但若任務只是 Luna 就能正確處理的資料擷取,則是種浪費。
GPT-5.6 Luna - 前一代模型
官方定價為每 100 萬 token 輸入 $0.20、輸出 $1.20。GPT-6 Luna 在同樣的高性價比定位下,將官方輸入價格減半,輸出成本更降至不到一半。
如何選擇
在上方 Playground 中使用您最複雜的記錄同時測試這兩個級別。如果 Luna 的表現依然出色,那麼在 20 倍的價格差距下,Sol 就必須在該特定任務上證明其價值,而非僅憑聲譽。
GPT-6 Luna 常見問題
關於線上 playground、價格與 API 存取的常見問題。
/ 01什麼時候該選擇 GPT-6 Luna?
若有大量且任務明確的工作(例如摘要、擷取和分類),請選擇 Luna。只有在任務需要旗艦級推理能力時,才切換至 GPT-6 Sol。
/ 02GPT-6 Luna 在 AIReiter 上的費用是多少?
AIReiter 僅收取 OpenAI 官方定價的 30%:每 1M 輸入 tokens 為 $0.03,每 1M 輸出 tokens 為 $0.15,相較於官方定價的 $0.10 與 $0.50。快取輸入(Cached input)讀取費用為每 1M $0.003。
/ 03GPT-6 Luna 與 GPT-5.6 Luna 有何不同?
GPT-6 Luna 是新一代模型,屬於同等高性價比層級,但其官方輸入價格僅為 GPT-5.6 Luna 的一半,官方輸出價格僅為五分之一。
/ 04上下文視窗大小為何?
GPT-6 Luna 支援約 1M 輸入 tokens 及最高 128K 輸出 tokens。超過 272K 輸入 tokens 的請求將以 2 倍輸入及 1.5 倍輸出費率計費,與 OpenAI 官方政策一致。
/ 05GPT-6 Luna 的速度有多快?
在 AIReiter 上,針對 494 個 token 的客服工單進行摘要與擷取請求時,非串流模式下花費 10.6 秒回傳 204 個輸出 token,而串流模式下的端到端耗時為 7.2 至 7.4 秒。請注意,Luna 在回答前會先進行推理:在多次測試中,第一個串流 token 需耗時 5.0 至 5.6 秒,因此大部分等待時間發生在文字出現之前。如果您需要更快開始回應,可降低 reasoning effort。
/ 06GPT-6 Luna 處理每 1,000 筆資料的費用是多少?
以同樣的實測請求(494 輸入與 204 輸出 tokens)為例,按 AIReiter 費率計算,每 1,000 張工單約為 $0.05。相同工作量在 GPT-6 Sol 上每 1,000 張約需 $0.91。
/ 07我可以透過 API 呼叫 GPT-6 Luna 嗎?
可以。請遵循連結的 API 說明文件,並在相容 OpenAI 的端點上使用模型 ID gpt-6-luna。