先講結論:專用的影像分割模型,效果明顯勝過其他方案。這次五條流程實測中,BiRefNet 拿下最佳品質;若使用 Replicate 的託管版本,每 1,000 張起價約 $0.51。以下是實測結果。
我刻意挑了一張很難處理的圖片:逆光的自然捲髮、一杯半透明的冰茶,以及人物身後擠滿人群和串燈的咖啡廳。這正是正式環境中最常讓去背失準的三種情境:細髮絲、透明物件與雜亂背景。我在 2026 年 7 月 17 日,將同一張 1024×1024 圖片送進三個開源模型和兩個提示詞式影像模型,並把五份輸出並排比較。一張高難度圖只能算冒煙測試,不是完整基準測試;它最大的價值,是讓你迅速看出各條流程會怎麼失敗。接著也該用同樣的方法測試自己的商品目錄。
同一張圖跑五種去背流程,結果如何?
| 流程 | 處理時間 | 是否有真正的 Alpha 通道? | 實際結果 |
|---|---|---|---|
| BiRefNet-general(透過 rembg) | CPU 15.2 秒 | 是 | 頭髮、手部與玻璃杯都完整保留 |
| isnet-general-use(rembg) | CPU 1.1 秒 | 是 | 玻璃杯保住了,但畫面中殘留另一個人的一大塊身影 |
| u2net(rembg 預設模型) | CPU 0.4 秒 | 是 | 連同飲料一起把人物的手刪掉 |
| GPT Image 2 | 99.8 秒 | 否 | 把假的棋盤格直接畫進像素裡 |
| Nano Banana Pro | 31.4 秒 | 否 | 直接把原本的女性換成另一個人 |
上面五條流程,都是現在任何人只要 pip install 或呼叫一次按量計費 API 就能執行的選項;後文也會比較商業 SaaS API 的已核實價格、免費額度與授權條件。只有 BiRefNet-general 同時跨過三個難關:飄散髮絲仍保有柔和邊緣、冰茶完整留在去背結果中,背景人群也沒有滲進來。代價是運算量。它的 ONNX 模型有 973MB,首次執行下載花了 74 秒,在 Apple Silicon CPU 上每張需 15.2 秒(M 系列、rembg 2.x 搭配 onnxruntime)。使用這個架構家族的託管 GPU 端點快得多:Replicate 列出的典型完成時間約為 3 秒,而 Bria 的 RMBG-2.0 本身也是 BiRefNet 的衍生模型。
另外兩個較輕量的模型,則呈現典型的速度與準確度取捨。isnet-general-use 只花 1.1 秒,且保住了玻璃杯,但去背圖左下角留下了一名咖啡廳客人的灰色輪廓。u2net 是 rembg 未指定模型時會載入的預設值,0.4 秒就完成,卻連同飲料一起切掉人物的手。如果你曾好奇,為什麼很多人會說「我試過 rembg,效果很差」,但 BiRefNet 的測試成績卻很好,原因就在這裡:預設模型與最佳模型之間,相隔了五年。
三個開源模型輸出的都是貨真價實的 RGBA 檔。RGBA 代表圖片帶有 Alpha 通道,也就是逐像素的透明度遮罩,因此能把去背結果合成到任何新背景上。這正是去背 API 的核心價值,而接下來兩位參賽者都沒能做到。
提示詞式影像模型,不是去背 API
我要求 Nano Banana Pro 把背景換成色鍵綠幕,並讓主體保持像素完全一致。它確實產出乾淨的綠色背景,但站在前面的已經是完全不同的女性:臉、髮型、玻璃杯和衣服全都不同,畫布尺寸還悄悄從 1024×1024 改成 1408×768。單看輸出圖,它很專業;但這反而更危險,因為系統沒有警告你:你上傳的商品照片,已經不再是你的商品。
GPT Image 2 的失敗方式更隱蔽。當我要求透明背景時,它對主體的保留好得多,還是同一位女性、同一件牛仔外套;但它交付的是 RGB 檔案,灰白棋盤格被直接畫進像素裡。在預覽視窗中,它看起來和透明背景一模一樣;但丟進設計工具後,棋盤格也會一起出現。它的處理時間還長達 99.8 秒,相比之下,Replicate 為專用去背端點列出的時間約為 3 秒。
這不是提示詞寫得不夠好的問題,而是架構差異。這類編輯模型會根據對圖片的壓縮理解重新生成整個畫面;分割模型則是判斷原圖的每一個像素屬於主體還是背景,再把原始像素連同遮罩交還給你。實務上,重新生成無法可靠保留原有身分;而這次測試裡,兩個編輯模型都沒有輸出 Alpha 通道,結果都被壓平成 RGB。
不過它們仍有合理的使用情境:如果你要的是新場景,而非去背素材,例如把咖啡廳換成攝影棚、重新打亮商品,或生成生活情境圖,影像編輯模型一次呼叫就能完成,省掉另外去背與合成的步驟。我透過 AIReiter 的兩次呼叫,Nano Banana Pro 為 $0.06、GPT Image 2 為 $0.01,因此用幾分錢就能摸清兩者的界線。但只要流程承諾把客戶自己的主體原樣交還,就不該用這類模型。
每 1,000 張圖片,實際要花多少?
以下列出的選項,價格差距約達 2,000 倍。所有價格均取自 2026 年 7 月 17 日的官方定價頁面。
remove.bg 是主流選項中價格最高的一個,而且高出許多。按量付費為 $3 購買 3 點額度,每點可處理一張全解析度圖片,換算就是每張 $1.00。Lite 訂閱方案提供 40 點額度,年繳時每月 $8.10,單張成本為 $0.20;即使是 500 點的 Volume+ 方案,每張仍要 $0.16。免費方案則提供 1 點試用額度,以及預覽解析度的 API 呼叫。
Photoroom 的 Remove Background API 單張固定收費 $0.02,也就是每 1,000 張 $20。你每月可獲得 1,000 次帶浮水印的 sandbox 呼叫用於開發,另有 10 次免費正式環境呼叫;包含 AI 陰影與完整編輯功能的方案則是每張 $0.10。Pixian.AI 依百萬像素計價,預付額度包從 $5 購買 250 點起,單張成本介於 $0.0009 至 $0.018;只要兩年內曾購買過任何額度,點數就不會過期。
Replicate 上的 851-labs/background-remover,在 Nvidia T4 硬體上的費用約為每張 $0.00051,也就是每 $1 可去背 1,960 張,典型完成時間為 3 秒。Bria 的 RMBG-2.0 在 fal.ai 上每張收費 $0.018。至於自行託管 rembg,每張成本是 $0,加上你的運算成本。
訂閱前先按自己的用量算一遍:每月 10,000 張圖片,在 remove.bg 最便宜的訂閱費率下,Volume+ 每張 $0.16,總計約 $1,600;Photoroom 為 $200;Replicate 則約 $5。這個領域的價格敏感度相當真實,已有開發者公開抱怨每張 $0.03的費用,而 r/MachineLearning 也有社群建立的 API 基準測試。
「免費」模型背後的授權陷阱
開源選項有一個授權上的陷阱,而且它會直接改變哪些「免費」模型能真正放進產品。
Bria 的 RMBG-2.0 是目前最強的開放權重模型之一,以 BiRefNet 架構為基礎,並使用專有授權資料集訓練。它在 Hugging Face 上發布的權重採 CC BY-NC 4.0 授權。NC 代表非商業用途:你可以拿來做基準測試,但若要整合進產品,就必須與 Bria 簽訂付費協議,或使用它每張 $0.018 的 API。付費路線提供的關鍵價值,是能對訓練資料給出明確說明:Bria 表示模型完全使用已授權圖像訓練,而這正是企業採購團隊近來開始詢問的問題。
BiRefNet 則正好相反:官方 repo 的程式碼和權重都採 MIT 授權,可免費商用。rembg 本身的程式碼同樣是 MIT,但 rembg 是一層包裝器,底下可替換十多種模型;每個模型的權重都有各自的上游授權,包裝器的授權並不能說明模型權重能否使用。Replicate 的 851-labs 頁面則完全沒有標示底層模型的授權。商業流程上線前,花五分鐘確認權重檔的授權,遠比另一種代價便宜。
該選哪一款去背 API?
想要最便宜且可用的 API:選 Replicate 的 851-labs remover,每 1,000 張約 $0.51、延遲約三秒,且不需要訂閱制。如果你寧可預付小額點數包,而不想讓雲端帳戶持續扣款,Pixian.AI 是次佳選擇。
去背品質直接影響營收:Photoroom 每張 $0.02 與 Bria 每張 $0.018,是兩個商業方案選擇。Photoroom 每月提供 1,000 次 sandbox 呼叫,讓你在付費前就能用自己的商品目錄檢查邊緣品質;這比相信任何人的單張測試,包括我的,更可靠。Bria 則多了已授權訓練資料的文件佐證。remove.bg 提供較便宜 API 沒有的官方 Photoshop、Figma 與 Zapier 外掛,但單張價格是 Photoroom 的 8 至 50 倍,若只看 API,很難合理化這筆支出。
圖片不能離開自己的基礎設施:使用 rembg 搭配 birefnet-general,可得到這次測試中品質最佳的結果,每張 $0,但必須為 GPU 預留預算。我測得的 CPU 推論時間為 15.2 秒,適合夜間批次工作,卻完全不適合結帳流程。一位開發者的誠實自架報告指出:結果比 remove.bg 差、速度明顯更慢,伺服器還在負載下當機。自架是可行選項,但不是免費午餐。
本來就已經在呼叫影像模型:把它們用於背景替換,也就是目標本來就是重新生成場景時,而不是用於主體擷取。一旦流程承諾將客戶自己的像素原樣交還,工作就該交給分割模型。
常見問題
有完全免費的去背 API 嗎?
若不附帶條件,答案是自行託管 rembg,程式碼採 MIT 授權,只需一次 pip install。託管 API 的免費方案則包括:Photoroom 每月提供 1,000 次帶浮水印的 sandbox 呼叫,加上 10 次正式環境呼叫;remove.bg 提供 1 點試用額度,以及不限次數的預覽解析度呼叫。
ChatGPT 或 GPT Image 可以去背嗎?
它能做出看似正確、實際卻不對的結果。這次測試中,GPT Image 2 回傳的是 RGB 檔,棋盤格圖樣被畫進像素中,而不是真正的 Alpha 通道,且花了 99.8 秒。請用它做背景替換;需要去背時,請使用分割 API。
最好的開源去背模型是什麼?
BiRefNet-general。它在我的五流程測試中,於頭髮、透明物件與雜亂背景三項都勝出,且程式碼與權重均採可商用的 MIT 授權。RMBG-2.0 以更好的訓練資料改良同一架構,但它的開放權重僅限非商業用途。
如何在 Python 中移除背景?
用 rembg 只要三行:pip install "rembg[cpu]" onnxruntime,接著:
from rembg import remove, new_session
from PIL import Image
out = remove(Image.open("in.jpg"), session=new_session("birefnet-general"))
out.save("out.png")
除非你對次秒級 CPU 速度的需求高過保住主體的手,否則請跳過預設的 u2net,明確指定 birefnet-general。