先说结论:专业的图像分割模型,远胜于通用图片编辑模型。这次五种方案实测中,BiRefNet 的效果最好;通过 Replicate 使用托管版本,每 1,000 张图片的起步成本约为 $0.51。下面直接上证据。
我特意选了一张很难抠的图:逆光卷发、半透明的一杯冰茶,以及人物身后挤满顾客和串灯的咖啡馆。这恰好是生产环境里最容易让抠图翻车的三类元素:发丝、透明物体和杂乱背景。2026 年 7 月 17 日,我将完全相同的一张 1024×1024 图片分别输入三个开源模型和两个提示词式图像模型,并把五份输出放在一起比较。一张高难度图片只能算冒烟测试,不是完整基准测试;它的价值在于快速暴露每条流水线的失效方式。随后,你仍应拿同样的方法跑一遍自己的商品图库。
同一张图跑 5 种方案,结果差别有多大?
| 方案 | 处理时间 | 是否有真实 Alpha 通道? | 实际表现 |
|---|---|---|---|
| BiRefNet-general(通过 rembg) | CPU 15.2 秒 | 是 | 头发、手和玻璃杯都被完整保留 |
| isnet-general-use(rembg) | CPU 1.1 秒 | 是 | 保住了玻璃杯,但画面中残留了另一个人的一块轮廓 |
| u2net(rembg 默认模型) | CPU 0.4 秒 | 是 | 把人物的手和玻璃杯一起删掉了 |
| GPT Image 2 | 99.8 秒 | 否 | 把假的棋盘格直接画进了像素里 |
| Nano Banana Pro | 31.4 秒 | 否 | 直接把原来的女性换成了另一个人 |
上面这五条流水线,普通开发者现在都能通过一次 pip install 或一次按量计费的 API 调用运行。后文提到的商业 SaaS API,则会按已核实的定价、免费额度与授权条件进行比较。只有 BiRefNet-general 成功处理了这三个难点:飘散的发丝保留了柔和边缘,冰茶没有丢失,背景中的顾客也没有渗进抠图结果。代价是算力消耗:ONNX 模型体积为 973MB,首次运行下载耗时 74 秒;在 Apple Silicon CPU 上,单张推理需要 15.2 秒(M 系列芯片、rembg 2.x 配合 onnxruntime)。托管 GPU 端点运行这类架构会快得多:Replicate 标注的典型完成时间约为 3 秒,而 Bria 的 RMBG-2.0 本身就是 BiRefNet 的衍生模型。
两个更轻量的模型,呈现出典型的速度与准确率取舍。isnet-general-use 只用了 1.1 秒,还保住了玻璃杯,但抠图左下角留下了一名咖啡馆顾客的灰色残影。u2net 是 rembg 未指定模型时默认加载的版本,0.4 秒完成处理,却连同饮料一起切掉了人物的手。如果你一直不理解,为什么很多人会说“我试过 rembg,效果很差”,但 BiRefNet 的基准成绩又很好,答案就在这里:默认模型与最佳模型之间相隔了五年。
三个开源模型输出的都是货真价实的 RGBA 文件。RGBA 指图片带有 Alpha 通道,也就是逐像素的透明度蒙版,因此你可以把抠出的主体合成到任何新背景上。这正是背景移除 API 最核心的能力,而接下来两位参赛者恰恰没有做到。
提示词图片模型,不等于背景移除 API
我要求 Nano Banana Pro 将背景替换成绿幕,同时让主体像素级保持不变。它确实给了我干净的绿色背景,但背景前站着的是完全不同的女性:脸、发型、玻璃杯、衣服全都变了,画布还在未提示的情况下从 1024×1024 改成了 1408×768。单独看成片很专业,这反而让问题更危险:系统不会提醒你,上传的商品图已经不再是你的商品。
GPT Image 2 的失败方式更隐蔽。要求透明背景后,它对主体的保留明显更好——还是同一位女性,也还是同一件牛仔外套——但交付的是 RGB 文件,灰白棋盘格被直接画进了像素。在预览窗口中,它看起来和透明背景一模一样;可一旦拖进设计工具,棋盘格也会一起带进去。它还耗时 99.8 秒,而 Replicate 给出的专业背景移除端点典型处理时间约为 3 秒。
这不是提示词写得不够好,而是架构使然。此类编辑模型会根据对原图的压缩理解重新生成整张画面;分割模型则是逐像素判断主体或背景,再将原始像素连同蒙版交还给你。实际使用中,重新生成无法稳定保留身份信息;而在我的测试中,这两次编辑调用也都没有返回 Alpha 通道,结果均被压成 RGB。
不过,它们仍有合理用途:如果你要的是新场景而非抠图,例如把咖啡馆换成摄影棚、重塑产品光线,或生成生活方式场景,编辑模型可以一次调用完成,无须再走移除背景和合成背景两步。我通过 AIReiter 的两次调用分别计费 $0.06(Nano Banana Pro)和 $0.01(GPT Image 2),用几分钱摸清边界很值得。但凡你的流水线承诺向客户交付他们自己的主体,就别把这类模型放进去。
每 1,000 张图片到底要花多少钱?
以下列出的方案,价格差距约为 2,000 倍。所有价格均于 2026 年 7 月 17 日从官方定价页面获取。
remove.bg 是主流方案中价格最高的一档,且领先幅度很大。按量付费为 $3 买 3 个额度,每个额度可处理一张全分辨率图片,也就是每张 $1.00。Lite 订阅为 40 个额度,按年付费后每月 $8.10,折合每张 $0.20;即使是 500 额度的 Volume+ 方案,每张也仍要 $0.16。免费层提供一个试用额度,以及预览分辨率的 API 调用。
Photoroom 的 Remove Background API 统一按每张 $0.02 收费,即每 1,000 张 $20。它提供每月 1,000 次带水印的沙盒调用供开发调试,另有 10 次免费生产调用;支持 AI 阴影和完整编辑能力的层级为每张 $0.10。Pixian.AI 按百万像素计费,预付费额度包从 $5 买 250 个额度起,单张成本在 $0.0009 到 $0.018 之间;只要你在两年内购买过任意额度,额度就不会过期。
Replicate 上的 851-labs/background-remover,采用 Nvidia T4 硬件运行,单张约 $0.00051,也就是每 1 美元可处理 1,960 张,典型完成时间为 3 秒。Bria 的 RMBG-2.0 在 fal.ai 上每张 $0.018。至于自托管 rembg,单张图片成本是 $0,外加你自己的算力费用。
订阅前一定要按实际量级算账:每月处理 10,000 张图,在 remove.bg 最便宜的订阅单价下约需 $1,600(Volume+ 每张 $0.16);Photoroom 约为 $200;Replicate 则约为 $5。这里的价格敏感度非常真实,开发者公开抱怨过每张 $0.03的成本,而 r/MachineLearning 也有社区维护的这类 API 基准测试。
“免费”模型背后的授权坑
开源方案还有一道授权门槛,它会直接改变你能否把所谓的“免费”模型用于上线产品。
Bria 的 RMBG-2.0 是目前较强的开放权重模型之一,基于 BiRefNet 架构构建,但训练数据集采用专有授权。其 Hugging Face 权重使用 CC BY-NC 4.0 许可发布,其中 NC 表示非商业用途:你可以拿它做基准测试,却不能直接将它集成到产品中上线。商用需要与 Bria 签订付费协议,或使用其每张 $0.018 的 API。付费路径带来的价值,是一份关于训练数据的明确说明:Bria 表示该模型完全使用已获授权的图像训练。这正是企业采购团队近来开始追问的问题。
BiRefNet 则正好相反:官方仓库中的代码和权重均采用 MIT 许可证发布,可免费商用。rembg 自身代码也是 MIT,但 rembg 本质上是对十多个可互换模型的封装,每个模型的权重都受各自上游许可证约束;封装器的许可证无法说明其中模型权重的授权状态。Replicate 的 851-labs 页面甚至没有标明底层模型的许可证。在权重文件进入商业流水线之前,花五分钟核查其许可证,成本远低于事后补救。
背景移除 API 到底该怎么选?
追求最低成本且能直接用的 API:选 Replicate 的 851-labs remover,每 1,000 张约 $0.51,延迟约 3 秒,无须订阅。如果你更愿意小额预存额度、不想持续给云账户充值,Pixian.AI 是第二选择。
抠图质量直接影响收入:Photoroom 每张 $0.02,Bria 每张 $0.018,是两个商业方案。Photoroom 每月提供 1,000 次沙盒调用,你可以先用自己的商品图库验证边缘质量,再决定是否付费;这比相信任何人的单图测试——包括我的——都靠谱。Bria 的额外优势是已授权训练数据的文档链路。remove.bg 提供 Photoshop、Figma 和 Zapier 官方插件,这是便宜 API 没有的;但单看 API,其单张价格是 Photoroom 的 8 到 50 倍,很难合理化。
图片不能离开自己的基础设施:使用 rembg 配合 birefnet-general,可以拿到这次测试中质量最好的结果,单张成本为 $0,但要预留 GPU 预算。我在 CPU 上的单张 15.2 秒推理,适合夜间批处理,对结账流程却毫无用处。一位开发者的真实自托管报告也很直接:效果不如 remove.bg,速度明显更慢,服务器还在负载下崩溃了。自托管是一个真实选项,但绝不是免费的午餐。
本来就在调用图片模型:那就把它们用于背景替换,也就是目标本来就是重新生成一个场景,而不是抠出主体。一旦流程承诺把客户自己的像素原样还给他,就应把任务交给分割模型。
FAQ
有没有完全免费的背景移除 API?
不附带额外条件的免费方案是自托管 rembg:代码采用 MIT 许可证,一次 pip install 即可。托管 API 的免费层方面,Photoroom 每月提供 1,000 次带水印的沙盒调用和 10 次生产调用;remove.bg 提供一个试用额度,以及不限次数的预览分辨率调用。
ChatGPT 或 GPT Image 能移除背景吗?
它会生成一个看起来正确、实际却不对的结果。我的测试中,GPT Image 2 返回的是 RGB 文件,棋盘格图案被直接画进像素,而非提供真实 Alpha 通道,且耗时 99.8 秒。要替换背景可以用它;要真正移除背景,请使用分割 API。
最好的开源背景移除模型是什么?
BiRefNet-general。在我的五种方案测试中,它在头发、透明物体和杂乱背景上胜出,代码与权重均采用可商用的 MIT 许可证。RMBG-2.0 在同一架构上通过更好的训练数据进一步优化,但其开放权重仅限非商业用途。
如何用 Python 移除图片背景?
借助 rembg,只需三行:pip install "rembg[cpu]" onnxruntime,然后:
from rembg import remove, new_session
from PIL import Image
out = remove(Image.open("in.jpg"), session=new_session("birefnet-general"))
out.save("out.png")
除非你对 CPU 亚秒级速度的需求高于保住主体的手,否则不要使用默认的 u2net,务必指定 birefnet-general。