需要託管式 API 來升頻和補幀,就選 ByteDance;想在本機互動式修復影片,就選 Topaz;要建立自架、可程式化的流程,則以 Real-ESRGAN 為起點。真正影響結果的,往往是素材損壞程度與交付需求,而不是影片最後掛上 4K 標籤。
先講結論:先看素材,不要只看輸出解析度
如果你要把 AI 生成內容、UGC、短劇或老電影素材輸出成 1080p、2K 或 4K,ByteDance Video Upscaler 是相當方便的 API 選擇。需要本機預覽、手動調整模型的剪輯師,會更適合 Topaz Video。Real-ESRGAN 則是成本低、可用腳本控制的基準方案,但逐幀處理時,還得自行處理畫面閃爍與音訊保留問題。
| 你的工作 | 建議起點 | 原因 |
|---|---|---|
| 把 AI 生成短片清理後輸出 2K/4K | ByteDance Video Upscaler | 提供 AIGC 預設,單次即可完成影片到影片的處理 |
| 在工作站上由剪輯師控制修復流程 | Topaz Video | 支援本機渲染、預覽與桌面工作流程 |
| 大量處理影片並完全掌控流程 | Real-ESRGAN | 開放原始碼推論與自動化彈性較高 |
| 需要公開每秒價格的商用 API | 透過 fal 使用 ByteDance | 提供佇列 API、Webhook、預設選項與計費控制 |
ByteDance Video Upscaler 實際提供哪些功能
Replicate 頁面將這個模型標示為 ByteDance 的 vCube 影片升頻器。文件說明它能將 480p、720p 和 1080p 輸入提升至 2K 或 4K,並在同一個流程中完成畫質增強與補幀。它不是把靜態圖片生成影片的工具,而是處理現有影片檔案。
真正值得注意的控制項包括場景預設、處理等級、目標解析度與目標影格率。Replicate 列出 aigc、short_series、ugc、old_film 和 common 等場景;頁面也說明了 standard,以及僅限獲准使用者的 pro 等級。Replicate 的 README 表示,5 秒影片通常需要 3–5 分鐘,因此它並不適合拿來做即時預覽。
| 控制項 | 文件列出的選項 | 實際用途 |
|---|---|---|
| 場景 | aigc、short_series、ugc、old_film、common | 依素材特性選擇對應預設 |
| 解析度 | Replicate 支援 240p 至 1080p、2K 與 4K | 以交付上限為準,不要一律選 4K |
| 影格率 | 24、30、60,以及文件列出的 120 | 除非刻意補幀,否則應與來源一致 |
| 等級 | standard;Replicate 上的 pro 需要取得使用權限 | 將 Pro 留給人臉與細節要求較高的素材 |
| 輸出 | 單一 MP4 | 仍要在選定的服務商上檢查音訊與中繼資料 |
fal 提供的控制項比 Replicate 更多,包括處理等級、保真度、位元深度、預設選項,以及最高 8K 的結構定義目標;不過它目前公開的價目表只涵蓋 1080p、2K 和 4K。
哪些設定會直接影響帳單
fal 列出的標準 30 fps 價格為:1080p 每秒 $0.0072、2K 每秒 $0.0144、4K 每秒 $0.0288。頁面說明,60 fps 的價格會加倍,而 Pro 則是一般價格的 10 倍。換算下來,30 秒的 4K/30 標準處理約為 $0.864,尚未計入任何帳戶層級的額外費用。
| fal 設定 | 每個輸出秒數的價格 | 30 秒範例 |
|---|---|---|
| Standard,1080p/30 | $0.0072 | $0.216 |
| Standard,2K/30 | $0.0144 | $0.432 |
| Standard,4K/30 | $0.0288 | $0.864 |
| Standard,4K/60 | $0.0576 | $1.728 |
| Pro,4K/30 | $0.288 | $8.640 |
以上是 fal 的價格,不代表 ByteDance 的統一費率;BytePlus VOD 採用以分鐘計價的獨立價格,並依處理等級、解析度與影格率區間收費。
用同一段老影片比較,才不會被結果誤導
有意義的比較必須固定同一份素材與同一個交付目標。從老影片中截取 5–10 秒,內容最好同時包含人臉、細緻紋理、字幕或招牌、移動中的邊緣,以及平坦的暗部區域。來源檔、截取片段、輸出解析度、影格率、編碼器與重新封裝音訊的步驟,都應保持一致。
| 流程 | 應該怎麼輸出 | 應該觀察什麼 |
|---|---|---|
| ByteDance | 使用 old_film 或 common,輸出 2K 或 4K,影格率與來源一致 | 顆粒、人臉、文字與時間上的穩定性 |
| Topaz Video | 固定使用同一個增強模型與完全相同的輸出設定 | 細節還原與憑空生成紋理之間的差異 |
| Real-ESRGAN | 以文件指定的模型與 tile 設定處理相同影格 | 前後影格一致性、光暈與處理時間 |
只有在記錄來源、設定、處理時間、成本,並完成盲測並排比較後,結果才適合當作基準;廠商頁面能證明功能與價格,卻不能替所有素材選出一個永遠勝出的方案。
上面的表格是分流建議,不是畫質保證:正式處理整部影片前,先拿素材做測試。比起品牌名稱,失敗模式更值得注意。細小字幕可能變成銳化過度的筆畫;人臉可能變得蠟像般平滑,或出現過度細節;電影顆粒可能變成不斷爬動的雜訊;24 fps 素材轉成 60 fps 後,畫面也許更滑順,卻不代表真的增加了原本沒有捕捉到的動作。若來源畫面模糊、壓縮嚴重、交錯掃描或曝光不佳,升到 4K 反而可能更難看,因為振鈴與模型臆測出的細節會變得更加明顯。
API 工作流程:提交、輪詢、下載,再批次處理
fal API 採用非同步模式。請把金鑰放在伺服器端,提交公開 URL 或上傳的檔案,輪詢佇列狀態,最後下載回傳的 MP4。最基本的 Python worker 可以寫成這樣:
import os
import fal_client
VIDEO = "https://example.com/archive/clip.mp4"
result = fal_client.subscribe(
"fal-ai/bytedance-upscaler/upscale/video",
arguments={
"video_url": VIDEO,
"target_resolution": "4k",
"target_fps": 30,
"enhancement_preset": "old_film",
"enhancement_tier": "standard",
"fidelity": "high",
},
with_logs=True,
)
print(result["video"]["url"])
正式的批次流程應將 subscribe 換成佇列提交,再搭配 Webhook 或狀態輪詢。針對暫時性錯誤加入重試機制,記錄服務商的 request ID,並限制同時處理數量,避免一整個資料夾的短片在不知不覺中堆出失控帳單。先處理 5–10 秒的測試片段,確認結果後再提交完整來源。
Real-ESRGAN 的逐幀流程更需要手動串接:先用 FFmpeg 擷取影格,再執行官方影片推論腳本或圖片模型,按照原始影格率重新組合編號影格,最後重新封裝原始音訊。請保留影格編號,並使用無損或高品質的中間檔;否則最後比較的,不只是升頻器,也包含你的中間編碼器。
哪些情況會讓升頻後的影片更糟
只要在短片測試中出現以下任何一種情況,就應該停止,或降低輸出目標:
- 文字變形。 模型是在猜測並重建畫面,不是在找回真正可讀的字元。
- 人臉在不同影格之間漂移。 改用更保守的處理等級,或換成本機且控制項更完整的流程。
- 邊緣出現光暈。 過度銳化只是在對比邊緣描線,而不是還原細節。
- 顆粒開始爬動。 雜訊被轉成時間上的紋理;這類素材可能需要先降噪,再進行放大。
- 動作看起來不自然。 補幀改變了時間感,或產生物件互相融合的畫面。
- 來源是交錯掃描或曝光嚴重不均。 應先去交錯或修正來源。
- 實際交付目標只有 1080p。 輸出 4K 不但增加成本,還可能放大最後縮小時根本看不見的瑕疵。
ByteDance 的 old_film 預設很適合拿來測試典藏素材,但公開模型頁面並未承諾去除刮痕、修正閃爍、保留音訊或使用特定編碼器。這些都應視為工作流程上的問題,而不是保證具備的功能。
FAQ:開始渲染前,先做這些實際判斷
ByteDance 能把影片升頻到 4K 嗎?
可以。Replicate 的文件列出 2K 與 4K 目標,fal 則提供 4K 及其他結構定義值。實際限制、價格與可用等級,取決於你使用的託管平台。
我應該把 24 fps 轉成 60 fps 嗎?
只有在交付規格要求,或你已檢查過補幀瑕疵時才值得這麼做。提高影格率,不會找回原本根本沒有被拍下來的動作。
ByteDance 比 Topaz 便宜嗎?
如果只處理幾秒 API 影片,託管式 ByteDance 可能相當便宜;fal 列出的標準 4K/30 價格是 30 秒 $0.864。Topaz Video 的官方價格文件列出 Video 年繳預付價格為每年 $299,或以年度承諾方案按月支付 $33。損益平衡點取決於你的 GPU、處理量,以及是否需要雲端渲染:應將年度授權費加上硬體處理時間,與預估的託管 API 秒數成本放在一起比較。
Real-ESRGAN 用在影片上是免費的嗎?
官方專案提供開放原始碼與預訓練模型,但運算資源、儲存空間與工程時間都不是免費的。逐幀處理也需要一套經過測試的音訊與時間一致性流程。
升頻器會保留音訊嗎?
不要直接假設會保留。模型或 API 的輸出是影片檔案,但目前查閱到的公開文件並未提供統一的音訊保留保證。需要時,請保留原始音訊並重新封裝。
處理人臉時該用哪一套?
先截取一小段測試,比較 ByteDance Pro、Topaz 與較保守的 Real-ESRGAN 設定。即使結果看起來多了更多毛孔,只要改變了人物身分特徵,或把皮膚處理得像塑膠,就應該淘汰。
如果是我上線,會這樣選
最穩妥的正式流程是:先截取短片段,讓所有候選方案以實際交付影格率輸出,在 100% 顯示倍率下檢查人臉、文字與動作,確認後再處理整個素材庫。若你想了解相關的本機流程,也可以參考 Real-ESRGAN 設定指南與 GFPGAN 和 CodeFormer 人臉修復。