AIREITER

CUA-Lite 評測:更適合電腦操作代理的 Harness 嗎?

最近更新: 2026-09-08 19:04:20

要讓電腦操作代理真正跑起來,光有模型還不夠:它還需要可操作的桌面、瀏覽器或手機環境,以及可靠的評分機制。CUA-Lite 是 Berkeley RDI 在 2026 年推出的開放平台,補上的正是這一層。它最有價值的地方,是能在不依賴 /dev/kvm 的情況下重複建立 GUI 環境;但也必須認清,Docker 提供的安全邊界並不等同於虛擬機。

結論:CUA-Lite 是實用的基礎設施,不是新一代代理模型

CUA-Lite 不是基礎模型,也不是面向一般使用者的自動化工具,而是一套串接代理、沙箱、資料集、評估、監督式微調(SFT)與強化學習(RL)的框架,可涵蓋桌面、瀏覽器與行動裝置環境。官方專案網站與 GitHub repository宣稱支援超過 30,000 個可驗證任務、10+ 個資料集、10+ 種內建代理,以及 15+ 個基準測試。

這些數字反映的是已公開的涵蓋範圍,並不代表每一項整合都有相同表現。如果團隊卡在環境建置,或基礎設施無法使用 /dev/kvm,CUA-Lite 值得先做試點;不過它並不能一概取代 VM 的隔離能力。

讓平台能重複使用的核心設計

CUA-Lite 將互動、資料,以及評估與訓練之間傳遞的結果物件標準化,減少每次接入新環境時都得重寫黏合程式碼的麻煩。

lite.gym 統一代理互動介面

lite.gym 會提供螢幕截圖與無障礙資訊,並接受點擊、拖曳、鍵盤輸入與 Bash 指令等操作。任務 ID 採可組合的命名方式,例如 lite.demo@create_file 或 lite.osworld@osworld_chrome_030eeff7。

因此,同一個代理工廠可以對接不同類型的環境。不過,各環境仍有自己的安裝需求:WebArena、AndroidWorld 與桌面環境都必須分別依照文件設定。

LiteSample 將訓練資料格式化

LiteSample 以 Parquet 資料與圖片保存單一步驟或完整軌跡。repository 列出的轉換資料集包含 Aguvis、CAGUI、GUI-360、GUIAct、GUIOdyssey、Multimodal-Mind2Web、OpenCUA、ScaleCUA 與 UI-Genie-Agent。

各模型的 adapter 會把共用紀錄轉換成目標模型所需的 prompt 與歷史格式。儲存層可以維持統一,但模型相關的 scaffolding 仍各自保留。

一次執行結果,同時服務評估與訓練

一次採樣軌跡會回傳 LiteRLSample,其中包含 episode_return、終止旗標、每回合步驟,以及底層的 LiteSample。repository 將 episode_return 定義為任務獎勵,1.0 代表成功。因此,同一段已評分的 rollout 不必再經過第二套任務 schema,就能成為評估紀錄或訓練資料。

這對拒絕採樣蒸餾與 RL 很實際:團隊可以保留成功軌跡、拿來微調,之後再利用環境獎勵進行 GRPO。不過,這並不能證明策略能泛化到被挑選任務以外的情境。

Lite.OSWorld 改變的是部署彈性,不是運算速度

CUA-Lite 最具體的主張是 Lite.OSWorld:將 OSWorld 任務與評估器從 QEMU/KVM 虛擬機搬進 GNOME Docker container 執行。

項目OSWorld VMLite.OSWorld container
執行環境QEMU/KVMDocker
主機需求/dev/kvm 與巢狀虛擬化Docker 主機
每個執行個體的記憶體4.1 GB0.9 GB
冷啟動時間29.9 s23.8 s
公布的平行密度基準值約 4.6×

4.6× 基本上就是記憶體用量的比值:4.1 除以 0.9 約為 4.56。它不代表模型或任務速度提升 4.6×;冷啟動僅縮短 6.1 秒,約為 20.4%。實際好處在於,不必暴露 /dev/kvm,也能在支援 Docker 的雲端與 CI 基礎設施上執行。

SnackOnAI 的技術分析同樣將密度數字視為記憶體計算,並指出實際桌面工作負載仍可能受 GPU 限制。MarkTechPost報導 Lite.OSWorld 與 OSWorld VM 在 13 個模型上的分數一致。已公開的摘要沒有提供逐任務一致性矩陣、信賴區間或模型層級分數表,因此是否真的對等,仍應在自己的工作負載中驗證。

哪些情況下 Docker 的取捨不能接受

Docker container 共用主機 kernel,VM 則多了一層 hypervisor 邊界;Docker 的安全性文件也說明,container 隔離仰賴 kernel 控制與設定。對可信任的 benchmark 任務而言,這通常是合理取捨;但若模型可能產生任意 shell 指令,就需要更嚴格的設計。面對不可信任程式碼,應使用外層的暫時性 VM,或繼續採用 QEMU/KVM。

CUA-Lite 文件中的桌面範例採用 GNOME/Linux。若工作需要重新開機、BIOS 行為、原始磁碟操作、自訂 kernel module,或測試結果取決於低階 OS 行為,完整 VM 基礎設施依然是較安全的選擇。對像素敏感的任務,也應驗證 headless X11 與應用程式 image 的表現,而不能直接假定它和原生顯示管線完全相同。

目前可執行的代理與環境

repository 列出以下代理家族與環境群組:

類別CUA-Lite 列出的範例
API 代理GPT, Claude, Gemini
本機模型Qwen3-VL, Qwen2.5-VL, Qwen3.5, UI-TARS, Fara, MAI-UI, EvoCUA, GELab, UI-Venus-2
桌面OSWorld, OSWorld-2, Lite.OSWorld, WindowsAgentArena, CUABench
瀏覽器WebArena, VisualWebArena, MiniWoB, WebVoyager, Online-Mind2Web, WebGym
行動裝置AndroidWorld, AndroidLab, MobileWorld, MobileGym

首頁將其歸納為 15+ 個 benchmarks;README 中列出的群組加總則有 16 項整合。registry 支援不代表開箱即用:API key、本機模型服務與環境設定仍會因整合而異。

一套最小但有意義的 CUA-Lite 試跑流程

建議把官方 README 的 evaluation 區段當成分階段驗證流程,而非把「一行指令」理解成完全不用設定。

  1. 以 uv sync --all-extras 安裝相依套件;只有需要訓練時才初始化 Slime submodule。
  2. 使用 gpt-5.5 執行 lite.demo@create_file 快速入門,並保存軌跡。
  3. 以相符的模型設定執行小規模 lite.osworld 評估,檢查 summary.json。
  4. 如果對等性會影響正式環境決策,請在原始 OSWorld 中重跑同類任務。
  5. 在自己的應用程式 image 上量測記憶體、GPU 使用率、重設時間與逐任務一致性。

README 在 ScreenSpot-Pro 範例中,對 Qwen/Qwen3-VL-8B-Instruct 使用 --concurrency 256,但 Lite.OSWorld 僅使用 --concurrency 8。靜態 grounding 與有狀態的桌面任務,應採用不同的 concurrency 預算。

訓練成果有參考價值,但設定很容易踩坑

repository 文件提供一個 SFT 範例:以 Lite.ScaleCUA 桌面軌跡訓練 Qwen3-VL-2B-Instruct,並在包含 332 個任務的 lite.osworld split 上使用兩張 GPU 評估。該次公布的執行結果中,平均 episode return 從 0.138 提升至 0.237。

公布的執行結果SFT 前SFT 後
平均 episode return0.1380.237

這是文件記載的單一範例,並非經過獨立重現後可普遍套用的結論。README 提到,精簡版 Qwen 設定為了容納訓練 VRAM,會降低解析度並使用 history_n=1。評估 checkpoint 時,應沿用訓練時的精簡設定;若切換成全解析度預設值,可能會因為 harness 改變,讓原本有效的 fine-tune 看起來像壞掉了一樣。

在 RL 部分,CUA-Lite 文件記載了在 MobileGym 上進行 GRPO 的作法,涵蓋 28 個應用程式中的 416 個任務。指令需要環境 server 與 Slime 訓練 container。來源沒有提供通用的訓練成本、實際耗時或成功率提升幅度。

CUA-Lite FAQ

CUA-Lite 是開源的嗎?

專案在 GitHub 發布程式碼,資料集則透過 Hugging Face 提供。商業導入前,請確認 repository 與每個資料集目前的授權條款;能免費下載,不代表不需要進行授權審查。

CUA-Lite 是模型嗎?

不是。CUA-Lite 是平台與 harness,可將支援的 API 或本機模型連接到環境、資料集、benchmarks、SFT 與 RL 工作流程。

CUA-Lite 可以取代 OSWorld VM 嗎?

只限於它所針對的工作負載邊界。若是可信任的 GUI 評估,且 RAM 或 /dev/kvm 是限制,可使用 Lite.OSWorld;如果要執行惡意或不受控程式碼、處理低階 OS 任務,或需要原生 Windows/macOS 行為,仍應保留 VM 邊界。

工作負載建議
沒有 KVM 的 CI/雲端上的可信任 GUI benchmarks導入試點
RAM 受限的大規模 SFT/RL測試 Lite.OSWorld,並量測 GPU 飽和度
惡意或任意程式碼執行保留 VM 邊界
kernel、重新開機、BIOS 或原始磁碟測試保留完整 VM/實體基礎設施
Windows/macOS 專屬工作流程以原生環境驗證

最適合把 CUA-Lite 視為更省成本、可攜性更高的電腦操作代理 harness。真正尚未消失的問題,不是 container 在公布比較中是否節省記憶體,而是你的任務是否需要 VM 原本提供的隔離性與低階行為一致性。