コンピュータ操作エージェントに必要なのはモデルだけではない。実際に操作させるデスクトップ、ブラウザ、あるいはスマートフォンと、その成否を安定して判定する評価系も欠かせない。CUA-Liteは、この不足しがちな実行基盤を埋める2026年のBerkeley RDIによるオープンプラットフォームだ。/dev/kvmなしで再現可能なGUI環境を動かせる点が最大の魅力だが、DockerはVMと同じセキュリティ境界ではない。
結論:CUA-Liteは新しいエージェントではなく、役立つ実行基盤
CUA-Liteは基盤モデルでも一般向け自動化アプリでもない。デスクトップ、ブラウザ、モバイル環境を対象に、エージェント、サンドボックス、データセット、評価、教師ありファインチューニング(SFT)、強化学習(RL)をまとめるフレームワークだ。公式プロジェクトサイトとGitHubリポジトリでは、検証可能なタスクが30,000件超、データセットが10種超、組み込みエージェントが10種超、ベンチマークが15種超とされている。
ただし、これらの数字は公開範囲を示すものであり、すべての統合で同等の完成度や性能を意味するわけではない。環境構築や/dev/kvmの確保がボトルネックなら、CUA-Liteを試す価値はある。一方で、VMによる隔離を一律に置き換えるものではない。
使い回せる仕組みはどこにあるか
CUA-Liteは、操作、データ、評価と学習の間で受け渡す結果オブジェクトにまつわる、繰り返し書かれがちな接着コードを減らす設計になっている。
lite.gymで操作インターフェースを共通化
lite.gymはスクリーンショットとアクセシビリティ情報を提供し、クリック、ドラッグ、キー入力、Bash呼び出しを受け付ける。IDはlite.demo@create_fileやlite.osworld@osworld_chrome_030eeff7のように、組み合わせやすい形式で付けられている。
そのため、1つのエージェントファクトリから異なる環境ファミリーを扱える。ただし環境固有の導入作業まで不要になるわけではない。WebArena、AndroidWorld、デスクトップ環境には、それぞれ別のセットアップ手順が用意されている。
LiteSampleで学習データを揃える
LiteSampleは、単一アクションまたは軌跡を、画像とParquetデータとして保存する。リポジトリには、Aguvis、CAGUI、GUI-360、GUIAct、GUIOdyssey、Multimodal-Mind2Web、OpenCUA、ScaleCUA、UI-Genie-Agentを含む変換済みコーパスが掲載されている。
モデルごとのアダプターが共通レコードを各モデルの期待するプロンプト形式と履歴形式へ変換するため、保存形式は統一したまま、実行時の足場はモデルごとに最適化できる。
評価結果をそのまま学習にも回せる
サンプリングした軌跡は、episode_return、終了フラグ、ターンごとのステップ、元となるLiteSampleを含むLiteRLSampleとして返される。リポジトリではepisode_returnをタスク報酬と定義しており、1.0は成功を表す。同じスコア付きロールアウトを、別のタスクスキーマに変換せず評価記録にも学習入力にも使えるわけだ。
これは拒否サンプリングによる蒸留やRLで重要になる。チームは成功した軌跡を残してファインチューニングに使い、後から環境報酬を用いてGRPOを実行できる。ただし、選んだタスク以外へ方策が一般化できることまでは証明しない。
Lite.OSWorldの価値は高速化より可搬性
CUA-Liteで最も具体的な主張はLite.OSWorldにある。これはQEMU/KVM仮想マシンではなく、GNOMEを含むDockerコンテナ上でOSWorldのタスクと評価器を実行するものだ。
| 項目 | OSWorld VM | Lite.OSWorldコンテナ |
|---|---|---|
| 実行環境 | QEMU/KVM | Docker |
| ホスト要件 | /dev/kvmとネスト仮想化 | Dockerホスト |
| インスタンスあたりのメモリ | 4.1 GB | 0.9 GB |
| コールドスタート | 29.9 s | 23.8 s |
| 報告されている並列実行密度 | ベースライン | 約4.6× |
4.6×という数字は、実質的にはメモリ比だ。4.1を0.9で割ると約4.56になる。モデルやタスクが4.6倍高速になるという意味ではない。コールドスタートの短縮は6.1秒、比率では約20.4%にとどまる。実用上の利点は、/dev/kvmを公開せずに、Docker対応のクラウドやCI基盤で動かせることにある。
SnackOnAIの技術分析も、この並列実行密度をメモリから導かれた数字として扱っており、実際のデスクトップワークロードではGPUが引き続きボトルネックになりうると指摘している。MarkTechPostは、13モデルでLite.OSWorldとOSWorld VMのスコアが一致したと報じている。もっとも、公開された要約にはタスク単位の一致行列、信頼区間、モデル別スコア表は含まれていない。性能の同等性は、自社ワークロードで確認すべき主張として扱うのがよい。
Dockerのトレードオフが許容できなくなる場面
Dockerコンテナはホストカーネルを共有するのに対し、VMにはハイパーバイザーによる境界がある。Dockerのセキュリティドキュメントでも、コンテナの隔離がカーネル制御と設定に依存することが説明されている。信頼できるベンチマークタスクであれば実用的な選択肢になりうるが、モデルが生成した任意のシェルコマンドを実行するなら、より厳格な設計が必要だ。信頼できないコードには、外側に使い捨てVMを置くか、QEMU/KVMを維持したい。
CUA-Liteで文書化されているデスクトップ例はGNOME/Linuxを使う。再起動、BIOSの挙動、rawディスク操作、カスタムカーネルモジュール、低レベルのOS動作に結果が依存するテストでは、完全なVM基盤のほうが引き続き安全な選択だ。ヘッドレスX11やアプリケーションイメージも、ネイティブな表示パイプラインと同一だと決めつけず、ピクセルに敏感なタスクで検証する必要がある。
現時点で利用できる対象
リポジトリには、以下のエージェント群と環境グループが掲載されている。
| 領域 | CUA-Liteが掲載する例 |
|---|---|
| APIエージェント | GPT, Claude, Gemini |
| ローカルモデル | Qwen3-VL, Qwen2.5-VL, Qwen3.5, UI-TARS, Fara, MAI-UI, EvoCUA, GELab, UI-Venus-2 |
| デスクトップ | OSWorld, OSWorld-2, Lite.OSWorld, WindowsAgentArena, CUABench |
| ブラウザ | WebArena, VisualWebArena, MiniWoB, WebVoyager, Online-Mind2Web, WebGym |
| モバイル | AndroidWorld, AndroidLab, MobileWorld, MobileGym |
ホームページでは15種超のベンチマークをカバーするとしている一方、READMEに挙がるグループを数えると統合は16件になる。レジストリ対応は、そのまま使えることを意味しない。APIキー、ローカルモデルのサービング、環境構築の要件は依然として異なる。
CUA-Liteを試すなら、まずこの最小構成から
「ワンコマンド」という言葉をセットアップ不要と受け取らず、公式READMEの評価セクションを段階的なテスト手順として使うとよい。
uv sync --all-extrasで依存関係を導入する。Slimeのサブモジュール初期化は、学習が必要な場合だけでよい。gpt-5.5を使い、lite.demo@create_fileのクイックスタートを実行して軌跡を保存する。- 対応するモデル設定で小規模な
lite.osworld評価を実行し、summary.jsonを確認する。 - 性能の同等性が本番判断に影響するなら、同じタスク種別を元のOSWorldでも繰り返す。
- 自社のアプリケーションイメージ上で、メモリ、GPU使用率、リセット時間、タスク単位の一致度を測定する。
READMEでは、ScreenSpot-Proに対してQwen/Qwen3-VL-8B-Instructを--concurrency 256で使う例がある一方、Lite.OSWorldでは--concurrency 8としている。静的なグラウンディングと状態を持つデスクトップタスクには、別々の並列実行予算を設定したい。
学習結果を見る際の注意点:設定まで揃える
リポジトリにはSFTの例が1件記載されている。Lite.ScaleCUAのデスクトップ軌跡で学習したQwen3-VL-2B-Instructを、2基のGPUで332タスクのlite.osworld分割により評価したものだ。この報告された実行では、平均エピソード報酬が0.138から0.237へ上がっている。
| 報告された実行 | SFT前 | SFT後 |
|---|---|---|
| 平均エピソード報酬 | 0.138 | 0.237 |
これは文書化された実例であり、独立して再現された一般的な結果ではない。READMEによれば、コンパクトなQwen設定では学習VRAMに収めるため解像度を下げ、history_n=1を使っている。学習済みチェックポイントは、学習時と同じコンパクトな設定で評価すべきだ。フル解像度のデフォルト設定へ切り替えると、ハーネス側が変わったことで正常なファインチューニングまで壊れて見える可能性がある。
RLについては、CUA-Liteは28アプリケーションにまたがる416タスクを対象としたMobileGymでのGRPOを文書化している。コマンドでは環境サーバーとSlime学習コンテナを利用する。ソースには、汎用的な学習コスト、実行時間、成功率の改善幅は示されていない。
CUA-Lite FAQ
CUA-Liteはオープンソースか?
プロジェクトはGitHubでコードを、Hugging Faceでデータセットを公開している。商用導入の前には、リポジトリと各データセットの最新ライセンスを確認してほしい。「無料でダウンロードできる」ことは、ライセンス確認の代わりにはならない。
CUA-Liteはモデルなのか?
いいえ。CUA-Liteは、対応するAPIモデルやローカルモデルを、環境、データセット、ベンチマーク、SFT、RLのワークフローへ接続するプラットフォーム兼ハーネスだ。
CUA-LiteはOSWorld VMを置き換えられるか?
対象とするワークロードの範囲に限られる。RAMや/dev/kvmが制約となる、可搬性を求める信頼済みGUI評価にはLite.OSWorldを使える。悪意のあるコード、低レベルOSタスク、ネイティブのWindows/macOS動作が必要なワークフローでは、VM境界を維持したい。
| ワークロード | 判断 |
|---|---|
| KVMなしのCI/クラウドで信頼できるGUIベンチマークを実行する | パイロット導入する |
| RAMが制約となる大規模SFT/RL | Lite.OSWorldを試し、GPU飽和度を測定する |
| 悪意のあるコードまたは任意コードの実行 | VM境界を維持する |
| カーネル、再起動、BIOS、rawディスクのテスト | 完全なVMまたは物理基盤を維持する |
| Windows/macOS固有のワークフロー | ネイティブ環境で検証する |
CUA-Liteは、より低コストで可搬性の高いコンピュータ操作エージェント用ハーネスと捉えるのが適切だ。公開比較でコンテナがメモリを節約できるかどうかは、もはや大きな論点ではない。重要なのは、自分のタスクがVMの隔離性や低レベルの忠実性を必要としているかどうかである。