Computer-use агенту недостаточно одной модели: ему нужна среда — рабочий стол, браузер или смартфон, — в которой он будет действовать, а также надёжный механизм проверки результата. CUA-Lite — открытая платформа Berkeley RDI 2026 года, закрывающая именно этот инфраструктурный пробел. Её сильная сторона — воспроизводимые GUI-окружения без /dev/kvm; слабая — Docker не даёт того же уровня изоляции, что виртуальная машина.
Вердикт по CUA-Lite: полезная инфраструктура, а не новый агент
CUA-Lite — не фундаментальная модель и не пользовательское приложение для автоматизации. Это фреймворк, объединяющий агентов, песочницы, датасеты, оценку, supervised fine-tuning (SFT) и reinforcement learning (RL) для десктопных, браузерных и мобильных сред. На официальном сайте проекта и в репозитории GitHub заявлены более 30 000 проверяемых задач, более 10 датасетов, более 10 встроенных агентов и более 15 бенчмарков.
Эти цифры говорят о заявленном масштабе проекта, а не о равной зрелости и производительности всех интеграций. CUA-Lite стоит попробовать, если узким местом стали развёртывание окружений или доступность /dev/kvm. Но считать её универсальной заменой изоляции на уровне VM не стоит.
Как устроена платформа и почему её удобно переиспользовать
CUA-Lite сокращает объём повторяющегося связующего кода между взаимодействием с окружением, данными и объектом результата, который используется и в оценке, и в обучении.
lite.gym: единый интерфейс для действий
Интерфейс lite.gym предоставляет скриншоты и данные accessibility, а в ответ принимает клики, перетаскивания, нажатия клавиш и Bash-команды. Идентификаторы строятся по композиционной схеме, например lite.demo@create_file или lite.osworld@osworld_chrome_030eeff7.
Благодаря этому одна фабрика агентов может работать с разными семействами окружений. Однако настройка самих сред никуда не исчезает: для WebArena, AndroidWorld и десктопных окружений по-прежнему есть отдельные инструкции по установке.
LiteSample: общий формат для обучающих данных
LiteSample хранит отдельные действия и целые траектории в формате Parquet вместе с изображениями. В репозитории перечислены конвертированные корпуса, включая Aguvis, CAGUI, GUI-360, GUIAct, GUIOdyssey, Multimodal-Mind2Web, OpenCUA, ScaleCUA и UI-Genie-Agent.
Адаптеры для конкретных моделей преобразуют общие записи в ожидаемый каждой моделью формат промпта и истории. Хранилище остаётся единым, а обвязка сохраняет специфику моделей.
Один результат — для оценки и обучения
Выборка траектории возвращает LiteRLSample, содержащий episode_return, флаги завершения, пошаговые действия и исходный LiteSample. В репозитории episode_return определён как награда за задачу, где 1.0 означает успех. Поэтому одну и ту же оценённую траекторию можно использовать и как запись бенчмарка, и как входные данные для обучения — без второй схемы задачи.
Это важно для rejection-sampled distillation и RL: команда может отобрать успешные траектории, дообучить на них модель, а затем применять награды окружения для GRPO. Впрочем, сам по себе такой подход не доказывает, что политика будет обобщаться за пределами отобранных задач.
Lite.OSWorld выигрывает в переносимости, а не в скорости
Самое конкретное заявление CUA-Lite связано с Lite.OSWorld: задачи и оценщики OSWorld запускаются в GNOME-контейнере Docker, а не в виртуальной машине QEMU/KVM.
| Параметр | VM OSWorld | Контейнер Lite.OSWorld |
|---|---|---|
| Среда выполнения | QEMU/KVM | Docker |
| Требования к хосту | /dev/kvm и вложенная виртуализация | Docker-хост |
| Память на экземпляр | 4.1 GB | 0.9 GB |
| Холодный старт | 29.9 s | 23.8 s |
| Заявленная плотность параллельного запуска | Базовый уровень | Примерно 4.6× |
Показатель 4.6× фактически следует из соотношения потребления памяти: 4.1, делённое на 0.9, даёт примерно 4.56. Речь не о модели или задаче, работающей в 4.6 раза быстрее. Холодный старт сокращается на 6.1 секунды, то есть примерно на 20.4%. Практическая выгода — возможность запускать среду в облаке и CI-инфраструктуре с Docker, не открывая доступ к /dev/kvm.
Технический разбор SnackOnAI тоже рассматривает показатель плотности как расчёт по памяти и отмечает, что реальные десктопные нагрузки могут оставаться ограниченными GPU. MarkTechPost сообщает о совпадающих результатах Lite.OSWorld и VM OSWorld на 13 моделях. В опубликованных сводках нет матрицы совпадений по отдельным задачам, доверительных интервалов и таблицы результатов по моделям, поэтому заявленный паритет стоит проверить на собственной нагрузке.
Когда компромисс в пользу Docker уже неприемлем
Контейнеры Docker используют общее ядро хоста, тогда как VM добавляет изоляцию через гипервизор. В документации Docker по безопасности указано, что изоляция контейнеров зависит от механизмов ядра и конфигурации. Для доверенных задач бенчмарка это может быть практичным выбором, но произвольные shell-команды, сгенерированные моделью, требуют более строгой архитектуры. Для недоверенного кода используйте внешний эфемерный VM-слой либо сохраняйте QEMU/KVM.
В документированных десктопных примерах CUA-Lite применяется GNOME/Linux. Полноценная VM-инфраструктура остаётся более безопасным вариантом для перезагрузок, поведения BIOS, операций с сырыми дисками, пользовательских модулей ядра и тестов, зависящих от низкоуровневого поведения ОС. Для задач, чувствительных к пикселям, также не следует автоматически считать headless X11 и образы приложений эквивалентными нативному графическому конвейеру — это нужно проверять.
Что CUA-Lite умеет запускать уже сейчас
В репозитории перечислены следующие семейства агентов и группы окружений:
| Категория | Примеры, указанные CUA-Lite |
|---|---|
| API-агенты | GPT, Claude, Gemini |
| Локальные модели | Qwen3-VL, Qwen2.5-VL, Qwen3.5, UI-TARS, Fara, MAI-UI, EvoCUA, GELab, UI-Venus-2 |
| Десктоп | OSWorld, OSWorld-2, Lite.OSWorld, WindowsAgentArena, CUABench |
| Браузер | WebArena, VisualWebArena, MiniWoB, WebVoyager, Online-Mind2Web, WebGym |
| Мобильные устройства | AndroidWorld, AndroidLab, MobileWorld, MobileGym |
На главной странице покрытие сгруппировано как более 15 бенчмарков, а README при подсчёте перечисленных групп называет 16 интеграций. Поддержка через реестр не означает полностью готовый запуск: API-ключи, серверинг локальных моделей и настройка окружений всё ещё различаются.
Минимальный полезный тест CUA-Lite
Раздел оценки в официальном README лучше воспринимать как последовательный план проверки, а не как обещание запуска без настройки по принципу «одной команды».
- Установите зависимости командой
uv sync --all-extras; инициализируйте подмодуль Slime, только если требуется обучение. - Запустите быстрый пример
lite.demo@create_fileсgpt-5.5и сохраните траекторию. - Проведите небольшую оценку
lite.osworldс соответствующей конфигурацией модели и изучитеsummary.json. - Если паритет влияет на решение для продакшена, повторите тот же класс задач в исходном OSWorld.
- Измерьте потребление памяти, загрузку GPU, время сброса среды и совпадение результатов по отдельным задачам на собственных образах приложений.
В README для ScreenSpot-Pro показана модель Qwen/Qwen3-VL-8B-Instruct с --concurrency 256, но для Lite.OSWorld используется --concurrency 8. Для статического grounding и десктопных задач с состоянием нужны разные лимиты параллелизма.
Данные по обучению и ловушка конфигурации
В репозитории описан один пример SFT: Qwen3-VL-2B-Instruct обучали на десктопных траекториях Lite.ScaleCUA, а затем оценивали на сплите из 332 задач lite.osworld с использованием двух GPU. В этом заявленном запуске средний episode return вырос с 0.138 до 0.237.
| Заявленный запуск | До SFT | После SFT |
|---|---|---|
| Средний episode return | 0.138 | 0.237 |
Это документированный пример, а не независимо воспроизведённый общий результат. В README сказано, что компактная конфигурация Qwen уменьшает разрешение и использует history_n=1, чтобы уложиться в VRAM для обучения. Оценивайте чекпоинт в той же компактной конфигурации, на которой он обучался: переход на полноразмерный вариант по умолчанию может создать впечатление, что корректный fine-tune сломан, хотя изменился сам хост.
Для RL в CUA-Lite документирован GRPO на MobileGym: 416 задач в 28 приложениях. Команды используют сервер окружения и обучающий контейнер Slime. Источники не приводят универсальную стоимость обучения, время выполнения или прирост успешности.
CUA-Lite: вопросы и ответы
CUA-Lite — это open source?
Проект публикует код на GitHub, а датасеты — через Hugging Face. Перед коммерческим внедрением проверьте актуальные лицензии репозитория и каждого датасета: возможность бесплатного скачивания не заменяет юридическую проверку лицензии.
CUA-Lite — это модель?
Нет. CUA-Lite — это платформа и хост, связывающий поддерживаемые API- или локальные модели с окружениями, датасетами, бенчмарками, SFT- и RL-процессами.
Может ли CUA-Lite заменить VM OSWorld?
Только в пределах целевой нагрузки. Выбирайте Lite.OSWorld для переносимой оценки доверенных GUI-задач, когда ограничением становятся RAM или /dev/kvm. Для враждебного кода, низкоуровневых задач ОС или процессов, которым требуется нативное поведение Windows/macOS, сохраняйте границу VM.
| Нагрузка | Решение |
|---|---|
| Доверенные GUI-бенчмарки в CI/облаке без KVM | Запустить пилот |
| Масштабный SFT/RL, ограниченный RAM | Протестировать Lite.OSWorld и измерить насыщение GPU |
| Враждебное или произвольное выполнение кода | Сохранить границу VM |
| Тестирование ядра, перезагрузок, BIOS или сырых дисков | Сохранить полноценную VM/физическую инфраструктуру |
| Процессы, специфичные для Windows/macOS | Проверять в нативном окружении |
CUA-Lite лучше воспринимать как более дешёвый и переносимый хост для computer-use агентов. В опубликованном сравнении контейнеры действительно экономят память; открытым остаётся другой вопрос: нужны ли вашим задачам изоляция и низкоуровневая точность, которые обеспечивала VM.