AIREITER

CUA-Lite 리뷰: 컴퓨터 사용 에이전트 하니스의 더 나은 선택지일까?

마지막 업데이트: 2026-09-08 19:03:14

컴퓨터 사용 에이전트에 모델만 있으면 되는 것은 아니다. 조작할 데스크톱·브라우저·휴대폰 환경과 결과를 안정적으로 판정할 그레이더도 필요하다. 2026년 Berkeley RDI가 공개한 CUA-Lite는 바로 이 빈칸을 겨냥한 오픈 플랫폼이다. /dev/kvm 없이도 재현 가능한 GUI 환경을 돌릴 수 있다는 점이 가장 큰 강점이다. 다만 Docker가 가상 머신과 같은 수준의 보안 경계는 아니라는 점은 분명한 한계다.

CUA-Lite 총평: 새 에이전트가 아니라 쓸 만한 인프라

CUA-Lite는 파운데이션 모델이나 소비자용 자동화 앱이 아니다. 데스크톱, 브라우저, 모바일 환경에서 에이전트·샌드박스·데이터셋·평가·지도 미세 조정(SFT)·강화학습(RL)을 연결하는 프레임워크다. 공식 프로젝트 사이트와 GitHub 저장소는 검증 가능한 작업 30,000개 이상, 데이터셋 10개 이상, 내장 에이전트 10개 이상, 벤치마크 15개 이상을 내세운다.

다만 이 수치는 공개된 지원 범위를 뜻할 뿐, 모든 통합 구성에서 동일한 성능을 보장한다는 의미는 아니다. 환경 구성이나 /dev/kvm 확보가 병목이라면 CUA-Lite를 시범 도입할 만하다. 그렇다고 VM 격리를 전면적으로 대체할 도구는 아니다.

재사용성을 만드는 CUA-Lite의 구조

CUA-Lite는 상호작용, 데이터, 그리고 평가와 학습 사이를 오가는 결과 객체에서 반복되던 접착 코드를 줄이는 데 초점을 맞춘다.

lite.gym으로 상호작용 인터페이스 통일

lite.gym 인터페이스는 스크린샷과 접근성 정보를 제공하고, 클릭·드래그·키 입력·Bash 실행을 받는다. ID는 lite.demo@create_file, lite.osworld@osworld_chrome_030eeff7처럼 조합 가능한 패턴을 따른다.

덕분에 하나의 에이전트 팩토리로 서로 다른 환경군을 겨냥할 수 있다. 그렇다고 환경별 설치 과정이 사라지는 것은 아니다. WebArena, AndroidWorld, 데스크톱 환경은 여전히 각각 별도의 설정 문서를 따라야 한다.

LiteSample로 학습 데이터 형식 통일

LiteSample은 단일 액션 또는 궤적을 이미지와 함께 Parquet 데이터로 저장한다. 저장소에는 Aguvis, CAGUI, GUI-360, GUIAct, GUIOdyssey, Multimodal-Mind2Web, OpenCUA, ScaleCUA, UI-Genie-Agent 등 변환된 코퍼스가 나열돼 있다.

모델별 어댑터는 공통 레코드를 각 모델이 요구하는 프롬프트와 히스토리 형식으로 변환한다. 저장 형식은 통일하면서도, 실제 실행을 위한 스캐폴딩은 모델별 특성에 맞춰 유지하는 방식이다.

평가 결과를 학습 데이터로도 활용

샘플링한 궤적은 episode_return, 종료 플래그, 턴별 스텝, 원본 LiteSample을 담은 LiteRLSample을 반환한다. 저장소는 episode_return을 작업 보상으로 정의하며, 1.0은 성공을 뜻한다. 따라서 점수가 매겨진 하나의 롤아웃을 별도 작업 스키마 없이 평가 기록과 학습 입력 양쪽에 쓸 수 있다.

이는 거부 샘플링 기반 증류와 RL에서 특히 유용하다. 팀은 성공한 궤적을 보관해 미세 조정에 쓰고, 이후 GRPO를 위해 환경 보상을 활용할 수 있다. 물론 이것만으로 해당 정책이 선택된 작업 밖에서도 일반화된다는 사실이 증명되지는 않는다.

Lite.OSWorld의 핵심은 속도보다 이식성

CUA-Lite가 내세우는 가장 구체적인 기능은 Lite.OSWorld다. QEMU/KVM 가상 머신 대신 GNOME Docker 컨테이너에서 OSWorld 작업과 평가기를 실행한다.

항목OSWorld VMLite.OSWorld 컨테이너
런타임QEMU/KVMDocker
호스트 요구사항/dev/kvm 및 중첩 가상화Docker 호스트
인스턴스당 메모리4.1 GB0.9 GB
콜드 스타트29.9 s23.8 s
공개된 병렬 실행 밀도기준선약 4.6×

4.6×라는 수치는 사실상 메모리 비율이다. 4.1을 0.9로 나누면 약 4.56이 나온다. 모델이나 작업이 4.6배 빨라진다는 뜻은 아니다. 콜드 스타트는 6.1초, 약 20.4% 개선됐다. 실질적인 이점은 /dev/kvm을 노출하지 않고 Docker를 쓸 수 있는 클라우드 및 CI 인프라에서 실행할 수 있다는 데 있다.

SnackOnAI의 기술 분석도 이 집적도 수치를 메모리 계산으로 해석하며, 실제 데스크톱 워크로드는 여전히 GPU 병목에 걸릴 수 있다고 지적한다. MarkTechPost는 13개 모델에서 Lite.OSWorld와 OSWorld VM의 점수가 일치했다고 전한다. 하지만 공개된 요약에는 작업별 일치 행렬, 신뢰 구간, 모델별 점수표가 없다. 동등성은 자체 워크로드에서 검증해야 할 주장으로 보는 편이 맞다.

Docker를 선택하면 안 되는 보안 경계

Docker 컨테이너는 호스트 커널을 공유하는 반면, VM은 하이퍼바이저 경계를 추가한다. Docker의 보안 문서가 설명하듯 컨테이너 격리는 커널 제어 기능과 설정에 의존한다. 신뢰할 수 있는 벤치마크 작업에는 실용적인 선택일 수 있지만, 모델이 생성한 임의의 셸 명령을 실행해야 한다면 더 엄격한 설계가 필요하다. 신뢰할 수 없는 코드는 외부의 일회성 VM에서 실행하거나 QEMU/KVM을 유지하는 편이 낫다.

CUA-Lite의 문서화된 데스크톱 예시는 GNOME/Linux 기반이다. 재부팅, BIOS 동작, 로 디스크 작업, 커스텀 커널 모듈, 저수준 OS 동작에 결과가 좌우되는 테스트라면 완전한 VM 인프라가 여전히 더 안전한 선택이다. 헤드리스 X11과 애플리케이션 이미지도 픽셀 민감형 작업에서는 네이티브 디스플레이 파이프라인과 같다고 가정하지 말고 검증해야 한다.

현재 실행 가능한 구성

저장소는 다음 에이전트 계열과 환경 그룹을 나열한다.

영역CUA-Lite가 열거한 예시
API 에이전트GPT, Claude, Gemini
로컬 모델Qwen3-VL, Qwen2.5-VL, Qwen3.5, UI-TARS, Fara, MAI-UI, EvoCUA, GELab, UI-Venus-2
데스크톱OSWorld, OSWorld-2, Lite.OSWorld, WindowsAgentArena, CUABench
브라우저WebArena, VisualWebArena, MiniWoB, WebVoyager, Online-Mind2Web, WebGym
모바일AndroidWorld, AndroidLab, MobileWorld, MobileGym

홈페이지는 지원 범위를 벤치마크 15개 이상으로 묶어 소개한다. 반면 README에서 나열한 그룹을 세면 통합 구성은 16개다. 레지스트리에 등록돼 있다고 해서 바로 쓸 수 있는 것은 아니다. API 키, 로컬 모델 서빙, 환경 설정은 여전히 구성별로 다르다.

CUA-Lite를 제대로 시험하는 최소 절차

“명령 하나”라는 표현을 무설정 환경으로 받아들이기보다, 공식 README의 평가 섹션을 단계별 테스트 가이드로 활용하는 편이 좋다.

  1. uv sync --all-extras로 의존성을 설치한다. 학습이 필요할 때만 Slime 서브모듈을 초기화한다.
  2. gpt-5.5로 lite.demo@create_file 퀵스타트를 실행하고 궤적을 저장한다.
  3. 동일한 모델 설정으로 작은 규모의 lite.osworld 평가를 실행한 뒤 summary.json을 확인한다.
  4. 운영 도입 판단에 동등성이 중요하다면, 원본 OSWorld에서도 같은 작업군을 반복 실행한다.
  5. 자체 애플리케이션 이미지에서 메모리, GPU 사용률, 리셋 시간, 작업별 일치도를 측정한다.

README는 ScreenSpot-Pro에서 Qwen/Qwen3-VL-8B-Instruct를 --concurrency 256으로 실행하는 예를 보이지만, Lite.OSWorld에는 --concurrency 8을 사용한다. 정적 그라운딩 작업과 상태를 유지하는 데스크톱 작업에는 서로 다른 동시성 예산을 잡아야 한다.

학습 사례와 설정 함정

저장소에는 SFT 사례 하나가 문서화돼 있다. Lite.ScaleCUA 데스크톱 궤적으로 학습한 Qwen3-VL-2B-Instruct를 GPU 두 장으로 332개 작업의 lite.osworld 분할에서 평가했으며, 해당 실행에서 평균 에피소드 리턴은 0.138에서 0.237로 올랐다.

공개된 실행 결과SFT 이전SFT 이후
평균 에피소드 리턴0.1380.237

이는 문서화된 사례이지, 독립적으로 재현된 일반적 결과는 아니다. README에 따르면 소형 Qwen 설정은 학습 VRAM에 맞추기 위해 해상도를 낮추고 history_n=1을 사용한다. 학습된 체크포인트는 학습 당시와 같은 소형 설정으로 평가해야 한다. 전체 해상도 기본값으로 바꾸면 하니스 자체가 달라져, 정상적인 미세 조정 모델도 고장 난 것처럼 보일 수 있다.

RL 쪽에서는 CUA-Lite가 28개 애플리케이션에 걸친 416개 작업으로 MobileGym에서 GRPO를 수행하는 방식을 문서화한다. 명령은 환경 서버와 Slime 학습 컨테이너를 사용한다. 출처는 범용적인 학습 비용, 소요 시간, 성공률 향상 수치를 제공하지 않는다.

CUA-Lite FAQ

CUA-Lite는 오픈소스인가?

프로젝트는 GitHub에 코드를, Hugging Face를 통해 데이터셋을 공개한다. 상업적으로 도입하기 전에는 저장소와 각 데이터셋의 최신 라이선스를 확인해야 한다. 다운로드가 무료라는 사실이 라이선스 검토를 대신하지는 않는다.

CUA-Lite는 모델인가?

아니다. CUA-Lite는 지원되는 API 또는 로컬 모델을 환경, 데이터셋, 벤치마크, SFT, RL 워크플로에 연결하는 플랫폼이자 하니스다.

CUA-Lite가 OSWorld VM을 대체할 수 있나?

대상 워크로드 범위 안에서만 가능하다. RAM이나 /dev/kvm이 제약인 환경에서 신뢰할 수 있는 GUI 평가를 이식성 있게 실행하려면 Lite.OSWorld를 사용하면 된다. 적대적인 코드, 저수준 OS 작업, 네이티브 Windows/macOS 동작이 필요한 워크플로라면 VM 경계를 유지해야 한다.

워크로드권장 판단
KVM 없는 CI/클라우드에서 신뢰 가능한 GUI 벤치마크 실행파일럿 도입
RAM이 제약인 대규모 SFT/RLLite.OSWorld를 시험하고 GPU 포화도를 측정
적대적이거나 임의적인 코드 실행VM 경계 유지
커널, 재부팅, BIOS, 로 디스크 테스트완전한 VM/물리 인프라 유지
Windows/macOS 전용 워크플로네이티브 환경에서 검증

CUA-Lite는 비용을 낮추고 이식성을 높인 컴퓨터 사용 에이전트 하니스로 이해하는 것이 가장 적절하다. 공개 비교에서 컨테이너가 메모리를 절감한다는 사실은 쟁점이 아니다. 진짜 판단 기준은 여러분의 작업이 VM이 제공하던 격리와 저수준 충실도를 필요로 하는지다.