AIREITER

CUA-Lite İncelemesi: Computer-Use Agent’lar için Daha İyi Bir Altyapı mı?

Son Güncelleme: 2026-09-08 19:01:00

Bir computer-use agent’ın çalışması için yalnızca model yetmez. Modelin kullanabileceği bir masaüstü, tarayıcı ya da telefon ortamı ve sonuçları güvenilir biçimde puanlayacak bir değerlendirici gerekir. Berkeley RDI’nin 2026 tarihli açık platformu CUA-Lite, tam da bu eksik katmana odaklanıyor. En güçlü yanı, /dev/kvm gerektirmeden tekrarlanabilir GUI ortamları çalıştırabilmesi. Buna karşılık Docker’ın, sanal makineyle aynı düzeyde bir güvenlik sınırı olmadığını unutmamak gerekiyor.

CUA-Lite kararı: Yeni bir agent değil, işlevsel bir altyapı

CUA-Lite; desktop, browser ve mobile ortamlarında agent’ları, sandbox’ları, veri setlerini, değerlendirmeyi, supervised fine-tuning (SFT) ve reinforcement learning (RL) süreçlerini bir araya getiren bir framework. Bir foundation model ya da son kullanıcıya yönelik otomasyon uygulaması değil. Resmî proje sitesi ile GitHub deposu, 30.000+ doğrulanabilir görev, 10+ veri seti, 10+ yerleşik agent ve 15+ benchmark desteği belirtiyor.

Ancak bu rakamlar, her entegrasyonun aynı performansı sunduğu anlamına gelmiyor; yayımlanan kapsamı tarif ediyor. Ortam kurulumları veya /dev/kvm erişimi darboğaz yaratıyorsa CUA-Lite pilot çalışma için mantıklı. Yine de VM izolasyonunun her senaryo için doğrudan alternatifi değil.

Platformu tekrar kullanılabilir kılan mimari

CUA-Lite, etkileşim katmanı, veri akışı ve değerlendirme ile eğitim arasında taşınan sonuç nesnesi için tekrar tekrar yazılan bağlantı kodlarını azaltmayı hedefliyor.

lite.gym, etkileşimleri ortak bir arayüzde topluyor

lite.gym arayüzü ekran görüntülerini ve erişilebilirlik bilgilerini sunuyor; tıklama, sürükleme, klavye girdisi ve Bash çağrılarını kabul ediyor. Kimlikler, lite.demo@create_file ya da lite.osworld@osworld_chrome_030eeff7 gibi birleştirilebilir bir düzen izliyor.

Böylece tek bir agent factory, farklı ortam ailelerini hedefleyebiliyor. Bununla birlikte ortam bazlı kurulum ihtiyacı ortadan kalkmıyor: WebArena, AndroidWorld ve desktop ortamları için hâlâ ayrı kurulum dokümantasyonları bulunuyor.

LiteSample, eğitim verisini tek formatta tutuyor

LiteSample, tekil eylemleri veya trajectory’leri görsellerle birlikte Parquet verisi olarak saklıyor. Depoda dönüştürülmüş corpus’lar arasında Aguvis, CAGUI, GUI-360, GUIAct, GUIOdyssey, Multimodal-Mind2Web, OpenCUA, ScaleCUA ve UI-Genie-Agent yer alıyor.

Model başına hazırlanan adapter’lar, ortak kayıtları her modelin beklediği prompt ve geçmiş formatına dönüştürüyor. Böylece depolama katmanı birleşik kalırken, scaffolding model özelinde şekillenebiliyor.

Tek sonuç nesnesi, iki farklı iş akışında kullanılabiliyor

Örneklenen bir trajectory, episode_return, sonlanma bayrakları, tur başına adımlar ve temel LiteSample verisini içeren bir LiteRLSample döndürüyor. Depo, episode_return değerini görev ödülü olarak tanımlıyor; 1.0 başarı anlamına geliyor. Böylece aynı puanlanmış rollout, ikinci bir görev şemasına gerek kalmadan hem değerlendirme kaydı hem de eğitim girdisi olabiliyor.

Bu yaklaşım rejection-sampled distillation ve RL açısından önemli: ekipler başarılı trajectory’leri saklayabilir, bunlarla fine-tuning yapabilir ve daha sonra GRPO için ortam ödüllerini kullanabilir. Ancak bu, politikanın seçilmiş görevlerin ötesinde genelleşebildiğini kanıtlamaz.

Lite.OSWorld hızdan çok taşınabilirliği değiştiriyor

CUA-Lite’ın en somut iddiası Lite.OSWorld. Bu yapı, OSWorld görevlerini ve değerlendiricilerini QEMU/KVM sanal makinesi yerine GNOME tabanlı bir Docker container’ında çalıştırıyor.

ÖlçümOSWorld VMLite.OSWorld container
Çalışma zamanıQEMU/KVMDocker
Host gereksinimi/dev/kvm ve nested virtualizationDocker host
Örnek başına bellek4.1 GB0.9 GB
Cold start29.9 s23.8 s
Bildirilen paralel yoğunlukReferansYaklaşık 4.6×

4.6× değeri temelde bellek oranından geliyor: 4.1’in 0.9’a bölümü yaklaşık 4.56. Bu, modelin ya da görevin 4.6× daha hızlı çalıştığı anlamına gelmiyor; cold start süresi 6.1 saniye, yani yaklaşık %20.4 azalıyor. Pratikteki kazanç, /dev/kvm erişimini açmadan Docker destekli cloud ve CI altyapılarında çalışabilmek.

SnackOnAI’nin teknik analizi de yoğunluk değerini bellek hesabı olarak ele alıyor ve canlı desktop iş yüklerinin GPU sınırlı kalabileceğine dikkat çekiyor. MarkTechPost, 13 modelde Lite.OSWorld ve OSWorld VM skorlarının eşleştiğini bildiriyor. Yayımlanan özetlerde görev bazlı uyum matrisi, güven aralıkları veya model düzeyinde skor tablosu bulunmuyor. Bu nedenle eşdeğerlik iddiasını kendi iş yükünüzde doğrulamak daha doğru olur.

Docker tavizinin kabul edilemez hâle geldiği yer

Docker container’ları host kernel’ını paylaşırken VM’ler hypervisor sınırı ekler. Docker’ın güvenlik dokümantasyonu, container izolasyonunun kernel kontrollerine ve yapılandırmaya bağlı olduğunu açıklıyor. Güvenilen benchmark görevlerinde bu pratik bir tercih olabilir; ancak modelin ürettiği rastgele shell komutları için daha sıkı bir tasarım gerekir. Güvenilmeyen kodlarda dış katmanda ephemeral bir VM kullanın veya QEMU/KVM yaklaşımını koruyun.

CUA-Lite’ın dokümante edilen desktop örnekleri GNOME/Linux kullanıyor. Yeniden başlatma, BIOS davranışı, raw-disk işlemleri, özel kernel modülleri ve sonucunun düşük seviyeli OS davranışına bağlı olduğu testler için tam VM altyapısı daha güvenli seçenek olmaya devam ediyor. Headless X11 ve uygulama image’ları da piksel hassasiyetli görevlerde native ekran pipeline’ıyla aynı kabul edilmemeli; mutlaka doğrulanmalı.

Bugün hangi bileşenleri çalıştırabilirsiniz?

Depoda listelenen agent aileleri ve ortam grupları şöyle:

AlanCUA-Lite’ın listelediği örnekler
API agent’larıGPT, Claude, Gemini
Yerel modellerQwen3-VL, Qwen2.5-VL, Qwen3.5, UI-TARS, Fara, MAI-UI, EvoCUA, GELab, UI-Venus-2
DesktopOSWorld, OSWorld-2, Lite.OSWorld, WindowsAgentArena, CUABench
BrowserWebArena, VisualWebArena, MiniWoB, WebVoyager, Online-Mind2Web, WebGym
MobileAndroidWorld, AndroidLab, MobileWorld, MobileGym

Ana sayfa kapsamı 15+ benchmark olarak topluyor; README’deki gruplar sayıldığında 16 entegrasyon adı geçiyor. Registry desteği her zaman tak-çalıştır anlamına gelmiyor: API anahtarları, yerel model sunumu ve ortam kurulumu değişkenlik gösteriyor.

İşe yarar bir CUA-Lite denemesi için minimum plan

“Tek komut” ifadesini sıfır kurulum olarak yorumlamak yerine, resmî README’nin değerlendirme bölümünü aşamalı bir test planı olarak kullanın.

  1. Bağımlılıkları uv sync --all-extras ile kurun; Slime submodule’unu yalnızca eğitim gerekiyorsa başlatın.
  2. gpt-5.5 ile lite.demo@create_file hızlı başlangıç örneğini çalıştırın ve trajectory’yi kaydedin.
  3. Eşleşen model yapılandırmasıyla küçük bir lite.osworld değerlendirmesi çalıştırın, ardından summary.json dosyasını inceleyin.
  4. Üretim kararını eşdeğerlik etkiliyorsa aynı görev sınıfını orijinal OSWorld üzerinde tekrarlayın.
  5. Kendi uygulama image’larınızda bellek kullanımını, GPU kullanımını, reset süresini ve görev bazlı uyumu ölçün.

README, ScreenSpot-Pro için Qwen/Qwen3-VL-8B-Instruct ile --concurrency 256 kullanırken Lite.OSWorld için --concurrency 8 gösteriyor. Statik grounding ile durum bilgisi taşıyan desktop görevleri için ayrı concurrency bütçeleri belirleyin.

Eğitim verisi ve yapılandırma tuzağı

Depoda bir SFT örneği dokümante ediliyor: Qwen3-VL-2B-Instruct, Lite.ScaleCUA desktop trajectory’leri üzerinde eğitiliyor ve iki GPU kullanılarak 332 görevlik bir lite.osworld split’i üzerinde değerlendiriliyor. Bildirilen çalıştırmada ortalama episode return, 0.138 değerinden 0.237 seviyesine çıkıyor.

Bildirilen çalıştırmaSFT öncesiSFT sonrası
Ortalama episode return0.1380.237

Bu, bağımsız olarak yeniden üretilmiş ve genellenebilirliği gösterilmiş bir sonuç değil; dokümante edilmiş bir örnek. README, kompakt Qwen yapılandırmasının eğitim VRAM’ine sığmak için çözünürlüğü düşürdüğünü ve history_n=1 kullandığını belirtiyor. Checkpoint’i, eğitimde kullanılan aynı kompakt yapılandırmayla değerlendirin. Tam çözünürlüklü varsayılan ayara geçmek, aslında geçerli olan bir fine-tune’un bozuk görünmesine yol açabilir; çünkü değişen model değil, harness olur.

RL tarafında CUA-Lite, 28 uygulamada toplam 416 görev içeren MobileGym üzerinde GRPO dokümantasyonu sunuyor. Komutlar bir environment server ve Slime eğitim container’ı kullanıyor. Kaynaklarda evrensel bir eğitim maliyeti, wall-clock süresi veya başarı oranı artışı paylaşılmıyor.

CUA-Lite hakkında sık sorulanlar

CUA-Lite açık kaynak mı?

Proje kodlarını GitHub’da, veri setlerini ise Hugging Face üzerinden yayımlıyor. Ticari kullanıma geçmeden önce deponun ve her veri setinin güncel lisansını inceleyin; “ücretsiz indirilebilir” olması lisans incelemesinin yerini tutmaz.

CUA-Lite bir model mi?

Hayır. CUA-Lite; desteklenen API veya yerel modelleri ortamlar, veri setleri, benchmark’lar, SFT ve RL iş akışlarıyla bağlayan bir platform ve harness.

CUA-Lite, OSWorld VM’lerinin yerini alabilir mi?

Yalnızca hedeflediği iş yükü sınırları içinde. RAM veya /dev/kvm erişiminin kısıt olduğu, taşınabilir ve güvenilen GUI değerlendirmelerinde Lite.OSWorld kullanın. Düşmanca kodlar, düşük seviyeli OS görevleri ya da native Windows/macOS davranışı gerektiren iş akışlarında VM sınırını koruyun.

İş yüküKarar
KVM olmayan CI/cloud altyapısında güvenilen GUI benchmark’larıPilot uygulama başlatın
RAM’in sınırlayıcı olduğu büyük ölçekli SFT/RLLite.OSWorld’ü test edin ve GPU doygunluğunu ölçün
Düşmanca veya rastgele kod çalıştırmaVM sınırını koruyun
Kernel, reboot, BIOS veya raw-disk testleriTam VM/fiziksel altyapıyı koruyun
Windows/macOS’a özgü iş akışlarıNative ortamda doğrulayın

CUA-Lite’ı, computer-use agent’lar için daha düşük maliyetli ve daha taşınabilir bir harness olarak görmek en doğrusu. Yayımlanan karşılaştırmada container’ların bellek tasarrufu sağladığı tartışmalı değil. Asıl açık soru, görevlerinizin VM’in sunduğu izolasyona ve düşük seviyeli davranış doğruluğuna ihtiyaç duyup duymadığı.