AIREITER

Qwen-UI-Agent: официальные бенчмарки и доступность

Последнее обновление: 2026-08-20 19:29:17

В официальных сравнительных тестах Qwen-UI-Agent особенно уверенно выглядит на мобильных устройствах: 92.2% в реальном MobileWorld-Real и 97.5% в AndroidDaily. Но саму 27B-модель, показавшую эти результаты, пока нельзя ни скачать, ни вызвать через API. На сегодня доступны технический отчёт, демонстрации и только более ранние компактные модели семейства MAI-UI. В этом и состоит главное противоречие релиза: лидерские цифры есть, а практического доступа к модели нет. Ниже собраны все официальные результаты и подробно разобрано, что именно можно получить уже сейчас.

Все результаты Qwen-UI-Agent: мобильные устройства, ПК, веб и grounding

Qwen-UI-Agent — базовая GUI-агентная модель команды Tongyi-MAI из Alibaba, представленная в техническом отчёте 30 июля 2026 года (arXiv 2607.28227). Единая модель работает в мобильных сценариях, задачах управления компьютером, веб-средах и DeepSearch. Её общее пространство действий охватывает операции в GUI, выполнение CLI-команд и пакетные последовательности действий. На официальной странице результатов Qwen-UI-Agent занимает первое место во всех показанных мобильных и grounding-бенчмарках, второе — в OSWorld-Verified и третье — в долгосрочном тесте OSWorld-v2. В отчёте оцениваются варианты на 27B, 35B-A3B и 4B параметров; приведённые ниже результаты относятся к флагманской версии 27B.

Официальные результаты Qwen-UI-Agent в сравнении с Claude Opus 4.8 и Gemini 3.1 Pro

Мобильные сценарии: заявка на лидерство

Именно в мобильных задачах авторы заявляют state of the art — и отрыв здесь заметный. В GUI-only части MobileWorld Qwen-UI-Agent набирает 82.1%: это на 8.9 пункта выше ближайшей универсальной модели Seed 2.1 Pro с 73.2% и на 38.2 пункта выше сильнейшего специализированного GUI-агента GUI-Owl-1.5-32B-Instruct с 43.9%.

МодельMobileWorld (только GUI)MobileWorld-RealAndroidDaily
Qwen-UI-Agent (Alibaba)82.192.297.5
Seed 2.1 Pro (ByteDance)73.288.795.2
Claude Opus 4.8 (Anthropic)67.584.793.0
Gemini 3.1 Pro (Google)58.186.293.8
Qwen 3.7 Plus (Alibaba)62.372.779.8

В официальных таблицах для мобильных строк указан GPT-5.6 Sol с результатами 70.1 / 85.4 / 92.6, а для десктопных — GPT-5.5. Это важно учитывать, прежде чем ссылаться на отдельную цифру для «GPT».

MobileWorld-Real — центральный бенчмарк отчёта и собственная разработка авторов. Он включает 409 сквозных задач в 104 реальных Android-приложениях из семи повседневных категорий. Тесты запускаются на физических устройствах, с настоящими аккаунтами и помехами из реального мира, а оценку выставляет ансамбль из пяти VLM по принципу большинства голосов.

Управление компьютером: сильный результат, но не первое место

На десктопе формулировка отчёта о «конкурентоспособности» звучит уже более сдержанно. Qwen-UI-Agent получает 79.5% в OSWorld-Verified и занимает второе место, уступая Claude Opus 4.8 3.9 пункта. В долгосрочном OSWorld-v2 показатель 40.0% отражает частичный прогресс, а не долю полностью завершённых задач: при бинарной оценке результат составляет 13.9%. Claude Opus 4.8 с 54.8 и GPT-5.5 с 49.5 находятся заметно впереди.

МодельOSWorld-VerifiedOSWorld-v2 (частичный прогресс)OSWorld-v2 (бинарная оценка)
Claude Opus 4.883.454.8не указано
Qwen-UI-Agent79.540.013.9
Seed 2.1 Pro78.8не указаноне указано
GPT-5.578.749.513.0
MiniMax M3не указано22.3не указано

При этом аргумент об эффективности выглядит убедительно. Пакетные действия снижают среднее число шагов на задачу до 135.8 — против 326.7 у MiniMax M3 и 173.5 у Qwen 3.7 Plus. Одновременно Qwen-UI-Agent опережает каждую модель с открытыми весами более чем на 17 пунктов по частичному прогрессу. В OSWorld-v2 свыше 50% операций агента приходится на CLI-команды, так что гибридная схема GUI+CLI здесь даёт измеримый эффект.

Веб-задачи и DeepSearch

В WebArena лидирует Qwen-UI-Agent с 73.6%: впереди Claude Opus 4.8 с 71.9, GPT-5.5 с 69.5 и Gemini 3.1 Pro с 65.3. В исследовательских задачах BrowseComp модель получает 64.1 против 61.0 у базовой Qwen3.5-27B, а в BrowseComp-ZH — 75.0 против 62.1. Иными словами, обучение DeepSearch улучшает не только наведение на элементы интерфейса.

GUI grounding: первое место во всех тестах

В grounding-задачах — когда по визуальной инструкции нужно нажать точно в нужную точку интерфейса — Qwen-UI-Agent показывает полный набор первых мест. Согласно официальной странице результатов, модель лидирует во всех представленных grounding-бенчмарках.

БенчмаркQwen-UI-AgentЛучший конкурент
ScreenSpot-Pro (без масштабирования)76.672.9 (GUI-Owl-1.5)
ScreenSpot-Pro (с увеличением)81.580.7 (Seed 2.1 Pro)
SS-V297.596.6 (Seed 2.1 Pro / Qwen 3.7 Plus)
MM-GUI-L292.691.3 (MAI-UI)
OSW-G-R78.578.2 (Qwen 3.7 Plus)
UI-Vision70.068.0 (Qwen 3.7 Plus)

Цена универсальности оказалась небольшой

Специализированные GUI-модели нередко теряют способность нормально работать как языковые модели. Qwen-UI-Agent в основном избегает этой проблемы: в MMLU-Pro она набирает 86.5 против 86.0 у Qwen3.5-27B, а в IFEval — 90.2 против 90.4. На фоне узкоспециализированных конкурентов разрыв становится огромным.

БенчмаркQwen-UI-AgentQwen3.5-27BUI-Venus 30B-A3BGUI-Owl 32BOpenCUA-72B
Tau2-Bench89.989.222.76.114.4
Terminal-Bench 2.050.141.13.20.09.0
BFCL-v474.271.319.832.728.3
BrowseComp64.161.0не указаноне указаноне указано
QwenClawBench44.248.56.45.111.4

Единственное заметное поражение собственной базовой модели — QwenClawBench: 44.2 против 48.5. Также стоит учесть, что на официальной странице эти показатели общих способностей помечены как воспроизведённые авторами в собственной среде оценки.

Как обучали Qwen-UI-Agent

Согласно техническому отчёту, данные для Qwen-UI-Agent собирались на парке реальных устройств: более 100 физических смартфонов с покрытием свыше 150 приложений. Эта инфраструктура питает агентный цикл сбора данных, в котором система самостоятельно формирует и диагностирует задачи. После supervised fine-tuning модель проходит многоэтапное RL-обучение на траекториях длиннее 100 ходов, развёрнутых более чем в 10 000 параллельных сред.

Насколько можно доверять этим таблицам

На официальной странице есть три важных оговорки, и их стоит упоминать вместе с любыми цитируемыми результатами. Во-первых, MobileWorld-Real создан самими авторами. Во-вторых, результаты базовых моделей, отмеченные кинжалом, были воспроизведены авторами в собственной среде: тестовый harness, судья, симулятор и подмножества задач могут отличаться от официальных оценок других поставщиков. В-третьих, 40.0% в OSWorld-v2 — это частичный прогресс, а не процент успешного завершения задач. Источник: примечания на официальной странице результатов и технический отчёт.

«Новый GUI-агент Alibaba побеждает на телефонах и буксует на десктопе». — @Daily_AI_Brief на X, где также отметили, что «Alibaba оценивала все базовые модели в собственной среде».

Независимые разборы в X пришли к похожему выводу. Японский обзор от @itarutomy отметил лидерство на мобильных устройствах с реальными девайсами, но подчеркнул второе место в десктопных тестах. Первичным источником о самом релизе остаётся официальный анонс Pengxiang Li из Tongyi Lab (@oliverlee1999). Вывод такой: MobileWorld-Real — сильная, но пока ожидающая независимого воспроизведения заявка; OSWorld-Verified — более переносимое сравнение, поскольку этот бенчмарк создан не авторами модели.

Как получить доступ к Qwen-UI-Agent сейчас

На данный момент Qwen-UI-Agent существует как исследовательский релиз: опубликованы статья, страница проекта и репозитории с кодом, но подтверждённого публичного чекпойнта самой модели нет. Ниже — что содержит каждый из доступных артефактов.

Официальная страница проекта Qwen-UI-Agent со сравнением результатов бенчмарков

Что опубликовано на самом деле

АртефактСсылкаСодержимое
Технический отчётarxiv.org/abs/2607.28227Полная статья, отправлена 30 июля 2026 года; доступны PDF, HTML и исходники TeX
Страница проектаtongyi-mai.github.io/Qwen-UI-AgentДемонстрации возможностей, полные графики бенчмарков, информация для цитирования
Репозиторий MAI-UIgithub.com/Tongyi-MAI/MAI-UIРепозиторий Apache-2.0, переименованный для Qwen-UI-Agent; содержит ссылки на чекпойнты MAI-UI-8B и MAI-UI-2B в Hugging Face, выпущенные в декабре 2025 года
Репозиторий Qwen-UI-Agentgithub.com/Tongyi-MAI/Qwen-UI-AgentТолько исходники сайта — в репозитории прямо указано, что моделей, кода обучения и реализации агента там нет

Официальным продолжением проекта служит репозиторий MAI-UI: 30 июля 2026 года в нём анонсировали Qwen-UI-Agent, и сейчас именно оттуда ведут ссылки на единственные доступные для скачивания чекпойнты этой линейки.

Что известно о весах моделей

Скачать можно только MAI-UI-8B и MAI-UI-2B — предшественников, выпущенных в декабре 2025 года. Ссылки на них размещены в разделе Hugging Face репозитория MAI-UI. Публичный выпуск чекпойнтов Qwen-UI-Agent на 27B, 35B-A3B или 4B параметров не подтверждён. Статус доступности проверялся по официальным репозиториям и странице проекта в конце августа 2026 года, и релиза там не обнаружилось. Не следует принимать ссылки на чекпойнты MAI-UI или репозиторий с исходниками сайта за веса Qwen-UI-Agent.

API и локального запуска пока нет

Ни в одном официальном канале не обнаружены публичный API Qwen-UI-Agent, размещённый сервис или пакет для vLLM/Ollama. Практический выбор сейчас такой: для десктопных сценариев, которые нужно внедрять в продукт, опубликованные результаты склоняют в пользу Claude Opus 4.8; для экспериментов с GUI-моделями с открытыми весами доступен путь через MAI-UI 2B/8B и собственный harness. Но это именно MAI-UI, а не Qwen-UI-Agent. За анонсами релиза стоит следить в официальных репозиториях Tongyi-MAI и каналах Qwen. Для универсальной линейки Qwen, у которой API уже доступен, каталог моделей Qwen от AIReiter отслеживает актуальные эндпоинты и цены.

Место Qwen-UI-Agent в эволюции GUI-агентов Alibaba

Qwen-UI-Agent — третье поколение GUI-агентов Alibaba. UI-TARS заложил подход Qwen к работе с графическими интерфейсами в 2025 году. MAI-UI (arXiv 2512.22047, декабрь 2025 года) представил ориентированный на реальные сценарии цикл сбора данных и открыл веса 2B/8B. Qwen-UI-Agent масштабирует этот рецепт до 27B и добавляет гибридное выполнение через GUI+CLI. В обеих метриках OSWorld из таблиц выше лидирует Claude Opus 4.8.

Qwen-UI-Agent: ответы на частые вопросы

Qwen-UI-Agent — это open source?

Репозитории кода распространяются по лицензии Apache-2.0, а отчёт находится в открытом доступе, но открытые веса самой модели не подтверждены. Скачать можно только чекпойнты предшественника MAI-UI-8B и MAI-UI-2B, опубликованные в Hugging Face в декабре 2025 года. На момент написания текста не было подтверждённого публичного релиза Qwen-UI-Agent на 27B, 35B-A3B или 4B параметров.

Можно ли сегодня запустить Qwen-UI-Agent локально?

Нет. Проверенной локальной конфигурации не существует: нет чекпойнта, пакета GGUF или Ollama, а также рецепта для vLLM. Локальные эксперименты ограничены MAI-UI 2B/8B с собственным harness.

Есть ли у Qwen-UI-Agent API?

Нет, публичный эндпоинт или размещённый продукт не анонсированы. Следите за объявлениями в официальных GitHub-репозиториях Tongyi-MAI и каналах команды Qwen.

Как Qwen-UI-Agent сравнивается с Claude Opus 4.8 в управлении компьютером?

Claude Opus 4.8 лидирует в OSWorld-Verified со счётом 83.4 против 79.5 и в OSWorld-v2 по частичному прогрессу — 54.8 против 40.0. В то же время Qwen-UI-Agent впереди в WebArena, 73.6 против 71.9, и во всех показанных мобильных бенчмарках. Для длительных десктопных задач сейчас предпочтительнее Claude, а самые сильные заявленные результаты Qwen-UI-Agent относятся к mobile-first сценариям.

Что такое MobileWorld-Real?

Это Android-бенчмарк на реальных устройствах, созданный авторами Qwen-UI-Agent: 409 задач в 104 работающих приложениях из семи повседневных категорий. Оценку проводит ансамбль из пяти VLM по большинству голосов. Результаты заявлены самими авторами и ожидают независимого воспроизведения.

Что может изменить эту оценку

Существенно пересмотреть картину заставят три сигнала:

СигналПочему это важно
Чекпойнт Qwen-UI-Agent в Hugging Face-аккаунте Tongyi-MAIПревратит исследовательский релиз в вариант, на котором можно строить решения, и запустит поток сторонних результатов
Воспроизведение OSWorld-Verified вне инфраструктуры AlibabaПокажет, сохраняется ли результат 79.5% за пределами среды авторов
Любая продуктовая форма: API, интеграция в приложение Qwen или превьюПереведёт сравнение из плоскости таблиц в статье к реальным компромиссам продакшена

До тех пор остаётся нерешённый вопрос: лидерские результаты в мобильных сценариях из опубликованных сравнений заявлены самой командой и получены на бенчмарке, который она же разработала.

Читайте также: о новом универсальном флагмане Alibaba и статусе его открытых весов рассказывается в материале Qwen3.8-Max open weights, а стоимость эндпоинтов собрана в Qwen3.8-Max API pricing guide.