Переводчик, который отвечает примерно за 2,3 секунды, вполне можно представить в переговорной. Qwen3.8-LiveTranslate уже доступен, но только как облачный API Alibaba Cloud/Model Studio. При этом 2,3 секунды — официальное заявление разработчика, а не независимый замер в реальном продакшене. Для бюджета и архитектуры это принципиальная разница.
Коротко: стоит ли подключать
Qwen3.8-LiveTranslate подойдёт для аккуратного прототипа, если вам нужны потоковый перевод речи, субтитры и синтезированный аудиовыход через realtime-соединение. Но не воспринимайте заявленную задержку как гарантию для шумных совещаний, перебивающих друг друга собеседников или любой языковой пары: независимых практических тестов именно этой версии пока мало.
Модель разумно использовать в серверном сервисе, где API-ключ можно надёжно спрятать, а региональную инфраструктуру Alibaba Cloud — принять как данность. Это не лучший выбор, если вам нужны скачиваемые веса, зрелая инфраструктура сторонних хостингов или подтверждённые бенчмарки качества ещё до формулировки продакшен-требований.
Что именно доступно сейчас
Точный идентификатор облачной модели — qwen3.8-livetranslate-flash-realtime. В официальной документации Alibaba Cloud и журнале изменений Model Studio она указана как realtime-сервис, выпущенный 17 сентября 2026 года. На официальной странице модели заявлена поддержка 60 языков распознавания и 29 языков голосового вывода.
| Вопрос | Текущий ответ |
|---|---|
| Релиз состоялся? | Да, как облачная API-модель |
| Идентификатор модели | qwen3.8-livetranslate-flash-realtime |
| Основной транспорт | Realtime API, включая WebSocket |
| Входные данные | Аудио и контекст изображений |
| Результат | Текст и аудио — в зависимости от настроек сессии |
| Официальная заявленная задержка | Около 2,3 секунды от начала до конца |
| Открытые веса | Официальных подтверждений не найдено |
Иными словами, перед нами уже не просто презентационный анонс, но и не модель, которую можно скачать и запустить локально. Официальная документация описывает доступ к инференсу через Model Studio, а не через локальные чекпойнты.
Сколько это стоит до первой строки кода
Для международного развёртывания в Сингапуре официальный тариф разделён на четыре категории. Все цены указаны за один миллион токенов:
| Категория списания | Официальная цена |
|---|---|
| Входное аудио | $7.50 / 1M токенов |
| Входное изображение | $0.55 / 1M токенов |
| Выходной текст | $20 / 1M токенов |
| Выходное аудио | $30 / 1M токенов |
В руководстве Qwen по realtime-переводу указано, что входное аудио тарифицируется как 7 токенов в секунду, а выходное — как 12,5 токена в секунду. Для непрерывного потока можно примерно оценить входные и выходные расходы:
- 60 секунд входного аудио: 420 токенов, то есть около $0.00315 по указанному тарифу на входное аудио.
- 60 секунд сгенерированного аудио: 750 токенов, то есть около $0.0225 по указанному тарифу на выходное аудио.
Это не полный расчёт «стоимости минуты». В нём не учтены выходной текст, изображения, особенности подключения и возможная разница в длительности исходного и переведённого аудио. Если запрашивать только текст, будет использоваться другая категория списания. Проверьте страницу с тарифами моделей для конкретного региона и варианта развёртывания.
Как устроено подключение по WebSocket
Документированный сценарий — это серверная realtime-сессия, а не обычный одноразовый запрос на перевод. В официальном обзоре Realtime API WebSocket назван удобным вариантом для серверных приложений и прототипов.
Минимальная интеграция выглядит так:
- Сформировать региональный URL realtime-WebSocket, указав в качестве модели
qwen3.8-livetranslate-flash-realtime. - Передать при рукопожатии
Authorization: Bearer <API_KEY>; ключ должен оставаться на вашем сервере. - Отправить
session.updateс исходным и целевым языком, а также нужными форматами вывода. - Передавать аудио в base64 через
input_audio_buffer.append. - Явно зафиксировать буфер или дождаться, пока обработку запустит настроенное определение голосовой активности.
- Получать события с переводом текста и аудио, пока текущая реплика не будет завершена.
Конечная точка зависит от рабочего пространства и региона, поэтому скопированный из другой конфигурации hostname может не заработать даже при правильном формате событий. При настройке сессии, VAD, ключевых слов и ручной фиксации буфера ориентируйтесь на справочник клиентских событий LiveTranslate.
Где модель полезна, а где пока рано на неё рассчитывать
| Сценарий | Оценка | Почему |
|---|---|---|
| Субтитры для контролируемого стрима | Хороший вариант для прототипа | Потоковое аудио и текстовый вывод соответствуют архитектуре API |
| Перевод на сервере для двустороннего приложения | Подходит, но требует тестов | WebSocket поддерживает постоянную сессию и может возвращать аудио |
| Небольшая встреча с чёткой очередностью реплик | Вполне вероятно | Перевод в реальном времени с учётом говорящих заявлен среди сценариев модели |
| Шумная конференция с перебиваниями | Пока не подтверждено | Здесь нет независимых данных о работе с перекрывающейся речью, акцентами и шумом |
| Медицинский или юридический перевод с высокой ответственностью | Не стоит выбирать по умолчанию | Имеющихся данных недостаточно, чтобы подтвердить надёжность терминологии |
| Локальный или офлайн-запуск | Нет | Официально модель доступна как облачный сервис, а не как скачиваемая модель |
Полезный сигнал для экосистемы — открытая реализация AlbusWei/LiveTranslate. В README описаны режимы перевода для одного пользователя, озвучки файлов и встреч; основным транспортом выбран WebRTC, а WebSocket используется как запасной вариант. Это показывает, что вокруг realtime-моделей Qwen можно собрать практическую оболочку, но ничего не говорит напрямую о точности Qwen3.8 или стабильности сервиса в продакшене.
Что уже подтверждено, а что ещё предстоит проверить
Официальная документация достаточно подробно описывает возможности и тарифы, но независимое тестирование остаётся слабым местом. В обсуждениях сообщества нашлось лишь небольшое число публикаций именно об этом релизе, а отдельной содержательной ветки на Reddit о Qwen3.8-LiveTranslate обнаружить не удалось.
Один из пользователей осторожно описал главное изменение так:
«2.3 秒还没有消失,但已经更接近人类能自然接话的节奏了。» — @WukongNumber1, X
Это полезная человеческая реакция на заявление о задержке, но не результат бенчмарка. Другая дискуссия на Reddit о более раннем опыте использования Qwen для перевода также оказалась неоднозначной: u/ReplacementTommy написал: «Честно говоря, среди всех переводчиков, которыми я пользовался, Qwen оказался самым точным и естественно звучащим», тогда как u/Valhall22 сообщил, что в тестах английского, немецкого и французского Qwen не вошёл в его первую пятёрку. Эти комментарии не подтверждают, что речь шла именно о realtime-модели Qwen3.8, и не описывают контролируемый тест, поэтому превращать их в рейтинг нельзя.
Практический вывод здесь довольно узкий: Qwen3.8-LiveTranslate официально доступна через API, её биллинг описан, а realtime-архитектура позволяет начинать интеграцию. Но качество на сложной речи покупателю всё равно придётся проверять самостоятельно.
Qwen3.8 LiveTranslate API: вопросы и ответы
Qwen3.8 LiveTranslate уже доступна?
Да. В документации Alibaba Cloud qwen3.8-livetranslate-flash-realtime указана как облачная модель API в Model Studio. Подтверждений выпуска модели с открытыми весами нет.
Qwen3.8 LiveTranslate работает через WebSocket?
Да. В официальных документах Realtime API и справочнике событий LiveTranslate описаны доступ по WebSocket, аутентификация, обновление сессии, события аудиобуфера и потоковая выдача результата.
Сколько стоит минута работы Qwen3.8 LiveTranslate?
Единой универсальной цены за минуту нет: входное аудио, выходной текст, выходное аудио и контекст изображений тарифицируются отдельно. Если использовать указанные в документации 7 входных токенов в секунду и 12,5 выходного токена в секунду, минута входного аудио обойдётся примерно в $0.00315, а минута сгенерированного аудио — примерно в $0.0225 по указанным международным тарифам, без учёта текста и других операций.
Можно ли получать только текст, без переведённого аудио?
Да. В сессии можно настроить форматы вывода: только текст или текст вместе с аудио. Перед запуском проверьте актуальные названия событий в официальной документации по клиентским событиям.
Сколько языков поддерживает модель?
В официальной информации о модели указаны 60 языков распознавания и 29 языков голосового вывода. Поэтому число языков для аудиовывода меньше числа языков распознавания.
Можно ли переводить видео в реальном времени?
Модель принимает аудио и контекст изображений и позиционируется для аудиовизуального перевода. Но это не означает, что любой сценарий озвучки видеофайлов работает именно через realtime-модель: для перевода аудио и видео Qwen отдельно описывает нережимы реального времени.
Можно ли скачать модель и запустить локально?
Официального релиза весов именно для этой realtime-модели не найдено. Планируйте использовать облачный инференс, пока Qwen не опубликует отдельный чекпойнт и лицензию.
Практический вывод: начинать с прототипа за переключателем
Qwen3.8-LiveTranslate стоит проверить в контролируемом API-прототипе, но не подключать к продакшену вслепую. Перед запуском измерьте на собственных аудиозаписях три параметра: время до появления первого переведённого результата, качество языковой пары на именах и отраслевой терминологии, а также поведение при паузах, перебиваниях и восстановлении соединения.
Держите модель за конфигурационным переключателем, чтобы при необходимости сменить регион, транспорт или провайдера без переписывания приложения. На сегодня это самый здравый компромисс: API и тарифы уже достаточно конкретны для разработки, а самые сложные вопросы — качество в шумном помещении и стабильность при длительной работе — пока должны решаться вашим планом тестирования, а не полагаться на формулировки анонса.