AIREITER

Тарифы Qwen3.8 LiveTranslate API и настройка WebSocket

Последнее обновление: 2026-09-18 18:56:52

Переводчик, который отвечает примерно за 2,3 секунды, вполне можно представить в переговорной. Qwen3.8-LiveTranslate уже доступен, но только как облачный API Alibaba Cloud/Model Studio. При этом 2,3 секунды — официальное заявление разработчика, а не независимый замер в реальном продакшене. Для бюджета и архитектуры это принципиальная разница.

Коротко: стоит ли подключать

Qwen3.8-LiveTranslate подойдёт для аккуратного прототипа, если вам нужны потоковый перевод речи, субтитры и синтезированный аудиовыход через realtime-соединение. Но не воспринимайте заявленную задержку как гарантию для шумных совещаний, перебивающих друг друга собеседников или любой языковой пары: независимых практических тестов именно этой версии пока мало.

Модель разумно использовать в серверном сервисе, где API-ключ можно надёжно спрятать, а региональную инфраструктуру Alibaba Cloud — принять как данность. Это не лучший выбор, если вам нужны скачиваемые веса, зрелая инфраструктура сторонних хостингов или подтверждённые бенчмарки качества ещё до формулировки продакшен-требований.

Что именно доступно сейчас

Точный идентификатор облачной модели — qwen3.8-livetranslate-flash-realtime. В официальной документации Alibaba Cloud и журнале изменений Model Studio она указана как realtime-сервис, выпущенный 17 сентября 2026 года. На официальной странице модели заявлена поддержка 60 языков распознавания и 29 языков голосового вывода.

ВопросТекущий ответ
Релиз состоялся?Да, как облачная API-модель
Идентификатор моделиqwen3.8-livetranslate-flash-realtime
Основной транспортRealtime API, включая WebSocket
Входные данныеАудио и контекст изображений
РезультатТекст и аудио — в зависимости от настроек сессии
Официальная заявленная задержкаОколо 2,3 секунды от начала до конца
Открытые весаОфициальных подтверждений не найдено

Иными словами, перед нами уже не просто презентационный анонс, но и не модель, которую можно скачать и запустить локально. Официальная документация описывает доступ к инференсу через Model Studio, а не через локальные чекпойнты.

Официальная страница модели Qwen3.8 LiveTranslate

Сколько это стоит до первой строки кода

Для международного развёртывания в Сингапуре официальный тариф разделён на четыре категории. Все цены указаны за один миллион токенов:

Категория списанияОфициальная цена
Входное аудио$7.50 / 1M токенов
Входное изображение$0.55 / 1M токенов
Выходной текст$20 / 1M токенов
Выходное аудио$30 / 1M токенов

В руководстве Qwen по realtime-переводу указано, что входное аудио тарифицируется как 7 токенов в секунду, а выходное — как 12,5 токена в секунду. Для непрерывного потока можно примерно оценить входные и выходные расходы:

  • 60 секунд входного аудио: 420 токенов, то есть около $0.00315 по указанному тарифу на входное аудио.
  • 60 секунд сгенерированного аудио: 750 токенов, то есть около $0.0225 по указанному тарифу на выходное аудио.

Это не полный расчёт «стоимости минуты». В нём не учтены выходной текст, изображения, особенности подключения и возможная разница в длительности исходного и переведённого аудио. Если запрашивать только текст, будет использоваться другая категория списания. Проверьте страницу с тарифами моделей для конкретного региона и варианта развёртывания.

Справочная информация о тарифах Qwen Model Studio

Как устроено подключение по WebSocket

Документированный сценарий — это серверная realtime-сессия, а не обычный одноразовый запрос на перевод. В официальном обзоре Realtime API WebSocket назван удобным вариантом для серверных приложений и прототипов.

Минимальная интеграция выглядит так:

  1. Сформировать региональный URL realtime-WebSocket, указав в качестве модели qwen3.8-livetranslate-flash-realtime.
  2. Передать при рукопожатии Authorization: Bearer <API_KEY>; ключ должен оставаться на вашем сервере.
  3. Отправить session.update с исходным и целевым языком, а также нужными форматами вывода.
  4. Передавать аудио в base64 через input_audio_buffer.append.
  5. Явно зафиксировать буфер или дождаться, пока обработку запустит настроенное определение голосовой активности.
  6. Получать события с переводом текста и аудио, пока текущая реплика не будет завершена.

Конечная точка зависит от рабочего пространства и региона, поэтому скопированный из другой конфигурации hostname может не заработать даже при правильном формате событий. При настройке сессии, VAD, ключевых слов и ручной фиксации буфера ориентируйтесь на справочник клиентских событий LiveTranslate.

Где модель полезна, а где пока рано на неё рассчитывать

СценарийОценкаПочему
Субтитры для контролируемого стримаХороший вариант для прототипаПотоковое аудио и текстовый вывод соответствуют архитектуре API
Перевод на сервере для двустороннего приложенияПодходит, но требует тестовWebSocket поддерживает постоянную сессию и может возвращать аудио
Небольшая встреча с чёткой очередностью репликВполне вероятноПеревод в реальном времени с учётом говорящих заявлен среди сценариев модели
Шумная конференция с перебиваниямиПока не подтвержденоЗдесь нет независимых данных о работе с перекрывающейся речью, акцентами и шумом
Медицинский или юридический перевод с высокой ответственностьюНе стоит выбирать по умолчаниюИмеющихся данных недостаточно, чтобы подтвердить надёжность терминологии
Локальный или офлайн-запускНетОфициально модель доступна как облачный сервис, а не как скачиваемая модель

Полезный сигнал для экосистемы — открытая реализация AlbusWei/LiveTranslate. В README описаны режимы перевода для одного пользователя, озвучки файлов и встреч; основным транспортом выбран WebRTC, а WebSocket используется как запасной вариант. Это показывает, что вокруг realtime-моделей Qwen можно собрать практическую оболочку, но ничего не говорит напрямую о точности Qwen3.8 или стабильности сервиса в продакшене.

Что уже подтверждено, а что ещё предстоит проверить

Официальная документация достаточно подробно описывает возможности и тарифы, но независимое тестирование остаётся слабым местом. В обсуждениях сообщества нашлось лишь небольшое число публикаций именно об этом релизе, а отдельной содержательной ветки на Reddit о Qwen3.8-LiveTranslate обнаружить не удалось.

Один из пользователей осторожно описал главное изменение так:

«2.3 秒还没有消失,但已经更接近人类能自然接话的节奏了。» — @WukongNumber1, X

Это полезная человеческая реакция на заявление о задержке, но не результат бенчмарка. Другая дискуссия на Reddit о более раннем опыте использования Qwen для перевода также оказалась неоднозначной: u/ReplacementTommy написал: «Честно говоря, среди всех переводчиков, которыми я пользовался, Qwen оказался самым точным и естественно звучащим», тогда как u/Valhall22 сообщил, что в тестах английского, немецкого и французского Qwen не вошёл в его первую пятёрку. Эти комментарии не подтверждают, что речь шла именно о realtime-модели Qwen3.8, и не описывают контролируемый тест, поэтому превращать их в рейтинг нельзя.

Практический вывод здесь довольно узкий: Qwen3.8-LiveTranslate официально доступна через API, её биллинг описан, а realtime-архитектура позволяет начинать интеграцию. Но качество на сложной речи покупателю всё равно придётся проверять самостоятельно.

Qwen3.8 LiveTranslate API: вопросы и ответы

Qwen3.8 LiveTranslate уже доступна?

Да. В документации Alibaba Cloud qwen3.8-livetranslate-flash-realtime указана как облачная модель API в Model Studio. Подтверждений выпуска модели с открытыми весами нет.

Qwen3.8 LiveTranslate работает через WebSocket?

Да. В официальных документах Realtime API и справочнике событий LiveTranslate описаны доступ по WebSocket, аутентификация, обновление сессии, события аудиобуфера и потоковая выдача результата.

Сколько стоит минута работы Qwen3.8 LiveTranslate?

Единой универсальной цены за минуту нет: входное аудио, выходной текст, выходное аудио и контекст изображений тарифицируются отдельно. Если использовать указанные в документации 7 входных токенов в секунду и 12,5 выходного токена в секунду, минута входного аудио обойдётся примерно в $0.00315, а минута сгенерированного аудио — примерно в $0.0225 по указанным международным тарифам, без учёта текста и других операций.

Можно ли получать только текст, без переведённого аудио?

Да. В сессии можно настроить форматы вывода: только текст или текст вместе с аудио. Перед запуском проверьте актуальные названия событий в официальной документации по клиентским событиям.

Сколько языков поддерживает модель?

В официальной информации о модели указаны 60 языков распознавания и 29 языков голосового вывода. Поэтому число языков для аудиовывода меньше числа языков распознавания.

Можно ли переводить видео в реальном времени?

Модель принимает аудио и контекст изображений и позиционируется для аудиовизуального перевода. Но это не означает, что любой сценарий озвучки видеофайлов работает именно через realtime-модель: для перевода аудио и видео Qwen отдельно описывает нережимы реального времени.

Можно ли скачать модель и запустить локально?

Официального релиза весов именно для этой realtime-модели не найдено. Планируйте использовать облачный инференс, пока Qwen не опубликует отдельный чекпойнт и лицензию.

Практический вывод: начинать с прототипа за переключателем

Qwen3.8-LiveTranslate стоит проверить в контролируемом API-прототипе, но не подключать к продакшену вслепую. Перед запуском измерьте на собственных аудиозаписях три параметра: время до появления первого переведённого результата, качество языковой пары на именах и отраслевой терминологии, а также поведение при паузах, перебиваниях и восстановлении соединения.

Держите модель за конфигурационным переключателем, чтобы при необходимости сменить регион, транспорт или провайдера без переписывания приложения. На сегодня это самый здравый компромисс: API и тарифы уже достаточно конкретны для разработки, а самые сложные вопросы — качество в шумном помещении и стабильность при длительной работе — пока должны решаться вашим планом тестирования, а не полагаться на формулировки анонса.

Проверенные источники