AIREITER

Kokoro 82M TTS: тест на CPU, голоса и стоимость

Последнее обновление: 2026-09-28 01:31:12

Если нужна естественная озвучка, но отправлять каждую фразу в платный API не хочется, Kokoro 82M TTS — одна из самых практичных открытых моделей для первого теста. Но важно понимать границы: «82M» не означает универсальную замену ElevenLabs. Kokoro особенно хороша для пресетных голосов, чистой дикторской начитки и локальной пакетной обработки. А вот клонирование голоса, драматическая выразительность и готовая управляемая инфраструктура — уже аргументы в пользу других решений.

Коротко: кому подойдёт Kokoro

Kokoro-82M — открытая text-to-speech-модель с 82 миллионами параметров. В актуальной карточке модели на Hugging Face указано, что версия v1.0 вышла 27 января 2025 года, поддерживает восемь языков и 54 голоса, а веса распространяются по лицензии Apache 2.0: официальная карточка модели. Официальная библиотека для инференса — hexgrad/kokoro.

Выбирайте Kokoro, если нужна приватная или офлайн-озвучка, пресетные голоса вас устраивают, а объём задач уже делает оплату API заметной статьёй расходов. ElevenLabs лучше подойдёт для клонирования голоса, управляемой студии и выразительной коммерческой озвучки. Qwen3-TTS стоит рассматривать, если важнее широкий набор языков и клонирование, а не минимальный размер локальной модели.

Локальный запуск: рабочий путь без лишних сюрпризов

В официальных примерах используются Python, kokoro, soundfile, PyTorch и espeak-ng; аудио на выходе имеет частоту дискретизации 24 кГц. Базовая установка в Linux выглядит так:

pip install -q "kokoro>=0.9.4" soundfile
sudo apt-get install espeak-ng

Минимальный пример для английского:

from kokoro import KPipeline
import soundfile as sf

pipeline = KPipeline(lang_code="a")
text = "Kokoro is a small local text to speech model."

for index, (_, _, audio) in enumerate(
    pipeline(text, voice="af_heart", speed=1)
):
    sf.write(f"kokoro-{index}.wav", audio, 24000)

В репозитории перечислены коды языков для американского и британского английского, испанского, французского, хинди, итальянского, японского, бразильского португальского и китайского (мандарин). Для японского и китайского понадобятся соответствующие дополнения Misaki. Код языка должен соответствовать выбранному голосу.

В Windows установка не сводится к одной команде: README проекта отправляет пользователей к MSI-релизу espeak-ng. На Apple Silicon можно попробовать PyTorch MPS с переменной PYTORCH_ENABLE_MPS_FALLBACK=1. Когда первый запуск не удаётся, эти детали оказываются важнее самого количества параметров модели.

CPU, GPU и скорость в реальном времени: что можно утверждать

Инференс на CPU поддерживается, но ни официальная карточка модели, ни библиотека не приводят единого показателя real-time factor для всех систем. Скорость зависит от среды выполнения, процессора, языка, разбиения текста и от того, учитывается ли в первом запуске загрузка модели.

Замеры сообщества хорошо показывают, почему с широкими обещаниями нужно быть осторожнее. В подробном сравнении @analogalok сообщил примерно о 0,7 секунды на генерацию 21 секунды аудио на GPU; в этой конфигурации использовалось около 0,9 ГБ видеопамяти. Это полезное подтверждение сценария с небольшим потреблением памяти на GPU, но не обещание аналогичного результата для любого ноутбука.

«Я без проблем запускаю её на CPU, и получившееся аудио очень приятно слушать». — @rasmus1610, X

На своём железе лучше отдельно измерить три показателя:

  1. Время от запуска процесса до первого аудиофрагмента.
  2. Время генерации после прогрева модели и голоса.
  3. Длительность аудио, делённая на время генерации после прогрева — это и есть реальный real-time factor.

Для пакетной озвучки именно третий показатель определяет производительность. Для интерактивного ассистента важнее задержка до первого фрагмента и поведение потоковой генерации. Не выдавайте результат на GPU за показатель CPU и не называйте десятисекундный пример производительностью для продакшена.

Голоса и языки: где заканчиваются возможности Kokoro

В карточке модели v1.0 указаны восемь языков и 54 голоса — заметный шаг вперёд по сравнению с версией v0.19, где был один язык и 10 голосов. В документации библиотеки перечислены следующие коды:

КодЯзык
aАмериканский английский
bБританский английский
eИспанский
fФранцузский
hХинди
iИтальянский
jЯпонский
pБразильский португальский
zКитайский (мандарин)

Kokoro работает с пресетными голосами и не умеет клонировать голос по референсной записи. Кроме того, модель опирается на стек преобразования графем в фонемы Misaki и резервные пути через espeak-ng. Имена, аббревиатуры, числа и текст на нескольких языках стоит отдельно проверить перед длинным экспортом.

Лицензия модели Apache 2.0 удобна для коммерческого использования, но формулировку «модель распространяется по Apache 2.0» не следует воспринимать как универсальное разрешение на любые образцы голосов, датасеты и сторонние зависимости. Перед релизом проверьте лицензию модели, файлов голосов и всех зависимостей.

Kokoro против ElevenLabs и Qwen3-TTS

Слепое сравнение звучания имеет смысл только при одинаковых тексте, требованиях к голосу, нормализации, уровне громкости и составе группы слушателей. В этой статье не заявляется победитель контролируемого слепого теста: официальные материалы Kokoro такого сравнения не публикуют. Корректнее сравнивать рабочие сценарии и компромиссы:

КритерийKokoro-82MElevenLabsQwen3-TTS
РазвёртываниеЛокальные/открытые весаОблачный API и студияЛокальное семейство открытых моделей
Лицензия/исходный код моделиВеса Apache 2.0Условия провайдераВ официальных карточках моделей указана Apache 2.0
Пресетные голосаДаБольшая облачная библиотека голосовCustomVoice и другие варианты
Клонирование голосаНетДоступно на поддерживаемых тарифах/в поддерживаемых функцияхБазовый вариант поддерживает клонирование по референсу
Языки8 заявлено для v1.0Зависит от модели; официальная цена API различается по моделямЗаявлено 10 языков
Оптимальный сценарийПриватная пакетная озвучкаУправляемое выразительное производствоЭксперименты с мультиязычностью и клонированием
Основные затратыЖелезо или облачный инференсОплата символов/кредитовЖелезо или хостинг

На официальной странице цен API ElevenLabs сейчас указано около $0.05 за 1000 символов для Flash/Turbo и $0.10 за 1000 символов для v2 Multilingual и v3: цены API. В официальной карточке Qwen3-TTS перечислены китайский, английский, японский, корейский, немецкий, французский, русский, португальский, испанский и итальянский, а также варианты, ориентированные на клонирование: карточка Qwen3-TTS.

Практический вывод не в том, что «Kokoro звучит лучше». Её преимущество — отсутствие регулярной зависимости от API и возможность не отправлять текст за пределы своей машины. ElevenLabs покупает удобство, а Qwen3-TTS — более широкий набор языков и функций клонирования ценой большего размера локальной модели.

Стоимость пакетной озвучки: цифры, которые можно обосновать

У локальной Kokoro нет отдельной платы за каждый символ. Предельные расходы складываются из электричества, хранения данных и стоимости машины или облачного инстанса, на котором выполняется инференс. Если компьютер уже есть, дополнительные затраты на программное обеспечение фактически равны нулю; при аренде CPU или GPU умножьте почасовую ставку провайдера на фактическое время генерации.

Для сравнения с API в карточке модели Kokoro приведены примеры размещённого инференса за апрель 2025 года: менее $1 за миллион входных символов, включая $0.65 на Replicate и $0.80 на DeepInfra. Это ориентиры на тот момент, а не гарантия текущих цен. При таком же объёме текста официальные тарифы ElevenLabs дают следующие значения:

ОбъёмПлата за локальную модель KokoroElevenLabs Flash/TurboElevenLabs v2 Multilingual/v3
100 000 символов$0 локально*$5$10
1 000 000 символов$0 локально*$50$100
10 000 000 символов$0 локально*$500$1,000

\* Не включены электричество, оборудование, хостинг и время инженеров. В расчёте для ElevenLabs используются официальные ставки $0.05/$0.10 за 1000 символов; скидки по тарифам, кредиты, налоги и правила оплаты перерасхода не учитываются. Таблица предназначена для планирования бюджета, а не является обещанием итогового счёта.

Поэтому Kokoro особенно интересна для повторяемых конвейеров озвучки: субтитров, документации, аудио для доступности и внутренних обучающих роликов. Но если проверка произношения и склейка фрагментов требуют больше человеческого времени, чем стоит API, выгода становится менее очевидной.

FAQ

Можно ли запустить Kokoro без GPU?

Да. Инференс на CPU поддерживается, но официальный проект не обещает универсальный real-time factor. Измерьте скорость после прогрева на конкретном процессоре и языке, которые планируете использовать в продакшене.

Умеет ли Kokoro клонировать голоса?

Нет. Kokoro работает с пресетными голосами. Если идентичность диктора — ключевое требование, используйте модель с поддержкой клонирования, например подходящий вариант Qwen3-TTS.

Можно ли бесплатно использовать Kokoro в коммерческих проектах?

В карточке модели Kokoro-82M указано, что веса распространяются по лицензии Apache 2.0 — это разрешительная лицензия. Перед выпуском коммерческого продукта всё равно проверьте условия для конкретного голоса, зависимостей и распространения.

Какие языки поддерживает Kokoro?

В карточке модели v1.0 указаны восемь языков; официальная библиотека документирует американский и британский английский, а также испанский, французский, хинди, итальянский, японский, бразильский португальский и китайский (мандарин). Для отдельных языков могут потребоваться дополнительные пакеты.

Kokoro лучше ElevenLabs?

Не по всем параметрам. Kokoro лучше подходит для локальной, приватной пакетной озвучки с пресетными голосами. ElevenLabs надёжнее в сценариях с управляемой инфраструктурой, клонированием голоса и выразительной коммерческой подачей.

Практический выбор

Начните с Kokoro, если ваш критерий звучит так: «Может ли эта машина приватно создавать чистую озвучку с нужной скоростью и одним из доступных голосов?» Проверьте модель на именах, датах, числах, длинных абзацах и тех языках, которые действительно понадобятся.

Если тест пройден, экономика проста: регулярная оплата символов заменяется машинным временем. Если модель не справляется с произношением, идентичностью диктора или эмоциональной подачей, переход на ElevenLabs или Qwen3-TTS — не признание поражения. Вы просто платите за возможности, которые Kokoro намеренно не ставит во главу угла.

О коммерческой части этого же выбора читайте в руководстве по API ElevenLabs Eleven v3.