Hy3 — это текстовая MoE-модель для программирования, рассуждений, работы с длинным контекстом и агентами. Для первой интеграции используйте размещённый OpenAI-compatible endpoint, отправьте обычный запрос Chat Completions и оцените один рабочий процесс, который вы действительно автоматизировали бы. Не стандартизируйте на ней работу, пока она не будет следовать вашей tool schema и сохранять ограничения, важные для ваших длинных входных данных.
Подробности о поставщике ниже были проверены 14 июля 2026 года. Документация DeepInfra указывает модель как tencent/Hy3 на её OpenAI-compatible endpoint Chat Completions. SiliconFlow также перечисляет Hy3 под тем же ID модели. Цены, лимиты и псевдонимы поставщика могут меняться, поэтому перед запуском обязательно проверьте актуальную страницу поставщика.
Начните с вызова размещённого API Hy3
DeepInfra публикует этот минимальный запрос для своего размещённого конечного пункта Hy3. Замените токен на свой собственный токен провайдера; не помещайте его в код браузера или клиентское приложение.
curl "https://api.deepinfra.com/v1/openai/chat/completions" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPINFRA_TOKEN" \
-d '{
"model": "tencent/Hy3",
"messages": [
{"role": "user", "content": "Верни три проверки приёмки API."}
]
}'
Ответ использует стандартную структуру Chat Completions. Разберите поля answer и billing следующим образом:
{
"id": "chatcmpl-...",
"object": "chat.completion",
"model": "tencent/Hy3",
"choices": [{
"message": {"role": "assistant", "content": "..."},
"finish_reason": "stop"
}],
"usage": {
"prompt_tokens": 0,
"completion_tokens": 0,
"total_tokens": 0
}
}
Читайте choices[0].message.content для ответа и usage для учета токенов. Добавляйте "stream": true только после того, как запрос без streaming начнет работать; DeepInfra документирует streaming как server-sent events, которые заканчиваются [DONE].
Варианты поставщиков в таблице намеренно ограничены. Это проверенные маршруты публичного доступа, а не рейтинг по цене.
Провайдер | Подтверждённая деталь доступа | Что подтвердить перед запуском в production |
|---|---|---|
| Текущая цена, лимиты аккаунта, поддержка инструментов и условия использования данных | |
API, совместимый с OpenAI; модель | Текущий endpoint, цена, лимиты запросов и область действия API-ключа | |
14 июля на его странице был указан | По-прежнему ли доступен этот alias, каковы его лимиты и какой провайдер маршрутизируется |
Анонс выпуска Tencent от 6 июля 2026 года представил Hy3 как open-weight модель Mixture-of-Experts. Официальное объявление о ценах и card модели делают её кандидатом для размещённой оценки, но страница API сама по себе не является доказательством того, что она подходит для производственной нагрузки.
Что такое Hy3 и чем он не является
Hy3 — это MoE-модель с 295B параметрами и 21B активными параметрами на токен. В официальной карточке модели Hy3 указаны 192 эксперта с маршрутизацией top-8, 80-слойный backbone, один слой MTP, контекстное окно на 256K токенов и лицензия Apache 2.0.
Эти числа описывают текстовую модель, предназначенную для рассуждений, программирования, длительных диалогов и агентов, использующих инструменты. Они не делают Hy3 моделью для изображений или OCR. Рабочий процесс, ключевым входом которого является отсканированный счет, снимок экрана, фотография продукта или диаграмма, сначала нуждается в модели vision или OCR, а уже потом — в Hy3. Четкое соблюдение этой границы предотвращает распространенную архитектурную ошибку: просить способную текстовую модель восстановить информацию, которую она никогда не получала.
Tencent позиционирует Hy3 для программирования, офисной работы, финансового моделирования, frontend-разработки и разработки игр. Рассматривайте их как возможные сценарии использования, а не как универсальный рейтинг.
Читайте заявления о бенчмарках с учетом их ограничений
В анонсе релиза Tencent сообщается о слепой оценке с участием 270 экспертов, выполнявших рабочие задачи, в которой Hy3 получил 2,67 из 4, а GLM-5.1 — 2,51 из 4. Тот же источник утверждает, что точность Hy3 на SWE-Bench Verified варьировалась менее чем на четыре процентных пункта между scaffolds CodeBuddy, Cline и KiloCode. Это результаты, опубликованные Tencent, а не независимая гарантия того, что Hy3 превзойдёт указанного конкурента в вашей среде.
Artificial Analysis — еще одна точка отсчета для измерений на уровне модели. Читайте результаты бенчмарков как входные данные для выбора модели, а не как замену критериям приемки на уровне приложения.
Выберите режим рассуждений в зависимости от цены ошибки
Hy3 предоставляет no_think, low и high уровни усилий рассуждения в своих официальных примерах обслуживания. Выбор должен определяться ценой неправильного ответа, а не престижем использования модели рассуждений.
Тип рабочей нагрузки | Начинать с | Что измерять перед повышением уровня |
|---|---|---|
Классификация, извлечение из чистого текста или простая маршрутизация |
| Правильная метка или значения полей, задержка и токены вывода |
Ограниченные изменения кода, многошаговые сводки по нескольким правилам или одна последовательность инструментов |
| Процент успешных тестов, корректные аргументы инструментов и правки человека |
Отладка в нескольких файлах, планирование при конфликтующих ограничениях или числовое рассуждение |
| Доля выполненных задач, повторы, общее число токенов и время на проверку |
Оставляйте no-think для ограниченной работы
no_think — это режим прямого ответа по умолчанию. Это правильная базовая настройка, когда источник уже структурирован, ответ имеет известную форму, и более медленный ответ не добавит полезного рассуждения. Например, рабочий процесс поддержки, который выбирает один документированный статус и вызывает одну функцию, сначала следует тестировать в этом режиме. Добавьте строгую схему JSON и отклоняйте ответы с лишними полями вместо того, чтобы надеяться, что более длинная цепочка рассуждений исправит расплывчатый контракт.
Используйте низкий или высокий уровень рассуждения, когда ошибка меняет следующее действие
Переходите к low, когда модели нужно согласовать несколько правил или внести ограниченное изменение в код. Используйте high для задач, где слабое промежуточное решение приводит к дорогостоящей повторной попытке: при диагностике сбоя по нескольким файлам, выборе порядка операций или проверке вычислений перед вызовом инструмента.
Компромисс измерим. Сравните всю завершённую задачу целиком: задержку запроса, количество сгенерированных токенов, повторные вызовы инструментов, ошибки тестов и минуты, которые рецензент тратит на исправление ответа. Режим, который выглядит более вдумчивым, но удваивает число токенов, не сокращая время проверки, — не лучший вариант для production.
Запустите четырехэтапный API-тест, прежде чем внедрять Hy3
Этот тест создает доказательства для вашей системы, а не общий вердикт по модели. Используйте реальные, но не содержащие конфиденциальных данных задачи. Зафиксируйте промпты, схемы и критерии прохождения до запуска моделей, чтобы не менять правила после того, как вы увидите ответ.
Докажите путь запроса с помощью минимального самостоятельного вызова
Следующий пример следует официальному шаблону self-hosted, совместимому с OpenAI, для обслуживания Hy3. Он использует локальную endpoint, совместимую с vLLM, и имя модели, настроенное этим сервером. Идентификаторы hosted-моделей зависят от провайдера; используйте таблицу провайдеров выше для подтверждённых hosted-ID.
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:8000/v1",
api_key="EMPTY",
)
response = client.chat.completions.create(
model="hy3",
messages=[
{"role": "user", "content": "Перечислите проверки приемки для вызова JSON-инструмента."}
],
temperature=0.9,
top_p=1.0,
extra_body={
"chat_template_kwargs": {"reasoning_effort": "low"}
},
)
print(response.choices[0].message.content)
Сначала добейтесь работы этого простого вызова, прежде чем оценивать сложного агента. Это позволяет отделить проблему аутентификации, endpoint, шаблона или имени модели от проблемы качества модели. Для каждой попытки фиксируйте provider, model revision, если доступно, reasoning mode, timestamp, input tokens, output tokens и elapsed time.
Проверьте структурированный вывод и вызовы инструментов с вашей реальной схемой
Вызывание инструментов не следует оценивать как «модель выбрала правдоподобное действие». Отправляйте явную схему и проверяйте возвращаемые аргументы в вашем приложении. Это фрагмент запроса в стиле OpenAI; перед тем как полагаться на него, уточните у провайдера точную поддержку параметров инструмента.
{
"model": "tencent/Hy3",
"messages": [
{"role": "user", "content": "Проверьте статус инцидента INC-1042."}
],
"tools": [
{
"type": "function",
"function": {
"name": "get_incident",
"description": "Найти один инцидент по его идентификатору.",
"parameters": {
"type": "object",
"properties": {"incident_id": {"type": "string"}},
"required": ["incident_id"],
"additionalProperties": false
}
}
}
]
}
Для этого запроса правильное решение о выборе инструмента означает вызов get_incident, у которого incident_id в точности равен INC-1042. Ваш код должен отклонять отсутствующее поле, некорректную строку аргумента JSON или неожиданный инструмент, прежде чем обращаться к downstream-системе. Проверьте пять вещей:
Выбранный инструмент допустим для задачи.
Все обязательные аргументы присутствуют и имеют правильный тип.
Идентификаторы, даты и суммы берутся из предоставленного контекста, а не выдумываются.
Модель запрашивает отсутствующее обязательное значение, а не угадывает его.
Ошибка инструмента приводит к ограниченному пути исправления или эскалации, а не к циклу.
Запустите достаточно примеров, чтобы включить валидные входные данные, неоднозначные запросы, отсутствующие поля и один намеренно неудачный ответ инструмента. Надёжный JSON на успешном пути полезен; надёжное поведение, когда система отклоняет аргумент, — это то, что не даёт агенту создавать работу для оператора.
Тест длинного контекста для сохранения ограничений, а не длины заголовка
Контекст 256K у Hy3 ценен только тогда, когда релевантные факты сохраняются в вашем формате prompt. Постройте тест на основе репрезентативного репозитория, набора политик или цепочки истории клиента. Разместите несколько конкретных ограничений в разных местах, добавьте реалистичные отвлекающие элементы и попросите ответ, который должен ссылаться на эти ограничения или преобразовывать их.
Оценивайте точность извлечения, соблюдение каждого указанного ограничения, неподтверждённые утверждения и общую стоимость запроса. Затем повторите с включённым вашим production retrieval layer. Это показывает, относится ли сбой к модели, chunking, retrieval ranking или к коду сборки prompt. Успешная обработка одного большого вставленного документа — недостаточное основание, чтобы отключать guardrails.
Протестируйте нагрузку, которая оправдала бы миграцию
Выберите одну задачу, где улучшение результата модели имеет явную бизнес-ценность: исправление падающего теста в нескольких файлах, извлечение обязательств из длинной политики или выполнение многошаговой внутренней операции с помощью инструментов. Сравните текущий production-путь и Hy3 при одинаковом таймауте и правиле проверки.
Записывайте показатель завершения задач, задержку p50 и p95, входные и выходные токены, количество повторных попыток инструментов и время на исправления рецензента. Именно здесь также становится полезной смешанная обратная связь сообщества. Не принимайте решение, исходя из абстрактного утверждения о том, что Hy3 исключителен или разочаровывает. Принимайте решение, исходя из задачи, которую вы действительно заплатили бы за автоматизацию.
Хостируемый API или самостоятельный хостинг?
Сначала используйте hosted API, когда вы оцениваете модель, трафик все еще неопределен или ваша команда уже не располагает необходимой GPU capacity. Это сокращает путь к тестам выше и отделяет доступность провайдера от логики вашего приложения.
Используйте self-hosting только тогда, когда у вас есть конкретная причина, связанная с контролем, конфиденциальностью, объемом или задержкой, а также инфраструктура для его поддержки. Официальная карточка модели рекомендует восемь GPU H20-3e или другие GPU с большим объемом памяти для обслуживания Hy3, с рецептами vLLM или SGLang. Это рекомендация Tencent для production-serving, а не утверждение, что потребительский ноутбук обеспечивает эквивалентное развертывание. Сравните стоимость резервирования GPU, обновлений, мониторинга, batching и дежурного сопровождения с счетом от hosted-решения, прежде чем считать open weights бесплатной инфраструктурой.
Выберите этот путь | Когда он лучше подходит | Основной риск, к которому нужно подготовиться |
|---|---|---|
Hosted API | Быстрая оценка, переменный спрос, небольшая платформа-команда | ID моделей провайдера, лимиты, доступность и цена могут измениться |
Self-hosted Hy3 | Сильная потребность в контроле над данными или устойчивый объём при наличии опытных операторов | Оборудование с большим объёмом памяти, сложность обслуживания, планирование мощностей и операционная поддержка |
Цены и доступность могут меняться быстрее, чем веса
Tencent опубликовала цены на Hy3 API — 1 RMB за миллион входных токенов, 4 RMB за миллион выходных токенов и 0,25 RMB за миллион кэшированных входных токенов — 6 июля. Используйте это как ориентир с привязкой к дате, а затем перед отправкой подтвердите фактическую цену конечной точки. Бесплатный тариф провайдера, вводный кредит или временный бесплатный псевдоним модели — это возможность для эксперимента, а не постоянное обещание стоимости за единицу.
Для простого расчёта стоимости 100 ежедневных запросов, содержащих 20K входных токенов и 1K выходных токенов, используют 2M входных и 0.1M выходных токенов. По опубликованной базовой цене Tencent это составляет 2.4 RMB в день, или около 72 RMB за 30 дней. Если все 2M входных токенов подходят под кешированную цену, та же арифметика даёт 0.9 RMB в день. Это оценка только по токенам: она не включает наценку провайдера, ограничения бесплатного тарифа, повторные попытки и любой контекст, который добавляет ваше приложение.
При планировании бюджета для пробного использования учитывайте извлечённый контекст, системный prompt, определения инструментов, повторные попытки и вывод, создаваемый выбранным режимом reasoning. Не выбирайте Hy3, если ключевой ввод является визуальным, требуется лёгкое локальное развертывание как жёсткое условие или приложение не может проверять аргументы инструментов и последующие побочные эффекты.
Для агента с большим объёмом текста, которому нужен большой контекстный окно, настраиваемое reasoning и открытые веса, Hy3 — разумная модель для оценки. Оставляйте её только тогда, когда она сокращает время на исправления при приемлемой общей стоимости.
Часто задаваемые вопросы
Является ли Hy3 мультимодальным?
Нет. Hy3 — это модель с текстовым вводом и текстовым выводом. Используйте модель vision или OCR, когда задача начинается с изображений, сканов или скриншотов.
Что такое окно контекста Hy3?
В карточке модели Tencent указан контекстный буфер на 256K токенов. Большой лимит контекста не гарантирует, что будут извлечены или учтены релевантные факты, поэтому проверяйте его на репрезентативном исходном материале.
С какого режима рассуждения Hy3 мне следует начать?
Начните с no_think для ограниченных по объёму и чувствительных к задержке задач. Переходите к low или high только после того, как стоимость ошибки в задаче и измеренное улучшение оправдают дополнительные токены и время.
Могу ли я самостоятельно размещать Hy3?
Да. Tencent предоставляет рекомендации по развертыванию vLLM и SGLang и рекомендует восемь GPU с большой памятью для обслуживания. При самостоятельном размещении следует исходить из решения по мощности и эксплуатации, а не только из открытой лицензии на веса.
Бесплатный Hy3 API — это постоянный тарифный план?
Нет. Бесплатный доступ зависит от провайдера и может быть прекращён или лимиты могут быть изменены. Перед запуском рабочего процесса в production подтвердите текущие условия провайдера и платную ставку.
