Модель на 124 млрд параметров обычно означает медленный и дорогой инференс. Ling 3.0 Flash устроена иначе: на каждый токен она задействует примерно 5,1 млрд параметров, а прямо сейчас её можно запускать бесплатно.
inclusionAI представила модель 23 июля 2026 года. Это гибридная MoE-модель с режимом рассуждений, рассчитанная на агентные сценарии: программирование, вызов инструментов, исследования и длительные многошаговые задачи.
Что представляет собой Ling 3.0 Flash
Ling 3.0 Flash разработана inclusionAI — исследовательской группой, стоящей за семействами моделей Ling и Ring компании Ant Group. Ant Group — финтех-компания, создавшая Alipay. Приставка «Flash» обозначает быстрый и экономичный уровень линейки, расположенный ниже гораздо более крупных флагманских моделей группы.
Это модель типа Mixture-of-Experts: из 124B параметров в целом для обработки одного токена активируется лишь около 5,1B. Благодаря этому по скорости и стоимости работы она ближе к небольшой модели.
Также это гибридная модель с рассуждениями: на простые запросы она отвечает сразу, а для сложных переключается в более развёрнутый режим размышлений. inclusionAI нацеливает её на «агентов производственного масштаба» — системы, которые вызывают инструменты, работают в браузере, пишут и исполняют код, а также сохраняют состояние на протяжении множества шагов.
Главная ставка — на эффективность
Сравнение с предшественницей Ling 2.6 Flash хорошо показывает замысел разработчиков. Общее число параметров выросло со 104B до 124B, но количество активных параметров на токен сократилось с 7,4B до 5,1B.
Большее число параметров даёт модели больше пространства для хранения знаний, а меньшее активное число снижает цену генерации каждого токена. На практике вы платите примерно как за инференс модели на 5B параметров, при этом используя ёмкость модели на 124B.
Особенно это важно для агентов. Если задача расходует тысячи токенов за множество вызовов инструментов, основную часть счёта определяет цена токена. В таком сценарии сокращение активных параметров полезнее, чем просто внушительное число в характеристиках.
Внутри используется гибридный стек с линейным вниманием. inclusionAI описывает повторяющийся блок из пяти слоёв KDA с линейным вниманием и одного слоя полного внимания MLA. Линейное внимание позволяет недорого обрабатывать длинный входной контекст, а периодический слой полного внимания компенсирует потерю точности извлечения информации, характерную для чисто линейных моделей. За счёт этого Flash получает нативное окно контекста 256K с потенциалом роста до 1M. В роутерах оно отображается как 262K — точное значение составляет 262 144 токена.
Для каких задач её создавали
Flash оптимизирована не для свободного общения в чате, а для агентной работы. В анонсе inclusionAI заявлены более точные вызовы инструментов, более стабильное выполнение долгих задач и лучшая совместимость с распространёнными фреймворками-«обвязками» для агентов. Это же видно по демонстрациям на запуске: 3D-город в Blender, исследования с несколькими агентами, задачи Office через MCP и браузерные приложения.
В задачах программирования inclusionAI делает акцент не только на обычной генерации кода, но и на пространственном и структурном рассуждении — например, работе с сетками сцен и относительными позициями объектов.
У бенчмарков есть важная оговорка: модели всего несколько дней, поэтому доступные цифры — это заявления inclusionAI и ранние тесты сообщества, а не независимые оценки. По данным inclusionAI, Flash сопоставима с их флагманской моделью примерно на 1 трлн параметров или превосходит её во многих задачах, используя лишь часть активных параметров. В таблице результатов компании указан балл 56,63 на SWE-Bench Pro в режиме рассуждений. Пока независимые стороны не подтвердят эти данные, их стоит воспринимать как показатели вендора.
Как бесплатно попробовать Ling 3.0 Flash
Самый быстрый путь — OpenRouter. Модель доступна под именем inclusionai/ling-3.0-flash; на момент запуска цена составляла $0 за входные и $0 за выходные токены, бесплатный доступ действует до 3 августа 2026 года. Цены проверены 24 июля 2026 года. Модель также бесплатна на ZenMux. Обе платформы предоставляют API, совместимый с OpenAI.
Минимальный запрос:
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "inclusionai/ling-3.0-flash",
"messages": [{"role": "user", "content": "Write a Python function to parse a CSV."}]
}'
Подойдёт любой клиент, который уже умеет работать с chat/completions: достаточно заменить базовый URL, ключ и строку модели. С помощью роутера моделей можно также сравнить Ling 3.0 Flash с текущей моделью на одних и тех же промптах, ничего не переписывая.
Стоит учитывать два момента. Бесплатный период — промоакция, поэтому после начала августа ожидается тарификация по количеству токенов. Для ориентира: Ling 2.6 Flash стоит примерно $0,01 за входные и $0,03 за выходные токены на 1 млн токенов. Кроме того, на старте модель обслуживал один провайдер, так что скорость и доступность зависят от единственного бэкенда.
Можно ли скачать веса?
Именно здесь запросы вроде «Ling 3.0 flash download» и «Ling 3.0 flash github» упираются в тупик. На старте веса не были опубликованы: пока Flash доступна только через API.
В этом её отличие от предыдущей версии. Ling 2.6 Flash вышла с открытыми весами на Hugging Face, поэтому её уже можно запускать локально. С Flash 3.0 такой возможности нет.
Если вам нужен самостоятельный хостинг или квантизация под собственное железо, следите за страницей inclusionAI на Hugging Face. Там размещены веса версии 2.6, и при повторении прежнего подхода веса 3.0 появятся там же. До этого момента доступ остаётся только через перечисленные выше API-роутеры.
Ling 3.0 Flash и Ling 2.6 Flash: ключевые различия
| Ling 3.0 Flash | Ling 2.6 Flash | |
|---|---|---|
| Дата выпуска | 23 июля 2026 | 21 апреля 2026 |
| Всего параметров | 124B | 104B |
| Активно на токен | ~5,1B | ~7,4B |
| Контекстное окно | 256K нативно (262K в роутерах) | 256K (262K в роутерах) |
| Открытые веса | Нет на момент запуска | Да (Hugging Face) |
| Цена на запуске | Бесплатно до 3 августа 2026 | ~$0,01 за входные / $0,03 за выходные на 1M |
| Основной фокус | Агенты с гибридными рассуждениями, инструменты, программирование | Быстрая instruct-модель для агентов |
Если кратко: 3.0 Flash жертвует частью активных вычислений ради большей ёмкости и гибридного режима рассуждений, а распространяется прежде всего через API. Если вам принципиально нужны локальные офлайн-веса, скачать пока можно только 2.6 Flash.
FAQ
Ling 3.0 Flash бесплатна?
Да, пока что. На OpenRouter модель бесплатна до 3 августа 2026 года, также она доступна бесплатно на ZenMux. После завершения акции ожидается тарификация по токенам.
Ling 3.0 Flash — это open source? Её можно скачать или найти на GitHub?
На старте — нет. Веса не публиковались, поэтому модель работает только через API: нет ни загрузки, ни репозитория. Используйте OpenRouter (inclusionai/ling-3.0-flash) или ZenMux. Более старая Ling 2.6 Flash открыта на Hugging Face, поэтому веса 3.0, если они выйдут, вероятнее всего появятся там же.
Ling 3.0 Flash — китайская модель?
Да. Её создала inclusionAI — исследовательская AI-группа, связанная с Ant Group, китайской финтех-компанией, стоящей за Alipay.
Насколько велика Ling 3.0 Flash?
124B параметров всего и около 5,1B активных на токен благодаря MoE-архитектуре. Нативный контекст составляет 256K, а inclusionAI заявляет возможность масштабирования до 1M.
Ling 3.0 Flash или Ling 2.6 Flash: что выбрать?
Выбирайте 3.0 Flash для агентных задач с гибридными рассуждениями и более низкой стоимостью токена через API. Ling 2.6 Flash лучше подойдёт, если нужно скачать веса и запускать модель локально: версия 3.0 пока не открыта.
