AIREITER

OpenAI Ultrafast Mode: GPT-5.6 Sol в 14 раз быстрее, цена пока неизвестна

Последнее обновление: 2026-08-17 00:37:37

У OpenAI теперь есть три предложения со словами «fast» и «ultra» — но скорость 750 токенов в секунду относится лишь к одному из них. Анонсированный 13 августа 2026 года режим OpenAI Ultrafast — это новый уровень API-сервиса для GPT-5.6 Sol на ваферных чипах Cerebras: заявлено до 14 раз больше скорости, чем у Standard. Пока есть важное ограничение: доступ предоставляют только по приглашениям, а цены OpenAI не назвала. Поэтому самый быстрый тариф, который можно купить уже сегодня, — Fast mode за $10/$60 за миллион токенов.

Не путайте ultra, Fast mode и Ultrafast

У пользователей GPT-5.6 Sol сейчас три похожих по названию опции, но каждая означает совершенно разное. Сводим различия в одну таблицу.

НазваниеЧто этоКак получитьЦена Sol (за 1 млн токенов)Заявленная скорость
Настройка рассуждений ultraРежим работы, в котором для одной задачи задействуются субагенты и дополнительные вычисленияНастройка Codex, а не отдельный платный уровень APIОтдельного тарифа нет; быстро расходует лимиты использованияМедленнее по замыслу
Fast modeУровень обработки API, переименованный из Priority 30 июля 2026 годаservice_tier="fast" в любом API-запросе$10 за вход / $60 за выход (короткий контекст)До 2,5x Standard
Ultrafast modeAPI-уровень для GPT-5.6 Sol на базе Cerebras, представленный в превью 13 августа 2026 годаОграниченное превью только для отдельных клиентовНе раскрытаДо 14x Standard

По сути, эти режимы направлены в разные стороны. ultra — это режим работы с субагентами, где скорость обменивают на тщательность. Ultrafast mode, напротив, ускоряет генерацию того же самого модели. Fast mode находится между ними: это доступное за деньги улучшение задержки, которое OpenAI описывает отдельно на странице Fast mode.

Что именно даёт превью от 13 августа

Страница анонса OpenAI Ultrafast mode с предварительными данными о скорости GPT-5.6 Sol

В официальном анонсе зафиксированы пять конкретных пунктов. Ultrafast сначала выходит в OpenAI API, работает только с GPT-5.6 Sol, обещает до 14 раз больше скорости Standard и до 750 выходных токенов в секунду, использует Cerebras и запускается как ограниченное превью для избранной группы клиентов, среди которых Jane Street, Podium, Basis и Rogo.

При этом в анонсе нет четырёх вещей, критичных для покупателя: цены за токен, ID модели, лимитов запросов и SLA по задержке. Именованных бенчмарков тоже не приводится.

В качестве демонстрации OpenAI показывает, как Ultrafast и Standard Sol по одному промпту создают 3D-симулятор склада. Суть предложения хорошо передаёт цитата Алекса Вана из Rogo: «С Ultrafast сложные финансовые исследования ощущаются как работа в реальном времени».

Что дают 14x скорости вместо 2,5x

Столбчатая диаграмма заявленных множителей скорости Standard, Fast mode и Ultrafast для GPT-5.6 Sol

Сначала важная оговорка о метриках. 750 токенов в секунду — заявленная пропускная способность на выходе, тогда как показатель Fast mode — нижняя граница SLA. Это связанные, но не идентичные величины. Если разделить 750 на 14, получится, что Standard Sol генерирует примерно 54 токена в секунду. Тогда ответ на 10 000 токенов займёт около 186 секунд на Standard, до 125 секунд при SLA Fast mode для Enterprise в 80 токенов/с и примерно 13 секунд на Ultrafast.

НагрузкаStandard (~54 ток/с, расчётно)Fast mode (SLA ≥80 ток/с)Ultrafast (заявлено 750 ток/с)
Генерация на 10 000 токенов~186 с≤125 с~13 с
Цикл агента из 5 шагов, по 1 000 токенов на шаг~93 с≤63 с~7 с

Цифры, распространяемые в r/AIToolsPerformance, приписывают эти сравнения Artificial Analysis и Cerebras: Ultrafast в 11 раз быстрее Claude Fable 5 и в 5 раз быстрее Opus 4.8 в Fast mode. Полный прогон Humanity's Last Exam из 2 500 вопросов якобы занял 11 часов 11 минут против 78 часов 27 минут у Fable 5. Все эти данные предоставлены вендорами; независимого воспроизведения пока нет.

Цена Ultrafast пока известна только участникам превью

Страница OpenAI с таблицей цен Fast mode для API-клиентов

Публичной цены Ultrafast не существует. В анонсе нет ни одного тарифа, и сообщество сразу обратило внимание на этот пробел. Как написал один из участников r/AIToolsPerformance: «В блоге не сказано главное — цена. Никто за пределами превью не знает, сколько это стоит».

Сейчас можно ориентироваться только на известную тарифную сетку GPT-5.6 Sol — все цены указаны за миллион токенов:

УровеньВход (короткий контекст)Выход (короткий контекст)Вход (длинный контекст >272k)Выход (длинный контекст)Кэшированный вход
Standard$5.00$30.00$10.00$45.00$0.50
Fast mode$10.00$60.00$20.00$90.00$1.00
Ultrafastне раскрытане раскрытане раскрытане раскрытане раскрыта
Групповая столбчатая диаграмма цен GPT-5.6 Sol Standard и Fast mode за миллион токенов

Для Sol Fast mode стоит ровно в 2 раза дороже Standard, но по этому множителю нельзя оценить цену Ultrafast: публичных данных для такого расчёта нет, а тарифы могут меняться в обе стороны — например, 30 июля OpenAI снизила цены Terra/Luna. В бюджете на задержки стоит учитывать и условие Fast mode: если превысить 1 миллион токенов в минуту и нарастить трафик более чем на 50% менее чем за 15 минут, избыточные запросы без уведомления переключаются на Standard, возвращают service_tier="Default" и тарифицируются по ставкам Standard.

Как получить доступ сегодня

В Ultrafast попадают по приглашениям, публичного листа ожидания нет. OpenAI говорит, что превью расширится «по мере роста доступных мощностей», и предлагает подписаться на обновления о доступе на странице анонса. Согласно июльским сообщениям, на раннем этапе доступ к Sol был примерно у 20 организаций.

У этой инфраструктуры уже есть история: партнёрство OpenAI с Cerebras началось 14 января 2026 года и резервирует 750 МВт ваферных мощностей. А GPT-5.3-Codex-Spark уже превысил 1 000 токенов в секунду на том же оборудовании.

Как ускорить ответы, не дожидаясь приглашения

Fast mode уже доступен всем API-клиентам, а для его включения достаточно одного параметра:

  1. Добавьте service_tier="fast" в запрос к /v1/responses или /v1/chat/completions.
  2. Устаревшее значение service_tier="priority" по-прежнему работает: существующие модели продолжают показывать priority в дашбордах использования, а модели после GPT-5.6 будут отображать fast.
  3. Чтобы включить режим по умолчанию для всего проекта, откройте Project settings -> Default Service Tier -> Fast.
Модель с Fast modeЦена за 1 млн (вход / выход)SLA по задержке
GPT-5.6 Sol$10 / $60>80 ток/с
GPT-5.6 Terra$4 / $24>70 ток/с
GPT-5.6 Luna$0.40 / $2.40>100 ток/с

У Luna самая высокая нижняя граница SLA из трёх моделей. Чтение из кэша снижает цену входных токенов на 90%: для Standard Sol это $0.50/M при TTL примерно 30 минут. Поэтому длительная сессия выгоднее новых запросов на любом уровне. Проверить эти уровни на реальном трафике можно через GPT-5.6 API endpoint, где все три модели доступны через единый интерфейс.

FAQ

Ultrafast mode доступен в ChatGPT или Codex?

Нет. Ultrafast сначала запускается в OpenAI API, а даты появления в ChatGPT или Codex в анонсе нет.

Меняется ли качество ответов GPT-5.6 Sol при работе на Cerebras?

OpenAI позиционирует Ultrafast как тот же GPT-5.6 Sol с более быстрой обработкой, а не как другую модель. Пока есть только заявление Cerebras об ускорении GDP-Val в 5,6 раза без потери качества; независимые бенчмарки этого не подтвердили.

Есть ли у Ultrafast mode SLA по задержке?

Опубликованного SLA нет. Для Fast mode заявлены p50 SLA >80 токенов/с и доступность 99,9% для Enterprise-клиентов; для Ultrafast на этапе превью SLA не указан.

Какие модели поддерживают Ultrafast mode?

Только GPT-5.6 Sol. Terra и Luna поддерживают Fast mode, но в превью Ultrafast не участвуют.

Сколько будет стоить Ultrafast mode?

Официальной цифры нет. Единственный ориентир — опубликованная для Fast mode наценка 2x относительно Standard Sol.