OpenAI показала Ultrafast: GPT-5.6 Sol работает до 14 раз быстрее
У мощных нейросетей давно есть неприятный компромисс: чем сложнее модель, тем заметнее может становиться ожидание ответа. OpenAI пытается убрать именно это ограничение. Компания показала режим Ultrafast, в котором флагманская GPT-5.6 Sol работает до 14 раз быстрее стандартной обработки и способна генерировать до 750 выходных токенов в секунду. Но обычный ChatGPT от этого пока не стал в 14 раз шустрее.
Ultrafast — это не новая версия GPT-5.6
Самый неочевидный нюанс в названии: Ultrafast не является отдельной облегчённой моделью вроде условной GPT-5.6 Fast. Это новый сервисный режим для существующей GPT-5.6 Sol в OpenAI API. Компания оставляет саму флагманскую модель, но запускает её на инфраструктуре, рассчитанной на очень быстрый вывод ответа.
За технической частью стоит Cerebras. В режиме Ultrafast GPT-5.6 Sol может выдавать до 750 выходных токенов в секунду. OpenAI сравнивает его со стандартным режимом обработки и заявляет ускорение до 14 раз. Для сравнения, ранее появившийся Fast mode для GPT-5.6 Sol обещает ускорение до 2,5 раза относительно Standard. То есть Ultrafast — уже другой класс скорости, а не небольшое уменьшение задержки.
При этом цифру «14 раз» не стоит читать как обещание, что абсолютно любая задача завершится ровно в четырнадцать раз быстрее. На полное время ответа влияют размер запроса, объём генерируемого текста, рассуждение модели, обращения к инструментам и внешним источникам. Особенно заметен Ultrafast должен быть там, где существенную часть ожидания занимает именно генерация большого ответа.
Зачем вообще нужна скорость в сотни токенов в секунду
Для обычного вопроса разница между быстрым и очень быстрым ответом скорее приятна, чем критична. Совсем иначе это выглядит в сервисах, где модель встроена внутрь рабочего процесса и человек или программа ждут её прямо сейчас.
- анализ логов и изменений кода во время технического сбоя;
- исследование меняющихся финансовых данных и подозрительных операций;
- поддержка клиентов и голосовые системы с ответами в реальном времени;
- поиск товаров, проверка наличия и помощь при покупке;
- исследовательские задачи с несколькими последовательными итерациями.
OpenAI уже тестирует Ultrafast внутри компании. Один из сценариев связан с расследованием сбоев: модель быстро читает логи, трассировки и обсуждения инженеров, помогает сформулировать следующую проверку и подготовить вариант исправления. Другой сценарий — исследования, где сокращение ожидания позволяет провести несколько циклов анализа за рабочий день вместо запуска долгой обработки на ночь.
Почему OpenAI не просто сделала GPT-5.6 Sol быстрее для всех
Такая производительность требует отдельной вычислительной инфраструктуры и достаточной доступной мощности. Поэтому Ultrafast пока запускается не как новый стандарт для каждого запроса, а как отдельный уровень обслуживания API. Это позволяет использовать дорогой по ресурсам режим там, где задержка действительно влияет на работу сервиса.
Здесь хорошо видно различие между моделью и инфраструктурой. Пользователь привык сравнивать нейросети по качеству ответов, контексту и возможностям, но скорость исполнения зависит ещё и от того, на каком оборудовании и в каком режиме запускается одна и та же модель. Ultrafast как раз показывает, насколько сильно можно изменить ощущение от GPT-5.6 Sol, не переходя ради скорости на заметно меньшую модель.
В теории это особенно интересно для голосовых помощников и интерактивных сервисов. Когда модель отвечает медленно, даже хороший интеллект ощущается вялым: пользователь сказал фразу, а дальше ждёт. Если сложная модель способна держать темп обычного диалога, появляется совсем другой сценарий использования.
Можно ли включить Ultrafast сейчас
Для большинства пользователей — нет. OpenAI объявила Ultrafast 13 августа 2026 года и запустила его в ограниченном preview для выбранных клиентов. Первой площадкой стал OpenAI API, а расширять доступ компания собирается по мере роста доступной мощности.
Это означает, что переключателя Ultrafast в обычном ChatGPT для всех пользователей сейчас нет. Разработчик с обычным API-доступом тоже не должен рассчитывать, что режим автоматически заработает: сервисный уровень Ultrafast относится к доступу с отдельным контролем.
Поэтому главный результат анонса пока не в том, что все ответы GPT внезапно ускорились в четырнадцать раз. Интереснее другое: OpenAI показывает, что флагманскую модель можно приблизить по отзывчивости к гораздо более лёгким решениям. Если такой режим со временем станет массовее, выбор между «быстро» и «умно» будет уже не таким жёстким, как раньше.
Комментарии
Оставить комментарий
Имя можно не указывать. Все комментарии сначала отправляются на модерацию.