Новый уровень скорости для GPT-5.6 Sol
Компания Cerebras объявила о запуске нового уровня обслуживания под названием Ultrafast для флагманской модели OpenAI GPT-5.6 Sol. Этот сервис обеспечивает скорость генерации до 750 токенов в секунду, что, по данным OpenAI, в 14 раз быстрее стандартной обработки данных.
На данный момент Ultrafast доступен в OpenAI API в режиме ограниченного предварительного просмотра для избранной группы клиентов. Доступ будет расширяться по мере роста вычислительных мощностей компании.
Превосходство в тестах производительности
Согласно результатам собственных испытаний Cerebras, модель GPT-5.6 Sol на платформе Ultrafast демонстрирует значительное преимущество перед конкурентами. В сравнении с показателями Artificial Analysis, скорость работы модели в 11 раз выше, чем у Claude Fable 5, и в 5 раз выше, чем у Opus 4.8 в быстром режиме.
В сложном тесте Humanity’s Last Exam, состоящем из 2500 вопросов уровня PhD, модель на чипах Cerebras справилась со всеми задачами за 11 часов 11 минут. Для сравнения: Claude Fable 5 потребовалось на это почти 78 часов 27 минут.
Также компания провела тестирование на бенчмарке GDP-Val, предназначенном для оценки знаний в экономически значимых сферах. Результаты показали ускорение в 5,6 раза по сравнению со стандартной обработкой без потери качества ответов.
Технология Wafer-Scale Engine
Высокая скорость работы достигается за счет архитектуры чипов Cerebras. В отличие от традиционных GPU, где данные постоянно перемещаются между памятью и процессором, создавая задержки, технология Wafer-Scale Engine размещает 44 ГБ памяти SRAM непосредственно на одном чипе размером с целую пластину.
Это позволяет хранить веса модели прямо на кристалле, обеспечивая непрерывный поток токенов через слои процессора. Такой подход решает проблему пропускной способности памяти, которая является основным ограниem при работе с крупными моделями, и позволяет масштабировать скорость по мере роста сложности ИИ.
Партнерство OpenAI и Cerebras
Запуск Ultrafast стал важным этапом сотрудничества компаний. Ранее в 2026 году OpenAI выделила 10 миллиардов долларов на закупку вычислительных мощностей у Cerebras с низкой задержкой. Теперь эти мощности используются для работы самой мощной модели в линейке OpenAI — GPT-5.6 Sol.
OpenAI позиционирует этот уровень для критически важных задач, требующих мгновенной реакции: оперативного реагирования на инциденты, финансовых исследований в реальном времени и голосового сопровождения клиентов. Среди первых пользователей сервиса значатся компании из сфер программирования, коммерции и финансов, включая Jane Street и Podium.
Что это значит
Запуск Ultrafast позволяет использовать самые мощные модели OpenAI в продуктах реального времени, где критически важна скорость ответа, а не только глубина знаний.
