Новые голосовые модели OpenAI: GPT-Live-1 и GPT-Live-1 mini
OpenAI представила две новые голосовые модели — GPT-Live-1 и GPT-Live-1 mini, которые, по заявлению компании, обеспечивают более естественные разговоры в реальном времени. Модели работают в режиме полнодуплекса, то есть могут одновременно говорить и слушать, что позволяет пользователям перебивать ассистента и использовать функции вроде живого перевода.
Компания заменяет текущий режим Advanced Voice Mode в ChatGPT на GPT-Live-1 mini по умолчанию. Пользователи платных тарифов получат доступ к более мощной модели GPT-Live-1.
Архитектура и принцип работы
В отличие от предыдущей системы, которая объединяла распознавание речи, языковую модель и синтез голоса в отдельные цепочки, новые модели решают проблемы прерывания пользователя в момент речи и недостаточной глубины ответов. GPT-Live-1 направляет запросы к новейшим текстовым моделям, таким как GPT-5.5, для поиска, логических рассуждений и агентных задач, продолжая при этом диалог.
Модель способна длительное время молчать, накапливая контекст разговора, и активироваться только тогда, когда это необходимо. Благодаря доступу к более новым GPT-моделям, голосовой режим также может представлять информацию в визуальном формате.
Голос как основной интерфейс вычислений
OpenAI считает, что голос может стать главным интерфейсом для работы с компьютером при выполнении сложных задач. Во время презентации руководитель продукта ChatGPT Voice Этти Элети рассказал, что проводил 30–40-минутные разговоры с голосовым ассистентом во время прогулок.
По данным источников, компания может запустить пару наушников с функциями ИИ в этом году, однако деталей о аппаратных продуктах пока не раскрывается.
Конкуренты и рынок голосовых ИИ-ассистентов
OpenAI — не единственная компания, развивающая голосовые возможности. Apple и Amazon обновили своих ассистентов для более естественного диалога и лучшей работы с контекстом. Стартап Sesame, основанный сооснователем Oculus Бренданом Ириби и Анкитом Кумаром, также представил ИИ-ассистентов с более живым общением, выполняющих задачи в фоновом режиме.
Другие игроки рынка также делают ставку на визуальные ответы. Так, стартап Monogram привлёк $40 млн в рамках раунда seed-финансирования от DST и Lux Capital, чтобы сделать ассистентов более интерактивными за счёт визуальных элементов.
Ограничения и меры безопасности
Несмотря на заявления о естественности звучания, новая модель пока имеет заметные недостатки. Во время демонстрации функции живого перевода на хинди ассистент звучал с тяжёлым американским акцентом и говорил на хинди неестественно, с книжной интонацией.
OpenAI подчёркивает, что не стремится превратить голосового ассистента в ИИ-компаньона. В моделях заложены механизмы безопасности, обеспечивающие возрастно-адекватные ответы для подростков, а также ресурсы, если разговор заходит на темы, связанные с Сэмоповреждением. Компания также отмечает, что более 150 миллионов человек используют голосовые и диктовочные функции ChatGPT.
