Инвестиции в развитие технологий речи

Стартап Fish Audio, базирующийся в Пало-Альто, объявил о привлечении $52 млн в рамках посевного раунда. Инвестиции возглавили фонды Coreline Ventures и Capital Today. В раунде также приняли участие еще несколько венчурных компаний, включая 359 Capital и Parable.

Компания планирует использовать полученные средства для разработки более совершенных моделей и расширения работы с корпоративными клиентами. Ранее проект существовал в формате небольшого open-source решения и не нуждался во внешнем капитале, но рост интереса со стороны бизнеса потребовал новых ресурсов.

От исследовательского проекта до прибыльного бизнеса

История Fish Audio началась с проекта Шицзя Ляо, бывшего исследователя Nvidia. Его не устраивало низкое качество синтетических голосов на рынке, поэтому он обучил модель генерации голоса на одном графическом процессоре и выложил её в открытый доступ. Репозиторий Fish Speech на GitHub набрал более 31 000 звезд и стал востребован у разработчиков игр и независимых создателей контента.

На сегодняшний день платформой пользуются более 8 миллионов человек. Ежегодная регулярная выручка (ARR) компании составляет $21 млн. За последний год стартап выпустил пять моделей: четыре для генерации речи и одну для преобразования речи в текст.

Разные задачи — разные подходы к голосу

Fish Audio стремится удовлетворить потребности двух разных сегментов рынка. Творческим авторам нужны максимально экспрессивные и эмоциональные голоса. Корпоративным клиентам, использующим ИИ для поддержки или продаж, важна управляемость и точность параметров.

В компании отмечают, что разные индустрии ставят разные задачи. Например, сервисам с ИИ-аватарами нужна реалистичность, игровым студиям — выразительность персонажей, а компаниям, создающим голосовых агентов для звонков, — естественность и минимальная задержка звука.

Проблема авторских прав и защита голосов

Одним из способов наполнения библиотеки голосов является предложение пользователям загружать свои образцы для обучения моделей за вознаграждение. Однако этот метод вызвал споры: некоторые авторы заявили, что их голоса загружали на платформу без их согласия.

В Fish Audio признали проблему и автоматизировали процесс удаления контента. Теперь, если пользователь предоставит доказательства владения голосом, его удалят с платформы менее чем за три минуты. Тем не менее, проблема несанкционированной загрузки чужих голосов остается: пока автор не обнаружит использование своего голоса и не подаст заявку, ИИ будет продолжать его использовать.

Планы на будущее и конкуренция

Рынок генерации речи переполнен такими игроками, как ElevenLabs, Speechify и Cartesia. Чтобы конкурировать с крупными ИИ-лабораториями, Fish Audio делает ставку на детальные настройки для разработчиков и экономичную стоимость обучения моделей.

В ближайших планах компании — выпуск модели для понимания аудио, а также разработка технологии преобразования речи в речь (speech-to-speech).

Что это значит

Fish Audio планирует развивать технологии синтеза речи, создавая специализированные решения как для эмоциональной передачи эмоций в творчестве, так и для эффективной автоматизации бизнес-процессов.