Fish Audio привлёк $52 млн на создание ИИ-голосовых моделей для авторов и корпораций
Рынок ИИ-голосов огромен, и его рост ускоряется с каждым годом. Для творческих применений требуются более выразительные и эмоциональные голосовые модели, способные передавать интонации и акценты. Корпоративным клиентам, автоматизирующим обслуживание клиентов и продажи, нужны управляемые и контролируемые голоса, которые можно настраивать под конкретные бизнес-сценарии. Стартап Fish Audio из Пало-Альто намерен охватить все эти сценарии с помощью своей библиотеки из более чем 15 000 элементов управления естественным языком, позволяющей тонко настраивать параметры синтезируемой речи.
С момента запуска в прошлом году стартап привлёк более 8 миллионов пользователей открытой и облачной версий своих моделей, а также вышел на выручку в 21 миллион долларов годового повторяющегося дохода. Столь впечатляющий рост показывает, насколько востребованы качественные ИИ-голоса на рынке, где доминируют такие игроки, как ElevenLabs и WellSaid.
Для дальнейшего развития во вторник стартап объявил о привлечении 52 миллионов долларов в рамках посевного раунда, возглавленного Coreline Ventures и Capital Today. Это один из крупнейших посевных раундов в сфере ИИ-голосовых технологий. В раунде также участвовали 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners и HF0.
Fish Audio начинался как небольшой проект бывшего исследователя Nvidia Шицзя Ляо, который, разочаровавшись в неестественно звучащих синтезированных голосах на рынке, обучил модель генерации голоса на одном GPU и выложил её в открытый доступ. Репозиторий Fish Speech на GitHub теперь имеет более 31 000 звёзд и активно используется независимыми разработчиками, дизайнерами видеоигр и креаторами по всему миру. Открытый исходный код позволил сообществу быстро адаптировать модель под различные задачи и языки.
За последний год компания выпустила пять моделей: четыре для генерации речи и одну для преобразования речи в текст. Три модели генерации речи были опубликованы в открытом доступе, что способствовало их широкому распространению. Однако последняя модель S2.1 Pro доступна только через платный API — это часть стратегии монетизации, позволяющая компании зарабатывать на корпоративных клиентах, сохраняя привлекательность для сообщества разработчиков.
Fish Audio предлагает ежемесячные планы для авторов контента и команд разработчиков, которые открывают определённое количество минут генерации и функции клонирования голоса. Компания также предлагает корпоративную версию API и платформы, и такие организации, как HeyGen и Sanas, уже активно используют её технологии. HeyGen применяет голоса Fish Audio для озвучивания ИИ-аватаров, а Sanas — для улучшения качества голосовых助手 в колл-центрах.
«У каждого предприятия разные сценарии использования и предпочтения. Например, компании вроде HeyGen, использующие наши голоса для аватаров, хотят максимальной реалистичности; игровые студии хотят выразительных голосов для персонажей с уникальными характерами; а голосовые агенты вроде LiveKit — более естественных и быстрых голосов, достаточно выразительных для естественных разговоров», — рассказала генеральный директор и сооснователь Fish Audio Рисса Цао.
Один из способов создания библиотеки голосов — запись голосов пользователей для обучения моделей с выплатой компенсации, если их голос используется в коммерческих целях. Это привело к проблемам несколько месяцев назад: некоторые авторы утверждали, что их голоса были загружены на платформу без получения соответствующего согласия. У стартапа был процесс DMCA для обработки таких жалоб, но удаление голосов занимало слишком много времени — до нескольких недель.
Цао сообщила TechCrunch, что компания полностью автоматизировала процесс удаления контента по запросу. Теперь авторы могут отправить короткий образец голоса или контракт, доказывающий, что голос принадлежит им, и их голос будет удалён с платформы менее чем за три минуты. Это значительное улучшение по сравнению с предыдущим процессом, который мог затягиваться на недели.
Тем не менее это не решает фундаментальную проблему: любой может загрузить голос исполнителя без его ведома. И пока исполнитель не узнает об этом самостоятельно, его голос будет продолжать использоваться на платформе, пока он не подаст официальную заявку на удаление. Это остаётся серьёзным этическим вопросом для всей индустрии ИИ-генерации голоса.
Осуке Хонда, партнёр Coreline Ventures, отметил, что модель, основанная на сообществе, работает только тогда, когда создатели доверяют платформе. «Доверие — это фундамент любой платформы, работающей с пользовательским контентом. Fish Audio проделала большую работу по автоматизации процессов, но предстоит сделать ещё больше», — добавил он.
Цао рассказала, что когда стартап предлагал только открытый продукт с планами для авторов, он работал эффективно и не нуждался во внешнем финансировании. Однако компания захотела разработать более продвинутые модели и адаптироваться под корпоративных клиентов, а интерес инвесторов к сфере ИИ-голосов значительно вырос, что и привело к привлечению капитала.
В планах Fish Audio — выпустить модель понимания аудио (audio understanding) в этом году, а также построить модель прямого преобразования «речь-в-речь» с сохранением эмоциональной окраски. Эти технологии позволят компании выйти за рамки простой генерации речи и создать полноценные диалоговые системы.
Рынок генерации речи становится всё более конкурентным. Такие компании, как ElevenLabs, WellSaid, Cartesia, Speechify, Async (ранее Podcastle) и Krisp, активно борются за бюджеты авторов контента и корпоративных клиентов. Каждая из них предлагает свои уникальные возможности: от сверхреалистичных голосов до специализированных решений для конкретных отраслей.
По словам Рико Маллоцци, партнёра 359 Capital, тонкая настройка для разработчиков и экономичное обучение моделей помогут Fish Audio лучше конкурировать с крупными ИИ-лабораториями, располагающими значительно большими бюджетами.
«Я думаю, то, что им удалось построить — модели мирового уровня с той небольшой командой, которая у них есть, — по сравнению с некоторыми другими хорошо финансируемыми ИИ-лабораториями, это невероятно. Это показывает их техническое мастерство в сокращении разрыва между искусственно звучащими и по-настоящему человеческими голосами», — отметил Маллоцци в интервью TechCrunch.
