Технологическая индустрия

Новая модель речи v4 от ElevenLabs поддерживает расширенные возможности управления выражением лица и 90 языков.

Главный редакторAMP · Быстрое чтение

В понедельник компания ElevenLabs представила две новые модели распознавания речи, получившие названия ElevenLabs v4 и v4 Turbo. Они предлагают более широкий контроль над выражением лица, меньшую задержку для голосовых агентов и поддержку более 90 языков.

Компания выпустила свою модель v3 в прошлом году и представила её на мероприятии в Варшаве в начале этого года . Для моделей поколения v4 ElevenLabs использует новую архитектуру, которая обеспечивает лучший контроль и более быстрое клонирование. Компания заявила, что с v4 пользователи смогут клонировать голос, используя всего 10 секунд аудиозаписи.

С творческой точки зрения, модель лучше справляется с идентификацией голоса на более длинных фрагментах текста. Она также учитывает контекст текста при чтении вслух, чтобы изменять выражения. В версии 3 ElevenLabs представила встроенные теги для определения выражений, а в версии 4 расширяет их возможности, позволяя пользователям размещать несколько тегов друг над другом, и модель будет следовать этой последовательности.

Предыдущая версия поддерживала 70 языков, и компания ElevenLabs работала над тем, чтобы увеличить это число до 90 языков в новой версии. Стартап заявил, что наибольший прирост качества наблюдался в японском, бразильском португальском, мандаринском и кантонском языках.

За последний год компания ElevenLabs стремительно расширила свой бизнес в сфере корпоративных звонков, и более 55% её заказов приходится на крупные компании . Компания заявила, что новая модель подходит для голосовых агентов, поскольку новая версия имеет меньшую задержку, что позволяет вести более плавный разговор. Кроме того, версия 4 может начать генерировать аудио, как только LLM-система, лежащая в её основе, начнет генерировать ответы. Более того, модель также может по-разному обрабатывать конфликты, эскалации и удержания для более эффективного решения проблем.

Конкуренция в области моделей речи усилилась, поскольку такие стартапы, как Cartesia, Deepgram, Fish Audio, Boson и WellSaid Labs, создали выразительные модели речи. Крупные компании, такие как Google и OpenAI, также улучшили свои голосовые модели.

В начале этого года ElevenLabs привлекла 500 миллионов долларов от Sequoia в рамках раунда финансирования, возглавленного Sequoia, который оценил компанию в 11 миллиардов долларов. Уже ходят слухи о последующем раунде привлечения средств, который оценит компанию в 22 миллиарда долларов. Годовая выручка ElevenLabs выросла с примерно 330 миллионов долларов в начале года до более чем 600 миллионов долларов. Компания активно нанимает персонал на различных рынках, таких как Индия, Европа и Бразилия, и ее штат достиг более 800 человек.

В недавнем интервью соучредитель и генеральный директор компании Мати Станишевски заявил , что компания планирует провести IPO «в ближайшие годы», но не назвал конкретных сроков.