Дом
Генеральный директор ElevenLabs прогнозирует, что аудиоинструменты на базе искусственного интеллекта станут товарами широкого потребления

Мати Станишевски, генеральный директор и соучредитель компании ElevenLabs, занимающейся разработкой аудиотехнологий на базе искусственного интеллекта, недавно сделал откровенное заявление для компании, специализирующейся на создании моделей искусственного интеллекта: он считает, что в конечном итоге эти модели станут товаром широкого потребления.
Он поделился этой точкой зрения во время обсуждения будущего искусственного интеллекта в области аудио на конференции TechCrunch Disrupt 2025 во вторник, изложив свои краткосрочные и долгосрочные прогнозы для этой области.
Станишевски отметил, что исследовательская команда его компании успешно справилась с ключевыми проблемами в архитектуре моделей, и эта ориентация на разработку базовых моделей останется приоритетом на ближайшие год-два.
«В долгосрочной перспективе — в течение следующих нескольких лет — эта технология станет товаром широкого потребления», — прогнозирует Станишевски. «Даже если различия в определенных голосах или языках сохранятся, общий разрыв в основных возможностях значительно сократится».
На вопрос, почему ElevenLabs сосредоточится на создании моделей, если они обречены стать товаром широкого потребления, Станишевски пояснил, что на данный момент они представляют собой «наиболее значительное конкурентное преимущество и самый существенный доступный скачок вперед».
Он упомянул о постоянной проблеме качества и естественности голосов или взаимодействий ИИ, которая по-прежнему требует решения.
«Единственный путь к решению этой проблемы в настоящее время — это... разработка моделей собственными силами. В долгосрочной перспективе другие игроки также займутся решением этой проблемы», — пояснил Станишевски.
Он добавил, что для надежных и масштабируемых приложений пользователи, вероятно, будут продолжать использовать специализированные модели, адаптированные к конкретным задачам.
Глядя в будущее, Станишевски прогнозирует изменения в течение следующих двух лет, когда все больше моделей будут использовать мультимодальные или объединенные архитектуры.
«Это означает, что вы будете генерировать аудио и видео одновременно или комбинировать аудио с большими языковыми моделями в диалоговом интерфейсе», — сказал он, указав на Veo 3 от Google как пример того, чего могут достичь интегрированные модели.
Основатель компании рассказал, что ElevenLabs намерена налаживать партнерские отношения и изучать технологии с открытым исходным кодом, чтобы объединить свою специализацию в области аудио с преимуществами других моделей искусственного интеллекта.
По его словам, стратегия компании заключается в инвестировании как в разработку базовых моделей, так и в практические приложения для создания долгосрочной ценности.
«Так же, как синергия между программным и аппаратным обеспечением была революционной для Apple, мы считаем, что сочетание дизайна продукта и ИИ определит следующее поколение трансформационных вариантов использования», — заключил он.
Связанная статья
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Олли делает ставку на приватность, чтобы выиграть гонку за лидерство в сфере ИИ-помощников
Чтобы быть по-настоящему полезным, ИИ-помощник должен глубоко понимать своего пользователя. Ollie — личный помощник, разработанный для повседневной жизни, — работает по принципу, согласно которому для
Как на мероприятии AI LIVE: London будут рассматриваться темы искусственного интеллекта и промышленной автоматизации
На саммите соберутся руководители высшего звена со всего мира, чтобы обсудить актуальные проблемы мировых отраслей — от радикальных изменений, вызванных искусственным интеллектом, до экономической нес
Рекомендации по связанным специальным темам
Комментарии (0)

Мати Станишевски, генеральный директор и соучредитель компании ElevenLabs, занимающейся разработкой аудиотехнологий на базе искусственного интеллекта, недавно сделал откровенное заявление для компании, специализирующейся на создании моделей искусственного интеллекта: он считает, что в конечном итоге эти модели станут товаром широкого потребления.
Он поделился этой точкой зрения во время обсуждения будущего искусственного интеллекта в области аудио на конференции TechCrunch Disrupt 2025 во вторник, изложив свои краткосрочные и долгосрочные прогнозы для этой области.
Станишевски отметил, что исследовательская команда его компании успешно справилась с ключевыми проблемами в архитектуре моделей, и эта ориентация на разработку базовых моделей останется приоритетом на ближайшие год-два.
«В долгосрочной перспективе — в течение следующих нескольких лет — эта технология станет товаром широкого потребления», — прогнозирует Станишевски. «Даже если различия в определенных голосах или языках сохранятся, общий разрыв в основных возможностях значительно сократится».
На вопрос, почему ElevenLabs сосредоточится на создании моделей, если они обречены стать товаром широкого потребления, Станишевски пояснил, что на данный момент они представляют собой «наиболее значительное конкурентное преимущество и самый существенный доступный скачок вперед».
Он упомянул о постоянной проблеме качества и естественности голосов или взаимодействий ИИ, которая по-прежнему требует решения.
«Единственный путь к решению этой проблемы в настоящее время — это... разработка моделей собственными силами. В долгосрочной перспективе другие игроки также займутся решением этой проблемы», — пояснил Станишевски.
Он добавил, что для надежных и масштабируемых приложений пользователи, вероятно, будут продолжать использовать специализированные модели, адаптированные к конкретным задачам.
Глядя в будущее, Станишевски прогнозирует изменения в течение следующих двух лет, когда все больше моделей будут использовать мультимодальные или объединенные архитектуры.
«Это означает, что вы будете генерировать аудио и видео одновременно или комбинировать аудио с большими языковыми моделями в диалоговом интерфейсе», — сказал он, указав на Veo 3 от Google как пример того, чего могут достичь интегрированные модели.
Основатель компании рассказал, что ElevenLabs намерена налаживать партнерские отношения и изучать технологии с открытым исходным кодом, чтобы объединить свою специализацию в области аудио с преимуществами других моделей искусственного интеллекта.
По его словам, стратегия компании заключается в инвестировании как в разработку базовых моделей, так и в практические приложения для создания долгосрочной ценности.
«Так же, как синергия между программным и аппаратным обеспечением была революционной для Apple, мы считаем, что сочетание дизайна продукта и ИИ определит следующее поколение трансформационных вариантов использования», — заключил он.
Олли делает ставку на приватность, чтобы выиграть гонку за лидерство в сфере ИИ-помощников
Чтобы быть по-настоящему полезным, ИИ-помощник должен глубоко понимать своего пользователя. Ollie — личный помощник, разработанный для повседневной жизни, — работает по принципу, согласно которому для
Как на мероприятии AI LIVE: London будут рассматриваться темы искусственного интеллекта и промышленной автоматизации
На саммите соберутся руководители высшего звена со всего мира, чтобы обсудить актуальные проблемы мировых отраслей — от радикальных изменений, вызванных искусственным интеллектом, до экономической нес











