Heim
Der CEO von ElevenLabs prognostiziert, dass Audio-Tools mit künstlicher Intelligenz zu Massenware werden

Mati Staniszewski, CEO und Mitbegründer des KI-Audio-Unternehmens ElevenLabs, gab kürzlich eine aufschlussreiche Erklärung für ein Unternehmen ab, das sich der Entwicklung von KI-Modellen widmet: Er glaubt, dass diese Modelle letztendlich zu einer Massenware werden.
Er teilte diese Sichtweise während einer Diskussion über die Zukunft von KI-Audio auf der TechCrunch Disrupt 2025-Konferenz am Dienstag und skizzierte dabei sowohl seine kurzfristigen als auch seine langfristigen Aussichten für diesen Bereich.
Staniszewski merkte an, dass das Forschungsteam seines Unternehmens wichtige Herausforderungen in der Modellarchitektur erfolgreich bewältigt habe und dass dieser Fokus auf der Entwicklung von Kernmodellen auch in den nächsten ein bis zwei Jahren Priorität haben werde.
„Die Technologie wird sich langfristig – in den nächsten Jahren – zu einer Massenware entwickeln“, prognostizierte Staniszewski. „Auch wenn bei bestimmten Stimmen oder Sprachen weiterhin Unterschiede bestehen, wird sich der allgemeine Abstand bei den Kernfunktionen deutlich verringern.“
Auf die Frage, warum ElevenLabs sich auf die Modellentwicklung konzentrieren würde, wenn diese doch irgendwann zur Massenware werden würde, erklärte Staniszewski, dass sie derzeit „den bedeutendsten Wettbewerbsvorteil und den größten verfügbaren Fortschritt“ darstellten.
Er verwies auf das anhaltende Problem der mangelnden Qualität und Natürlichkeit von KI-Stimmen oder -Interaktionen als ein Problem, für das noch eine Lösung gefunden werden muss.
„Der einzige Weg, dies derzeit zu lösen, ist ... die Entwicklung der Modelle im eigenen Haus. Langfristig werden sich auch andere Akteure dieser Herausforderung stellen“, erklärte Staniszewski.
Er fügte hinzu, dass Nutzer für zuverlässige, skalierbare Anwendungen wahrscheinlich weiterhin spezielle Modelle einsetzen werden, die auf bestimmte Aufgaben zugeschnitten sind.
Mit Blick auf die Zukunft rechnet Staniszewski innerhalb der nächsten zwei Jahre mit einer Veränderung, da immer mehr Modelle multimodale oder fusionierte Architekturen verwenden werden.
„Das bedeutet, dass Sie Audio und Video gleichzeitig generieren oder Audio mit großen Sprachmodellen in einer Konversationsschnittstelle kombinieren können“, sagte er und verwies auf Googles Veo 3 als Beispiel dafür, was integrierte Modelle leisten können.
Der Gründer gab bekannt, dass ElevenLabs Partnerschaften anstrebt und Open-Source-Technologien erforscht, um seine Audiospezialisierung mit den Stärken anderer KI-Modelle zu verbinden.
Die Strategie des Unternehmens bestehe darin, sowohl in die Entwicklung grundlegender Modelle als auch in praktische Anwendungen zu investieren, um dauerhaften Wert zu schaffen.
„Genauso wie die Synergie zwischen Software und Hardware für Apple revolutionär war, glauben wir, dass die Kombination aus Produktdesign und KI die nächste Generation transformativer Anwendungsfälle definieren wird“, schloss er.
Verwandter Artikel
Ollie setzt auf Datenschutz, um das Rennen um den KI-Assistenten zu gewinnen
Um wirklich hilfreich zu sein, muss ein KI-Assistent seinen Nutzer genau verstehen. Ollie, ein für den Alltag konzipierter persönlicher Assistent, basiert auf der Prämisse, dass dies nicht mit der Wei
So wird die „AI LIVE: London“ KI und industrielle Automatisierung beleuchten
Auf dem Gipfel werden Führungskräfte der obersten Ebene aus aller Welt zusammenkommen, um dringende Herausforderungen in globalen Branchen zu erörtern – von KI-getriebenen Umbrüchen bis hin zu wirtsch
Anthropic tritt in den Markt für KI-gestützte Rechtstechnologie ein, während der Wettbewerb zunimmt
Anthropic hat am Dienstag eine Reihe neuer Chatbot-Funktionen vorgestellt, die darauf abzielen, Rechtsanwaltskanzleien automatisierte Unterstützung zu bieten. Diese Verbesserungen erweitern die bereits zu Jahresbeginn eingeführte, mandantenspezifisch
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)

Mati Staniszewski, CEO und Mitbegründer des KI-Audio-Unternehmens ElevenLabs, gab kürzlich eine aufschlussreiche Erklärung für ein Unternehmen ab, das sich der Entwicklung von KI-Modellen widmet: Er glaubt, dass diese Modelle letztendlich zu einer Massenware werden.
Er teilte diese Sichtweise während einer Diskussion über die Zukunft von KI-Audio auf der TechCrunch Disrupt 2025-Konferenz am Dienstag und skizzierte dabei sowohl seine kurzfristigen als auch seine langfristigen Aussichten für diesen Bereich.
Staniszewski merkte an, dass das Forschungsteam seines Unternehmens wichtige Herausforderungen in der Modellarchitektur erfolgreich bewältigt habe und dass dieser Fokus auf der Entwicklung von Kernmodellen auch in den nächsten ein bis zwei Jahren Priorität haben werde.
„Die Technologie wird sich langfristig – in den nächsten Jahren – zu einer Massenware entwickeln“, prognostizierte Staniszewski. „Auch wenn bei bestimmten Stimmen oder Sprachen weiterhin Unterschiede bestehen, wird sich der allgemeine Abstand bei den Kernfunktionen deutlich verringern.“
Auf die Frage, warum ElevenLabs sich auf die Modellentwicklung konzentrieren würde, wenn diese doch irgendwann zur Massenware werden würde, erklärte Staniszewski, dass sie derzeit „den bedeutendsten Wettbewerbsvorteil und den größten verfügbaren Fortschritt“ darstellten.
Er verwies auf das anhaltende Problem der mangelnden Qualität und Natürlichkeit von KI-Stimmen oder -Interaktionen als ein Problem, für das noch eine Lösung gefunden werden muss.
„Der einzige Weg, dies derzeit zu lösen, ist ... die Entwicklung der Modelle im eigenen Haus. Langfristig werden sich auch andere Akteure dieser Herausforderung stellen“, erklärte Staniszewski.
Er fügte hinzu, dass Nutzer für zuverlässige, skalierbare Anwendungen wahrscheinlich weiterhin spezielle Modelle einsetzen werden, die auf bestimmte Aufgaben zugeschnitten sind.
Mit Blick auf die Zukunft rechnet Staniszewski innerhalb der nächsten zwei Jahre mit einer Veränderung, da immer mehr Modelle multimodale oder fusionierte Architekturen verwenden werden.
„Das bedeutet, dass Sie Audio und Video gleichzeitig generieren oder Audio mit großen Sprachmodellen in einer Konversationsschnittstelle kombinieren können“, sagte er und verwies auf Googles Veo 3 als Beispiel dafür, was integrierte Modelle leisten können.
Der Gründer gab bekannt, dass ElevenLabs Partnerschaften anstrebt und Open-Source-Technologien erforscht, um seine Audiospezialisierung mit den Stärken anderer KI-Modelle zu verbinden.
Die Strategie des Unternehmens bestehe darin, sowohl in die Entwicklung grundlegender Modelle als auch in praktische Anwendungen zu investieren, um dauerhaften Wert zu schaffen.
„Genauso wie die Synergie zwischen Software und Hardware für Apple revolutionär war, glauben wir, dass die Kombination aus Produktdesign und KI die nächste Generation transformativer Anwendungsfälle definieren wird“, schloss er.
Ollie setzt auf Datenschutz, um das Rennen um den KI-Assistenten zu gewinnen
Um wirklich hilfreich zu sein, muss ein KI-Assistent seinen Nutzer genau verstehen. Ollie, ein für den Alltag konzipierter persönlicher Assistent, basiert auf der Prämisse, dass dies nicht mit der Wei
So wird die „AI LIVE: London“ KI und industrielle Automatisierung beleuchten
Auf dem Gipfel werden Führungskräfte der obersten Ebene aus aller Welt zusammenkommen, um dringende Herausforderungen in globalen Branchen zu erörtern – von KI-getriebenen Umbrüchen bis hin zu wirtsch
Anthropic tritt in den Markt für KI-gestützte Rechtstechnologie ein, während der Wettbewerb zunimmt
Anthropic hat am Dienstag eine Reihe neuer Chatbot-Funktionen vorgestellt, die darauf abzielen, Rechtsanwaltskanzleien automatisierte Unterstützung zu bieten. Diese Verbesserungen erweitern die bereits zu Jahresbeginn eingeführte, mandantenspezifisch











