Heim
Tencents Li Yutao zum Live-Stream der Weltmeisterschaft: Debüt der großflächigen KI-Produktion und Cloud-Anbieter drängen in den multimodalen Bereich

Tencent Cloud diente als technisches Rückgrat für die kürzlich in den USA, Kanada und Mexiko stattfindende FIFA-Weltmeisterschaft und ermöglichte offizielle Übertragungen in 17 Ländern und Regionen. Diese Berichterstattung erreichte zwei Drittel aller autorisierten Plattformen in den asiatisch-pazifischen und inländischen Märkten. Li Yutao, Vizepräsident von Tencent Cloud und Leiter der Internationalen Produkttechnologie, betonte in einem kürzlichen Interview, dass KI in einem nie dagewesenen Maßstab für die Live-Produktion eingesetzt wurde. Schlüsselprozesse – darunter Bildverbesserung, intelligente Regie, automatisches Schneiden, intelligente Umwandlung von horizontal nach vertikal, Qualitätsprüfung und Rückverfolgbarkeit – wurden vollständig automatisiert. Diese Unterstützung für ein einzelnes Weltmeisterschaftsereignis ist nur ein Aspekt des Übergangs von AIGC zur großflächigen Produktion.
Li Yutao beschreibt den Ansatz von Tencent Cloud im multimodalen Bereich als „Harness“. Statt sich ausschließlich darauf zu konzentrieren, wie Modelle Inhalte generieren, liegt der Schwerpunkt der Strategie auf der gesamten Lieferkette von der Generierung bis zur stabilen Auslieferung an den Benutzer. Dies umfasst Vorverarbeitung, Qualitätsprüfung, Zusammenführung, Codierung, Verteilung und Formatanpassung.
Er bemerkte, dass generative KI mehrere Herausforderungen für Multimedia-Anwendungen eingeführt hat, insbesondere im Live-Streaming, On-Demand-Ansehen, der Medienproduktion und interaktiven Szenarien. Diese sind durch Netzwerkinfrastruktur, Videoqualität, Benutzererfahrung und die Integration verschiedener Funktionen eingeschränkt, was es schwierig macht, alle Probleme mit einem einzigen Modell zu lösen. Viele Anbieter versuchen, jedes neue multimodale Großmodell so schnell wie möglich anzubinden, was zu Integrationsproblemen und unvermeidbaren technischen Hürden führt. Wenn die meisten Unternehmen mit ähnlichen Herausforderungen konfrontiert sind, entsteht aus dem Kundenfeedback eine gemeinsame Anforderung: Es besteht Bedarf an einem Anbieter, der die zugrunde liegenden Aufgaben übernimmt, sodass sich Unternehmen auf Innovation und höherwertige Anwendungen konzentrieren können. Die Identifizierung von Benutzerbedürfnissen, die Auswahl geeigneter Modelle, die Behebung inhärenter Mängel und die Bereitstellung endgültiger Dienste für Benutzer sind die Kernherausforderungen, die ein Video- und Audio-PaaS-Cloud-Anbieter lösen muss.
Am 5. Juni, auf der Tencent Cloud AI Industrial Application Conference, stellte das Unternehmen seine AI-Marke „Tencent Cloud WAND“ vor. Diese Initiative umfasst sechs eigenentwickelte, medienspezifische Modelle und über 60 KI-Funktionen, die den gesamten Pipeline-Prozess der Inhaltsgenerierung, -verständnis, -verarbeitung und -codierung abdecken. Diese Tools sind speziell für vertikale Szenarien wie E-Commerce, Kurzfilme, Bildung und Sport-Livestreaming trainiert. Li Yutao erklärte, dass das Team alle Modelle integriert, einschließlich großer Sprachmodelle, multimodaler Modelle und kleiner Parametermodelle für Bildverbesserung oder spezifische Anwendungen. Die Arbeiten am multimodalen Harness begannen im vergangenen Jahr, parallel zum Aufkommen generativer Videomodelle und einem wachsenden branchenweiten Konsens über das Harness-Konzept.
Die Videogenerierung wird weithin als das zweite KI-Transformations-Szenario angesehen, das nach dem KI-Codeing einen geschlossenen kommerziellen Kreislauf erreicht hat. Seit Anfang dieses Jahres hat sich der Wettbewerb in den Szenarien großer Videomodelle beschleunigt und die Marktstrukturen erheblich verändert. Inländische Anbieter schreiten in der Kommerzialisierung rasch voran, wobei ByteDance’s Seedance und Kuaishou’s KeLing AI ein Duopol im Markt für die KI-Videogenerierung bilden. Öffentliche Daten zeigen, dass der jährliche wiederkehrende Umsatz (ARR) von KeLing AI bis März 500 Millionen US-Dollar erreichte, was einem vierfachen Wachstum innerhalb eines Jahres entspricht. Andere Berichte deuteten darauf hin, dass der ARR von Seedance 2.0 bis zur Jahresmitte 2 Milliarden US-Dollar erreichte. Obwohl ByteDance die Umsatzangaben als „übertrieben hoch und nicht mit der Realität übereinstimmend“ zurückwies, bestätigte sie, dass Seedance 2.0 den „Produktivitätswendepunkt“ überschritten hat. In Übersee-Märkten kündigte OpenAI im März an, dass sie ihre eigenständige App, die API-Schnittstelle und die in ChatGPT integrierten Videofunktionen für Sora einstellen wird, was faktisch einem Rückzug aus dem Verbrauchermarkt für die KI-Videogenerierung entspricht.
Bei der Entwicklung von To-B-Produkten und -Lösungen ist die ökologische Zusammenarbeit Li Yutao’s oberste strategische Priorität. Er räumte ein, dass sein Team debattiert hat, ob die Rolle des Harness möglicherweise ignoriert oder umgangen wird, da die Verbindung zwischen Generierung und Interaktion kürzer wird. Seine Einschätzung, basierend auf sechs Monaten Beobachtung, ist, dass dies nicht geschehen wird; vielmehr könnte die Bedeutung des Harness zunehmen. Wenn große Modelle die Produktivität im Backend darstellen, werden ihre Effizienzgewinne die Nachfrage nach Frontend-Anwendungen erheblich stimulieren. Das Ausmaß des Nachfragewachstums wird immer schneller sein als die Verbesserungen der Produktivität, was bedeutet, dass große Modelle die Bedürfnisse der Endbenutzer niemals vollständig erfüllen können. Diese anhaltende „Angebots-Nachfrage-Lücke“ unterstreicht die Notwendigkeit des Harness.
Li Yutao identifiziert zwei große Chancen für Tencent Cloud im Bereich des multimodalen Harness. Erstens erfordern viele Video- und Audio-Szenarien ein Umdenken. Zweitens liegt die Herausforderung, wenn leistungsfähigere und umfassendere Modelle entstehen, darin, sie schnell in unternehmenskritische Produktionsdienste einzubinden und das neueste große Modellerlebnis an Endbenutzer auszuliefern. Die kontinuierliche Integration der neuesten Modelle für Kunden und die Verwaltung des gesamten Produktionsprozesses und der Toolchain sind kritische Ziele des multimodalen Harness.
Seit dem vergangenen Jahr hat sich die KI-Berechnungsleistung vom Training auf das Inference verschoben. Viele Unternehmen geben jetzt mehr für Inference aus als für Training, was darauf hindeutet, dass zahlreiche AIGC-Anwendungen in die großflächige Produktion eintreten. In China sind Kurzfilme und animierte Serien typische Szenarien, in denen multimodale Technologien weit verbreitet für die Produktion eingesetzt werden. In der asiatisch-pazifischen Region dienen Video- und Audio-Lösungen als „Frontlinie“ von Tencent Clouds internationaler Expansion und führen in Umsatz, Marktanteil und Branchenbekanntheit. In den vergangenen fünf Jahren hat Tencent Cloud die Internationalisierung priorisiert und erhebliche Investitionen in Geschäftsmittel und Infrastruktur im Ausland getätigt. Das Unternehmen gab bekannt, dass sein Übersee-Geschäft in den letzten drei Jahren ein zweistelliges Wachstum aufrechterhalten hat.
Li Zhicheng, General Manager von Tencent Cloud Video and Audio, bemerkte, dass Kunden zunächst Wirksamkeit und Einfluss priorisieren, sich später jedoch auf die ROI – spezifisch, ob die Technologie Gewinn generiert und Wert schafft – konzentrieren, unabhängig davon, ob es sich um Kurzfilme, animierte Serien, E-Commerce oder toolbasierte Szenarien handelt. Die häufigsten Anfragen betreffen derzeit Kurzfilme und E-Commerce-Tools, die in den nächsten 1-2 Jahren weit verbreitet sein werden. Viele Benutzer und Unternehmen werden diese Technologien übernehmen, ähnlich wie große Sprachmodelle, die einst auf vertikale Branchen beschränkt waren, aber heute allgegenwärtig und integraler Bestandteil der täglichen Arbeit sind.
Mit dem Aufkommen der Agent-Ära werden die Fähigkeiten von Tencent Cloud in Video- und Audio-Intelligenz, KI-Hardware, verkörperte Roboter und Cloud-Telefone integriert. Durch die Nutzung globaler Infrastruktur und Edge-Inference werden diese Lösungen die schnelle globale Bereitstellung von KI-Anwendungen unterstützen. Li Yutao erwähnte, dass das Team mit mehreren Unternehmen der verkörperten Intelligenz und autonomen Reinigungsfahrzeuge, wie Zhuji, zusammengearbeitet hat, um TRRO-Remote-Echtzeitsteuerung (eine Remote-Digitalmensch-Lösung) zu entwickeln. Dies adressiert Kernprobleme wie latenzarme stabile Kommunikation und Audio-Video-Datenübertragung während manueller Eingriffe unter schwachen Netzwerkbedingungen.
Mit Blick auf die Zukunft skizziert Li Yutao drei Schlüsselrichtungen für den Wettbewerb zwischen Cloud-Anbietern im multimodalen Bereich. Erstens ist dies multimodales Training und Berechnungsleistung. Im Gegensatz zum Training von Sprachmodellen fließt ein erheblicher Teil der Investitionen im multimodalen Bereich in das Verständnis und die Generierung von Inhalten. Zukünftige End-to-End-Stimminteraktionen und Videogenerierung werden erhebliche Berechnungsleistungen und Infrastrukturinvestitionen von Cloud-Anbietern erfordern. Zweitens sind dies Speicher und Datenakkumulation. Multimedia erfordert höhere Speicherkapazitäten als Text, mit unterschiedlichen Anforderungen an Stabilität, Datenbereinigung und -beschaffung. Große Mengen an Videodaten müssen vor dem Pre-Training bereinigt und verarbeitet werden, und die Kombination verschiedener Modalitäten umfasst Verarbeitungsschritte, die sich erheblich von textbasierten Aufgaben unterscheiden. Drittens ist dies die Anwendungsproduktionsseite. Cloud-Anbieter, die Endbenutzer-orientierte Inference-Dienste und umfassende Verarbeitungsfähigkeiten anbieten, sind entscheidende Faktoren bei der Kundenwahl. Die effektive Erfüllung der durch operative Innovationstrends getriebenen Kundenanforderungen ist für Tencent Cloud ebenfalls von entscheidender Bedeutung.
Verwandter Artikel
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird
Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)

Tencent Cloud diente als technisches Rückgrat für die kürzlich in den USA, Kanada und Mexiko stattfindende FIFA-Weltmeisterschaft und ermöglichte offizielle Übertragungen in 17 Ländern und Regionen. Diese Berichterstattung erreichte zwei Drittel aller autorisierten Plattformen in den asiatisch-pazifischen und inländischen Märkten. Li Yutao, Vizepräsident von Tencent Cloud und Leiter der Internationalen Produkttechnologie, betonte in einem kürzlichen Interview, dass KI in einem nie dagewesenen Maßstab für die Live-Produktion eingesetzt wurde. Schlüsselprozesse – darunter Bildverbesserung, intelligente Regie, automatisches Schneiden, intelligente Umwandlung von horizontal nach vertikal, Qualitätsprüfung und Rückverfolgbarkeit – wurden vollständig automatisiert. Diese Unterstützung für ein einzelnes Weltmeisterschaftsereignis ist nur ein Aspekt des Übergangs von AIGC zur großflächigen Produktion.
Li Yutao beschreibt den Ansatz von Tencent Cloud im multimodalen Bereich als „Harness“. Statt sich ausschließlich darauf zu konzentrieren, wie Modelle Inhalte generieren, liegt der Schwerpunkt der Strategie auf der gesamten Lieferkette von der Generierung bis zur stabilen Auslieferung an den Benutzer. Dies umfasst Vorverarbeitung, Qualitätsprüfung, Zusammenführung, Codierung, Verteilung und Formatanpassung.
Er bemerkte, dass generative KI mehrere Herausforderungen für Multimedia-Anwendungen eingeführt hat, insbesondere im Live-Streaming, On-Demand-Ansehen, der Medienproduktion und interaktiven Szenarien. Diese sind durch Netzwerkinfrastruktur, Videoqualität, Benutzererfahrung und die Integration verschiedener Funktionen eingeschränkt, was es schwierig macht, alle Probleme mit einem einzigen Modell zu lösen. Viele Anbieter versuchen, jedes neue multimodale Großmodell so schnell wie möglich anzubinden, was zu Integrationsproblemen und unvermeidbaren technischen Hürden führt. Wenn die meisten Unternehmen mit ähnlichen Herausforderungen konfrontiert sind, entsteht aus dem Kundenfeedback eine gemeinsame Anforderung: Es besteht Bedarf an einem Anbieter, der die zugrunde liegenden Aufgaben übernimmt, sodass sich Unternehmen auf Innovation und höherwertige Anwendungen konzentrieren können. Die Identifizierung von Benutzerbedürfnissen, die Auswahl geeigneter Modelle, die Behebung inhärenter Mängel und die Bereitstellung endgültiger Dienste für Benutzer sind die Kernherausforderungen, die ein Video- und Audio-PaaS-Cloud-Anbieter lösen muss.
Am 5. Juni, auf der Tencent Cloud AI Industrial Application Conference, stellte das Unternehmen seine AI-Marke „Tencent Cloud WAND“ vor. Diese Initiative umfasst sechs eigenentwickelte, medienspezifische Modelle und über 60 KI-Funktionen, die den gesamten Pipeline-Prozess der Inhaltsgenerierung, -verständnis, -verarbeitung und -codierung abdecken. Diese Tools sind speziell für vertikale Szenarien wie E-Commerce, Kurzfilme, Bildung und Sport-Livestreaming trainiert. Li Yutao erklärte, dass das Team alle Modelle integriert, einschließlich großer Sprachmodelle, multimodaler Modelle und kleiner Parametermodelle für Bildverbesserung oder spezifische Anwendungen. Die Arbeiten am multimodalen Harness begannen im vergangenen Jahr, parallel zum Aufkommen generativer Videomodelle und einem wachsenden branchenweiten Konsens über das Harness-Konzept.
Die Videogenerierung wird weithin als das zweite KI-Transformations-Szenario angesehen, das nach dem KI-Codeing einen geschlossenen kommerziellen Kreislauf erreicht hat. Seit Anfang dieses Jahres hat sich der Wettbewerb in den Szenarien großer Videomodelle beschleunigt und die Marktstrukturen erheblich verändert. Inländische Anbieter schreiten in der Kommerzialisierung rasch voran, wobei ByteDance’s Seedance und Kuaishou’s KeLing AI ein Duopol im Markt für die KI-Videogenerierung bilden. Öffentliche Daten zeigen, dass der jährliche wiederkehrende Umsatz (ARR) von KeLing AI bis März 500 Millionen US-Dollar erreichte, was einem vierfachen Wachstum innerhalb eines Jahres entspricht. Andere Berichte deuteten darauf hin, dass der ARR von Seedance 2.0 bis zur Jahresmitte 2 Milliarden US-Dollar erreichte. Obwohl ByteDance die Umsatzangaben als „übertrieben hoch und nicht mit der Realität übereinstimmend“ zurückwies, bestätigte sie, dass Seedance 2.0 den „Produktivitätswendepunkt“ überschritten hat. In Übersee-Märkten kündigte OpenAI im März an, dass sie ihre eigenständige App, die API-Schnittstelle und die in ChatGPT integrierten Videofunktionen für Sora einstellen wird, was faktisch einem Rückzug aus dem Verbrauchermarkt für die KI-Videogenerierung entspricht.
Bei der Entwicklung von To-B-Produkten und -Lösungen ist die ökologische Zusammenarbeit Li Yutao’s oberste strategische Priorität. Er räumte ein, dass sein Team debattiert hat, ob die Rolle des Harness möglicherweise ignoriert oder umgangen wird, da die Verbindung zwischen Generierung und Interaktion kürzer wird. Seine Einschätzung, basierend auf sechs Monaten Beobachtung, ist, dass dies nicht geschehen wird; vielmehr könnte die Bedeutung des Harness zunehmen. Wenn große Modelle die Produktivität im Backend darstellen, werden ihre Effizienzgewinne die Nachfrage nach Frontend-Anwendungen erheblich stimulieren. Das Ausmaß des Nachfragewachstums wird immer schneller sein als die Verbesserungen der Produktivität, was bedeutet, dass große Modelle die Bedürfnisse der Endbenutzer niemals vollständig erfüllen können. Diese anhaltende „Angebots-Nachfrage-Lücke“ unterstreicht die Notwendigkeit des Harness.
Li Yutao identifiziert zwei große Chancen für Tencent Cloud im Bereich des multimodalen Harness. Erstens erfordern viele Video- und Audio-Szenarien ein Umdenken. Zweitens liegt die Herausforderung, wenn leistungsfähigere und umfassendere Modelle entstehen, darin, sie schnell in unternehmenskritische Produktionsdienste einzubinden und das neueste große Modellerlebnis an Endbenutzer auszuliefern. Die kontinuierliche Integration der neuesten Modelle für Kunden und die Verwaltung des gesamten Produktionsprozesses und der Toolchain sind kritische Ziele des multimodalen Harness.
Seit dem vergangenen Jahr hat sich die KI-Berechnungsleistung vom Training auf das Inference verschoben. Viele Unternehmen geben jetzt mehr für Inference aus als für Training, was darauf hindeutet, dass zahlreiche AIGC-Anwendungen in die großflächige Produktion eintreten. In China sind Kurzfilme und animierte Serien typische Szenarien, in denen multimodale Technologien weit verbreitet für die Produktion eingesetzt werden. In der asiatisch-pazifischen Region dienen Video- und Audio-Lösungen als „Frontlinie“ von Tencent Clouds internationaler Expansion und führen in Umsatz, Marktanteil und Branchenbekanntheit. In den vergangenen fünf Jahren hat Tencent Cloud die Internationalisierung priorisiert und erhebliche Investitionen in Geschäftsmittel und Infrastruktur im Ausland getätigt. Das Unternehmen gab bekannt, dass sein Übersee-Geschäft in den letzten drei Jahren ein zweistelliges Wachstum aufrechterhalten hat.
Li Zhicheng, General Manager von Tencent Cloud Video and Audio, bemerkte, dass Kunden zunächst Wirksamkeit und Einfluss priorisieren, sich später jedoch auf die ROI – spezifisch, ob die Technologie Gewinn generiert und Wert schafft – konzentrieren, unabhängig davon, ob es sich um Kurzfilme, animierte Serien, E-Commerce oder toolbasierte Szenarien handelt. Die häufigsten Anfragen betreffen derzeit Kurzfilme und E-Commerce-Tools, die in den nächsten 1-2 Jahren weit verbreitet sein werden. Viele Benutzer und Unternehmen werden diese Technologien übernehmen, ähnlich wie große Sprachmodelle, die einst auf vertikale Branchen beschränkt waren, aber heute allgegenwärtig und integraler Bestandteil der täglichen Arbeit sind.
Mit dem Aufkommen der Agent-Ära werden die Fähigkeiten von Tencent Cloud in Video- und Audio-Intelligenz, KI-Hardware, verkörperte Roboter und Cloud-Telefone integriert. Durch die Nutzung globaler Infrastruktur und Edge-Inference werden diese Lösungen die schnelle globale Bereitstellung von KI-Anwendungen unterstützen. Li Yutao erwähnte, dass das Team mit mehreren Unternehmen der verkörperten Intelligenz und autonomen Reinigungsfahrzeuge, wie Zhuji, zusammengearbeitet hat, um TRRO-Remote-Echtzeitsteuerung (eine Remote-Digitalmensch-Lösung) zu entwickeln. Dies adressiert Kernprobleme wie latenzarme stabile Kommunikation und Audio-Video-Datenübertragung während manueller Eingriffe unter schwachen Netzwerkbedingungen.
Mit Blick auf die Zukunft skizziert Li Yutao drei Schlüsselrichtungen für den Wettbewerb zwischen Cloud-Anbietern im multimodalen Bereich. Erstens ist dies multimodales Training und Berechnungsleistung. Im Gegensatz zum Training von Sprachmodellen fließt ein erheblicher Teil der Investitionen im multimodalen Bereich in das Verständnis und die Generierung von Inhalten. Zukünftige End-to-End-Stimminteraktionen und Videogenerierung werden erhebliche Berechnungsleistungen und Infrastrukturinvestitionen von Cloud-Anbietern erfordern. Zweitens sind dies Speicher und Datenakkumulation. Multimedia erfordert höhere Speicherkapazitäten als Text, mit unterschiedlichen Anforderungen an Stabilität, Datenbereinigung und -beschaffung. Große Mengen an Videodaten müssen vor dem Pre-Training bereinigt und verarbeitet werden, und die Kombination verschiedener Modalitäten umfasst Verarbeitungsschritte, die sich erheblich von textbasierten Aufgaben unterscheiden. Drittens ist dies die Anwendungsproduktionsseite. Cloud-Anbieter, die Endbenutzer-orientierte Inference-Dienste und umfassende Verarbeitungsfähigkeiten anbieten, sind entscheidende Faktoren bei der Kundenwahl. Die effektive Erfüllung der durch operative Innovationstrends getriebenen Kundenanforderungen ist für Tencent Cloud ebenfalls von entscheidender Bedeutung.
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13











