Maison
Li Yutao de Tencent sur la diffusion en direct de la Coupe du Monde : la première production à grande échelle de l’IA et l’entrée des fournisseurs cloud dans le multimodal

Tencent Cloud a servi de colonne technique pour la Coupe du Monde de la FIFA récemment conclue aux États-Unis, au Canada et au Mexique, en assurant les diffusions officielles dans 17 pays et régions. Cette couverture a atteint deux tiers de toutes les plateformes autorisées en Asie-Pacifique et sur les marchés nationaux. Li Yutao, Vice-président de Tencent Cloud et responsable de la technologie des produits internationaux, a souligné dans une interview récente que l’intelligence artificielle a été déployée à une échelle sans précédent pour la production de diffusions en direct. Les processus clés, y compris l’amélioration d’image, la réalisation intelligente, le montage automatisé, la conversion intelligente de l’horizontal au vertical, l’inspection de la qualité et la traçabilité, ont été entièrement automatisés. Ce soutien pour un seul événement de Coupe du Monde ne représente qu’un aspect de la transition de l’AIGC vers une production à grande échelle.
Li Yutao décrit l’approche de Tencent Cloud dans le domaine multimodal comme « Harness ». Plutôt que de se concentrer uniquement sur la manière dont les modèles génèrent du contenu, la stratégie porte sur toute la chaîne d’approvisionnement, de la génération à la livraison stable aux utilisateurs. Cela englobe le prétraitement, l’inspection de la qualité, le collage, l’encodage, la distribution et l’adaptation des formats.
Il a noté que l’intelligence artificielle générative a introduit plusieurs défis pour les applications multimédias, en particulier dans les domaines de la diffusion en direct, du visionnage à la demande, de la création de médias et des scénarios interactifs. Ceux-ci sont contraints par la transmission réseau, la qualité vidéo, l’expérience utilisateur et l’intégration de diverses fonctionnalités, ce qui rend difficile pour un seul modèle de résoudre tous les problèmes. De nombreux fournisseurs tentent de connecter chaque nouveau grand modèle multimodal dès son émergence, ce qui entraîne des problèmes d’intégration et des obstacles techniques inévitables. Lorsque la plupart des entreprises font face à des défis similaires, une demande commune émerge des retours des clients : il existe un besoin pour un fournisseur de gérer les tâches sous-jacentes, permettant aux entreprises de se concentrer sur l’innovation et les applications de niveau supérieur. Identifier les besoins des utilisateurs, sélectionner les modèles appropriés, corriger les défauts inhérents et fournir des services finaux aux utilisateurs sont les défis principaux qu’un fournisseur de cloud PaaS vidéo et audio doit résoudre.
Le 5 juin, lors de la Conférence sur les applications industrielles de l’IA de Tencent Cloud, l’entreprise a lancé sa marque d’IA « Tencent Cloud WAND ». Cette initiative comprend six modèles multimédias auto-développés et plus de 60 capacités d’IA couvrant l’ensemble du pipeline de génération, de compréhension, de traitement et d’encodage du contenu. Ces outils sont spécifiquement formés pour des scénarios verticaux tels que le commerce électronique, les courts drames, l’éducation et la diffusion en direct de sports. Li Yutao a expliqué que l’équipe intègre tous les modèles, y compris les grands modèles de langage, les modèles multimodaux et les modèles à petits paramètres pour l’amélioration d’image ou des applications spécifiques. Les travaux sur le multimodal Harness ont commencé l’année dernière, coïncidant avec l’essor des modèles de vidéo générative et un consensus croissant dans l’industrie sur le concept de Harness.
La génération de vidéo est largement considérée comme le deuxième scénario de transformation par l’IA à atteindre une boucle commerciale fermée, après le codage par IA. Depuis le début de cette année, la concurrence dans les scènes de grands modèles vidéo s’est accélérée, modifiant significativement les structures du marché. Les fournisseurs nationaux progressent rapidement dans la commercialisation, avec Seedance de ByteDance et KeLing AI de Kuaishou formant un duopole sur le marché de la génération vidéo par IA. Des données publiques indiquent qu’en mars, les revenus annuels récurrents (ARR) de KeLing AI approchaient 500 millions de dollars, représentant une croissance quadruplée en un an. D’autres rapports suggéraient qu’à la mi-année, les revenus annuels récurrents (ARR) de Seedance 2.0 atteignaient 2 milliards de dollars. Bien que ByteDance ait nié les chiffres de revenus comme « excessivement élevés et incohérents avec la réalité », elle a confirmé que Seedance 2.0 a franchi le « point de bascule de la productivité ». Parallèlement, sur les marchés étrangers, OpenAI a annoncé en mars qu’elle mettrait fin à son application indépendante, à l’interface API et aux fonctions vidéo intégrées à ChatGPT pour Sora, quittant ainsi le marché de la génération vidéo par IA de niveau grand public.
Lors du développement de produits et de solutions B2B, la coopération écologique est la priorité stratégique absolue de Li Yutao. Il a reconnu que son équipe a débattu de la question de savoir si le rôle de Harness pourrait être ignoré ou contourné à mesure que le lien entre la génération et l’interaction se raccourcit. Son évaluation, basée sur six mois d’observation, est que cela ne se produira pas ; plutôt, l’importance de Harness pourrait augmenter. Si les grands modèles représentent la productivité en arrière-plan, leurs gains d’efficacité stimuleront de manière significative la demande pour les applications frontales. La largeur de la croissance de la demande dépassera toujours les améliorations de productivité, ce qui signifie que les grands modèles ne pourront jamais entièrement répondre aux besoins des utilisateurs finaux. Ce « fossé offre-demande » persistant souligne la nécessité de Harness.
Li Yutao identifie deux grandes opportunités pour Tencent Cloud dans l’espace multimodal Harness. Premièrement, de nombreux scénarios vidéo et audio nécessitent une réflexion nouvelle. Deuxièmement, à mesure que des modèles plus puissants et complets émergent, le défi réside dans leur application rapide aux services de production d’entreprise et dans la livraison de la dernière expérience de grand modèle aux utilisateurs finaux. L’intégration continue des derniers modèles pour les clients et la gestion de l’ensemble du processus de production et de la chaîne d’outils sont des objectifs critiques du multimodal Harness.
Depuis l’année dernière, la puissance de calcul de l’IA s’est déplacée de l’entraînement vers l’inférence. De nombreuses entreprises dépensent désormais plus pour l’inférence que pour l’entraînement, indiquant que de nombreuses applications AIGC entrent dans une production à grande échelle. En Chine, les courts drames et les séries animées sont des scénarios typiques où les technologies multimodales sont largement utilisées pour la production. En Asie-Pacifique, les solutions vidéo et audio servent de « front » à l’expansion internationale de Tencent Cloud, en tête des revenus, de la part de marché et de la notoriété industrielle. Au cours des cinq dernières années, Tencent Cloud a priorisé l’internationalisation, investissant massivement dans les ressources commerciales et les infrastructures à l’étranger. L’entreprise a divulgué que ses activités internationales ont maintenu une croissance à deux chiffres au cours des trois dernières années.
Li Zhicheng, directeur général de Tencent Cloud Vidéo et Audio, a noté que, qu’il s’agisse de courts drames, de séries animées, de commerce électronique ou de scénarios basés sur des outils, les clients privilégient initialement l’efficacité et l’influence, puis se concentrent sur le retour sur investissement (ROI) – spécifiquement, si la technologie génère des profits et crée de la valeur. Les questions les plus fréquentes concernent désormais les courts drames et les outils de commerce électronique, qui devraient se généraliser au cours des 1 à 2 prochaines années. De nombreux utilisateurs et entreprises adopteront ces technologies, de manière similaire aux grands modèles de langage, qui étaient autrefois confinés à des industries verticales mais sont désormais omniprésents et intégrés au travail quotidien.
Avec l’arrivée de l’ère des Agents, les capacités de Tencent Cloud s’intégreront à l’intelligence vidéo et audio, au matériel d’IA, aux robots incarnés et aux téléphones cloud. En s’appuyant sur des infrastructures mondiales et l’inférence périphérique, ces solutions soutiendront le déploiement rapide à l’échelle mondiale des applications d’IA. Li Yutao a mentionné que l’équipe a collaboré avec plusieurs entreprises d’intelligence incarnée et de véhicules de nettoyage autonomes, telles que Zhuji, pour développer le contrôle à distance en temps réel TRRO (une solution d’humain numérique à distance). Cela répond à des problèmes clés tels que la communication stable à faible latence et la transmission de données audio-vidéo lors d’une intervention manuelle dans des conditions de réseau faible.
Pour l’avenir, Li Yutao esquisse trois directions clés pour la concurrence parmi les fournisseurs de cloud dans le domaine multimodal. La première est l’entraînement multimodal et la puissance de calcul. Contrairement à l’entraînement des modèles de langage, une part importante des investissements dans le domaine multimodal est consacrée à la compréhension et à la génération de contenu. Les futures interactions vocales de bout en bout et la génération vidéo nécessiteront des investissements substantiels en puissance de calcul et en infrastructures de la part des fournisseurs de cloud. La deuxième est le stockage et l’accumulation de données. Le multimédia exige une capacité de stockage supérieure au texte, avec des exigences distinctes en matière de stabilité, de nettoyage des données et d’acquisition. De grands volumes de données vidéo doivent être nettoyés et traités avant le pré-entraînement, et la combinaison de différentes modalités implique des étapes de traitement qui diffèrent considérablement des tâches basées sur le texte. La troisième est le côté production d’applications. Les fournisseurs de cloud offrant des services d’inférence orientés vers l’utilisateur final et des capacités de traitement complètes sont des facteurs clés dans le choix des clients. Répondre efficacement aux demandes des clients motivées par les tendances d’innovation opérationnelle est tout aussi critique pour Tencent Cloud.
Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (0)

Tencent Cloud a servi de colonne technique pour la Coupe du Monde de la FIFA récemment conclue aux États-Unis, au Canada et au Mexique, en assurant les diffusions officielles dans 17 pays et régions. Cette couverture a atteint deux tiers de toutes les plateformes autorisées en Asie-Pacifique et sur les marchés nationaux. Li Yutao, Vice-président de Tencent Cloud et responsable de la technologie des produits internationaux, a souligné dans une interview récente que l’intelligence artificielle a été déployée à une échelle sans précédent pour la production de diffusions en direct. Les processus clés, y compris l’amélioration d’image, la réalisation intelligente, le montage automatisé, la conversion intelligente de l’horizontal au vertical, l’inspection de la qualité et la traçabilité, ont été entièrement automatisés. Ce soutien pour un seul événement de Coupe du Monde ne représente qu’un aspect de la transition de l’AIGC vers une production à grande échelle.
Li Yutao décrit l’approche de Tencent Cloud dans le domaine multimodal comme « Harness ». Plutôt que de se concentrer uniquement sur la manière dont les modèles génèrent du contenu, la stratégie porte sur toute la chaîne d’approvisionnement, de la génération à la livraison stable aux utilisateurs. Cela englobe le prétraitement, l’inspection de la qualité, le collage, l’encodage, la distribution et l’adaptation des formats.
Il a noté que l’intelligence artificielle générative a introduit plusieurs défis pour les applications multimédias, en particulier dans les domaines de la diffusion en direct, du visionnage à la demande, de la création de médias et des scénarios interactifs. Ceux-ci sont contraints par la transmission réseau, la qualité vidéo, l’expérience utilisateur et l’intégration de diverses fonctionnalités, ce qui rend difficile pour un seul modèle de résoudre tous les problèmes. De nombreux fournisseurs tentent de connecter chaque nouveau grand modèle multimodal dès son émergence, ce qui entraîne des problèmes d’intégration et des obstacles techniques inévitables. Lorsque la plupart des entreprises font face à des défis similaires, une demande commune émerge des retours des clients : il existe un besoin pour un fournisseur de gérer les tâches sous-jacentes, permettant aux entreprises de se concentrer sur l’innovation et les applications de niveau supérieur. Identifier les besoins des utilisateurs, sélectionner les modèles appropriés, corriger les défauts inhérents et fournir des services finaux aux utilisateurs sont les défis principaux qu’un fournisseur de cloud PaaS vidéo et audio doit résoudre.
Le 5 juin, lors de la Conférence sur les applications industrielles de l’IA de Tencent Cloud, l’entreprise a lancé sa marque d’IA « Tencent Cloud WAND ». Cette initiative comprend six modèles multimédias auto-développés et plus de 60 capacités d’IA couvrant l’ensemble du pipeline de génération, de compréhension, de traitement et d’encodage du contenu. Ces outils sont spécifiquement formés pour des scénarios verticaux tels que le commerce électronique, les courts drames, l’éducation et la diffusion en direct de sports. Li Yutao a expliqué que l’équipe intègre tous les modèles, y compris les grands modèles de langage, les modèles multimodaux et les modèles à petits paramètres pour l’amélioration d’image ou des applications spécifiques. Les travaux sur le multimodal Harness ont commencé l’année dernière, coïncidant avec l’essor des modèles de vidéo générative et un consensus croissant dans l’industrie sur le concept de Harness.
La génération de vidéo est largement considérée comme le deuxième scénario de transformation par l’IA à atteindre une boucle commerciale fermée, après le codage par IA. Depuis le début de cette année, la concurrence dans les scènes de grands modèles vidéo s’est accélérée, modifiant significativement les structures du marché. Les fournisseurs nationaux progressent rapidement dans la commercialisation, avec Seedance de ByteDance et KeLing AI de Kuaishou formant un duopole sur le marché de la génération vidéo par IA. Des données publiques indiquent qu’en mars, les revenus annuels récurrents (ARR) de KeLing AI approchaient 500 millions de dollars, représentant une croissance quadruplée en un an. D’autres rapports suggéraient qu’à la mi-année, les revenus annuels récurrents (ARR) de Seedance 2.0 atteignaient 2 milliards de dollars. Bien que ByteDance ait nié les chiffres de revenus comme « excessivement élevés et incohérents avec la réalité », elle a confirmé que Seedance 2.0 a franchi le « point de bascule de la productivité ». Parallèlement, sur les marchés étrangers, OpenAI a annoncé en mars qu’elle mettrait fin à son application indépendante, à l’interface API et aux fonctions vidéo intégrées à ChatGPT pour Sora, quittant ainsi le marché de la génération vidéo par IA de niveau grand public.
Lors du développement de produits et de solutions B2B, la coopération écologique est la priorité stratégique absolue de Li Yutao. Il a reconnu que son équipe a débattu de la question de savoir si le rôle de Harness pourrait être ignoré ou contourné à mesure que le lien entre la génération et l’interaction se raccourcit. Son évaluation, basée sur six mois d’observation, est que cela ne se produira pas ; plutôt, l’importance de Harness pourrait augmenter. Si les grands modèles représentent la productivité en arrière-plan, leurs gains d’efficacité stimuleront de manière significative la demande pour les applications frontales. La largeur de la croissance de la demande dépassera toujours les améliorations de productivité, ce qui signifie que les grands modèles ne pourront jamais entièrement répondre aux besoins des utilisateurs finaux. Ce « fossé offre-demande » persistant souligne la nécessité de Harness.
Li Yutao identifie deux grandes opportunités pour Tencent Cloud dans l’espace multimodal Harness. Premièrement, de nombreux scénarios vidéo et audio nécessitent une réflexion nouvelle. Deuxièmement, à mesure que des modèles plus puissants et complets émergent, le défi réside dans leur application rapide aux services de production d’entreprise et dans la livraison de la dernière expérience de grand modèle aux utilisateurs finaux. L’intégration continue des derniers modèles pour les clients et la gestion de l’ensemble du processus de production et de la chaîne d’outils sont des objectifs critiques du multimodal Harness.
Depuis l’année dernière, la puissance de calcul de l’IA s’est déplacée de l’entraînement vers l’inférence. De nombreuses entreprises dépensent désormais plus pour l’inférence que pour l’entraînement, indiquant que de nombreuses applications AIGC entrent dans une production à grande échelle. En Chine, les courts drames et les séries animées sont des scénarios typiques où les technologies multimodales sont largement utilisées pour la production. En Asie-Pacifique, les solutions vidéo et audio servent de « front » à l’expansion internationale de Tencent Cloud, en tête des revenus, de la part de marché et de la notoriété industrielle. Au cours des cinq dernières années, Tencent Cloud a priorisé l’internationalisation, investissant massivement dans les ressources commerciales et les infrastructures à l’étranger. L’entreprise a divulgué que ses activités internationales ont maintenu une croissance à deux chiffres au cours des trois dernières années.
Li Zhicheng, directeur général de Tencent Cloud Vidéo et Audio, a noté que, qu’il s’agisse de courts drames, de séries animées, de commerce électronique ou de scénarios basés sur des outils, les clients privilégient initialement l’efficacité et l’influence, puis se concentrent sur le retour sur investissement (ROI) – spécifiquement, si la technologie génère des profits et crée de la valeur. Les questions les plus fréquentes concernent désormais les courts drames et les outils de commerce électronique, qui devraient se généraliser au cours des 1 à 2 prochaines années. De nombreux utilisateurs et entreprises adopteront ces technologies, de manière similaire aux grands modèles de langage, qui étaient autrefois confinés à des industries verticales mais sont désormais omniprésents et intégrés au travail quotidien.
Avec l’arrivée de l’ère des Agents, les capacités de Tencent Cloud s’intégreront à l’intelligence vidéo et audio, au matériel d’IA, aux robots incarnés et aux téléphones cloud. En s’appuyant sur des infrastructures mondiales et l’inférence périphérique, ces solutions soutiendront le déploiement rapide à l’échelle mondiale des applications d’IA. Li Yutao a mentionné que l’équipe a collaboré avec plusieurs entreprises d’intelligence incarnée et de véhicules de nettoyage autonomes, telles que Zhuji, pour développer le contrôle à distance en temps réel TRRO (une solution d’humain numérique à distance). Cela répond à des problèmes clés tels que la communication stable à faible latence et la transmission de données audio-vidéo lors d’une intervention manuelle dans des conditions de réseau faible.
Pour l’avenir, Li Yutao esquisse trois directions clés pour la concurrence parmi les fournisseurs de cloud dans le domaine multimodal. La première est l’entraînement multimodal et la puissance de calcul. Contrairement à l’entraînement des modèles de langage, une part importante des investissements dans le domaine multimodal est consacrée à la compréhension et à la génération de contenu. Les futures interactions vocales de bout en bout et la génération vidéo nécessiteront des investissements substantiels en puissance de calcul et en infrastructures de la part des fournisseurs de cloud. La deuxième est le stockage et l’accumulation de données. Le multimédia exige une capacité de stockage supérieure au texte, avec des exigences distinctes en matière de stabilité, de nettoyage des données et d’acquisition. De grands volumes de données vidéo doivent être nettoyés et traités avant le pré-entraînement, et la combinaison de différentes modalités implique des étapes de traitement qui diffèrent considérablement des tâches basées sur le texte. La troisième est le côté production d’applications. Les fournisseurs de cloud offrant des services d’inférence orientés vers l’utilisateur final et des capacités de traitement complètes sont des facteurs clés dans le choix des clients. Répondre efficacement aux demandes des clients motivées par les tendances d’innovation opérationnelle est tout aussi critique pour Tencent Cloud.
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter











