Lar
O streaming ao vivo da Copa do Mundo por Li Yutao, da Tencent: a estreia da produção em larga escala da IA e o avanço dos provedores de nuvem para multimodalidade

A Tencent Cloud atuou como a espinha dorsal técnica da recente Copa do Mundo da FIFA, realizada nos Estados Unidos, no Canadá e no México, garantindo as transmissões oficiais em 17 países e regiões. Essa cobertura alcançou dois terços de todas as plataformas autorizadas nos mercados da Ásia-Pacífico e domésticos. Li Yutao, Vice-Presidente da Tencent Cloud e Chefe de Tecnologia de Produtos Internacionais, destacou em uma entrevista recente que a inteligência artificial foi implementada em uma escala sem precedentes para a produção de transmissões ao vivo. Processos-chave, incluindo aprimoramento de imagem, direção inteligente, edição automatizada, conversão inteligente de horizontal para vertical, inspeção de qualidade e rastreabilidade, foram totalmente automatizados. Esse suporte para um único evento da Copa do Mundo marca apenas uma faceta da transição da Geração de Conteúdo Gerado por IA (AIGC) para a produção em larga escala.
Li Yutao descreve a abordagem da Tencent Cloud no espaço multimodal como "Harness". Em vez de focar apenas em como os modelos geram conteúdo, a estratégia centra-se em toda a cadeia de suprimentos, desde a geração até a entrega estável ao usuário. Isso abrange pré-processamento, inspeção de qualidade, montagem, codificação, distribuição e adaptação de formato.
Ele observou que a IA generativa introduziu múltiplos desafios para aplicações multimídia, particularmente em transmissão ao vivo, visualização sob demanda, criação de mídia e cenários interativos. Esses cenários são limitados pela transmissão de rede, qualidade do vídeo, experiência do usuário e integração de vários recursos, o que torna difícil para um único modelo resolver todas as questões. Muitos fornecedores tentam conectar cada novo modelo grande multimodal assim que ele surge, o que leva a problemas de integração e obstáculos técnicos inevitáveis. Quando a maioria das empresas enfrenta desafios semelhantes, surge uma demanda comum a partir do feedback dos clientes: há a necessidade de um provedor que lide com tarefas subjacentes, permitindo que as empresas se concentrem na inovação e em aplicações de nível superior. Identificar as necessidades dos usuários, selecionar os modelos adequados, corrigir falhas inerentes e entregar serviços finais aos usuários são os desafios centrais que um provedor de nuvem PaaS de vídeo e áudio deve resolver.
Em 5 de junho, na Conferência de Aplicações Industriais de IA da Tencent Cloud, a empresa lançou sua marca de IA "Tencent Cloud WAND". Esta iniciativa inclui seis modelos específicos para mídia, desenvolvidos internamente, e mais de 60 capacidades de IA que cobrem todo o pipeline de geração, compreensão, processamento e codificação de conteúdo. Essas ferramentas são especificamente treinadas para cenários verticais, como comércio eletrônico, dramas curtos, educação e transmissões ao vivo de esportes. Li Yutao explicou que a equipe integra todos os modelos, incluindo grandes modelos de linguagem, modelos multimodais e modelos de pequenos parâmetros para aprimoramento de imagem ou aplicações específicas. O trabalho no Harness multimodal começou no ano passado, coincidindo com o surgimento de modelos de vídeo generativo e um crescente consenso na indústria sobre o conceito de Harness.
A geração de vídeo é amplamente considerada o segundo cenário de transformação da IA a alcançar um ciclo comercial fechado, após a codificação por IA. Desde o início deste ano, a competição em cenas de modelos grandes acelerou, alterando significativamente as estruturas de mercado. Fornecedores domésticos estão avançando rapidamente na comercialização, com o Seedance da ByteDance e o KeLing AI da Kuaishou formando um duopólio no mercado de geração de vídeo por IA. Dados públicos indicam que, até março, o ARR (Receita Recorrente Anual) do KeLing AI aproximava-se de US$ 500 milhões, representando um crescimento quadruplo em um ano. Outros relatórios sugeriram que, até meados do ano, o ARR do Seedance 2.0 atingiu US$ 2 bilhões. Embora a ByteDance tenha negado os valores de receita como "excessivamente altos e inconsistentes com a realidade", confirmou que o Seedance 2.0 cruzou o "ponto de virada da produtividade". Enquanto isso, nos mercados internacionais, a OpenAI anunciou em março que descontinuaria seu aplicativo independente, a interface de API e as funções de vídeo integradas ao ChatGPT para o Sora, efetivamente saindo do mercado de geração de vídeo por IA de nível consumidor.
Ao desenvolver produtos e soluções para empresas (To B), a cooperação ecológica é a principal prioridade estratégica de Li Yutao. Ele reconheceu que sua equipe debatiu se o papel do Harness poderia ser ignorado ou contornado à medida que o elo entre geração e interação se encurtasse. Sua avaliação, baseada em seis meses de observação, é que isso não acontecerá; na verdade, a importância do Harness pode aumentar. Se os grandes modelos representam a produtividade do back-end, seus ganhos de eficiência estimularão significativamente a demanda por aplicações front-end. A amplitude do crescimento da demanda sempre ultrapassará os melhorias de produtividade, o que significa que os grandes modelos nunca poderão atender completamente às necessidades dos usuários finais. Essa "lacuna persistente entre oferta e demanda" sublinha a necessidade do Harness.
Li Yutao identifica duas grandes oportunidades para a Tencent Cloud no espaço do Harness multimodal. Primeiro, muitos cenários de vídeo e áudio exigem uma repensagem. Segundo, à medida que modelos mais poderosos e abrangentes surgem, o desafio reside em aplicá-los rapidamente aos serviços de produção de nível empresarial e entregar a mais recente experiência de grandes modelos aos usuários finais. Integrar continuamente os modelos mais recentes para os clientes e gerenciar todo o processo de produção e a cadeia de ferramentas são objetivos críticos do Harness multimodal.
Desde o ano passado, a capacidade computacional de IA mudou do treinamento para a inferência. Muitas empresas agora gastam mais com inferência do que com treinamento, indicando que numerosas aplicações de AIGC estão entrando em produção em larga escala. Na China, dramas curtos e séries animadas são cenários típicos onde as tecnologias multimodais são amplamente utilizadas para produção. Na região da Ásia-Pacífico, as soluções de vídeo e áudio servem como a "linha de frente" da expansão internacional da Tencent Cloud, liderando em receita, participação de mercado e reconhecimento da indústria. Nos últimos cinco anos, a Tencent Cloud priorizou a internacionalização, investindo pesadamente em recursos de negócios e infraestrutura no exterior. A empresa divulgou que seu negócio internacional tem mantido crescimento de dois dígitos nos últimos três anos.
Li Zhicheng, Gerente-Geral de Vídeo e Áudio da Tencent Cloud, observou que seja para dramas curtos, séries animadas, comércio eletrônico ou cenários baseados em ferramentas, os clientes inicialmente priorizam eficácia e influência, mas posteriormente focam no ROI (Retorno sobre o Investimento) — especificamente, se a tecnologia gera lucro e cria valor. As perguntas mais frequentes agora dizem respeito a dramas curtos e ferramentas de comércio eletrônico, que devem se tornar generalizadas nos próximos 1-2 anos. Muitos usuários e empresas adotarão essas tecnologias, de forma semelhante aos grandes modelos de linguagem, que antes estavam confinados a indústrias verticais, mas agora são ubíquos e integrantes do trabalho diário.
Com a chegada da era dos Agentes, as capacidades da Tencent Cloud serão integradas a inteligências de vídeo e áudio, hardware de IA, robôs encarnados e telefones na nuvem. Aproveitando a infraestrutura global e a inferência de borda, essas soluções apoiarão o rápido implantação global de aplicações de IA. Li Yutao mencionou que a equipe colaborou com várias empresas de inteligência encarnada e veículos autônomos de limpeza, como a Zhuji, para desenvolver o controle remoto em tempo real TRRO (uma solução de humano digital remoto). Isso aborda questões centrais, como comunicação estável de baixa latência e transmissão de dados de áudio e vídeo durante a intervenção manual em condições de rede fraca.
Olhando para o futuro, Li Yutao delineia três direções-chave para a competição entre provedores de nuvem no campo multimodal. A primeira é o treinamento multimodal e a capacidade computacional. Diferentemente do treinamento de modelos de linguagem, uma parte significativa do investimento no campo multimodal destina-se à compreensão e geração de conteúdo. As futuras interações de voz e geração de vídeo de ponta a ponta exigirão substanciais investimentos em capacidade computacional e infraestrutura por parte dos provedores de nuvem. A segunda é o armazenamento e a acumulação de dados. A multimídia exige maior capacidade de armazenamento do que o texto, com requisitos distintos para estabilidade, limpeza de dados e aquisição. Grandes volumes de dados de vídeo devem ser limpos e processados antes do pré-treinamento, e a combinação de diferentes modalidades envolve etapas de processamento que diferem significativamente das tarefas baseadas em texto. A terceira é o lado da produção de aplicações. Provedores de nuvem que oferecem serviços de inferência orientados ao usuário final e capacidades abrangentes de processamento são fatores-chave na escolha dos clientes. Atender eficazmente às demandas dos clientes impulsionadas por tendências de inovação operacional é igualmente crítico para a Tencent Cloud.
Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (0)

A Tencent Cloud atuou como a espinha dorsal técnica da recente Copa do Mundo da FIFA, realizada nos Estados Unidos, no Canadá e no México, garantindo as transmissões oficiais em 17 países e regiões. Essa cobertura alcançou dois terços de todas as plataformas autorizadas nos mercados da Ásia-Pacífico e domésticos. Li Yutao, Vice-Presidente da Tencent Cloud e Chefe de Tecnologia de Produtos Internacionais, destacou em uma entrevista recente que a inteligência artificial foi implementada em uma escala sem precedentes para a produção de transmissões ao vivo. Processos-chave, incluindo aprimoramento de imagem, direção inteligente, edição automatizada, conversão inteligente de horizontal para vertical, inspeção de qualidade e rastreabilidade, foram totalmente automatizados. Esse suporte para um único evento da Copa do Mundo marca apenas uma faceta da transição da Geração de Conteúdo Gerado por IA (AIGC) para a produção em larga escala.
Li Yutao descreve a abordagem da Tencent Cloud no espaço multimodal como "Harness". Em vez de focar apenas em como os modelos geram conteúdo, a estratégia centra-se em toda a cadeia de suprimentos, desde a geração até a entrega estável ao usuário. Isso abrange pré-processamento, inspeção de qualidade, montagem, codificação, distribuição e adaptação de formato.
Ele observou que a IA generativa introduziu múltiplos desafios para aplicações multimídia, particularmente em transmissão ao vivo, visualização sob demanda, criação de mídia e cenários interativos. Esses cenários são limitados pela transmissão de rede, qualidade do vídeo, experiência do usuário e integração de vários recursos, o que torna difícil para um único modelo resolver todas as questões. Muitos fornecedores tentam conectar cada novo modelo grande multimodal assim que ele surge, o que leva a problemas de integração e obstáculos técnicos inevitáveis. Quando a maioria das empresas enfrenta desafios semelhantes, surge uma demanda comum a partir do feedback dos clientes: há a necessidade de um provedor que lide com tarefas subjacentes, permitindo que as empresas se concentrem na inovação e em aplicações de nível superior. Identificar as necessidades dos usuários, selecionar os modelos adequados, corrigir falhas inerentes e entregar serviços finais aos usuários são os desafios centrais que um provedor de nuvem PaaS de vídeo e áudio deve resolver.
Em 5 de junho, na Conferência de Aplicações Industriais de IA da Tencent Cloud, a empresa lançou sua marca de IA "Tencent Cloud WAND". Esta iniciativa inclui seis modelos específicos para mídia, desenvolvidos internamente, e mais de 60 capacidades de IA que cobrem todo o pipeline de geração, compreensão, processamento e codificação de conteúdo. Essas ferramentas são especificamente treinadas para cenários verticais, como comércio eletrônico, dramas curtos, educação e transmissões ao vivo de esportes. Li Yutao explicou que a equipe integra todos os modelos, incluindo grandes modelos de linguagem, modelos multimodais e modelos de pequenos parâmetros para aprimoramento de imagem ou aplicações específicas. O trabalho no Harness multimodal começou no ano passado, coincidindo com o surgimento de modelos de vídeo generativo e um crescente consenso na indústria sobre o conceito de Harness.
A geração de vídeo é amplamente considerada o segundo cenário de transformação da IA a alcançar um ciclo comercial fechado, após a codificação por IA. Desde o início deste ano, a competição em cenas de modelos grandes acelerou, alterando significativamente as estruturas de mercado. Fornecedores domésticos estão avançando rapidamente na comercialização, com o Seedance da ByteDance e o KeLing AI da Kuaishou formando um duopólio no mercado de geração de vídeo por IA. Dados públicos indicam que, até março, o ARR (Receita Recorrente Anual) do KeLing AI aproximava-se de US$ 500 milhões, representando um crescimento quadruplo em um ano. Outros relatórios sugeriram que, até meados do ano, o ARR do Seedance 2.0 atingiu US$ 2 bilhões. Embora a ByteDance tenha negado os valores de receita como "excessivamente altos e inconsistentes com a realidade", confirmou que o Seedance 2.0 cruzou o "ponto de virada da produtividade". Enquanto isso, nos mercados internacionais, a OpenAI anunciou em março que descontinuaria seu aplicativo independente, a interface de API e as funções de vídeo integradas ao ChatGPT para o Sora, efetivamente saindo do mercado de geração de vídeo por IA de nível consumidor.
Ao desenvolver produtos e soluções para empresas (To B), a cooperação ecológica é a principal prioridade estratégica de Li Yutao. Ele reconheceu que sua equipe debatiu se o papel do Harness poderia ser ignorado ou contornado à medida que o elo entre geração e interação se encurtasse. Sua avaliação, baseada em seis meses de observação, é que isso não acontecerá; na verdade, a importância do Harness pode aumentar. Se os grandes modelos representam a produtividade do back-end, seus ganhos de eficiência estimularão significativamente a demanda por aplicações front-end. A amplitude do crescimento da demanda sempre ultrapassará os melhorias de produtividade, o que significa que os grandes modelos nunca poderão atender completamente às necessidades dos usuários finais. Essa "lacuna persistente entre oferta e demanda" sublinha a necessidade do Harness.
Li Yutao identifica duas grandes oportunidades para a Tencent Cloud no espaço do Harness multimodal. Primeiro, muitos cenários de vídeo e áudio exigem uma repensagem. Segundo, à medida que modelos mais poderosos e abrangentes surgem, o desafio reside em aplicá-los rapidamente aos serviços de produção de nível empresarial e entregar a mais recente experiência de grandes modelos aos usuários finais. Integrar continuamente os modelos mais recentes para os clientes e gerenciar todo o processo de produção e a cadeia de ferramentas são objetivos críticos do Harness multimodal.
Desde o ano passado, a capacidade computacional de IA mudou do treinamento para a inferência. Muitas empresas agora gastam mais com inferência do que com treinamento, indicando que numerosas aplicações de AIGC estão entrando em produção em larga escala. Na China, dramas curtos e séries animadas são cenários típicos onde as tecnologias multimodais são amplamente utilizadas para produção. Na região da Ásia-Pacífico, as soluções de vídeo e áudio servem como a "linha de frente" da expansão internacional da Tencent Cloud, liderando em receita, participação de mercado e reconhecimento da indústria. Nos últimos cinco anos, a Tencent Cloud priorizou a internacionalização, investindo pesadamente em recursos de negócios e infraestrutura no exterior. A empresa divulgou que seu negócio internacional tem mantido crescimento de dois dígitos nos últimos três anos.
Li Zhicheng, Gerente-Geral de Vídeo e Áudio da Tencent Cloud, observou que seja para dramas curtos, séries animadas, comércio eletrônico ou cenários baseados em ferramentas, os clientes inicialmente priorizam eficácia e influência, mas posteriormente focam no ROI (Retorno sobre o Investimento) — especificamente, se a tecnologia gera lucro e cria valor. As perguntas mais frequentes agora dizem respeito a dramas curtos e ferramentas de comércio eletrônico, que devem se tornar generalizadas nos próximos 1-2 anos. Muitos usuários e empresas adotarão essas tecnologias, de forma semelhante aos grandes modelos de linguagem, que antes estavam confinados a indústrias verticais, mas agora são ubíquos e integrantes do trabalho diário.
Com a chegada da era dos Agentes, as capacidades da Tencent Cloud serão integradas a inteligências de vídeo e áudio, hardware de IA, robôs encarnados e telefones na nuvem. Aproveitando a infraestrutura global e a inferência de borda, essas soluções apoiarão o rápido implantação global de aplicações de IA. Li Yutao mencionou que a equipe colaborou com várias empresas de inteligência encarnada e veículos autônomos de limpeza, como a Zhuji, para desenvolver o controle remoto em tempo real TRRO (uma solução de humano digital remoto). Isso aborda questões centrais, como comunicação estável de baixa latência e transmissão de dados de áudio e vídeo durante a intervenção manual em condições de rede fraca.
Olhando para o futuro, Li Yutao delineia três direções-chave para a competição entre provedores de nuvem no campo multimodal. A primeira é o treinamento multimodal e a capacidade computacional. Diferentemente do treinamento de modelos de linguagem, uma parte significativa do investimento no campo multimodal destina-se à compreensão e geração de conteúdo. As futuras interações de voz e geração de vídeo de ponta a ponta exigirão substanciais investimentos em capacidade computacional e infraestrutura por parte dos provedores de nuvem. A segunda é o armazenamento e a acumulação de dados. A multimídia exige maior capacidade de armazenamento do que o texto, com requisitos distintos para estabilidade, limpeza de dados e aquisição. Grandes volumes de dados de vídeo devem ser limpos e processados antes do pré-treinamento, e a combinação de diferentes modalidades envolve etapas de processamento que diferem significativamente das tarefas baseadas em texto. A terceira é o lado da produção de aplicações. Provedores de nuvem que oferecem serviços de inferência orientados ao usuário final e capacidades abrangentes de processamento são fatores-chave na escolha dos clientes. Atender eficazmente às demandas dos clientes impulsionadas por tendências de inovação operacional é igualmente crítico para a Tencent Cloud.
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr











