Lar
Zigong e a Universidade de Tsinghua apresentam a arquitetura de rede ZCube, que aumenta a taxa de processamento de inferência de modelos de grande porte em 15% e, ao mesmo tempo, reduz os custos de rede em um terço
A inferência de modelos de grande porte está remodelando a infraestrutura de IA, e as inovações na arquitetura de rede são agora fundamentais para explorar o potencial do hardware. Em setembro de 2025, a Zhipu, a Yuchen Network e a Universidade de Tsinghua apresentaram sua pesquisa sobre a arquitetura de rede ZCube na ACM SIGCOMM 2025, uma das principais conferências na área de redes.
Em 21 de maio de 2026, a Zhipu anunciou a implantação bem-sucedida da arquitetura ZCube no ambiente de produção de codificação GLM-5.1, resultando em ganhos substanciais de desempenho. Testes de benchmark, realizados com hardware de GPU, pilha de software e aplicativos inalterados, mostraram que o ZCube reduziu os gastos de capital com switches e módulos ópticos em 33%, aumentou a taxa de processamento média de inferência da GPU em 15% e reduziu a latência do primeiro token (TTFT P99) em 40,6%. Essa inovação em nível de sistema alcança um equilíbrio entre alta eficiência econômica e alto desempenho.

Atualmente, com a inferência de contexto longo e a implantação da separação Prefill-Decode (PD) se tornando padrões do setor, a transmissão entre nós do cache KV apresenta uma assimetria significativa. As arquiteturas ROFT (Rail-Optimized Fat-Tree) tradicionais, que dependem do empilhamento de switches em múltiplas camadas, são limitadas pela topologia estática, tornando-as propensas a pontos de congestionamento locais e contrapressão do PFC. Isso cria um gargalo estrutural em que a largura de banda total é suficiente, mas o congestionamento local é frequente.

Para resolver esse ponto crítico, a arquitetura ZCube se afasta do empilhamento hierárquico dos projetos Clos tradicionais. Ela elimina os switches da camada Spine e, em vez disso, utiliza dois grupos de switches totalmente planos em uma interconexão de grafo bipartido, combinada com o mecanismo de acesso híbrido de trilha única/múltipla de uma placa de rede (NIC) de porta dupla. Por meio de sua estratégia de roteamento exclusiva, o ZCube garante um caminho ideal dedicado para qualquer par de GPUs, alcançando um balanceamento de carga de tráfego perfeito no nível estrutural e suportando expansão em escala ultragrande para dezenas de milhares ou até centenas de milhares de GPUs.
Durante a transformação do ambiente de produção, a equipe da Yuchen Network superou com sucesso os desafios de recabeamento e reconstrução da estratégia de rotas utilizando ferramentas automatizadas de controle e verificação, garantindo uma atualização rápida e estável do cluster. O atual cluster de mil placas vem operando de forma estável há mais de duas semanas. A implantação bem-sucedida do ZCube marca uma mudança na infraestrutura de computação inteligente, passando da interconexão geral para a colaboração entre sistemas impulsionada pelo tráfego de modelos. No futuro, a integração profunda entre topologia de rede, bibliotecas de comunicação e estratégias de agendamento se tornará o principal impulsionador para melhorar ainda mais a eficiência na produção de tokens e reduzir os custos gerais do MaaS.
Artigo relacionado
Suno para Marcas d'Água em Músicas Durante Batalhas Legais
O Suno, plataforma que permite aos usuários gerar músicas criadas por inteligência artificial, apresentou novas funcionalidades para rotular as faixas produzidas pela plataforma, restringir downloads e atualizar os padrões da comunidade para coibir r
Musk admite que vazamento do código do Grok expôs dados de usuários e promete apagar todas as informações históricas.
Elon Musk abordou diretamente a controvérsia sobre privacidade envolvendo o Grok Build, começando com um simples "Verdadeiro" para confirmar a validade do incidente. Ele prometeu que todos os dados dos usuários carregados anteriormente para a SpaceXA
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Recomendações de tópicos especiais relacionados
Comentários (0)
A inferência de modelos de grande porte está remodelando a infraestrutura de IA, e as inovações na arquitetura de rede são agora fundamentais para explorar o potencial do hardware. Em setembro de 2025, a Zhipu, a Yuchen Network e a Universidade de Tsinghua apresentaram sua pesquisa sobre a arquitetura de rede ZCube na ACM SIGCOMM 2025, uma das principais conferências na área de redes.
Em 21 de maio de 2026, a Zhipu anunciou a implantação bem-sucedida da arquitetura ZCube no ambiente de produção de codificação GLM-5.1, resultando em ganhos substanciais de desempenho. Testes de benchmark, realizados com hardware de GPU, pilha de software e aplicativos inalterados, mostraram que o ZCube reduziu os gastos de capital com switches e módulos ópticos em 33%, aumentou a taxa de processamento média de inferência da GPU em 15% e reduziu a latência do primeiro token (TTFT P99) em 40,6%. Essa inovação em nível de sistema alcança um equilíbrio entre alta eficiência econômica e alto desempenho.

Atualmente, com a inferência de contexto longo e a implantação da separação Prefill-Decode (PD) se tornando padrões do setor, a transmissão entre nós do cache KV apresenta uma assimetria significativa. As arquiteturas ROFT (Rail-Optimized Fat-Tree) tradicionais, que dependem do empilhamento de switches em múltiplas camadas, são limitadas pela topologia estática, tornando-as propensas a pontos de congestionamento locais e contrapressão do PFC. Isso cria um gargalo estrutural em que a largura de banda total é suficiente, mas o congestionamento local é frequente.

Para resolver esse ponto crítico, a arquitetura ZCube se afasta do empilhamento hierárquico dos projetos Clos tradicionais. Ela elimina os switches da camada Spine e, em vez disso, utiliza dois grupos de switches totalmente planos em uma interconexão de grafo bipartido, combinada com o mecanismo de acesso híbrido de trilha única/múltipla de uma placa de rede (NIC) de porta dupla. Por meio de sua estratégia de roteamento exclusiva, o ZCube garante um caminho ideal dedicado para qualquer par de GPUs, alcançando um balanceamento de carga de tráfego perfeito no nível estrutural e suportando expansão em escala ultragrande para dezenas de milhares ou até centenas de milhares de GPUs.
Durante a transformação do ambiente de produção, a equipe da Yuchen Network superou com sucesso os desafios de recabeamento e reconstrução da estratégia de rotas utilizando ferramentas automatizadas de controle e verificação, garantindo uma atualização rápida e estável do cluster. O atual cluster de mil placas vem operando de forma estável há mais de duas semanas. A implantação bem-sucedida do ZCube marca uma mudança na infraestrutura de computação inteligente, passando da interconexão geral para a colaboração entre sistemas impulsionada pelo tráfego de modelos. No futuro, a integração profunda entre topologia de rede, bibliotecas de comunicação e estratégias de agendamento se tornará o principal impulsionador para melhorar ainda mais a eficiência na produção de tokens e reduzir os custos gerais do MaaS.
Suno para Marcas d'Água em Músicas Durante Batalhas Legais
O Suno, plataforma que permite aos usuários gerar músicas criadas por inteligência artificial, apresentou novas funcionalidades para rotular as faixas produzidas pela plataforma, restringir downloads e atualizar os padrões da comunidade para coibir r
Musk admite que vazamento do código do Grok expôs dados de usuários e promete apagar todas as informações históricas.
Elon Musk abordou diretamente a controvérsia sobre privacidade envolvendo o Grok Build, começando com um simples "Verdadeiro" para confirmar a validade do incidente. Ele prometeu que todos os dados dos usuários carregados anteriormente para a SpaceXA
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava











