Lar
Zhipu lança a versão rápida do GLM-5.1: 400 tokens/s estabelecem novo recorde global de API

Em 22 de maio, a Zhipu (02513.HK) causou grande repercussão tanto nos mercados de capitais quanto no setor de tecnologia. Suas ações subiram mais de 22% durante o pregão, elevando seu valor de mercado para mais de 450 bilhões de HKD. No mesmo dia, a empresa lançou um importante novo produto para clientes corporativos: a API GLM-5.1 Highspeed (GLM-5.1-highspeed).
Em testes reais, esse modelo atinge impressionantes 400 tokens/s (400 tokens por segundo), superando o limite de velocidade atual das APIs oficiais dos principais fornecedores globais de modelos de grande porte. Para se ter uma ideia: o volume de texto que um criador levaria dias de trabalho ininterrupto para produzir agora pode ser concluído em apenas um minuto. Uma tarefa de reengenharia de sistema que levaria três dias de digitação para um engenheiro pode ser totalmente executada no tempo que leva para tomar uma xícara de café.
Principais destaques:
Quebrando convenções: tradicionalmente, o setor partia do princípio de que “rápido” significava “pequeno ou leve”. A Zhipu é a primeira provedora nacional de modelos de grande porte a alcançar uma combinação perfeita entre **“recursos de ponta em escala real” e “latência extremamente baixa”**.
Conquistas impressionantes: a velocidade de saída chega a 400 tokens/s, suporta uma janela de contexto de 200 mil e permite uma saída única máxima de 128 mil tokens.
Tecnologia de ponta: Desenvolvido por meio de uma profunda colaboração entre a equipe GLM da Zhipu e a equipe TileRT, esse modelo reestrutura todo o ecossistema de inferência no nível do sistema.
Teste-piloto direcionado: já disponível para clientes corporativos selecionados por meio da plataforma aberta MaaS (Model as a Service) da Zhipu.
Como é, na prática, uma “resposta instantânea”? Um avanço em cenários sensíveis à velocidade
Ao longo do último ano, os recursos de colaboração entre codificação (programação) e agente (inteligência) em grandes modelos nacionais avançaram significativamente. Mas a “velocidade” continuou sendo o principal gargalo para tarefas de interação de cadeia longa e alta frequência. A Zhipu observa que a transição dos grandes modelos de “ferramentas” para “parceiros em tempo real” se torna verdadeiramente transformadora a 400 tokens/s:
Programação de IA (Agente de Codificação): Agentes inteligentes tradicionais geralmente exigem dezenas de chamadas entre arquivos e alinhamento de textos longos. Um único ciclo de resposta com atraso de alguns segundos pode prolongar toda a tarefa para mais de dez minutos. Com a versão de alta velocidade, escrever código é como trabalhar a uma velocidade 10 vezes maior — funções, interfaces e cadeias de chamadas subjacentes se desenrolam instantaneamente à medida que o usuário digita, eliminando qualquer tempo de espera para retrabalho de engenharia em grande escala.
Interação em tempo real e jogos 3D: a latência extremamente baixa permite que o modelo lide com geração dinâmica em tempo real dentro de mundos de jogos, construção instantânea de interfaces de usuário na web e mudanças imediatas no estado do sistema com base na entrada contínua do usuário — tudo sem atrasos.
Clusters de decisão empresarial: em simulação paralela com múltiplos agentes e análise de big data em tempo real, a versão de alta velocidade permite concluir respostas paralelas com múltiplas personalidades de clusters de agentes web em 30 segundos, elevando significativamente o limite de eficiência para quantificação e simulação de alta frequência.
Voz em tempo real sem interrupções: Em cenários de coaching com IA e atendimento inteligente ao cliente, a resposta ultrarrápida reduz a latência entre o reconhecimento de fala (ASR) e a síntese (TTS) a quase zero, proporcionando um fluxo de conversa verdadeiramente natural, com ritmo uniforme e semelhante ao humano.
Decifrando as três camadas da tecnologia de ponta: como chegamos a 400 tokens/s?
Esse recorde mundial de velocidade é, principalmente, resultado da otimização de engenharia em nível de sistema desenvolvida em conjunto pela equipe GLM da Zhipu e pela equipe TileRT. Os 400 tokens/s não são um “momento de pico” espalhafatoso — trata-se de uma capacidade estável e pronta para produção. A lógica de otimização subjacente se divide em três camadas:
[Infrastructure Layer: Cluster/Load Balancing Collaboration] ─► [Scheduling System Layer: Dynamic Batching & KV Cache Scheduling] ─► [Inference Engine Layer: TileRT Architecture Rewriting Core Path] ─► 400 tokens/s Stable Output
Camada do mecanismo de inferência (personalização profunda do TileRT): Com base na arquitetura de rede exclusiva do GLM-5.1, a equipe reescreveu completamente o caminho de inferência mais crítico e os operadores subjacentes, permitindo que a taxa de transferência de uma única GPU e a eficiência de execução do hardware se aproximassem dos limites físicos.
Camada do Sistema de Agendamento (Fusão Inteligente): Introduziu o agrupamento dinâmico altamente agressivo, tecnologias de fusão de solicitações e uma otimização inovadora do agendamento do cache KV, resolvendo efetivamente os problemas de latência residual que os modelos tradicionais enfrentam sob alta simultaneidade e múltiplas solicitações de usuários.
Camada de Infraestrutura (Colaboração em Clusters): A otimização colaborativa abrangente em nível de hardware em torno da implantação de rede, da topologia dos links de rede e do balanceamento de carga em ultra-alta frequência do cluster de inferência garante que o poder de computação seja transmitido sem perdas por todo o pipeline.
Reavaliação do Setor: A Segunda Metade da IA Trata da Definição de “Valor e Tempo”
Conforme enfatizado por importantes instituições analíticas internacionais, como o UBS, em recentes fóruns de tecnologia da bolsa de Hong Kong, esta rodada de reavaliação do setor impulsionada pela IA é fundamentalmente diferente da “monetização de tráfego e tempo” da era da internet móvel. A filosofia de receita e sobrevivência da IA não consiste em manter os usuários presos ao software — trata-se de “ajudar usuários e empresas a economizar tempo, melhorar a eficiência e compartilhar o valor criado”.
A versão de alta velocidade GLM-5.1 da Zhipu aborda diretamente esse ponto crítico. Ao reduzir o custo e o tempo de produção de cada token a uma fração do original, ela permite que as empresas deixem de fazer escolhas difíceis entre “alta inteligência (escolher um modelo grande, mas lento)” e “velocidade (escolher um modelo pequeno, mas pouco eficaz)”.
Artigo relacionado
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Como corrigir as Core Web Vitals para melhorar o ranqueamento de SEO
Simplifique os Comentários do Boletim Escolar com Ferramentas de IAIntroduçãoFerramentas de IA para Gerar Comentários do Boletim EscolarMagic SchoolAlmanac AIChat GPTUsando o Magic School para Gerar Comentários do Boletim EscolarFazendo login n
Recomendações de tópicos especiais relacionados
Comentários (0)

Em 22 de maio, a Zhipu (02513.HK) causou grande repercussão tanto nos mercados de capitais quanto no setor de tecnologia. Suas ações subiram mais de 22% durante o pregão, elevando seu valor de mercado para mais de 450 bilhões de HKD. No mesmo dia, a empresa lançou um importante novo produto para clientes corporativos: a API GLM-5.1 Highspeed (GLM-5.1-highspeed).
Em testes reais, esse modelo atinge impressionantes 400 tokens/s (400 tokens por segundo), superando o limite de velocidade atual das APIs oficiais dos principais fornecedores globais de modelos de grande porte. Para se ter uma ideia: o volume de texto que um criador levaria dias de trabalho ininterrupto para produzir agora pode ser concluído em apenas um minuto. Uma tarefa de reengenharia de sistema que levaria três dias de digitação para um engenheiro pode ser totalmente executada no tempo que leva para tomar uma xícara de café.
Principais destaques:
Quebrando convenções: tradicionalmente, o setor partia do princípio de que “rápido” significava “pequeno ou leve”. A Zhipu é a primeira provedora nacional de modelos de grande porte a alcançar uma combinação perfeita entre **“recursos de ponta em escala real” e “latência extremamente baixa”**.
Conquistas impressionantes: a velocidade de saída chega a 400 tokens/s, suporta uma janela de contexto de 200 mil e permite uma saída única máxima de 128 mil tokens.
Tecnologia de ponta: Desenvolvido por meio de uma profunda colaboração entre a equipe GLM da Zhipu e a equipe TileRT, esse modelo reestrutura todo o ecossistema de inferência no nível do sistema.
Teste-piloto direcionado: já disponível para clientes corporativos selecionados por meio da plataforma aberta MaaS (Model as a Service) da Zhipu.
Como é, na prática, uma “resposta instantânea”? Um avanço em cenários sensíveis à velocidade
Ao longo do último ano, os recursos de colaboração entre codificação (programação) e agente (inteligência) em grandes modelos nacionais avançaram significativamente. Mas a “velocidade” continuou sendo o principal gargalo para tarefas de interação de cadeia longa e alta frequência. A Zhipu observa que a transição dos grandes modelos de “ferramentas” para “parceiros em tempo real” se torna verdadeiramente transformadora a 400 tokens/s:
Programação de IA (Agente de Codificação): Agentes inteligentes tradicionais geralmente exigem dezenas de chamadas entre arquivos e alinhamento de textos longos. Um único ciclo de resposta com atraso de alguns segundos pode prolongar toda a tarefa para mais de dez minutos. Com a versão de alta velocidade, escrever código é como trabalhar a uma velocidade 10 vezes maior — funções, interfaces e cadeias de chamadas subjacentes se desenrolam instantaneamente à medida que o usuário digita, eliminando qualquer tempo de espera para retrabalho de engenharia em grande escala.
Interação em tempo real e jogos 3D: a latência extremamente baixa permite que o modelo lide com geração dinâmica em tempo real dentro de mundos de jogos, construção instantânea de interfaces de usuário na web e mudanças imediatas no estado do sistema com base na entrada contínua do usuário — tudo sem atrasos.
Clusters de decisão empresarial: em simulação paralela com múltiplos agentes e análise de big data em tempo real, a versão de alta velocidade permite concluir respostas paralelas com múltiplas personalidades de clusters de agentes web em 30 segundos, elevando significativamente o limite de eficiência para quantificação e simulação de alta frequência.
Voz em tempo real sem interrupções: Em cenários de coaching com IA e atendimento inteligente ao cliente, a resposta ultrarrápida reduz a latência entre o reconhecimento de fala (ASR) e a síntese (TTS) a quase zero, proporcionando um fluxo de conversa verdadeiramente natural, com ritmo uniforme e semelhante ao humano.
Decifrando as três camadas da tecnologia de ponta: como chegamos a 400 tokens/s?
Esse recorde mundial de velocidade é, principalmente, resultado da otimização de engenharia em nível de sistema desenvolvida em conjunto pela equipe GLM da Zhipu e pela equipe TileRT. Os 400 tokens/s não são um “momento de pico” espalhafatoso — trata-se de uma capacidade estável e pronta para produção. A lógica de otimização subjacente se divide em três camadas:
[Infrastructure Layer: Cluster/Load Balancing Collaboration] ─► [Scheduling System Layer: Dynamic Batching & KV Cache Scheduling] ─► [Inference Engine Layer: TileRT Architecture Rewriting Core Path] ─► 400 tokens/s Stable Output
Camada do mecanismo de inferência (personalização profunda do TileRT): Com base na arquitetura de rede exclusiva do GLM-5.1, a equipe reescreveu completamente o caminho de inferência mais crítico e os operadores subjacentes, permitindo que a taxa de transferência de uma única GPU e a eficiência de execução do hardware se aproximassem dos limites físicos.
Camada do Sistema de Agendamento (Fusão Inteligente): Introduziu o agrupamento dinâmico altamente agressivo, tecnologias de fusão de solicitações e uma otimização inovadora do agendamento do cache KV, resolvendo efetivamente os problemas de latência residual que os modelos tradicionais enfrentam sob alta simultaneidade e múltiplas solicitações de usuários.
Camada de Infraestrutura (Colaboração em Clusters): A otimização colaborativa abrangente em nível de hardware em torno da implantação de rede, da topologia dos links de rede e do balanceamento de carga em ultra-alta frequência do cluster de inferência garante que o poder de computação seja transmitido sem perdas por todo o pipeline.
Reavaliação do Setor: A Segunda Metade da IA Trata da Definição de “Valor e Tempo”
Conforme enfatizado por importantes instituições analíticas internacionais, como o UBS, em recentes fóruns de tecnologia da bolsa de Hong Kong, esta rodada de reavaliação do setor impulsionada pela IA é fundamentalmente diferente da “monetização de tráfego e tempo” da era da internet móvel. A filosofia de receita e sobrevivência da IA não consiste em manter os usuários presos ao software — trata-se de “ajudar usuários e empresas a economizar tempo, melhorar a eficiência e compartilhar o valor criado”.
A versão de alta velocidade GLM-5.1 da Zhipu aborda diretamente esse ponto crítico. Ao reduzir o custo e o tempo de produção de cada token a uma fração do original, ela permite que as empresas deixem de fazer escolhas difíceis entre “alta inteligência (escolher um modelo grande, mas lento)” e “velocidade (escolher um modelo pequeno, mas pouco eficaz)”.
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
Como corrigir as Core Web Vitals para melhorar o ranqueamento de SEO
Simplifique os Comentários do Boletim Escolar com Ferramentas de IAIntroduçãoFerramentas de IA para Gerar Comentários do Boletim EscolarMagic SchoolAlmanac AIChat GPTUsando o Magic School para Gerar Comentários do Boletim EscolarFazendo login n











