Lar
ZhiPu e TileRT lançam a API GLM-5.1 de alta velocidade a 400 tokens/s, estabelecendo um novo recorde mundial
A Zhipu lançou oficialmente hoje a API GLM-5.1 Highspeed (GLM-5.1-highspeed) para clientes corporativos selecionados. Esse modelo atinge uma velocidade de saída notável de 400 tokens/s, superando o atual recorde mundial de velocidade para APIs de modelos de grande porte.
Isso desafia a crença de longa data do setor de que “modelos de alto desempenho vêm com alta latência” ou que “modelos rápidos são necessariamente leves”. A versão GLM-5.1 Highspeed é o primeiro modelo de grande porte nacional a oferecer, em ambiente de produção, recursos de modelo premium e latência ultrabaixa ao mesmo tempo, liberando os usuários da necessidade de sacrificar a qualidade do modelo em prol da velocidade.

Transformando a experiência do usuário em cenários em que a velocidade é fundamental
Em tarefas de longo prazo e ambientes de produção complexos, o aumento na velocidade mudou fundamentalmente a forma como os produtos são projetados:
Programação de IA (Agente de Codificação): Aproveitando os poderosos recursos do GLM-5.1, o novo modelo oferece respostas instantâneas às consultas. Ele compreende o contexto de engenharia enquanto gera código continuamente e refina soluções. Em projetos de reconstrução que exigem dezenas de chamadas, ele elimina o tempo de espera acumulado de vários minutos.
Modelagem dinâmica em tempo real: em testes de campo com mapas 3D, os jogadores controlam o movimento de um personagem e inserem texto, e o modelo conclui instantaneamente a modelagem, atualizando dinamicamente a cena em tempo real.
Agendamento Paralelo de Enxame de Agentes: Em tarefas de longo prazo, o modelo processa páginas da web complexas em 30 segundos e agenda instantaneamente 50 personalidades diferentes para responder em paralelo, apresentando o protótipo de um novo sistema operacional.
Análise aprofundada da tecnologia central: Mecanismo de inferência de alto desempenho TileRT
A taxa de processamento estável de 400 TPS em nível de produção é resultado da otimização em nível de sistema realizada pelas equipes Zhipu GLM e TileRT:
Camada do motor de inferência (programação estática AOT no período de compilação do TileRT):
As estruturas tradicionais mais comuns utilizam operadores (operador/kernel) como unidade básica de agendamento. Em cenários de token único e pequenos lotes, isso amplifica a sobrecarga de agendamento, acesso à memória e sincronização. O TileRT elimina completamente o agendamento dinâmico na camada de tempo de execução, agendando estaticamente todo o gráfico de computação em uma GPU persistente persistent Engine Kernel durante a compilação (AOT). Dentro de uma única GPU, a computação, a E/S assíncrona e a comunicação são decompostas em microtarefas no nível de bloco. Todo o processo de inferência inicia apenas um kernel, com resultados intermediários transmitidos diretamente por meio de registros, memória compartilhada e cache L2, sem gravação na memória global.
Camada do sistema de agendamento:
Por meio do agrupamento dinâmico em lotes, da fusão de solicitações e da otimização do agendamento do cache KV, a latência residual em cenários de alta concorrência é significativamente reduzida.
Camada de infraestrutura:
Em escala de múltiplas placas, o TileRT amplia o conceito de Warp Specialization dentro de um único SM para toda a topologia NVL de 8 placas. Diferentes ranks de GPU são especializados em diferentes workers com base na densidade computacional e nas dependências de dados, combinados com links de rede e balanceamento de carga para otimização colaborativa, garantindo alto desempenho e operação estável.
Disponibilidade e acesso
A versão GLM-5.1 Highspeed é ideal para programação de IA, interação em tempo real, tomada de decisões empresariais e aplicativos de voz em tempo real que exigem latência de resposta extremamente baixa. O serviço já está oficialmente disponível na Plataforma Zhipu MaaS e está aberto a clientes corporativos selecionados
Artigo relacionado
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Como corrigir as Core Web Vitals para melhorar o ranqueamento de SEO
Simplifique os Comentários do Boletim Escolar com Ferramentas de IAIntroduçãoFerramentas de IA para Gerar Comentários do Boletim EscolarMagic SchoolAlmanac AIChat GPTUsando o Magic School para Gerar Comentários do Boletim EscolarFazendo login n
Recomendações de tópicos especiais relacionados
Comentários (0)
A Zhipu lançou oficialmente hoje a
Isso desafia a crença de longa data do setor de que “modelos de alto desempenho vêm com alta latência” ou que “modelos rápidos são necessariamente leves”. A versão GLM-5.1 Highspeed é o primeiro modelo de grande porte nacional a oferecer, em ambiente de produção, recursos de modelo premium e latência ultrabaixa ao mesmo tempo, liberando os usuários da necessidade de sacrificar a qualidade do modelo em prol da velocidade.

Transformando a experiência do usuário em cenários em que a velocidade é fundamental
Em tarefas de longo prazo e ambientes de produção complexos, o aumento na velocidade mudou fundamentalmente a forma como os produtos são projetados:
Programação de IA (Agente de Codificação): Aproveitando os poderosos recursos do GLM-5.1, o novo modelo oferece respostas instantâneas às consultas. Ele compreende o contexto de engenharia enquanto gera código continuamente e refina soluções. Em projetos de reconstrução que exigem dezenas de chamadas, ele elimina o tempo de espera acumulado de vários minutos.
Modelagem dinâmica em tempo real: em testes de campo com mapas 3D, os jogadores controlam o movimento de um personagem e inserem texto, e o modelo conclui instantaneamente a modelagem, atualizando dinamicamente a cena em tempo real.
Agendamento Paralelo de Enxame de Agentes: Em tarefas de longo prazo, o modelo processa páginas da web complexas em 30 segundos e agenda instantaneamente 50 personalidades diferentes para responder em paralelo, apresentando o protótipo de um novo sistema operacional.
Análise aprofundada da tecnologia central: Mecanismo de inferência de alto desempenho TileRT
A taxa de processamento estável de 400 TPS em nível de produção é resultado da otimização em nível de sistema realizada pelas equipes Zhipu GLM e TileRT:
Camada do motor de inferência (programação estática AOT no período de compilação do TileRT):
As estruturas tradicionais mais comuns utilizam operadores (operador/kernel) como unidade básica de agendamento. Em cenários de token único e pequenos lotes, isso amplifica a sobrecarga de agendamento, acesso à memória e sincronização. O TileRT elimina completamente o agendamento dinâmico na camada de tempo de execução, agendando estaticamente todo o gráfico de computação em uma GPU persistente persistent Engine Kernel durante a compilação (AOT). Dentro de uma única GPU, a computação, a E/S assíncrona e a comunicação são decompostas em microtarefas no nível de bloco. Todo o processo de inferência inicia apenas um kernel, com resultados intermediários transmitidos diretamente por meio de registros, memória compartilhada e cache L2, sem gravação na memória global.
Camada do sistema de agendamento:
Por meio do agrupamento dinâmico em lotes, da fusão de solicitações e da otimização do agendamento do cache KV, a latência residual em cenários de alta concorrência é significativamente reduzida.
Camada de infraestrutura:
Em escala de múltiplas placas, o TileRT amplia o conceito de Warp Specialization dentro de um único SM para toda a topologia NVL de 8 placas. Diferentes ranks de GPU são especializados em diferentes workers com base na densidade computacional e nas dependências de dados, combinados com links de rede e balanceamento de carga para otimização colaborativa, garantindo alto desempenho e operação estável.
Disponibilidade e acesso
A versão GLM-5.1 Highspeed é ideal para programação de IA, interação em tempo real, tomada de decisões empresariais e aplicativos de voz em tempo real que exigem latência de resposta extremamente baixa. O serviço já está oficialmente disponível na
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
Como corrigir as Core Web Vitals para melhorar o ranqueamento de SEO
Simplifique os Comentários do Boletim Escolar com Ferramentas de IAIntroduçãoFerramentas de IA para Gerar Comentários do Boletim EscolarMagic SchoolAlmanac AIChat GPTUsando o Magic School para Gerar Comentários do Boletim EscolarFazendo login n











