Lar
A Moonshot AI e a Universidade de Tsinghua propõem a arquitetura PrfaaS para centros de dados
Como os grandes modelos de linguagem (LLMs) exigem mais poder computacional durante o raciocínio, as arquiteturas de serviço convencionais enfrentam gargalos. A Moonshot AI, em colaboração com uma equipe de pesquisa da Universidade de Tsinghua, apresentou uma arquitetura inovadora chamada Pre-filling as a Service (PrfaaS), com o objetivo de superar as limitações dos data centers e dos recursos computacionais em serviços de LLMs.

O processo de raciocínio dos grandes modelos de linguagem é geralmente dividido em duas fases: pré-preenchimento e decodificação. O pré-preenchimento é computacionalmente intensivo, pois o modelo processa a entrada e cria um cache de chave-valor (KVCache). A decodificação é intensiva em largura de banda de memória, gerando saídas sequencialmente. As configurações tradicionais exigem que ambas as etapas ocorram no mesmo data center, o que gera restrições em termos de computação e largura de banda.
O PrfaaS possibilita um serviço eficiente entre data centers ao transferir as tarefas de pré-preenchimento para clusters dedicados de alta capacidade computacional, utilizando uma rede Ethernet padrão para transferir o KVCache gerado para clusters locais de decodificação. Pesquisas indicam que essa arquitetura aumenta o desempenho de processamento, alcançando um aumento de 54% na taxa de transferência do serviço em relação aos modelos tradicionais. Estudos de caso reais também mostram menor latência e maior eficiência.
A arquitetura do PrfaaS desacopla os três principais subsistemas — computação, rede e armazenamento —, gerenciando cada um deles de forma independente. Um mecanismo de roteamento preciso garante a transmissão eficiente de solicitações longas, evitando o congestionamento causado pela alocação desigual de recursos observada nas abordagens tradicionais. Além disso, um mecanismo de agendamento em dupla escala temporal se adapta a padrões de tráfego variáveis, otimizando ainda mais o uso de recursos.
À medida que cresce a demanda por raciocínio entre data centers e novos hardwares continuam a surgir, o PrfaaS oferece uma solução promissora para futuras aplicações de IA.
Artigo relacionado
Suno para Marcas d'Água em Músicas Durante Batalhas Legais
O Suno, plataforma que permite aos usuários gerar músicas criadas por inteligência artificial, apresentou novas funcionalidades para rotular as faixas produzidas pela plataforma, restringir downloads e atualizar os padrões da comunidade para coibir r
Musk admite que vazamento do código do Grok expôs dados de usuários e promete apagar todas as informações históricas.
Elon Musk abordou diretamente a controvérsia sobre privacidade envolvendo o Grok Build, começando com um simples "Verdadeiro" para confirmar a validade do incidente. Ele prometeu que todos os dados dos usuários carregados anteriormente para a SpaceXA
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Recomendações de tópicos especiais relacionados
Comentários (10)
Интересная архитектура PrfaS от Moonshot и Цинхуа для решения проблем с вычислительной мощностью LLM. Надеюсь, это поможет оптимизировать центры обработки данных! 🚀
A arquitetura PrfaS proposta por Moonshot e Tsinghua é um passo interessante para resolver gargalos de computação em LLMs. Será que isso viabiliza data centers mais eficientes? 🤔
La arquitectura PrfaS de Moonshot y Tsinghua parece una gran solución para los cuellos de botella en centros de datos con LLMs. ¡Esperamos ver resultados concretos pronto! 📈
Moonshot AI und Tsinghua zeigen mit PrfaS einen vielversprechenden Ansatz gegen Rechenengpässe bei LLMs. Spannend zu sehen, wie diese Kooperation die Datenzukunft gestaltet! 🌐
Como os grandes modelos de linguagem (LLMs) exigem mais poder computacional durante o raciocínio, as arquiteturas de serviço convencionais enfrentam gargalos. A Moonshot AI, em colaboração com uma equipe de pesquisa da Universidade de Tsinghua, apresentou uma arquitetura inovadora chamada Pre-filling as a Service (PrfaaS), com o objetivo de superar as limitações dos data centers e dos recursos computacionais em serviços de LLMs.

O processo de raciocínio dos grandes modelos de linguagem é geralmente dividido em duas fases: pré-preenchimento e decodificação. O pré-preenchimento é computacionalmente intensivo, pois o modelo processa a entrada e cria um cache de chave-valor (KVCache). A decodificação é intensiva em largura de banda de memória, gerando saídas sequencialmente. As configurações tradicionais exigem que ambas as etapas ocorram no mesmo data center, o que gera restrições em termos de computação e largura de banda.
O PrfaaS possibilita um serviço eficiente entre data centers ao transferir as tarefas de pré-preenchimento para clusters dedicados de alta capacidade computacional, utilizando uma rede Ethernet padrão para transferir o KVCache gerado para clusters locais de decodificação. Pesquisas indicam que essa arquitetura aumenta o desempenho de processamento, alcançando um aumento de 54% na taxa de transferência do serviço em relação aos modelos tradicionais. Estudos de caso reais também mostram menor latência e maior eficiência.
A arquitetura do PrfaaS desacopla os três principais subsistemas — computação, rede e armazenamento —, gerenciando cada um deles de forma independente. Um mecanismo de roteamento preciso garante a transmissão eficiente de solicitações longas, evitando o congestionamento causado pela alocação desigual de recursos observada nas abordagens tradicionais. Além disso, um mecanismo de agendamento em dupla escala temporal se adapta a padrões de tráfego variáveis, otimizando ainda mais o uso de recursos.
À medida que cresce a demanda por raciocínio entre data centers e novos hardwares continuam a surgir, o PrfaaS oferece uma solução promissora para futuras aplicações de IA.
Suno para Marcas d'Água em Músicas Durante Batalhas Legais
O Suno, plataforma que permite aos usuários gerar músicas criadas por inteligência artificial, apresentou novas funcionalidades para rotular as faixas produzidas pela plataforma, restringir downloads e atualizar os padrões da comunidade para coibir r
Musk admite que vazamento do código do Grok expôs dados de usuários e promete apagar todas as informações históricas.
Elon Musk abordou diretamente a controvérsia sobre privacidade envolvendo o Grok Build, começando com um simples "Verdadeiro" para confirmar a validade do incidente. Ele prometeu que todos os dados dos usuários carregados anteriormente para a SpaceXA
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Интересная архитектура PrfaS от Moonshot и Цинхуа для решения проблем с вычислительной мощностью LLM. Надеюсь, это поможет оптимизировать центры обработки данных! 🚀
A arquitetura PrfaS proposta por Moonshot e Tsinghua é um passo interessante para resolver gargalos de computação em LLMs. Será que isso viabiliza data centers mais eficientes? 🤔
La arquitectura PrfaS de Moonshot y Tsinghua parece una gran solución para los cuellos de botella en centros de datos con LLMs. ¡Esperamos ver resultados concretos pronto! 📈
Moonshot AI und Tsinghua zeigen mit PrfaS einen vielversprechenden Ansatz gegen Rechenengpässe bei LLMs. Spannend zu sehen, wie diese Kooperation die Datenzukunft gestaltet! 🌐











