Lar
O Google DeepMind apresenta a estrutura STATIC para aumentar em 948 vezes a velocidade de recuperação em sistemas de recuperação generativa com modelos de linguagem de grande escala (LLM)
Nos sistemas modernos de recomendação industrial, a Busca Generativa (GR) baseada em grandes modelos de linguagem (LLM) vem substituindo gradualmente a busca tradicional baseada em embeddings. No entanto, na prática, essa abordagem enfrenta um problema crítico: o modelo frequentemente gera IDs de produtos inválidos ou resultados que violam restrições de estoque, resultando em recomendações sem sentido.
Para resolver esse problema, pesquisadores do Google DeepMind e do YouTube apresentaram, em conjunto, uma nova estrutura chamada STATIC (Índice Trie Acelerado por Matriz de Transição Esparsa para Decodificação Restrita). Essa técnica utiliza métodos matemáticos inovadores para acelerar a decodificação restrita em LLMs em impressionantes 948 vezes.

Principais avanços tecnológicos:
Transformar “Árvore” em “Matriz”: A verificação tradicional de restrições depende de árvores de prefixos (Trie), que apresentam baixo desempenho em hardware como GPUs e TPUs. O STATIC transforma a árvore complexa em uma matriz de linhas esparsas comprimidas estáticas (CSR), convertendo a verificação em uma operação vetorizada que o hardware processa com eficiência.
Velocidade de resposta excepcional: Em testes com um modelo de 3 bilhões de parâmetros, o STATIC atinge uma latência de etapa única de apenas 0,033 milissegundos. Isso é quase 1.000 vezes mais rápido do que a recuperação tradicional baseada em CPU e mais de 40 vezes mais rápido do que as soluções existentes aceleradas por hardware.
Teste bem-sucedido no YouTube: O STATIC foi implantado no sistema de recomendação de vídeos do YouTube para garantir que as recomendações atendam a restrições comerciais, como a atualidade dos vídeos nos últimos sete dias. Os testes revelaram um aumento de 5,1% no volume de reprodução de vídeos recentes, juntamente com uma melhoria notável na taxa de cliques (CTR).
Além disso, o STATIC supera as limitações da recuperação generativa durante a fase de inicialização a frio. Ao impor restrições precisas de decodificação, o modelo alcança uma melhoria significativa na precisão ao recomendar produtos totalmente novos que nunca encontrou antes.
Artigo relacionado
O Slackbot torna-se um Agente de IA
O Slackbot, o assistente automatizado integrado à plataforma de mensagens corporativas Slack da Salesforce, está se transformando em um agente de IA. O CTO da Salesforce, Parker Harris, prevê que ele alcance um status viral comparável ao do ChatGPT d
A ByteDance Aumenta os Incentivos de IA Principal com o Doubao Aumentando 14,6%
A ByteDance convocou recentemente uma reunião de divulgação sobre a participação acionária do DouBao para revelar novas políticas de incentivos para os funcionários envolvidos na divisão do DouBao. O preço de exercício das ações do DouBao foi elevado
MiniMax Lança Programa de Equipes 10x para Incentivar Especialistas Globais em IA
A MiniMax (Xiyu Technology), o Laboratório de Inteligência Artificial Geral, lançou oficialmente o "Equipe 10x", uma iniciativa global de colaboração de talentos. Este programa visa recrutar os melhores especialistas de diversos setores para explorar
Recomendações de tópicos especiais relacionados
Comentários (1)
Nos sistemas modernos de recomendação industrial, a Busca Generativa (GR) baseada em grandes modelos de linguagem (LLM) vem substituindo gradualmente a busca tradicional baseada em embeddings. No entanto, na prática, essa abordagem enfrenta um problema crítico: o modelo frequentemente gera IDs de produtos inválidos ou resultados que violam restrições de estoque, resultando em recomendações sem sentido.
Para resolver esse problema, pesquisadores do Google DeepMind e do YouTube apresentaram, em conjunto, uma nova estrutura chamada STATIC (Índice Trie Acelerado por Matriz de Transição Esparsa para Decodificação Restrita). Essa técnica utiliza métodos matemáticos inovadores para acelerar a decodificação restrita em LLMs em impressionantes 948 vezes.

Principais avanços tecnológicos:
Transformar “Árvore” em “Matriz”: A verificação tradicional de restrições depende de árvores de prefixos (Trie), que apresentam baixo desempenho em hardware como GPUs e TPUs. O STATIC transforma a árvore complexa em uma matriz de linhas esparsas comprimidas estáticas (CSR), convertendo a verificação em uma operação vetorizada que o hardware processa com eficiência.
Velocidade de resposta excepcional: Em testes com um modelo de 3 bilhões de parâmetros, o STATIC atinge uma latência de etapa única de apenas 0,033 milissegundos. Isso é quase 1.000 vezes mais rápido do que a recuperação tradicional baseada em CPU e mais de 40 vezes mais rápido do que as soluções existentes aceleradas por hardware.
Teste bem-sucedido no YouTube: O STATIC foi implantado no sistema de recomendação de vídeos do YouTube para garantir que as recomendações atendam a restrições comerciais, como a atualidade dos vídeos nos últimos sete dias. Os testes revelaram um aumento de 5,1% no volume de reprodução de vídeos recentes, juntamente com uma melhoria notável na taxa de cliques (CTR).
Além disso, o STATIC supera as limitações da recuperação generativa durante a fase de inicialização a frio. Ao impor restrições precisas de decodificação, o modelo alcança uma melhoria significativa na precisão ao recomendar produtos totalmente novos que nunca encontrou antes.
O Slackbot torna-se um Agente de IA
O Slackbot, o assistente automatizado integrado à plataforma de mensagens corporativas Slack da Salesforce, está se transformando em um agente de IA. O CTO da Salesforce, Parker Harris, prevê que ele alcance um status viral comparável ao do ChatGPT d
A ByteDance Aumenta os Incentivos de IA Principal com o Doubao Aumentando 14,6%
A ByteDance convocou recentemente uma reunião de divulgação sobre a participação acionária do DouBao para revelar novas políticas de incentivos para os funcionários envolvidos na divisão do DouBao. O preço de exercício das ações do DouBao foi elevado
MiniMax Lança Programa de Equipes 10x para Incentivar Especialistas Globais em IA
A MiniMax (Xiyu Technology), o Laboratório de Inteligência Artificial Geral, lançou oficialmente o "Equipe 10x", uma iniciativa global de colaboração de talentos. Este programa visa recrutar os melhores especialistas de diversos setores para explorar











