Hogar
Google DeepMind presenta el marco STATIC para multiplicar por 948 la velocidad de recuperación en la recuperación generativa con modelos de lenguaje a gran escala (LLM)
En los sistemas de recomendación industriales modernos, la «búsqueda generativa» (GR), basada en modelos de lenguaje a gran escala (LLM), está sustituyendo progresivamente a la búsqueda tradicional basada en incrustaciones. Sin embargo, en la práctica, este enfoque se enfrenta a un problema crítico: el modelo suele generar identificadores de producto inválidos o resultados que incumplen las restricciones de inventario, lo que da lugar a recomendaciones sin sentido.
Para resolver este problema, investigadores de Google DeepMind y YouTube han presentado conjuntamente un nuevo marco denominado STATIC (Índice Trie acelerado mediante matriz de transición dispersa para la decodificación con restricciones). Esta técnica aprovecha métodos matemáticos innovadores para acelerar la decodificación con restricciones en los LLM hasta 948 veces, lo cual es impresionante.

Avances tecnológicos clave:
Convertir el «árbol» en «matriz»: La verificación tradicional de restricciones se basa en árboles de prefijos (Trie), que funcionan de forma ineficiente en hardware como las GPU y las TPU. STATIC transforma el complejo árbol en una matriz de filas dispersas comprimidas estáticas (CSR), convirtiendo la verificación en una operación vectorizada que el hardware gestiona de forma eficiente.
Velocidad de respuesta excepcional: En pruebas con un modelo de 3 000 millones de parámetros, STATIC alcanza una latencia por paso de tan solo 0,033 milisegundos. Esto es casi 1 000 veces más rápido que la recuperación tradicional basada en CPU y más de 40 veces más rápido que las soluciones existentes aceleradas por hardware.
Prueba satisfactoria en YouTube: STATIC se ha implementado en el sistema de recomendación de vídeos de YouTube para garantizar que las recomendaciones cumplan con las restricciones empresariales, como que los vídeos sean recientes (de los últimos siete días). Las pruebas revelaron un aumento del 5,1 % en el volumen de reproducción de los vídeos recientes, junto con una notable mejora en la tasa de clics (CTR).
Además, STATIC supera las limitaciones de la recuperación generativa durante la fase de arranque en frío. Al aplicar restricciones de decodificación precisas, el modelo logra una mejora significativa de la precisión a la hora de recomendar productos totalmente nuevos con los que nunca se ha encontrado antes.
Artículo relacionado
Slackbot se convierte en un agente de IA
Slackbot, el asistente automatizado integrado en la plataforma de mensajería corporativa Slack de Salesforce, está evolucionando hacia un agente de inteligencia artificial. El CTO de Salesforce, Parker Harris, prevé que alcance un estatus viral compa
ByteDance Refuerza los Incentivos de IA Central mientras Doubao Aumenta un 14.6%
ByteDance ha convocado recientemente una sesión informativa sobre la participación accionaria de DouBao para presentar nuevas políticas de incentivos para el personal involucrado en la división de DouBao. El precio de ejercicio de las acciones de Dou
MiniMax presenta el Programa de Equipo 10x para incentivar a expertos globales en IA
MiniMax (Xiyu Technology), el Laboratorio de Inteligencia Artificial General, ha lanzado oficialmente "10x Team", una iniciativa global de colaboración de talento. Este programa tiene como objetivo reclutar a los mejores expertos de diversas industri
Recomendaciones de temas especiales relacionados
comentario (1)
0/500
En los sistemas de recomendación industriales modernos, la «búsqueda generativa» (GR), basada en modelos de lenguaje a gran escala (LLM), está sustituyendo progresivamente a la búsqueda tradicional basada en incrustaciones. Sin embargo, en la práctica, este enfoque se enfrenta a un problema crítico: el modelo suele generar identificadores de producto inválidos o resultados que incumplen las restricciones de inventario, lo que da lugar a recomendaciones sin sentido.
Para resolver este problema, investigadores de Google DeepMind y YouTube han presentado conjuntamente un nuevo marco denominado STATIC (Índice Trie acelerado mediante matriz de transición dispersa para la decodificación con restricciones). Esta técnica aprovecha métodos matemáticos innovadores para acelerar la decodificación con restricciones en los LLM hasta 948 veces, lo cual es impresionante.

Avances tecnológicos clave:
Convertir el «árbol» en «matriz»: La verificación tradicional de restricciones se basa en árboles de prefijos (Trie), que funcionan de forma ineficiente en hardware como las GPU y las TPU. STATIC transforma el complejo árbol en una matriz de filas dispersas comprimidas estáticas (CSR), convirtiendo la verificación en una operación vectorizada que el hardware gestiona de forma eficiente.
Velocidad de respuesta excepcional: En pruebas con un modelo de 3 000 millones de parámetros, STATIC alcanza una latencia por paso de tan solo 0,033 milisegundos. Esto es casi 1 000 veces más rápido que la recuperación tradicional basada en CPU y más de 40 veces más rápido que las soluciones existentes aceleradas por hardware.
Prueba satisfactoria en YouTube: STATIC se ha implementado en el sistema de recomendación de vídeos de YouTube para garantizar que las recomendaciones cumplan con las restricciones empresariales, como que los vídeos sean recientes (de los últimos siete días). Las pruebas revelaron un aumento del 5,1 % en el volumen de reproducción de los vídeos recientes, junto con una notable mejora en la tasa de clics (CTR).
Además, STATIC supera las limitaciones de la recuperación generativa durante la fase de arranque en frío. Al aplicar restricciones de decodificación precisas, el modelo logra una mejora significativa de la precisión a la hora de recomendar productos totalmente nuevos con los que nunca se ha encontrado antes.
Slackbot se convierte en un agente de IA
Slackbot, el asistente automatizado integrado en la plataforma de mensajería corporativa Slack de Salesforce, está evolucionando hacia un agente de inteligencia artificial. El CTO de Salesforce, Parker Harris, prevé que alcance un estatus viral compa
ByteDance Refuerza los Incentivos de IA Central mientras Doubao Aumenta un 14.6%
ByteDance ha convocado recientemente una sesión informativa sobre la participación accionaria de DouBao para presentar nuevas políticas de incentivos para el personal involucrado en la división de DouBao. El precio de ejercicio de las acciones de Dou
MiniMax presenta el Programa de Equipo 10x para incentivar a expertos globales en IA
MiniMax (Xiyu Technology), el Laboratorio de Inteligencia Artificial General, ha lanzado oficialmente "10x Team", una iniciativa global de colaboración de talento. Este programa tiene como objetivo reclutar a los mejores expertos de diversas industri











