Hogar
Tongyi Lab presenta el algoritmo FIPO: la inferencia del modelo de 32 mil millones supera a o1-mini

El equipo de Computación Inteligente de Tongyi Lab ha presentado hoy un nuevo algoritmo de posentrenamiento para modelos de lenguaje a gran escala: FIPO (Future-KL Influenced Policy Optimization). Este algoritmo introduce un novedoso mecanismo denominado «Future-KL» que resuelve de forma eficaz el reto técnico habitual del «estancamiento de la longitud de inferencia» en el entrenamiento mediante aprendizaje por refuerzo puro (Pure RL).
Durante el entrenamiento para el razonamiento con textos largos y la alineación lógica compleja, el aprendizaje por refuerzo tradicional a menudo no logra identificar con precisión los puntos clave de decisión en secuencias extensas. El algoritmo FIPO, desarrollado por el equipo de Tongyi, aplica una asignación diferenciada de recompensas a los tokens clave, lo que anima al modelo a adoptar un enfoque más prospectivo durante la generación de la cadena de pensamiento (CoT).
Los resultados experimentales indican que, en un entorno de aprendizaje por refuerzo puro con un modelo a escala de 32B, el modelo que utiliza el algoritmo FIPO ya ha superado a modelos de tamaño similar, como DeepSeek-Zero-MATH y el o1-mini de OpenAI, lo que supone un avance significativo en las capacidades de razonamiento lógico y cálculo matemático de los grandes modelos nacionales.
En la actualidad, la competencia entre los modelos a gran escala está pasando de la escala de preentrenamiento a la alineación profunda en el momento de la inferencia. El lanzamiento de FIPO no solo ofrece una nueva forma de evaluar la calidad de los «procesos de pensamiento» en los modelos de razonamiento lógico, sino que también indica que la comunidad de código abierto y los principales laboratorios nacionales están forjando gradualmente una trayectoria tecnológica independiente en su búsqueda de modelos de razonamiento de primer orden.
Artículo relacionado
Corea del Sur inicia la construcción del Centro Nacional de Cómputo de IA, invirtiendo 2,5 billones de wones con un objetivo para 2028
El medio surcoreano EtNews informa que la ceremonia de colocación de la primera piedra del Centro de Cómputo de IA de Corea (KOACC) se llevó a cabo el 3 de agosto en el parque de centros de datos Solar City, en Sunan, Jeollanam-do. Con una inversión
Seis gigantes tecnológicos respaldan a la Linux Foundation con 12,5 millones de dólares para abordar el ruido de las vulnerabilidades de la inteligencia artificial
Para hacer frente a la avalancha de informes de seguridad de baja calidad generados por herramientas de automatización de IA, seis grandes empresas tecnológicas—Anthropic, Amazon (AWS), GitHub, Google, Microsoft y OpenAI—han contribuido conjuntamente
Musk Consideró Dejar OpenAI a Sus Hijos Mientras Altman Declaraba
Esta mañana, el director ejecutivo de OpenAI, Sam Altman, prestó declaración para responder a la demanda presentada por su antiguo cofundador, Elon Musk, que cuestiona la estructura corporativa de la empresa.Cuando se le preguntó sobre la afirmación
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

El equipo de Computación Inteligente de Tongyi Lab ha presentado hoy un nuevo algoritmo de posentrenamiento para modelos de lenguaje a gran escala: FIPO (Future-KL Influenced Policy Optimization). Este algoritmo introduce un novedoso mecanismo denominado «Future-KL» que resuelve de forma eficaz el reto técnico habitual del «estancamiento de la longitud de inferencia» en el entrenamiento mediante aprendizaje por refuerzo puro (Pure RL).
Durante el entrenamiento para el razonamiento con textos largos y la alineación lógica compleja, el aprendizaje por refuerzo tradicional a menudo no logra identificar con precisión los puntos clave de decisión en secuencias extensas. El algoritmo FIPO, desarrollado por el equipo de Tongyi, aplica una asignación diferenciada de recompensas a los tokens clave, lo que anima al modelo a adoptar un enfoque más prospectivo durante la generación de la cadena de pensamiento (CoT).
Los resultados experimentales indican que, en un entorno de aprendizaje por refuerzo puro con un modelo a escala de 32B, el modelo que utiliza el algoritmo FIPO ya ha superado a modelos de tamaño similar, como DeepSeek-Zero-MATH y el o1-mini de OpenAI, lo que supone un avance significativo en las capacidades de razonamiento lógico y cálculo matemático de los grandes modelos nacionales.
En la actualidad, la competencia entre los modelos a gran escala está pasando de la escala de preentrenamiento a la alineación profunda en el momento de la inferencia. El lanzamiento de FIPO no solo ofrece una nueva forma de evaluar la calidad de los «procesos de pensamiento» en los modelos de razonamiento lógico, sino que también indica que la comunidad de código abierto y los principales laboratorios nacionales están forjando gradualmente una trayectoria tecnológica independiente en su búsqueda de modelos de razonamiento de primer orden.
Corea del Sur inicia la construcción del Centro Nacional de Cómputo de IA, invirtiendo 2,5 billones de wones con un objetivo para 2028
El medio surcoreano EtNews informa que la ceremonia de colocación de la primera piedra del Centro de Cómputo de IA de Corea (KOACC) se llevó a cabo el 3 de agosto en el parque de centros de datos Solar City, en Sunan, Jeollanam-do. Con una inversión
Seis gigantes tecnológicos respaldan a la Linux Foundation con 12,5 millones de dólares para abordar el ruido de las vulnerabilidades de la inteligencia artificial
Para hacer frente a la avalancha de informes de seguridad de baja calidad generados por herramientas de automatización de IA, seis grandes empresas tecnológicas—Anthropic, Amazon (AWS), GitHub, Google, Microsoft y OpenAI—han contribuido conjuntamente
Musk Consideró Dejar OpenAI a Sus Hijos Mientras Altman Declaraba
Esta mañana, el director ejecutivo de OpenAI, Sam Altman, prestó declaración para responder a la demanda presentada por su antiguo cofundador, Elon Musk, que cuestiona la estructura corporativa de la empresa.Cuando se le preguntó sobre la afirmación











