Lar
O Tongyi Lab lança o algoritmo FIPO; a inferência do modelo de 32 bilhões supera o o1-mini

A equipe de Computação Inteligente do Tongyi Lab divulgou hoje um novo algoritmo pós-treinamento para grandes modelos de linguagem — o FIPO (Future-KL Influenced Policy Optimization). Esse algoritmo introduz um novo mecanismo “Future-KL” que resolve de forma eficaz o desafio técnico comum da “estagnação do comprimento da inferência” no treinamento por aprendizado por reforço puro (Pure RL).
Durante o treinamento para raciocínio com textos longos e alinhamento lógico complexo, a aprendizagem por reforço tradicional frequentemente não consegue identificar com precisão os pontos-chave de decisão em sequências extensas. O algoritmo FIPO, desenvolvido pela equipe da Tongyi, aplica uma alocação diferenciada de recompensas a tokens-chave, incentivando o modelo a adotar uma abordagem mais voltada para o futuro durante a geração da cadeia de pensamento (CoT).
Resultados experimentais indicam que, em uma configuração de aprendizado por reforço puro com um modelo na escala de 32B, o modelo que utiliza o algoritmo FIPO já superou modelos de tamanho semelhante, como o DeepSeek-Zero-MATH e o o1-mini da OpenAI, representando um avanço significativo nas habilidades de raciocínio lógico e computação matemática dos grandes modelos nacionais.
Atualmente, a competição entre grandes modelos está mudando da escala de pré-treinamento para o alinhamento profundo no momento da inferência. O lançamento do FIPO não apenas oferece uma nova maneira de avaliar a qualidade dos “processos de pensamento” em modelos de raciocínio lógico, mas também sinaliza que a comunidade de código aberto e os principais laboratórios nacionais estão gradualmente traçando um caminho tecnológico independente em sua busca por modelos de raciocínio de nível mundial.
Artigo relacionado
A Coreia do Sul inicia a construção do Centro Nacional de Computação em IA, investindo 2,5 trilhões de won com meta para 2028
O outlet sul-coreano EtNews relata que a cerimônia de lançamento da pedra fundamental do Centro de Computação em IA da Coreia (KOACC) ocorreu em 3 de agosto no parque de data centers Solar City, em Sunan, Jeollanam-do. Com um investimento total de 2,
Seis Gigantes da Tecnologia Apoiam a Linux Foundation com US$ 12,5 Milhões para Enfrentar o Ruído das Vulnerabilidades de IA
Para enfrentar o fluxo de relatórios de segurança de baixa qualidade produzidos por ferramentas de automação de IA, seis grandes empresas de tecnologia — Anthropic, Amazon (AWS), GitHub, Google, Microsoft e OpenAI — contribuíram coletivamente com US$
Musk Considerou Deixar a OpenAI Para Seus Filhos Enquanto Altman Presta Testemunho
Esta manhã, o CEO da OpenAI, Sam Altman, prestou depoimento para responder à ação judicial movida pelo ex-cofundador Elon Musk, que questiona a estrutura corporativa da empresa.Quando questionado sobre a alegação de Musk de que outros fundadores “ro
Recomendações de tópicos especiais relacionados
Comentários (0)

A equipe de Computação Inteligente do Tongyi Lab divulgou hoje um novo algoritmo pós-treinamento para grandes modelos de linguagem — o FIPO (Future-KL Influenced Policy Optimization). Esse algoritmo introduz um novo mecanismo “Future-KL” que resolve de forma eficaz o desafio técnico comum da “estagnação do comprimento da inferência” no treinamento por aprendizado por reforço puro (Pure RL).
Durante o treinamento para raciocínio com textos longos e alinhamento lógico complexo, a aprendizagem por reforço tradicional frequentemente não consegue identificar com precisão os pontos-chave de decisão em sequências extensas. O algoritmo FIPO, desenvolvido pela equipe da Tongyi, aplica uma alocação diferenciada de recompensas a tokens-chave, incentivando o modelo a adotar uma abordagem mais voltada para o futuro durante a geração da cadeia de pensamento (CoT).
Resultados experimentais indicam que, em uma configuração de aprendizado por reforço puro com um modelo na escala de 32B, o modelo que utiliza o algoritmo FIPO já superou modelos de tamanho semelhante, como o DeepSeek-Zero-MATH e o o1-mini da OpenAI, representando um avanço significativo nas habilidades de raciocínio lógico e computação matemática dos grandes modelos nacionais.
Atualmente, a competição entre grandes modelos está mudando da escala de pré-treinamento para o alinhamento profundo no momento da inferência. O lançamento do FIPO não apenas oferece uma nova maneira de avaliar a qualidade dos “processos de pensamento” em modelos de raciocínio lógico, mas também sinaliza que a comunidade de código aberto e os principais laboratórios nacionais estão gradualmente traçando um caminho tecnológico independente em sua busca por modelos de raciocínio de nível mundial.
A Coreia do Sul inicia a construção do Centro Nacional de Computação em IA, investindo 2,5 trilhões de won com meta para 2028
O outlet sul-coreano EtNews relata que a cerimônia de lançamento da pedra fundamental do Centro de Computação em IA da Coreia (KOACC) ocorreu em 3 de agosto no parque de data centers Solar City, em Sunan, Jeollanam-do. Com um investimento total de 2,
Seis Gigantes da Tecnologia Apoiam a Linux Foundation com US$ 12,5 Milhões para Enfrentar o Ruído das Vulnerabilidades de IA
Para enfrentar o fluxo de relatórios de segurança de baixa qualidade produzidos por ferramentas de automação de IA, seis grandes empresas de tecnologia — Anthropic, Amazon (AWS), GitHub, Google, Microsoft e OpenAI — contribuíram coletivamente com US$
Musk Considerou Deixar a OpenAI Para Seus Filhos Enquanto Altman Presta Testemunho
Esta manhã, o CEO da OpenAI, Sam Altman, prestou depoimento para responder à ação judicial movida pelo ex-cofundador Elon Musk, que questiona a estrutura corporativa da empresa.Quando questionado sobre a alegação de Musk de que outros fundadores “ro











