Lar
Black Tech, de Ali: modelo de 0,6 bilhão atualizado para 17 bilhões de MoE com 5% de parâmetros ativos, rodando na CPU a 30 tokens por segundo
A equipe de Comércio Digital da Ali International apresentou o Marco-Mini-Instruct, a mais recente adição à série Marco-MoE, demonstrando como “escalas menores podem gerar grandes resultados”. Com um total de 17,3 bilhões de parâmetros, apenas 0,86 bilhão estão ativos (aproximadamente 5%), permitindo uma velocidade de inferência excepcional que funciona perfeitamente até mesmo em CPUs padrão.

Ultraleve: otimizado para desempenho da CPU
De acordo com dados oficiais, utilizando quantização de 8 bits com quatro módulos de memória DDR4 2400, o modelo atinge uma velocidade de inferência de aproximadamente 30 tokens por segundo. Essa eficiência aproxima a arquitetura Mixture-of-Experts (MoE) da acessibilidade generalizada, reduzindo significativamente as barreiras à implantação local.
Inovação-chave: a tecnologia de upcycling transforma o potencial
A característica que mais se destaca no Marco-Mini-Instruct não é seu tamanho ou velocidade, mas seu método de criação exclusivo. Em vez de ser treinado do zero, esse modelo foi desenvolvido a partir do modelo Qwen3-0.6B-Base usando a tecnologia de upcycling.

Esse processo envolve dividir ou copiar componentes de um modelo pequeno e denso em múltiplos especialistas, introduzindo um mecanismo de roteamento. Ele também integra o particionamento refinado de submatrizes e estratégias de “Drop-Upcycling” — descartando aleatoriamente certos especialistas ou caminhos de roteamento durante o treinamento para adicionar regularização e melhorar a robustez. Essa abordagem transforma com sucesso um modelo Dense puro em uma arquitetura MoE, oferecendo ao setor um caminho novo, econômico e eficiente para o treinamento MoE.
Comprimento do contexto e configuração do treinamento
A configuração do modelo expande o `max_position_embeddings` para 32K, embora a fase de Ajuste Fino Supervisionado (SFT) utilize um contexto de 8.192 tokens. Consequentemente, o comprimento padrão do contexto é adequado para a maioria dos cenários práticos de aplicação.
Avanço pós-treinamento: destilação em cascata baseada na política
A fase pós-treinamento é igualmente impressionante: ela começa com o pré-aquecimento do SFT, seguido por uma estratégia de destilação on-policy em cascata. Inicialmente, a destilação utiliza o Qwen3-30B-A3B-Instruct como modelo professor e, em seguida, muda para o Qwen3-Next-80B-A3B-Instruct, que é mais potente. Os dados de destilação abrangem o cumprimento de instruções, raciocínio complexo, segurança de alinhamento e capacidades matemáticas, garantindo que o modelo mantenha a eficiência ao mesmo tempo em que aumenta significativamente a inteligência geral.
Resultados de benchmark: 0,86 bilhão de parâmetros ativos superam modelos densos de 4 bilhões
O Marco-Mini-Instruct final supera muitos modelos densos, como o Qwen3-4B, na maioria dos benchmarks convencionais. Com apenas 0,86 bilhão de parâmetros ativos, ele valida plenamente o vasto potencial da arquitetura MoE em oferecer um desempenho “pequeno, mas poderoso”.
Impacto no setor: um novo paradigma de treinamento MoE de código aberto
A AIbase acredita que o maior valor dessa conquista reside na abertura de novas oportunidades para os desenvolvedores. Não há mais necessidade de treinar modelos MoE em grande escala a partir do zero; em vez disso, as equipes podem selecionar um modelo denso pequeno adequado e reproduzir rigorosamente os processos de upcycling e Drop-Upcycling descritos no artigo. O custo total do treinamento permanece administrável: a fase SFT requer 64 GPUs por 24 horas, e a fase de destilação precisa de 64 GPUs por 110 horas, reduzindo significativamente o limiar para que equipes de pequeno e médio porte experimentem o MoE.
A mais recente “modificação” da Alibaba prova mais uma vez que avanços na eficiência dos modelos não dependem necessariamente do empilhamento de parâmetros; paradigmas inovadores de treinamento também podem impulsionar saltos qualitativos. O lançamento do Marco-Mini-Instruct, sem dúvida, acelerará a adoção da tecnologia MoE em dispositivos de borda e em cenários de desenvolvimento pessoal, tornando-o um avanço fundamental a ser acompanhado por todo o setor.
Artigo relacionado
A Seed, da ByteDance, lança campanha global de captação de talentos em campus universitários, oferecendo ações virtuais para conquistar os melhores especialistas em grandes modelos de inteligência artificial
No cenário competitivo dos grandes modelos de linguagem, garantir talentos de alto nível continua sendo o ativo estratégico mais crítico.Em 1º de abril, ByteDance anunciou o lançamento de sua iniciativa global de recrutamento campus Seed, parte de se
Suno para Marcas d'Água em Músicas Durante Batalhas Legais
O Suno, plataforma que permite aos usuários gerar músicas criadas por inteligência artificial, apresentou novas funcionalidades para rotular as faixas produzidas pela plataforma, restringir downloads e atualizar os padrões da comunidade para coibir r
Musk admite que vazamento do código do Grok expôs dados de usuários e promete apagar todas as informações históricas.
Elon Musk abordou diretamente a controvérsia sobre privacidade envolvendo o Grok Build, começando com um simples "Verdadeiro" para confirmar a validade do incidente. Ele prometeu que todos os dados dos usuários carregados anteriormente para a SpaceXA
Recomendações de tópicos especiais relacionados
Comentários (0)
A equipe de Comércio Digital da Ali International apresentou o Marco-Mini-Instruct, a mais recente adição à série Marco-MoE, demonstrando como “escalas menores podem gerar grandes resultados”. Com um total de 17,3 bilhões de parâmetros, apenas 0,86 bilhão estão ativos (aproximadamente 5%), permitindo uma velocidade de inferência excepcional que funciona perfeitamente até mesmo em CPUs padrão.

Ultraleve: otimizado para desempenho da CPU
De acordo com dados oficiais, utilizando quantização de 8 bits com quatro módulos de memória DDR4 2400, o modelo atinge uma velocidade de inferência de aproximadamente 30 tokens por segundo. Essa eficiência aproxima a arquitetura Mixture-of-Experts (MoE) da acessibilidade generalizada, reduzindo significativamente as barreiras à implantação local.
Inovação-chave: a tecnologia de upcycling transforma o potencial
A característica que mais se destaca no Marco-Mini-Instruct não é seu tamanho ou velocidade, mas seu método de criação exclusivo. Em vez de ser treinado do zero, esse modelo foi desenvolvido a partir do modelo Qwen3-0.6B-Base usando a tecnologia de upcycling.

Esse processo envolve dividir ou copiar componentes de um modelo pequeno e denso em múltiplos especialistas, introduzindo um mecanismo de roteamento. Ele também integra o particionamento refinado de submatrizes e estratégias de “Drop-Upcycling” — descartando aleatoriamente certos especialistas ou caminhos de roteamento durante o treinamento para adicionar regularização e melhorar a robustez. Essa abordagem transforma com sucesso um modelo Dense puro em uma arquitetura MoE, oferecendo ao setor um caminho novo, econômico e eficiente para o treinamento MoE.
Comprimento do contexto e configuração do treinamento
A configuração do modelo expande o `max_position_embeddings` para 32K, embora a fase de Ajuste Fino Supervisionado (SFT) utilize um contexto de 8.192 tokens. Consequentemente, o comprimento padrão do contexto é adequado para a maioria dos cenários práticos de aplicação.
Avanço pós-treinamento: destilação em cascata baseada na política
A fase pós-treinamento é igualmente impressionante: ela começa com o pré-aquecimento do SFT, seguido por uma estratégia de destilação on-policy em cascata. Inicialmente, a destilação utiliza o Qwen3-30B-A3B-Instruct como modelo professor e, em seguida, muda para o Qwen3-Next-80B-A3B-Instruct, que é mais potente. Os dados de destilação abrangem o cumprimento de instruções, raciocínio complexo, segurança de alinhamento e capacidades matemáticas, garantindo que o modelo mantenha a eficiência ao mesmo tempo em que aumenta significativamente a inteligência geral.
Resultados de benchmark: 0,86 bilhão de parâmetros ativos superam modelos densos de 4 bilhões
O Marco-Mini-Instruct final supera muitos modelos densos, como o Qwen3-4B, na maioria dos benchmarks convencionais. Com apenas 0,86 bilhão de parâmetros ativos, ele valida plenamente o vasto potencial da arquitetura MoE em oferecer um desempenho “pequeno, mas poderoso”.
Impacto no setor: um novo paradigma de treinamento MoE de código aberto
A AIbase acredita que o maior valor dessa conquista reside na abertura de novas oportunidades para os desenvolvedores. Não há mais necessidade de treinar modelos MoE em grande escala a partir do zero; em vez disso, as equipes podem selecionar um modelo denso pequeno adequado e reproduzir rigorosamente os processos de upcycling e Drop-Upcycling descritos no artigo. O custo total do treinamento permanece administrável: a fase SFT requer 64 GPUs por 24 horas, e a fase de destilação precisa de 64 GPUs por 110 horas, reduzindo significativamente o limiar para que equipes de pequeno e médio porte experimentem o MoE.
A mais recente “modificação” da Alibaba prova mais uma vez que avanços na eficiência dos modelos não dependem necessariamente do empilhamento de parâmetros; paradigmas inovadores de treinamento também podem impulsionar saltos qualitativos. O lançamento do Marco-Mini-Instruct, sem dúvida, acelerará a adoção da tecnologia MoE em dispositivos de borda e em cenários de desenvolvimento pessoal, tornando-o um avanço fundamental a ser acompanhado por todo o setor.
A Seed, da ByteDance, lança campanha global de captação de talentos em campus universitários, oferecendo ações virtuais para conquistar os melhores especialistas em grandes modelos de inteligência artificial
No cenário competitivo dos grandes modelos de linguagem, garantir talentos de alto nível continua sendo o ativo estratégico mais crítico.Em 1º de abril, ByteDance anunciou o lançamento de sua iniciativa global de recrutamento campus Seed, parte de se
Suno para Marcas d'Água em Músicas Durante Batalhas Legais
O Suno, plataforma que permite aos usuários gerar músicas criadas por inteligência artificial, apresentou novas funcionalidades para rotular as faixas produzidas pela plataforma, restringir downloads e atualizar os padrões da comunidade para coibir r
Musk admite que vazamento do código do Grok expôs dados de usuários e promete apagar todas as informações históricas.
Elon Musk abordou diretamente a controvérsia sobre privacidade envolvendo o Grok Build, começando com um simples "Verdadeiro" para confirmar a validade do incidente. Ele prometeu que todos os dados dos usuários carregados anteriormente para a SpaceXA











