Lar
A Mianbi Intelligence e a Universidade de Tsinghua apresentam o BitCPM-CANN, o primeiro modelo de grande porte de 1,58 bits da China
A Mingshi Intelligence, em parceria com a Universidade de Tsinghua e a comunidade OpenBMB, tornou oficialmente o BitCPM-CANN um projeto de código aberto — o primeiro modelo de linguagem de grande porte da China treinado na plataforma Ascend da Huawei. Utilizando quantização ternária (1,58 bit), essa inovação promove o avanço da tecnologia de treinamento de baixo número de bits e marca um marco significativo para o ecossistema de IA da China.
O BitCPM-CANN demonstra as capacidades robustas da infraestrutura de computação nacional, estabelecendo um fluxo de desenvolvimento totalmente nativo, desde operadores de quantização até algoritmos de treinamento. Disponível nas variantes de 0,5B, 1B, 3B e 8B, ele supera os modelos MiniCPM4 de precisão total de tamanho equivalente. Notavelmente, ele reduz o uso de memória na inferência em aproximadamente seis vezes, permitindo a operação fluida de modelos com 8B de parâmetros em smartphones emblemáticos convencionais e oferecendo benefícios substanciais para o setor de dispositivos móveis.

Com tecnologia da MindSpeed e do Megatron-LM, a Mingshi Intelligence construiu uma estrutura abrangente de treinamento de baixo número de bits. Essa infraestrutura oferece suporte à adaptação ao ambiente, ao processamento de sequências longas de 32 mil, a estratégias paralelas e a operadores integrados. Ao fornecer essa base pública para todo o treinamento de baixo número de bits baseado em Ascend, a empresa reduz as barreiras ao desenvolvimento e acelera a iteração tecnológica.

Para promover uma adoção mais ampla, todos os pesos do modelo BitCPM-CANN são de código aberto e acessíveis por meio do HuggingFace e do ModelScope. Essa iniciativa dota os desenvolvedores de ferramentas poderosas, incentivando aplicações inovadoras em todo o cenário da IA.
Em conclusão, o BitCPM-CANN representa um avanço crucial nas capacidades de treinamento de grandes modelos de IA da China, estabelecendo uma base sólida para futuras aplicações inteligentes.
Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (0)
A Mingshi Intelligence, em parceria com a Universidade de Tsinghua e a comunidade OpenBMB, tornou oficialmente o BitCPM-CANN um projeto de código aberto — o primeiro modelo de linguagem de grande porte da China treinado na plataforma Ascend da Huawei. Utilizando quantização ternária (1,58 bit), essa inovação promove o avanço da tecnologia de treinamento de baixo número de bits e marca um marco significativo para o ecossistema de IA da China.
O BitCPM-CANN demonstra as capacidades robustas da infraestrutura de computação nacional, estabelecendo um fluxo de desenvolvimento totalmente nativo, desde operadores de quantização até algoritmos de treinamento. Disponível nas variantes de 0,5B, 1B, 3B e 8B, ele supera os modelos MiniCPM4 de precisão total de tamanho equivalente. Notavelmente, ele reduz o uso de memória na inferência em aproximadamente seis vezes, permitindo a operação fluida de modelos com 8B de parâmetros em smartphones emblemáticos convencionais e oferecendo benefícios substanciais para o setor de dispositivos móveis.

Com tecnologia da MindSpeed e do Megatron-LM, a Mingshi Intelligence construiu uma estrutura abrangente de treinamento de baixo número de bits. Essa infraestrutura oferece suporte à adaptação ao ambiente, ao processamento de sequências longas de 32 mil, a estratégias paralelas e a operadores integrados. Ao fornecer essa base pública para todo o treinamento de baixo número de bits baseado em Ascend, a empresa reduz as barreiras ao desenvolvimento e acelera a iteração tecnológica.

Para promover uma adoção mais ampla, todos os pesos do modelo BitCPM-CANN são de código aberto e acessíveis por meio do HuggingFace e do ModelScope. Essa iniciativa dota os desenvolvedores de ferramentas poderosas, incentivando aplicações inovadoras em todo o cenário da IA.
Em conclusão, o BitCPM-CANN representa um avanço crucial nas capacidades de treinamento de grandes modelos de IA da China, estabelecendo uma base sólida para futuras aplicações inteligentes.
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr











