Lar
A Apple e a LM Studio anunciam uma parceria inovadora, à medida que quatro estúdios que utilizam Macs implementam modelos de grande porte com trilhões de parâmetros

Demonstração inovadora na WWDC: execução de um modelo de IA com um trilhão de parâmetros no hardware da Apple
Na recente WWDC, a plataforma de software de IA LM Studio colaborou com a Apple para apresentar uma conquista inovadora na tecnologia de inteligência artificial. A equipe executou com sucesso o modelo principal da Moonshot AI, o Kimi K2.6, utilizando um cluster de quatro Mac Studios. Essa demonstração ilustrou claramente as capacidades substanciais da arquitetura Apple Silicon no que diz respeito ao processamento de modelos de IA em escala ultragrande.
O modelo Kimi K2.6 é construído em torno de uma arquitetura MoE avançada, com um total de até um trilhão de parâmetros. Embora o sistema dinâmico de agendamento especializado do modelo reduza a carga computacional durante a inferência ao ativar apenas cerca de 32 bilhões de parâmetros por vez, carregar o modelo inteiro ainda representa um desafio significativo de memória. Quando processado com precisão FP16, ele requer aproximadamente 2 TB de memória. Em configurações convencionais de data center, atender a esse requisito normalmente envolve o uso de clusters de servidores com 8 a 16 GPUs de ponta, o que pode custar milhões de dólares.
No entanto, a demonstração superou essa limitação por meio de uma solução técnica inovadora. Os quatro Mac Studios equipados com chips M3 Ultra foram conectados por meio de interfaces Thunderbolt 5, aproveitando a tecnologia RDMA-over-Thunderbolt disponível nas versões mais recentes do macOS. Essa abordagem permitiu o compartilhamento direto de memória entre os dispositivos, unindo efetivamente seus 2 TB combinados de memória unificada em um único pool de memória lógica. Como resultado, o modelo de um trilhão de parâmetros pôde ser carregado sem problemas. Durante a demonstração ao vivo, o cluster apresentou excelente desempenho, gerando cerca de 28 tokens por segundo e consumindo muito menos energia do que os centros de computação tradicionais baseados em GPUs.
Juntamente com essa demonstração, a LM Studio também apresentou o LM Link como parte da colaboração. Desenvolvida com base na arquitetura de VPN em malha da Tailscale, essa ferramenta permite que os usuários acessem com segurança o cluster local do Mac Studio de qualquer lugar por meio de conexões criptografadas de ponta a ponta. Os usuários podem aproveitar o poder de computação do cluster para inferência usando um MacBook ou iPhone, sem precisar estar fisicamente presente no dispositivo host. Todos os dados confidenciais continuam sendo processados localmente dentro de um ciclo seguro, evitando qualquer transferência por meio de servidores em nuvem de terceiros.
Essa demonstração serviu não apenas como uma apresentação técnica, mas também enviou uma mensagem clara ao setor. O Apple Silicon, com seu design de memória unificada e recursos eficientes de conectividade entre vários dispositivos, está se tornando uma opção viável para a implantação de grandes modelos de IA. Para organizações que precisam executar tarefas de inferência de modelos grandes com frequência e a longo prazo, essa solução elimina os altos custos associados aos serviços em nuvem, substituindo-os por investimentos em hardware, o que resulta em uma economia significativa ao longo do tempo.
À medida que o desempenho dos clusters de hardware para o consumidor continua a melhorar, as barreiras à adoção de tecnologias de IA estão diminuindo ainda mais. Essa conquista sugere que a fonte de inovação de ponta em IA não ficará mais restrita a um punhado de gigantes da tecnologia com grandes instalações de supercomputação. É provável que um cenário de computação descentralizada veja novas oportunidades de desenvolvimento no futuro próximo.
Artigo relacionado
O Slackbot torna-se um Agente de IA
O Slackbot, o assistente automatizado integrado à plataforma de mensagens corporativas Slack da Salesforce, está se transformando em um agente de IA. O CTO da Salesforce, Parker Harris, prevê que ele alcance um status viral comparável ao do ChatGPT d
A ByteDance Aumenta os Incentivos de IA Principal com o Doubao Aumentando 14,6%
A ByteDance convocou recentemente uma reunião de divulgação sobre a participação acionária do DouBao para revelar novas políticas de incentivos para os funcionários envolvidos na divisão do DouBao. O preço de exercício das ações do DouBao foi elevado
MiniMax Lança Programa de Equipes 10x para Incentivar Especialistas Globais em IA
A MiniMax (Xiyu Technology), o Laboratório de Inteligência Artificial Geral, lançou oficialmente o "Equipe 10x", uma iniciativa global de colaboração de talentos. Este programa visa recrutar os melhores especialistas de diversos setores para explorar
Recomendações de tópicos especiais relacionados
Comentários (0)

Demonstração inovadora na WWDC: execução de um modelo de IA com um trilhão de parâmetros no hardware da Apple
Na recente WWDC, a plataforma de software de IA LM Studio colaborou com a Apple para apresentar uma conquista inovadora na tecnologia de inteligência artificial. A equipe executou com sucesso o modelo principal da Moonshot AI, o Kimi K2.6, utilizando um cluster de quatro Mac Studios. Essa demonstração ilustrou claramente as capacidades substanciais da arquitetura Apple Silicon no que diz respeito ao processamento de modelos de IA em escala ultragrande.
O modelo Kimi K2.6 é construído em torno de uma arquitetura MoE avançada, com um total de até um trilhão de parâmetros. Embora o sistema dinâmico de agendamento especializado do modelo reduza a carga computacional durante a inferência ao ativar apenas cerca de 32 bilhões de parâmetros por vez, carregar o modelo inteiro ainda representa um desafio significativo de memória. Quando processado com precisão FP16, ele requer aproximadamente 2 TB de memória. Em configurações convencionais de data center, atender a esse requisito normalmente envolve o uso de clusters de servidores com 8 a 16 GPUs de ponta, o que pode custar milhões de dólares.
No entanto, a demonstração superou essa limitação por meio de uma solução técnica inovadora. Os quatro Mac Studios equipados com chips M3 Ultra foram conectados por meio de interfaces Thunderbolt 5, aproveitando a tecnologia RDMA-over-Thunderbolt disponível nas versões mais recentes do macOS. Essa abordagem permitiu o compartilhamento direto de memória entre os dispositivos, unindo efetivamente seus 2 TB combinados de memória unificada em um único pool de memória lógica. Como resultado, o modelo de um trilhão de parâmetros pôde ser carregado sem problemas. Durante a demonstração ao vivo, o cluster apresentou excelente desempenho, gerando cerca de 28 tokens por segundo e consumindo muito menos energia do que os centros de computação tradicionais baseados em GPUs.
Juntamente com essa demonstração, a LM Studio também apresentou o LM Link como parte da colaboração. Desenvolvida com base na arquitetura de VPN em malha da Tailscale, essa ferramenta permite que os usuários acessem com segurança o cluster local do Mac Studio de qualquer lugar por meio de conexões criptografadas de ponta a ponta. Os usuários podem aproveitar o poder de computação do cluster para inferência usando um MacBook ou iPhone, sem precisar estar fisicamente presente no dispositivo host. Todos os dados confidenciais continuam sendo processados localmente dentro de um ciclo seguro, evitando qualquer transferência por meio de servidores em nuvem de terceiros.
Essa demonstração serviu não apenas como uma apresentação técnica, mas também enviou uma mensagem clara ao setor. O Apple Silicon, com seu design de memória unificada e recursos eficientes de conectividade entre vários dispositivos, está se tornando uma opção viável para a implantação de grandes modelos de IA. Para organizações que precisam executar tarefas de inferência de modelos grandes com frequência e a longo prazo, essa solução elimina os altos custos associados aos serviços em nuvem, substituindo-os por investimentos em hardware, o que resulta em uma economia significativa ao longo do tempo.
À medida que o desempenho dos clusters de hardware para o consumidor continua a melhorar, as barreiras à adoção de tecnologias de IA estão diminuindo ainda mais. Essa conquista sugere que a fonte de inovação de ponta em IA não ficará mais restrita a um punhado de gigantes da tecnologia com grandes instalações de supercomputação. É provável que um cenário de computação descentralizada veja novas oportunidades de desenvolvimento no futuro próximo.
O Slackbot torna-se um Agente de IA
O Slackbot, o assistente automatizado integrado à plataforma de mensagens corporativas Slack da Salesforce, está se transformando em um agente de IA. O CTO da Salesforce, Parker Harris, prevê que ele alcance um status viral comparável ao do ChatGPT d
A ByteDance Aumenta os Incentivos de IA Principal com o Doubao Aumentando 14,6%
A ByteDance convocou recentemente uma reunião de divulgação sobre a participação acionária do DouBao para revelar novas políticas de incentivos para os funcionários envolvidos na divisão do DouBao. O preço de exercício das ações do DouBao foi elevado
MiniMax Lança Programa de Equipes 10x para Incentivar Especialistas Globais em IA
A MiniMax (Xiyu Technology), o Laboratório de Inteligência Artificial Geral, lançou oficialmente o "Equipe 10x", uma iniciativa global de colaboração de talentos. Este programa visa recrutar os melhores especialistas de diversos setores para explorar











