A Microsoft torna o Phi-4-Vision, um modelo leve de IA multimodal, de código aberto
A Microsoft tornou oficialmente de código aberto seu mais recente modelo de raciocínio multimodal, o Phi-4-reasoning-vision-15B. Com 15 bilhões de parâmetros, esse modelo alcança um equilíbrio ideal entre alto desempenho e baixo custo. Sua arquitetura leve o torna uma nova opção atraente para lidar com tarefas visuais complexas em ambientes com recursos limitados.
Uma “potência compacta” alimentada por dados refinados
Ao contrário dos modelos típicos do setor, treinados com trilhões de tokens, o Phi-4-reasoning-vision foi desenvolvido usando apenas 200 bilhões de tokens multimodais. A equipe priorizou a qualidade dos dados por meio de uma limpeza rigorosa dos dados de código aberto, gerando dados sintéticos direcionados e calibrando cuidadosamente as proporções de dados específicos do domínio — como aumentar o conteúdo matemático para impulsionar o raciocínio computacional. Essa abordagem permite um excelente desempenho em tarefas de raciocínio científico e localização de elementos na tela.

Estratégia inovadora de raciocínio híbrido
Uma inovação fundamental deste modelo é seu design de “caminho de raciocínio híbrido”:
Tarefas de percepção: para tarefas simples, como legenda de imagens ou OCR, o modelo opera por padrão no modo de resposta direta, otimizado para velocidade e menor latência.
Tarefas de raciocínio: quando confrontado com lógica complexa, como a interpretação de fórmulas matemáticas ou gráficos científicos, ele aciona automaticamente um processo estruturado de cadeia de pensamento (CoT) para garantir a precisão da resposta.
Os usuários também podem alternar manualmente entre esses dois modos usando frases de ativação específicas, adaptando o comportamento do modelo às diferentes necessidades da aplicação.
Ao integrar o codificador de resolução dinâmica SigLIP-2, o modelo se destaca na percepção de detalhes finos em capturas de tela de alta resolução. Essa capacidade o posiciona como uma base ideal para o desenvolvimento de Agentes de Uso de Computador (CUAs), que podem identificar com precisão e interagir com botões, campos e outros elementos em interfaces digitais.
O Phi-4-reasoning-vision-15B já está disponível nas principais plataformas de código aberto. A Microsoft prevê que este modelo compacto demonstrará como “menor e mais rápido” também pode significar “mais capaz” no domínio multimodal, ajudando a impulsionar a adoção de inteligência espacial e tecnologias interativas em tempo real.
Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (1)
A Microsoft tornou oficialmente de código aberto seu mais recente modelo de raciocínio multimodal, o Phi-4-reasoning-vision-15B. Com 15 bilhões de parâmetros, esse modelo alcança um equilíbrio ideal entre alto desempenho e baixo custo. Sua arquitetura leve o torna uma nova opção atraente para lidar com tarefas visuais complexas em ambientes com recursos limitados.
Uma “potência compacta” alimentada por dados refinados
Ao contrário dos modelos típicos do setor, treinados com trilhões de tokens, o Phi-4-reasoning-vision foi desenvolvido usando apenas 200 bilhões de tokens multimodais. A equipe priorizou a qualidade dos dados por meio de uma limpeza rigorosa dos dados de código aberto, gerando dados sintéticos direcionados e calibrando cuidadosamente as proporções de dados específicos do domínio — como aumentar o conteúdo matemático para impulsionar o raciocínio computacional. Essa abordagem permite um excelente desempenho em tarefas de raciocínio científico e localização de elementos na tela.

Estratégia inovadora de raciocínio híbrido
Uma inovação fundamental deste modelo é seu design de “caminho de raciocínio híbrido”:
Tarefas de percepção: para tarefas simples, como legenda de imagens ou OCR, o modelo opera por padrão no modo de resposta direta, otimizado para velocidade e menor latência.
Tarefas de raciocínio: quando confrontado com lógica complexa, como a interpretação de fórmulas matemáticas ou gráficos científicos, ele aciona automaticamente um processo estruturado de cadeia de pensamento (CoT) para garantir a precisão da resposta.
Os usuários também podem alternar manualmente entre esses dois modos usando frases de ativação específicas, adaptando o comportamento do modelo às diferentes necessidades da aplicação.
Ao integrar o codificador de resolução dinâmica SigLIP-2, o modelo se destaca na percepção de detalhes finos em capturas de tela de alta resolução. Essa capacidade o posiciona como uma base ideal para o desenvolvimento de Agentes de Uso de Computador (CUAs), que podem identificar com precisão e interagir com botões, campos e outros elementos em interfaces digitais.
O Phi-4-reasoning-vision-15B já está disponível nas principais plataformas de código aberto. A Microsoft prevê que este modelo compacto demonstrará como “menor e mais rápido” também pode significar “mais capaz” no domínio multimodal, ajudando a impulsionar a adoção de inteligência espacial e tecnologias interativas em tempo real.
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr





Lar






