A Mistral lança um modelo de geração de fala de código aberto
A empresa francesa de IA Mistral revelou na quinta-feira um novo modelo de conversão de texto em fala de código aberto, projetado para assistentes de voz com IA e aplicações empresariais, como atendimento ao cliente. O modelo permite que as empresas criem agentes de voz para vendas e interação com o cliente, posicionando a Mistral como concorrente direta da ElevenLabs, Deepgram e OpenAI.
Chamado de Voxtral TTS, o modelo suporta nove idiomas, incluindo inglês, francês, alemão, espanhol, holandês, português, italiano, hindi e árabe.
“Nossos clientes têm solicitado um modelo de fala. Por isso, criamos um modelo de fala de tamanho reduzido que cabe em um smartwatch, smartphone, laptop ou outros dispositivos de ponta. O custo é uma fração do preço de qualquer outro produto no mercado, mas oferece desempenho de ponta”, disse Pierre Stock, vice-presidente de operações científicas da Mistral AI, em entrevista por telefone ao TechCrunch.

Crédito da imagem: Mistral
A Mistral afirma que o novo modelo pode se adaptar a uma voz personalizada usando uma amostra com menos de cinco segundos, captando sotaques sutis, inflexões, entonações e irregularidades no fluxo da fala. Baseado no Mistral 3B, ele pode alternar entre idiomas com fluidez, preservando as características da voz, o que o torna ideal para dublagem ou tradução em tempo real. Stock observou que o objetivo da empresa era fazer com que o modelo soasse humano, não robótico.
De acordo com a empresa, o modelo foi desenvolvido para desempenho em tempo real. Seu tempo até o primeiro áudio (TTFA) — o tempo entre o recebimento da entrada e o início da “fala” — é de 90 ms para uma amostra de 10 segundos com 500 caracteres. O modelo também atinge um fator de tempo real (RTF) de 6x, o que significa que ele pode gerar um clipe de 10 segundos em aproximadamente 1,6 segundos.

Crédito da imagem: Mistral AI
No início deste ano, a Mistral lançou dois modelos de transcrição — um para processamento em lote em grande escala e outro para casos de uso em tempo real com baixa latência. Com o novo modelo de fala, a empresa parece estar construindo um conjunto abrangente de produtos de voz para empresas.
Stock acrescentou: “Planejamos criar uma plataforma de ponta a ponta capaz de lidar com fluxos de entrada multimodais — áudio, texto e imagem —, bem como com a saída. A principal vantagem é que um sistema agente de ponta a ponta que suporta entrada e saída de áudio fornece informações muito mais ricas.”
A Mistral posiciona sua natureza de código aberto e seus recursos de personalização como principais diferenciais, permitindo que as empresas ajustem o modelo às suas necessidades específicas, favorecendo-o assim em relação às soluções concorrentes.
Artigo relacionado
A ElevenLabs lança uma IA musical capaz de mudar de gênero durante a execução da música
A ElevenLabs, empresa especializada em inteligência artificial de voz, lançou o Music v2, a versão mais recente do seu modelo de geração musical, capaz de alterar o gênero ao longo da música. Esse modelo foi desenvolvido para lidar com vocais e compo
O Google lança comandos de voz no Docs e no Keep
Na conferência de desenvolvedores Google I/O, a empresa anunciou que está introduzindo comandos de voz em aplicativos do Workspace, como o Docs, o Keep e o Gmail. Esses recursos permitem que os usuári
Ex-funcionários da Goldman e fundadores da Meta desenvolvem IA de voz para mercados pouco atendidos
O suporte e o atendimento ao cliente estão entre as áreas mais promissoras da IA de voz atualmente. No entanto, desenvolver um produto que soe humano e responda com o mínimo de atraso é muito mais des
Recomendações de tópicos especiais relacionados
Comentários (1)
I just tried out Mistral’s new open-source TTS model yesterday, and its pronunciation is way more natural than most free options I’ve used before. It’s super useful for companies that want to build their own voice assistants without spending tons on licensed services. Do you think this will change the game in the enterprise voice AI market?
A empresa francesa de IA Mistral revelou na quinta-feira um novo modelo de conversão de texto em fala de código aberto, projetado para assistentes de voz com IA e aplicações empresariais, como atendimento ao cliente. O modelo permite que as empresas criem agentes de voz para vendas e interação com o cliente, posicionando a Mistral como concorrente direta da ElevenLabs, Deepgram e OpenAI.
Chamado de Voxtral TTS, o modelo suporta nove idiomas, incluindo inglês, francês, alemão, espanhol, holandês, português, italiano, hindi e árabe.
“Nossos clientes têm solicitado um modelo de fala. Por isso, criamos um modelo de fala de tamanho reduzido que cabe em um smartwatch, smartphone, laptop ou outros dispositivos de ponta. O custo é uma fração do preço de qualquer outro produto no mercado, mas oferece desempenho de ponta”, disse Pierre Stock, vice-presidente de operações científicas da Mistral AI, em entrevista por telefone ao TechCrunch.

Crédito da imagem: Mistral
A Mistral afirma que o novo modelo pode se adaptar a uma voz personalizada usando uma amostra com menos de cinco segundos, captando sotaques sutis, inflexões, entonações e irregularidades no fluxo da fala. Baseado no Mistral 3B, ele pode alternar entre idiomas com fluidez, preservando as características da voz, o que o torna ideal para dublagem ou tradução em tempo real. Stock observou que o objetivo da empresa era fazer com que o modelo soasse humano, não robótico.
De acordo com a empresa, o modelo foi desenvolvido para desempenho em tempo real. Seu tempo até o primeiro áudio (TTFA) — o tempo entre o recebimento da entrada e o início da “fala” — é de 90 ms para uma amostra de 10 segundos com 500 caracteres. O modelo também atinge um fator de tempo real (RTF) de 6x, o que significa que ele pode gerar um clipe de 10 segundos em aproximadamente 1,6 segundos.

Crédito da imagem: Mistral AI
No início deste ano, a Mistral lançou dois modelos de transcrição — um para processamento em lote em grande escala e outro para casos de uso em tempo real com baixa latência. Com o novo modelo de fala, a empresa parece estar construindo um conjunto abrangente de produtos de voz para empresas.
Stock acrescentou: “Planejamos criar uma plataforma de ponta a ponta capaz de lidar com fluxos de entrada multimodais — áudio, texto e imagem —, bem como com a saída. A principal vantagem é que um sistema agente de ponta a ponta que suporta entrada e saída de áudio fornece informações muito mais ricas.”
A Mistral posiciona sua natureza de código aberto e seus recursos de personalização como principais diferenciais, permitindo que as empresas ajustem o modelo às suas necessidades específicas, favorecendo-o assim em relação às soluções concorrentes.
A ElevenLabs lança uma IA musical capaz de mudar de gênero durante a execução da música
A ElevenLabs, empresa especializada em inteligência artificial de voz, lançou o Music v2, a versão mais recente do seu modelo de geração musical, capaz de alterar o gênero ao longo da música. Esse modelo foi desenvolvido para lidar com vocais e compo
O Google lança comandos de voz no Docs e no Keep
Na conferência de desenvolvedores Google I/O, a empresa anunciou que está introduzindo comandos de voz em aplicativos do Workspace, como o Docs, o Keep e o Gmail. Esses recursos permitem que os usuári
Ex-funcionários da Goldman e fundadores da Meta desenvolvem IA de voz para mercados pouco atendidos
O suporte e o atendimento ao cliente estão entre as áreas mais promissoras da IA de voz atualmente. No entanto, desenvolver um produto que soe humano e responda com o mínimo de atraso é muito mais des
I just tried out Mistral’s new open-source TTS model yesterday, and its pronunciation is way more natural than most free options I’ve used before. It’s super useful for companies that want to build their own voice assistants without spending tons on licensed services. Do you think this will change the game in the enterprise voice AI market?





Lar






