Lar
Google lança o Gemini 3.5 Transcribe para conversão precisa de texto em ambientes com ruído
O Google lançou oficialmente o Gemini 3.5 Transcribe, a mais recente adição à sua série Gemini, posicionando-o como o modelo de reconhecimento de fala mais preciso da linha. Agora disponível para desenvolvedores, empresas e usuários em geral, o modelo aborda desafios persistentes do setor, incluindo ruído de fundo, terminologia especializada e padrões naturais de fala.
Com robustos recursos de generalização, o Gemini 3.5 Transcribe se destaca na filtragem de ruídos de fundo e no tratamento de vocabulário complexo em áreas especializadas. O modelo já aprimorou o desempenho do aplicativo Gemini no macOS e do recurso Rambler no Gboard para Android. Os desenvolvedores podem aproveitar essa ferramenta para criar soluções inovadoras, como agentes ativados por voz, sistemas de legendagem em tempo real e fluxos de trabalho de análise pós-chamada.

Otimizado para as nuances da conversa cotidiana, o modelo captura com precisão a intenção semântica e identifica vocabulário personalizado para auxiliar os usuários a concluir tarefas por meio da voz. Ele inclui recursos práticos como autocorreção automática, remoção inteligente de palavras de preenchimento (por exemplo, “hum”, “ah”) e formatação automática de texto. Além disso, ele pode delegar tarefas complexas, como análise de arquivos e geração de imagens, a outros modelos do Gemini, oferecendo uma experiência de colaboração multimodelo de ponta a ponta.
Dados públicos do Google indicam que o Gemini 3.5 Transcribe atinge uma taxa média de erro por palavra (WER) de apenas 4,0% em cenários de streaming e de 2,6% em cenários sem streaming. Ele mantém alta estabilidade de reconhecimento mesmo em ambientes ruidosos, oferecendo precisão superior para informações alfanuméricas críticas, como números de pedidos e códigos postais.
O modelo também se destaca no suporte multilíngue e na personalização, oferecendo suporte a 85 idiomas com adaptação a vários sotaques e dialetos regionais. Para áudio pré-processado, ele oferece identificação de falantes com registros de data e hora para até três falantes. Além disso, oferece suporte total a listas de vocabulário definidas pelo usuário, lidando com eficácia com terminologia profissional, grafias exclusivas e nomes específicos do setor.
Quanto à integração no ecossistema, os desenvolvedores podem acessar o Gemini 3.5 Transcribe em versão prévia por meio da API do Gemini no Google AI Studio e no Google Antigravity, enquanto os usuários em geral podem experimentá-lo no Android e no macOS. O Google planeja integrar o modelo ao Chrome, permitindo a entrada de voz em qualquer campo da web. Esse lançamento segue o lançamento do Gemini 3.7 Flash, a expansão do Gemini para todos os usuários de Android nos EUA e sua integração aos veículos autônomos da Waymo, reforçando o rápido avanço do Google em sua matriz de produtos de IA para todos os cenários.
Artigo relacionado
Suno para Marcas d'Água em Músicas Durante Batalhas Legais
O Suno, plataforma que permite aos usuários gerar músicas criadas por inteligência artificial, apresentou novas funcionalidades para rotular as faixas produzidas pela plataforma, restringir downloads e atualizar os padrões da comunidade para coibir r
Musk admite que vazamento do código do Grok expôs dados de usuários e promete apagar todas as informações históricas.
Elon Musk abordou diretamente a controvérsia sobre privacidade envolvendo o Grok Build, começando com um simples "Verdadeiro" para confirmar a validade do incidente. Ele prometeu que todos os dados dos usuários carregados anteriormente para a SpaceXA
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Recomendações de tópicos especiais relacionados
Comentários (0)
O Google lançou oficialmente o Gemini 3.5 Transcribe, a mais recente adição à sua série Gemini, posicionando-o como o modelo de reconhecimento de fala mais preciso da linha. Agora disponível para desenvolvedores, empresas e usuários em geral, o modelo aborda desafios persistentes do setor, incluindo ruído de fundo, terminologia especializada e padrões naturais de fala.
Com robustos recursos de generalização, o Gemini 3.5 Transcribe se destaca na filtragem de ruídos de fundo e no tratamento de vocabulário complexo em áreas especializadas. O modelo já aprimorou o desempenho do aplicativo Gemini no macOS e do recurso Rambler no Gboard para Android. Os desenvolvedores podem aproveitar essa ferramenta para criar soluções inovadoras, como agentes ativados por voz, sistemas de legendagem em tempo real e fluxos de trabalho de análise pós-chamada.

Otimizado para as nuances da conversa cotidiana, o modelo captura com precisão a intenção semântica e identifica vocabulário personalizado para auxiliar os usuários a concluir tarefas por meio da voz. Ele inclui recursos práticos como autocorreção automática, remoção inteligente de palavras de preenchimento (por exemplo, “hum”, “ah”) e formatação automática de texto. Além disso, ele pode delegar tarefas complexas, como análise de arquivos e geração de imagens, a outros modelos do Gemini, oferecendo uma experiência de colaboração multimodelo de ponta a ponta.
Dados públicos do Google indicam que o Gemini 3.5 Transcribe atinge uma taxa média de erro por palavra (WER) de apenas 4,0% em cenários de streaming e de 2,6% em cenários sem streaming. Ele mantém alta estabilidade de reconhecimento mesmo em ambientes ruidosos, oferecendo precisão superior para informações alfanuméricas críticas, como números de pedidos e códigos postais.
O modelo também se destaca no suporte multilíngue e na personalização, oferecendo suporte a 85 idiomas com adaptação a vários sotaques e dialetos regionais. Para áudio pré-processado, ele oferece identificação de falantes com registros de data e hora para até três falantes. Além disso, oferece suporte total a listas de vocabulário definidas pelo usuário, lidando com eficácia com terminologia profissional, grafias exclusivas e nomes específicos do setor.
Quanto à integração no ecossistema, os desenvolvedores podem acessar o Gemini 3.5 Transcribe em versão prévia por meio da API do Gemini no Google AI Studio e no Google Antigravity, enquanto os usuários em geral podem experimentá-lo no Android e no macOS. O Google planeja integrar o modelo ao Chrome, permitindo a entrada de voz em qualquer campo da web. Esse lançamento segue o lançamento do Gemini 3.7 Flash, a expansão do Gemini para todos os usuários de Android nos EUA e sua integração aos veículos autônomos da Waymo, reforçando o rápido avanço do Google em sua matriz de produtos de IA para todos os cenários.
Suno para Marcas d'Água em Músicas Durante Batalhas Legais
O Suno, plataforma que permite aos usuários gerar músicas criadas por inteligência artificial, apresentou novas funcionalidades para rotular as faixas produzidas pela plataforma, restringir downloads e atualizar os padrões da comunidade para coibir r
Musk admite que vazamento do código do Grok expôs dados de usuários e promete apagar todas as informações históricas.
Elon Musk abordou diretamente a controvérsia sobre privacidade envolvendo o Grok Build, começando com um simples "Verdadeiro" para confirmar a validade do incidente. Ele prometeu que todos os dados dos usuários carregados anteriormente para a SpaceXA
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava











