Hogar
Google presenta Gemini 3.5 Transcribe para una conversión precisa de texto en entornos ruidosos
Google ha lanzado oficialmente Gemini 3.5 Transcribe, la última incorporación a su serie Gemini, posicionándolo como el modelo de reconocimiento de voz más preciso de la gama. Ya disponible para desarrolladores, empresas y usuarios en general, el modelo aborda retos persistentes del sector, como el ruido de fondo, la terminología especializada y los patrones de habla natural.
Gracias a sus sólidas capacidades de generalización, Gemini 3.5 Transcribe destaca en el filtrado del ruido de fondo y en el manejo de vocabulario complejo en campos especializados. El modelo ya ha mejorado el rendimiento de la aplicación Gemini en macOS y de la función Rambler en Gboard para Android. Los desarrolladores pueden aprovechar esta herramienta para crear soluciones innovadoras, como agentes activados por voz, sistemas de subtitulado en tiempo real y flujos de trabajo de análisis posterior a las llamadas.

Optimizado para los matices de la conversación cotidiana, el modelo capta con precisión la intención semántica e identifica el vocabulario personalizado para ayudar a los usuarios a realizar tareas mediante la voz. Incluye funciones prácticas como la autocorrección automática, la eliminación inteligente de palabras de relleno (por ejemplo, «um», «uh») y el formato automático del texto. Además, puede delegar tareas complejas, como el análisis de archivos y la generación de imágenes, a otros modelos de Gemini, lo que ofrece una experiencia de colaboración multimodelo de extremo a extremo.
Los datos públicos de Google indican que Gemini 3.5 Transcribe alcanza una tasa de error por palabra (WER) media de tan solo el 4,0 % en escenarios de transmisión en directo y del 2,6 % en escenarios sin transmisión en directo. Mantiene una elevada estabilidad de reconocimiento incluso en entornos ruidosos, lo que garantiza una precisión superior en información alfanumérica crítica, como números de pedido y códigos postales.
El modelo también destaca por su compatibilidad multilingüe y su personalización, ya que admite 85 idiomas y se adapta a diversos acentos y dialectos regionales. En el caso del audio preprocesado, ofrece identificación de hablantes con marcas de tiempo para hasta tres hablantes. Además, es totalmente compatible con listas de vocabulario definidas por el usuario, lo que permite gestionar de forma eficaz la terminología profesional, las grafías específicas y los nombres propios del sector.
En cuanto a la integración en el ecosistema, los desarrolladores pueden acceder a Gemini 3.5 Transcribe en versión preliminar a través de la API de Gemini en Google AI Studio y Google Antigravity, mientras que los usuarios en general pueden probarlo en Android y macOS. Google tiene previsto integrar el modelo en Chrome, lo que permitirá la entrada de voz en cualquier campo web. Este lanzamiento sigue a la presentación de Gemini 3.7 Flash, la expansión de Gemini a todos los usuarios de Android de EE. UU. y su integración en los vehículos autónomos de Waymo, lo que refuerza el rápido avance de Google en su gama de productos de IA para todo tipo de escenarios.
Artículo relacionado
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Google ha lanzado oficialmente Gemini 3.5 Transcribe, la última incorporación a su serie Gemini, posicionándolo como el modelo de reconocimiento de voz más preciso de la gama. Ya disponible para desarrolladores, empresas y usuarios en general, el modelo aborda retos persistentes del sector, como el ruido de fondo, la terminología especializada y los patrones de habla natural.
Gracias a sus sólidas capacidades de generalización, Gemini 3.5 Transcribe destaca en el filtrado del ruido de fondo y en el manejo de vocabulario complejo en campos especializados. El modelo ya ha mejorado el rendimiento de la aplicación Gemini en macOS y de la función Rambler en Gboard para Android. Los desarrolladores pueden aprovechar esta herramienta para crear soluciones innovadoras, como agentes activados por voz, sistemas de subtitulado en tiempo real y flujos de trabajo de análisis posterior a las llamadas.

Optimizado para los matices de la conversación cotidiana, el modelo capta con precisión la intención semántica e identifica el vocabulario personalizado para ayudar a los usuarios a realizar tareas mediante la voz. Incluye funciones prácticas como la autocorrección automática, la eliminación inteligente de palabras de relleno (por ejemplo, «um», «uh») y el formato automático del texto. Además, puede delegar tareas complejas, como el análisis de archivos y la generación de imágenes, a otros modelos de Gemini, lo que ofrece una experiencia de colaboración multimodelo de extremo a extremo.
Los datos públicos de Google indican que Gemini 3.5 Transcribe alcanza una tasa de error por palabra (WER) media de tan solo el 4,0 % en escenarios de transmisión en directo y del 2,6 % en escenarios sin transmisión en directo. Mantiene una elevada estabilidad de reconocimiento incluso en entornos ruidosos, lo que garantiza una precisión superior en información alfanumérica crítica, como números de pedido y códigos postales.
El modelo también destaca por su compatibilidad multilingüe y su personalización, ya que admite 85 idiomas y se adapta a diversos acentos y dialectos regionales. En el caso del audio preprocesado, ofrece identificación de hablantes con marcas de tiempo para hasta tres hablantes. Además, es totalmente compatible con listas de vocabulario definidas por el usuario, lo que permite gestionar de forma eficaz la terminología profesional, las grafías específicas y los nombres propios del sector.
En cuanto a la integración en el ecosistema, los desarrolladores pueden acceder a Gemini 3.5 Transcribe en versión preliminar a través de la API de Gemini en Google AI Studio y Google Antigravity, mientras que los usuarios en general pueden probarlo en Android y macOS. Google tiene previsto integrar el modelo en Chrome, lo que permitirá la entrada de voz en cualquier campo web. Este lanzamiento sigue a la presentación de Gemini 3.7 Flash, la expansión de Gemini a todos los usuarios de Android de EE. UU. y su integración en los vehículos autónomos de Waymo, lo que refuerza el rápido avance de Google en su gama de productos de IA para todo tipo de escenarios.
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr











