Maison
Google dévoile « Gemini 3.5 Transcribe » pour une conversion précise du texte dans les environnements bruyants
Google a officiellement lancé Gemini 3.5 Transcribe, le dernier-né de sa série Gemini, qu’il présente comme le modèle de reconnaissance vocale le plus précis de sa gamme. Désormais accessible aux développeurs, aux entreprises et au grand public, ce modèle répond à des défis récurrents du secteur, notamment les bruits de fond, la terminologie spécialisée et les schémas de parole naturels.
Doté de solides capacités de généralisation, Gemini 3.5 Transcribe excelle dans le filtrage des bruits de fond et la gestion d’un vocabulaire complexe dans des domaines spécialisés. Ce modèle a déjà permis d'améliorer les performances de l'application Gemini sur macOS et de la fonctionnalité Rambler dans Gboard pour Android. Les développeurs peuvent tirer parti de cet outil pour créer des solutions innovantes, telles que des assistants vocaux, des systèmes de sous-titrage en temps réel et des workflows d'analyse post-appel.

Optimisé pour les nuances de la conversation quotidienne, le modèle saisit avec précision l’intention sémantique et identifie le vocabulaire spécifique afin d’aider les utilisateurs à accomplir des tâches à la voix. Il intègre des fonctionnalités pratiques telles que l’autocorrection, la suppression intelligente des mots de remplissage (par exemple, « euh », « hum ») et la mise en forme automatique du texte. De plus, il peut déléguer des tâches complexes, telles que l’analyse de fichiers et la génération d’images, à d’autres modèles Gemini, offrant ainsi une expérience de collaboration multimodèle de bout en bout.
Les données publiques de Google indiquent que Gemini 3.5 Transcribe atteint un taux d’erreur sur les mots (WER) moyen de seulement 4,0 % dans les scénarios en flux continu et de 2,6 % dans les scénarios hors flux continu. Il conserve une grande stabilité de reconnaissance même dans des environnements bruyants, offrant une précision supérieure pour les informations alphanumériques critiques telles que les numéros de commande et les codes postaux.
Le modèle excelle également en matière de prise en charge multilingue et de personnalisation, prenant en charge 85 langues et s’adaptant à divers accents et dialectes régionaux. Pour les fichiers audio prétraités, il propose l’identification des locuteurs avec horodatage pour un maximum de trois locuteurs. De plus, il prend entièrement en charge les listes de vocabulaire définies par l’utilisateur, gérant efficacement la terminologie professionnelle, les orthographes particulières et les noms spécifiques à un secteur d’activité.
En ce qui concerne l’intégration à l’écosystème, les développeurs peuvent accéder à Gemini 3.5 Transcribe en avant-première via l’API Gemini sur Google AI Studio et Google Antigravity, tandis que les utilisateurs lambda peuvent l’essayer sur Android et macOS. Google prévoit d’intégrer le modèle à Chrome, permettant ainsi la saisie vocale dans n’importe quel champ web. Ce déploiement fait suite au lancement de Gemini 3.7 Flash, à l’extension de Gemini à l’ensemble des utilisateurs Android aux États-Unis et à son intégration dans les véhicules autonomes Waymo, renforçant ainsi la progression rapide de Google dans le développement de sa gamme complète de produits d’IA couvrant tous les scénarios.
Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (0)
Google a officiellement lancé Gemini 3.5 Transcribe, le dernier-né de sa série Gemini, qu’il présente comme le modèle de reconnaissance vocale le plus précis de sa gamme. Désormais accessible aux développeurs, aux entreprises et au grand public, ce modèle répond à des défis récurrents du secteur, notamment les bruits de fond, la terminologie spécialisée et les schémas de parole naturels.
Doté de solides capacités de généralisation, Gemini 3.5 Transcribe excelle dans le filtrage des bruits de fond et la gestion d’un vocabulaire complexe dans des domaines spécialisés. Ce modèle a déjà permis d'améliorer les performances de l'application Gemini sur macOS et de la fonctionnalité Rambler dans Gboard pour Android. Les développeurs peuvent tirer parti de cet outil pour créer des solutions innovantes, telles que des assistants vocaux, des systèmes de sous-titrage en temps réel et des workflows d'analyse post-appel.

Optimisé pour les nuances de la conversation quotidienne, le modèle saisit avec précision l’intention sémantique et identifie le vocabulaire spécifique afin d’aider les utilisateurs à accomplir des tâches à la voix. Il intègre des fonctionnalités pratiques telles que l’autocorrection, la suppression intelligente des mots de remplissage (par exemple, « euh », « hum ») et la mise en forme automatique du texte. De plus, il peut déléguer des tâches complexes, telles que l’analyse de fichiers et la génération d’images, à d’autres modèles Gemini, offrant ainsi une expérience de collaboration multimodèle de bout en bout.
Les données publiques de Google indiquent que Gemini 3.5 Transcribe atteint un taux d’erreur sur les mots (WER) moyen de seulement 4,0 % dans les scénarios en flux continu et de 2,6 % dans les scénarios hors flux continu. Il conserve une grande stabilité de reconnaissance même dans des environnements bruyants, offrant une précision supérieure pour les informations alphanumériques critiques telles que les numéros de commande et les codes postaux.
Le modèle excelle également en matière de prise en charge multilingue et de personnalisation, prenant en charge 85 langues et s’adaptant à divers accents et dialectes régionaux. Pour les fichiers audio prétraités, il propose l’identification des locuteurs avec horodatage pour un maximum de trois locuteurs. De plus, il prend entièrement en charge les listes de vocabulaire définies par l’utilisateur, gérant efficacement la terminologie professionnelle, les orthographes particulières et les noms spécifiques à un secteur d’activité.
En ce qui concerne l’intégration à l’écosystème, les développeurs peuvent accéder à Gemini 3.5 Transcribe en avant-première via l’API Gemini sur Google AI Studio et Google Antigravity, tandis que les utilisateurs lambda peuvent l’essayer sur Android et macOS. Google prévoit d’intégrer le modèle à Chrome, permettant ainsi la saisie vocale dans n’importe quel champ web. Ce déploiement fait suite au lancement de Gemini 3.7 Flash, à l’extension de Gemini à l’ensemble des utilisateurs Android aux États-Unis et à son intégration dans les véhicules autonomes Waymo, renforçant ainsi la progression rapide de Google dans le développement de sa gamme complète de produits d’IA couvrant tous les scénarios.
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter











