Heim
Google stellt „Gemini 3.5 Transcribe“ für präzise Textumwandlung in lauten Umgebungen vor
Google hat „Gemini 3.5 Transcribe“ offiziell vorgestellt, das neueste Modell seiner Gemini-Reihe, und positioniert es als das genaueste Spracherkennungsmodell der Produktpalette. Das Modell steht nun Entwicklern, Unternehmen und allgemeinen Nutzern zur Verfügung und bewältigt seit langem bestehende Herausforderungen der Branche, darunter Hintergrundgeräusche, Fachterminologie und natürliche Sprachmuster.
Dank seiner robusten Generalisierungsfähigkeiten zeichnet sich „Gemini 3.5 Transcribe“ durch die Filterung von Hintergrundgeräuschen und den Umgang mit komplexem Vokabular in Fachgebieten aus. Das Modell hat bereits die Leistung der Gemini-App unter macOS und der Rambler-Funktion in Gboard für Android verbessert. Entwickler können dieses Tool nutzen, um innovative Lösungen zu entwickeln, wie beispielsweise sprachgesteuerte Chatbots, Echtzeit-Untertitelungssysteme und Workflows zur Analyse nach Telefonaten.

Das Modell ist auf die Nuancen alltäglicher Gespräche optimiert und erfasst präzise die semantische Absicht sowie benutzerdefiniertes Vokabular, um Nutzer bei der Erledigung von Aufgaben per Spracheingabe zu unterstützen. Es umfasst praktische Funktionen wie automatische Selbstkorrektur, intelligente Entfernung von Füllwörtern (z. B. „ähm“, „äh“) und automatische Textformatierung. Darüber hinaus kann es komplexe Aufgaben wie Dateianalysen und die Bildgenerierung an andere Gemini-Modelle delegieren und bietet so ein durchgängiges Erlebnis der Zusammenarbeit zwischen mehreren Modellen.
Öffentliche Daten von Google zeigen, dass Gemini 3.5 Transcribe eine durchschnittliche Wortfehlerrate (WER) von nur 4,0 % in Streaming-Szenarien und 2,6 % in Nicht-Streaming-Szenarien erreicht. Es gewährleistet auch in lauten Umgebungen eine hohe Erkennungsstabilität und liefert überragende Genauigkeit bei kritischen alphanumerischen Informationen wie Bestellnummern und Postleitzahlen.
Das Modell zeichnet sich zudem durch mehrsprachige Unterstützung und Personalisierung aus und unterstützt 85 Sprachen mit Anpassung an verschiedene regionale Akzente und Dialekte. Bei vorverarbeiteten Audioaufnahmen bietet es eine Sprecheridentifizierung mit Zeitstempeln für bis zu drei Sprecher. Darüber hinaus unterstützt es benutzerdefinierte Vokabellisten vollständig und verarbeitet Fachterminologie, eigenwillige Schreibweisen und branchenspezifische Namen effektiv.
Was die Integration in das Ökosystem betrifft, können Entwickler über die Gemini-API in Google AI Studio und Google Antigravity in der Vorschau auf „Gemini 3.5 Transcribe“ zugreifen, während allgemeine Nutzer es auf Android und macOS ausprobieren können. Google plant, das Modell in Chrome zu integrieren, um die Spracheingabe in jedem Webfeld zu ermöglichen. Diese Einführung folgt auf den Start von Gemini 3.7 Flash, die Ausweitung von Gemini auf alle US-amerikanischen Android-Nutzer und die Integration in die autonomen Fahrzeuge von Waymo und unterstreicht damit Googles raschen Ausbau seiner KI-Produktpalette für alle Anwendungsszenarien.
Verwandter Artikel
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird
Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
So beheben Sie Core Web Vitals für bessere SEO-Rankings
Berichtskartenkommentare mit KI-Tools optimierenEinführungKI-Tools zur Generierung von BerichtskartenkommentarenMagic SchoolAlmanac AIChat GPTNutzung von Magic School zur Generierung von BerichtskartenkommentarenAnmeldung bei Magic SchoolAuswahl des
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Google hat „Gemini 3.5 Transcribe“ offiziell vorgestellt, das neueste Modell seiner Gemini-Reihe, und positioniert es als das genaueste Spracherkennungsmodell der Produktpalette. Das Modell steht nun Entwicklern, Unternehmen und allgemeinen Nutzern zur Verfügung und bewältigt seit langem bestehende Herausforderungen der Branche, darunter Hintergrundgeräusche, Fachterminologie und natürliche Sprachmuster.
Dank seiner robusten Generalisierungsfähigkeiten zeichnet sich „Gemini 3.5 Transcribe“ durch die Filterung von Hintergrundgeräuschen und den Umgang mit komplexem Vokabular in Fachgebieten aus. Das Modell hat bereits die Leistung der Gemini-App unter macOS und der Rambler-Funktion in Gboard für Android verbessert. Entwickler können dieses Tool nutzen, um innovative Lösungen zu entwickeln, wie beispielsweise sprachgesteuerte Chatbots, Echtzeit-Untertitelungssysteme und Workflows zur Analyse nach Telefonaten.

Das Modell ist auf die Nuancen alltäglicher Gespräche optimiert und erfasst präzise die semantische Absicht sowie benutzerdefiniertes Vokabular, um Nutzer bei der Erledigung von Aufgaben per Spracheingabe zu unterstützen. Es umfasst praktische Funktionen wie automatische Selbstkorrektur, intelligente Entfernung von Füllwörtern (z. B. „ähm“, „äh“) und automatische Textformatierung. Darüber hinaus kann es komplexe Aufgaben wie Dateianalysen und die Bildgenerierung an andere Gemini-Modelle delegieren und bietet so ein durchgängiges Erlebnis der Zusammenarbeit zwischen mehreren Modellen.
Öffentliche Daten von Google zeigen, dass Gemini 3.5 Transcribe eine durchschnittliche Wortfehlerrate (WER) von nur 4,0 % in Streaming-Szenarien und 2,6 % in Nicht-Streaming-Szenarien erreicht. Es gewährleistet auch in lauten Umgebungen eine hohe Erkennungsstabilität und liefert überragende Genauigkeit bei kritischen alphanumerischen Informationen wie Bestellnummern und Postleitzahlen.
Das Modell zeichnet sich zudem durch mehrsprachige Unterstützung und Personalisierung aus und unterstützt 85 Sprachen mit Anpassung an verschiedene regionale Akzente und Dialekte. Bei vorverarbeiteten Audioaufnahmen bietet es eine Sprecheridentifizierung mit Zeitstempeln für bis zu drei Sprecher. Darüber hinaus unterstützt es benutzerdefinierte Vokabellisten vollständig und verarbeitet Fachterminologie, eigenwillige Schreibweisen und branchenspezifische Namen effektiv.
Was die Integration in das Ökosystem betrifft, können Entwickler über die Gemini-API in Google AI Studio und Google Antigravity in der Vorschau auf „Gemini 3.5 Transcribe“ zugreifen, während allgemeine Nutzer es auf Android und macOS ausprobieren können. Google plant, das Modell in Chrome zu integrieren, um die Spracheingabe in jedem Webfeld zu ermöglichen. Diese Einführung folgt auf den Start von Gemini 3.7 Flash, die Ausweitung von Gemini auf alle US-amerikanischen Android-Nutzer und die Integration in die autonomen Fahrzeuge von Waymo und unterstreicht damit Googles raschen Ausbau seiner KI-Produktpalette für alle Anwendungsszenarien.
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
So beheben Sie Core Web Vitals für bessere SEO-Rankings
Berichtskartenkommentare mit KI-Tools optimierenEinführungKI-Tools zur Generierung von BerichtskartenkommentarenMagic SchoolAlmanac AIChat GPTNutzung von Magic School zur Generierung von BerichtskartenkommentarenAnmeldung bei Magic SchoolAuswahl des











