Heim
OpenAI stellt drei Echtzeit-Sprachmodelle mit einer Schlussfolgerungsfähigkeit auf GPT-5-Niveau vor

OpenAI, der KI-Riese, hat mit der offiziellen Einführung von drei neuen Echtzeit-Sprachmodellen – GPT-Realtime-2, GPT-Realtime-Translate und GPT-Realtime-Whisper – erneut die Grenzen der Sprachtechnologie erweitert. Diese Modelle sind nun in die Realtime-API für Entwickler integriert und zielen darauf ab, häufige Herausforderungen bei der Sprachinteraktion wie hohe Latenz, mangelnde natürliche Unterbrechungsbehandlung und Probleme bei der mehrsprachigen Unterstützung zu bewältigen.
Das herausragende Merkmal dieser Veröffentlichung ist GPT-Realtime-2, das als das bislang intelligenteste KI-Sprachmodell und als erstes Sprachtool mit einer Schlussfolgerungsfähigkeit auf GPT-5-Niveau beschrieben wird. Im Gegensatz zu herkömmlichen Sprachassistenten ermöglicht es äußerst natürliche, flüssige Gespräche und führt gleichzeitig logische Schlussfolgerungen in Echtzeit durch, ruft nahtlos externe Tools auf und erkennt sowie reagiert präzise auf Unterbrechungen oder Korrekturen durch den Nutzer. Dieser Durchbruch signalisiert, dass sich zukünftige Sprachassistenten über einfache Befehlsausführer hinaus zu kollaborativen Echtzeit-Partnern entwickeln werden, die in der Lage sind, mehrstufige komplexe Aufgaben zu bewältigen.
Die Preise für GPT-Realtime-2 liegen bei 32 US-Dollar pro Million Token für Audioeingaben (ca. 218 RMB) und bei 64 US-Dollar pro Million Token für die Ausgabe (ca. 436 RMB). Die Kosten für zwischengespeicherte Eingaben sind mit nur 0,4 US-Dollar pro Million Token deutlich niedriger.
Über das zentrale Schlussfolgerungsmodell hinaus bieten die beiden anderen Funktionsmodelle spezifische Fähigkeiten. GPT-Realtime-Translate liefert eine starke Übersetzungsleistung und unterstützt die Echtzeit-Übersetzung zwischen 70 Eingabesprachen und 13 Ausgabesprachen. Seine Übersetzungsgeschwindigkeit entspricht nahezu dem Sprechtempo des Sprechers, wodurch es sich ideal für anspruchsvolle Echtzeit-Kommunikationsszenarien wie internationale Besprechungen eignet. GPT-Realtime-Whisper konzentriert sich auf die Transkription per Streaming mit extrem geringer Latenz und bietet ein Erlebnis, bei dem „die Stimme der Person folgt“, was die Wartezeiten für Besprechungsnotizen und Live-Untertitel deutlich verkürzt. Für diese beiden Modelle gilt eine flexiblere Abrechnung, die pro Minute mit 0,034 $ bzw. 0,017 $ berechnet wird.
Branchenanalysten sehen in den jüngsten Schritten von OpenAI einen Wandel in der KI-Sprachinteraktion von „einfachen Antworten“ hin zu „tiefgreifendem Echtzeit-Verständnis“, was die technologische Führungsposition des Unternehmens im Zeitalter der Intelligenz weiter festigt.
Verwandter Artikel
Amazon startet neue FDE-Organisation mit 1 Milliarde Dollar nach OpenAI und Anthropic
Während Unternehmen mit der Integration von KI kämpfen, wenden sie sich an externe Experten, was dazu führt, dass Dienstleister spezialisierte Teams aufbauen, um eine erfolgreiche Implementierung sicherzustellen.Am Dienstag kündigte Amazon Web Servi
Das Weiße Haus verzichtet auf die KI-Bezeichnung „Superintelligenz“
Laden des Players…Diese Woche versammelte das Weiße Haus fast alle großen Tech-CEOs in einem Raum – darunter Zuckerberg, Bezos, Musk und Anthreps Dario Amodei – um ein KI-Sicherheitsversprechen zu unterzeichnen, das Präsident Donald Trump als „moral
Amazon setzt auf KI und saubere Energie, um den Ausbau seiner Rechenzentren voranzutreiben
Amazon nutzt KI, Kernkraft und Elektrofahrzeuge, um die Infrastruktur auszubauen und gleichzeitig die CO₂-Intensität zu senken. Bildquelle: AmazonAmazons Nachhaltigkeitsbericht 2025 beschreibt detaill
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)

OpenAI, der KI-Riese, hat mit der offiziellen Einführung von drei neuen Echtzeit-Sprachmodellen – GPT-Realtime-2, GPT-Realtime-Translate und GPT-Realtime-Whisper – erneut die Grenzen der Sprachtechnologie erweitert. Diese Modelle sind nun in die Realtime-API für Entwickler integriert und zielen darauf ab, häufige Herausforderungen bei der Sprachinteraktion wie hohe Latenz, mangelnde natürliche Unterbrechungsbehandlung und Probleme bei der mehrsprachigen Unterstützung zu bewältigen.
Das herausragende Merkmal dieser Veröffentlichung ist GPT-Realtime-2, das als das bislang intelligenteste KI-Sprachmodell und als erstes Sprachtool mit einer Schlussfolgerungsfähigkeit auf GPT-5-Niveau beschrieben wird. Im Gegensatz zu herkömmlichen Sprachassistenten ermöglicht es äußerst natürliche, flüssige Gespräche und führt gleichzeitig logische Schlussfolgerungen in Echtzeit durch, ruft nahtlos externe Tools auf und erkennt sowie reagiert präzise auf Unterbrechungen oder Korrekturen durch den Nutzer. Dieser Durchbruch signalisiert, dass sich zukünftige Sprachassistenten über einfache Befehlsausführer hinaus zu kollaborativen Echtzeit-Partnern entwickeln werden, die in der Lage sind, mehrstufige komplexe Aufgaben zu bewältigen.
Die Preise für GPT-Realtime-2 liegen bei 32 US-Dollar pro Million Token für Audioeingaben (ca. 218 RMB) und bei 64 US-Dollar pro Million Token für die Ausgabe (ca. 436 RMB). Die Kosten für zwischengespeicherte Eingaben sind mit nur 0,4 US-Dollar pro Million Token deutlich niedriger.
Über das zentrale Schlussfolgerungsmodell hinaus bieten die beiden anderen Funktionsmodelle spezifische Fähigkeiten. GPT-Realtime-Translate liefert eine starke Übersetzungsleistung und unterstützt die Echtzeit-Übersetzung zwischen 70 Eingabesprachen und 13 Ausgabesprachen. Seine Übersetzungsgeschwindigkeit entspricht nahezu dem Sprechtempo des Sprechers, wodurch es sich ideal für anspruchsvolle Echtzeit-Kommunikationsszenarien wie internationale Besprechungen eignet. GPT-Realtime-Whisper konzentriert sich auf die Transkription per Streaming mit extrem geringer Latenz und bietet ein Erlebnis, bei dem „die Stimme der Person folgt“, was die Wartezeiten für Besprechungsnotizen und Live-Untertitel deutlich verkürzt. Für diese beiden Modelle gilt eine flexiblere Abrechnung, die pro Minute mit 0,034 $ bzw. 0,017 $ berechnet wird.
Branchenanalysten sehen in den jüngsten Schritten von OpenAI einen Wandel in der KI-Sprachinteraktion von „einfachen Antworten“ hin zu „tiefgreifendem Echtzeit-Verständnis“, was die technologische Führungsposition des Unternehmens im Zeitalter der Intelligenz weiter festigt.
Amazon startet neue FDE-Organisation mit 1 Milliarde Dollar nach OpenAI und Anthropic
Während Unternehmen mit der Integration von KI kämpfen, wenden sie sich an externe Experten, was dazu führt, dass Dienstleister spezialisierte Teams aufbauen, um eine erfolgreiche Implementierung sicherzustellen.Am Dienstag kündigte Amazon Web Servi
Das Weiße Haus verzichtet auf die KI-Bezeichnung „Superintelligenz“
Laden des Players…Diese Woche versammelte das Weiße Haus fast alle großen Tech-CEOs in einem Raum – darunter Zuckerberg, Bezos, Musk und Anthreps Dario Amodei – um ein KI-Sicherheitsversprechen zu unterzeichnen, das Präsident Donald Trump als „moral
Amazon setzt auf KI und saubere Energie, um den Ausbau seiner Rechenzentren voranzutreiben
Amazon nutzt KI, Kernkraft und Elektrofahrzeuge, um die Infrastruktur auszubauen und gleichzeitig die CO₂-Intensität zu senken. Bildquelle: AmazonAmazons Nachhaltigkeitsbericht 2025 beschreibt detaill











