Heim
Microsoft stellt die selbst entwickelten Modelle „MAI-Image-2.5-Pro“ und „MAI-Voice-2-Flash“ vor, die nun in Bing und PowerPoint integriert sind
Am 23. Juli kündigte Microsoft die öffentliche Vorschau auf zwei proprietäre KI-Modelle an: MAI-Image-2.5-Pro und MAI-Voice-2-Flash. Diese Modelle sind für die Erzeugung hochwertiger Bilder und Sprachinteraktionen mit hoher Parallelität ausgelegt. Microsoft betonte, dass die Trainingsdaten bereinigt und rückverfolgbar sind und nicht aus der Modelldestillation von Drittanbietern stammen. Die Modelle wurden von Grund auf neu entwickelt und stehen den Nutzern von Microsoft-Produkten direkt zur Verfügung.

Bildmodell mit höchster Präzision senkt GPU-Kosten um bis zu 84 %
MAI-Image-2.5-Pro ist das präziseste Bildmodell von Microsoft und zielt auf anspruchsvolle Anwendungsfälle wie die Erstellung von Hero-Bildern, detaillierte Bearbeitung und die Darstellung von Text innerhalb von Bildern ab, wobei es Bearbeitungsanweisungen in natürlicher Sprache unterstützt. Es ist zum Standardmodell für die Bildgenerierung im Bing Image Creator geworden und wird für die Bild-zu-Bild-Bearbeitung in PowerPoint verwendet. Im Vergleich zu GPT-Image-2 senkt es die GPU-Kosten um bis zu 84 %. Nach der Bereitstellung in OneDrive stiegen die Erfolgsraten der Szenarien um 26 %, die P95-Latenz sank um etwa 25 % und die Effizienz in Produktionsumgebungen mit mittlerer Auslastung verbesserte sich um das 2,5-Fache.
Die Preise betragen 5 US-Dollar pro Million Token für die Texteingabe und 106 US-Dollar pro Million Token für die Bildausgabe.
Sprachmodell verdoppelt die Geschwindigkeit und bedient Kunden wie T-Mobile

MAI-Voice-2-Flash ist für hochfrequente Sprachanwendungen optimiert und bietet etwa die doppelte Geschwindigkeit der Vorgängergeneration sowie eine Kostenreduzierung von 32 %, wodurch es sich ideal für Szenarien mit schnellen Reaktionszeiten wie Contact Center und Sprachassistenten eignet. Integriert in Dynamics 365 Contact Center bedient es Kunden wie T-Mobile und EasyJet und ermöglicht dabei GPU-Kosteneinsparungen von bis zu 89 %. Microsoft hat es zudem in den Azure Voice Live-Dienst eingebettet, wodurch Entwickler interaktive Sprach-zu-Sprache-Agenten erstellen können.
Zudem wurde das Modell „MAI-Transcribe-1.5“ aus derselben Serie in die medizinische Sprachlösung „Dragon Copilot“ integriert, die von 170.000 Gesundheitsdienstleistern genutzt wird. Es verarbeitete im letzten Quartal 28 Millionen Patientenkonsultationen, unterstützt 58 Sprachen und reduziert die Transkriptionsfehlerquote bei den meisten Sprachen um rund 50 %. Microsoft gab bekannt, dass der GB200-Rechencluster der nächsten Generation bereits in Betrieb ist und die MAI-Serie weiter ausgebaut wird.
Verwandter Artikel
ByteDances Seed startet globale Campus-Werbung und bietet virtuelle Aktien, um Top-Talente für große Modelle zu gewinnen
Im wettbewerbsintensiven Umfeld der großen Sprachmodelle bleibt die Sicherung erstklassiger Talente das wichtigste strategische Asset.Am 1. April ByteDance gab die Einführung seiner globalen Campus-Rekrutierungsinitiative Seed bekannt, die Teil seine
Suno fügt Wasserzeichen in Songs ein, während Rechtsstreitigkeiten andauern
Suno, die Plattform, die es Nutzern ermöglicht, KI-generierte Musik zu erstellen, hat neue Funktionen vorgestellt, um plattformproduzierte Tracks zu kennzeichnen, Downloads einzuschränken und die Community-Richtlinien zu aktualisieren, um unbefugte K
Musk räumt ein, dass Grok-Build Benutzercode geleakt hat, verspricht aber, alle historischen Daten zu löschen
Elon Musk wandte sich direkt an die Datenschutzkontroverse um Grok Build, beginnend mit einem einfachen „True“, um die Gültigkeit des Vorfalls zu bestätigen. Er versprach, dass alle zuvor bei SpaceXAI hochgeladenen Benutzerdaten unwiderruflich gelösc
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Am 23. Juli kündigte Microsoft die öffentliche Vorschau auf zwei proprietäre KI-Modelle an: MAI-Image-2.5-Pro und MAI-Voice-2-Flash. Diese Modelle sind für die Erzeugung hochwertiger Bilder und Sprachinteraktionen mit hoher Parallelität ausgelegt. Microsoft betonte, dass die Trainingsdaten bereinigt und rückverfolgbar sind und nicht aus der Modelldestillation von Drittanbietern stammen. Die Modelle wurden von Grund auf neu entwickelt und stehen den Nutzern von Microsoft-Produkten direkt zur Verfügung.

Bildmodell mit höchster Präzision senkt GPU-Kosten um bis zu 84 %
MAI-Image-2.5-Pro ist das präziseste Bildmodell von Microsoft und zielt auf anspruchsvolle Anwendungsfälle wie die Erstellung von Hero-Bildern, detaillierte Bearbeitung und die Darstellung von Text innerhalb von Bildern ab, wobei es Bearbeitungsanweisungen in natürlicher Sprache unterstützt. Es ist zum Standardmodell für die Bildgenerierung im Bing Image Creator geworden und wird für die Bild-zu-Bild-Bearbeitung in PowerPoint verwendet. Im Vergleich zu GPT-Image-2 senkt es die GPU-Kosten um bis zu 84 %. Nach der Bereitstellung in OneDrive stiegen die Erfolgsraten der Szenarien um 26 %, die P95-Latenz sank um etwa 25 % und die Effizienz in Produktionsumgebungen mit mittlerer Auslastung verbesserte sich um das 2,5-Fache.
Die Preise betragen 5 US-Dollar pro Million Token für die Texteingabe und 106 US-Dollar pro Million Token für die Bildausgabe.
Sprachmodell verdoppelt die Geschwindigkeit und bedient Kunden wie T-Mobile

MAI-Voice-2-Flash ist für hochfrequente Sprachanwendungen optimiert und bietet etwa die doppelte Geschwindigkeit der Vorgängergeneration sowie eine Kostenreduzierung von 32 %, wodurch es sich ideal für Szenarien mit schnellen Reaktionszeiten wie Contact Center und Sprachassistenten eignet. Integriert in Dynamics 365 Contact Center bedient es Kunden wie T-Mobile und EasyJet und ermöglicht dabei GPU-Kosteneinsparungen von bis zu 89 %. Microsoft hat es zudem in den Azure Voice Live-Dienst eingebettet, wodurch Entwickler interaktive Sprach-zu-Sprache-Agenten erstellen können.
Zudem wurde das Modell „MAI-Transcribe-1.5“ aus derselben Serie in die medizinische Sprachlösung „Dragon Copilot“ integriert, die von 170.000 Gesundheitsdienstleistern genutzt wird. Es verarbeitete im letzten Quartal 28 Millionen Patientenkonsultationen, unterstützt 58 Sprachen und reduziert die Transkriptionsfehlerquote bei den meisten Sprachen um rund 50 %. Microsoft gab bekannt, dass der GB200-Rechencluster der nächsten Generation bereits in Betrieb ist und die MAI-Serie weiter ausgebaut wird.
ByteDances Seed startet globale Campus-Werbung und bietet virtuelle Aktien, um Top-Talente für große Modelle zu gewinnen
Im wettbewerbsintensiven Umfeld der großen Sprachmodelle bleibt die Sicherung erstklassiger Talente das wichtigste strategische Asset.Am 1. April ByteDance gab die Einführung seiner globalen Campus-Rekrutierungsinitiative Seed bekannt, die Teil seine
Suno fügt Wasserzeichen in Songs ein, während Rechtsstreitigkeiten andauern
Suno, die Plattform, die es Nutzern ermöglicht, KI-generierte Musik zu erstellen, hat neue Funktionen vorgestellt, um plattformproduzierte Tracks zu kennzeichnen, Downloads einzuschränken und die Community-Richtlinien zu aktualisieren, um unbefugte K
Musk räumt ein, dass Grok-Build Benutzercode geleakt hat, verspricht aber, alle historischen Daten zu löschen
Elon Musk wandte sich direkt an die Datenschutzkontroverse um Grok Build, beginnend mit einem einfachen „True“, um die Gültigkeit des Vorfalls zu bestätigen. Er versprach, dass alle zuvor bei SpaceXAI hochgeladenen Benutzerdaten unwiderruflich gelösc











