Hogar
Microsoft presenta los modelos de desarrollo propio MAI-Image-2.5-Pro y MAI-Voice-2-Flash, que ya están integrados en Bing y PowerPoint
El 23 de julio, Microsoft anunció la versión preliminar pública de dos modelos de IA propios: MAI-Image-2.5-Pro y MAI-Voice-2-Flash. Estos modelos están diseñados para la generación de imágenes de alta calidad y para interacciones de voz con un alto nivel de concurrencia. Microsoft ha destacado que los datos de entrenamiento están depurados, son trazables y no proceden de la destilación de modelos de terceros. Creados desde cero, están destinados directamente a los usuarios de los productos de Microsoft.

El modelo de imagen de mayor precisión reduce los costes de la GPU hasta en un 84 %
MAI-Image-2.5-Pro es el modelo de imágenes más preciso de Microsoft, destinado a casos de uso exigentes como la generación de imágenes destacadas, la edición detallada y la representación de texto dentro de imágenes, al tiempo que admite instrucciones de edición en lenguaje natural. Se ha convertido en el modelo predeterminado de generación de imágenes en Bing Image Creator y se utiliza para la edición de imagen a imagen en PowerPoint. En comparación con GPT-Image-2, reduce los costes de la GPU hasta en un 84 %. Tras su implementación en OneDrive, las tasas de éxito de los escenarios aumentaron un 26 %, la latencia P95 se redujo en aproximadamente un 25 % y la eficiencia en entornos de producción con carga media mejoró 2,5 veces.
El precio es de 5 dólares por millón de tokens para la entrada de texto y de 106 dólares por millón de tokens para la salida de imágenes.
El modelo de voz duplica la velocidad y presta servicio a clientes como T-Mobile

MAI-Voice-2-Flash está optimizado para aplicaciones de voz de alta frecuencia, ya que ofrece aproximadamente el doble de velocidad que la generación anterior y una reducción de costes del 32 %, lo que lo hace ideal para escenarios que requieren una respuesta rápida, como los centros de contacto y los asistentes de voz. Integrado en Dynamics 365 Contact Center, presta servicio a clientes como T-Mobile y EasyJet, con reducciones de costes de GPU de hasta el 89 %. Microsoft también lo ha incorporado al servicio Azure Voice Live, lo que permite a los desarrolladores crear agentes interactivos de voz a voz.
Además, el modelo MAI-Transcribe-1.5 de la misma serie se ha aplicado a la solución de voz para el ámbito médico Dragon Copilot, utilizada por 170 000 profesionales sanitarios. El pasado trimestre procesó 28 millones de consultas de pacientes, admite 58 idiomas y reduce las tasas de error de transcripción en aproximadamente un 50 % para la mayoría de los idiomas. Microsoft ha revelado que el clúster informático GB200 de última generación ya está operativo y que la serie MAI seguirá ampliándose.
Artículo relacionado
El lanzamiento global de la campaña de campus de Seed de ByteDance ofrece acciones virtuales para captar a los mejores talentos en modelos grandes
En el competitivo panorama de los modelos de lenguaje grandes, asegurar el talento de primer nivel sigue siendo el activo estratégico más crítico.El 1 de abril, ByteDance anunció el lanzamiento de su iniciativa global de reclutamiento de campus Seed
Suno añade marcas de agua a las canciones en medio de batallas legales
Suno, la plataforma que permite a los usuarios generar música creada por inteligencia artificial, ha presentado nuevas funciones para etiquetar las pistas producidas en la plataforma, restringir las descargas y actualizar las normas de la comunidad c
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
El 23 de julio, Microsoft anunció la versión preliminar pública de dos modelos de IA propios: MAI-Image-2.5-Pro y MAI-Voice-2-Flash. Estos modelos están diseñados para la generación de imágenes de alta calidad y para interacciones de voz con un alto nivel de concurrencia. Microsoft ha destacado que los datos de entrenamiento están depurados, son trazables y no proceden de la destilación de modelos de terceros. Creados desde cero, están destinados directamente a los usuarios de los productos de Microsoft.

El modelo de imagen de mayor precisión reduce los costes de la GPU hasta en un 84 %
MAI-Image-2.5-Pro es el modelo de imágenes más preciso de Microsoft, destinado a casos de uso exigentes como la generación de imágenes destacadas, la edición detallada y la representación de texto dentro de imágenes, al tiempo que admite instrucciones de edición en lenguaje natural. Se ha convertido en el modelo predeterminado de generación de imágenes en Bing Image Creator y se utiliza para la edición de imagen a imagen en PowerPoint. En comparación con GPT-Image-2, reduce los costes de la GPU hasta en un 84 %. Tras su implementación en OneDrive, las tasas de éxito de los escenarios aumentaron un 26 %, la latencia P95 se redujo en aproximadamente un 25 % y la eficiencia en entornos de producción con carga media mejoró 2,5 veces.
El precio es de 5 dólares por millón de tokens para la entrada de texto y de 106 dólares por millón de tokens para la salida de imágenes.
El modelo de voz duplica la velocidad y presta servicio a clientes como T-Mobile

MAI-Voice-2-Flash está optimizado para aplicaciones de voz de alta frecuencia, ya que ofrece aproximadamente el doble de velocidad que la generación anterior y una reducción de costes del 32 %, lo que lo hace ideal para escenarios que requieren una respuesta rápida, como los centros de contacto y los asistentes de voz. Integrado en Dynamics 365 Contact Center, presta servicio a clientes como T-Mobile y EasyJet, con reducciones de costes de GPU de hasta el 89 %. Microsoft también lo ha incorporado al servicio Azure Voice Live, lo que permite a los desarrolladores crear agentes interactivos de voz a voz.
Además, el modelo MAI-Transcribe-1.5 de la misma serie se ha aplicado a la solución de voz para el ámbito médico Dragon Copilot, utilizada por 170 000 profesionales sanitarios. El pasado trimestre procesó 28 millones de consultas de pacientes, admite 58 idiomas y reduce las tasas de error de transcripción en aproximadamente un 50 % para la mayoría de los idiomas. Microsoft ha revelado que el clúster informático GB200 de última generación ya está operativo y que la serie MAI seguirá ampliándose.
El lanzamiento global de la campaña de campus de Seed de ByteDance ofrece acciones virtuales para captar a los mejores talentos en modelos grandes
En el competitivo panorama de los modelos de lenguaje grandes, asegurar el talento de primer nivel sigue siendo el activo estratégico más crítico.El 1 de abril, ByteDance anunció el lanzamiento de su iniciativa global de reclutamiento de campus Seed
Suno añade marcas de agua a las canciones en medio de batallas legales
Suno, la plataforma que permite a los usuarios generar música creada por inteligencia artificial, ha presentado nuevas funciones para etiquetar las pistas producidas en la plataforma, restringir las descargas y actualizar las normas de la comunidad c
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se











