Microsoft setzt auf eigene KI-Modelle: MAI statt OpenAI
Inhaltsverzeichnis Microsoft baut den Einsatz eigener KI-Modelle in seinen Produkten aus. Der Bing Image Creator arbeitet nach Angaben des Unternehmens inzwischen vollständig mit der Bild-KI MAI-Image-2.5. Auch in PowerPoint, OneDrive, Dynamics 365 und Azure kommen neue Modelle der MAI-Familie zum Einsatz. Weiterlesen nach der Anzeige Microsofts KI-Angebote sind bislang eng mit dem Partner OpenAI verbunden. GPT-Modelle bilden unter anderem eine Grundlage für die Copilot-Funktionen. Für PowerPoint vergleicht Microsoft den Einsatz von MAI-Image-2.5 ausdrücklich mit GPT-Image-2. Parallel entwickelt das Unternehmen seit etwa einem Jahr eigene Modelle unter dem Namen MAI. Sie sollen sich besser auf einzelne Produktfunktionen zuschneiden lassen und Microsoft bei Kosten, Laufzeiten und der Modellauswahl mehr Spielraum geben. Bing Image Creator arbeitet vollständig mit MAI Beim Bing Image Creator ist der Wechsel am weitesten fortgeschritten. Der Dienst arbeite nun vollständig mit Microsofts eigenen Modellen, teilt das Unternehmen mit. MAI-Image-2.5 dient dort standardmäßig sowohl zur Bilderzeugung als auch zur Bildbearbeitung. Nutzer können damit Bilder aus Texteingaben erstellen und vorhandene Motive per Anweisung verändern. Die KI kann etwa Objekte entfernen, Bildbereiche ergänzen oder ein Bild umgestalten. Microsoft hebt dabei vor allem die präzisere Bearbeitung per natürlicher Sprache hervor. Auch PowerPoint nutzt MAI-Image-2.5 für Bild-zu-Bild-Funktionen. Dabei dient ein vorhandenes Bild als Vorlage, die die KI verändern, erweitern oder stilistisch anpassen kann. Microsoft zufolge sinken die GPU-Kosten in diesem Einsatz um bis zu 84 Prozent gegenüber GPT-Image-2. In OneDrive ist MAI-Image-2.5 nach Unternehmensangaben das Standardmodell für wichtige Bildbearbeitungsfunktionen. Microsoft nennt eine um etwa ein Viertel geringere P95-Latenz. Der Wert beschreibt die Antwortzeit, die 95 Prozent der Anfragen nicht überschreiten. Außerdem sei die Speicherrate um 26 Prozent gestiegen; Nutzer speichern die erzeugten oder bearbeiteten Ergebnisse demnach häufiger. Weiterlesen nach der Anzeige Pro-Modell für anspruchsvollere Bildaufgaben Neben dem breiteren Einsatz von MAI-Image-2.5 stellt Microsoft MAI-Image-2.5-Pro als Public Preview bereit. Die Variante ist für Anwendungen gedacht, bei denen Bildqualität wichtiger ist als geringe Kosten oder kurze Antwortzeiten. Microsoft nennt als Einsatzfelder hochwertige Motive, detaillierte Bildbearbeitung und die möglichst fehlerfreie Darstellung von Text innerhalb erzeugter Bilder. Gerade letzteres gilt bei Bildgeneratoren weiterhin als schwierige Aufgabe, weil Buchstaben und Wörter oft verzerrt oder falsch wiedergegeben werden. Die Standardvariante MAI-Image-2.5 und das Pro-Modell werden parallel angeboten. Microsoft will Anwendungen damit je nach Anforderungen an Qualität, Geschwindigkeit und Kosten ausstatten. Sprachmodell für Contact Center und Azure Für Sprachfunktionen führt Microsoft MAI-Voice-2-Flash ein. Das Modell erzeugt künstliche Stimmen für dialogorientierte Anwendungen, etwa Sprachassistenten und telefonische Kundenservices. Gegenüber MAI-Voice-2 soll die Flash-Variante doppelt so schnell arbeiten und 32 Prozent weniger kosten. Dynamics 365 Contact Center nutzt MAI-Voice-2-Flash laut Microsoft bereits produktiv und reduziert dabei die GPU-Kosten um bis zu 89 Prozent. Die Plattform richtet sich an Unternehmen, die KI-Agenten für Hotlines und andere Servicekanäle betreiben. Microsoft nennt T-Mobile und EasyJet als Kunden. Auch Azure Voice Live integriert MAI-Voice-2-Flash bereits. Entwickler können damit Sprachagenten bauen, die Sprache direkt verarbeiten und wieder ausgeben. Niedrige Latenz ist dabei wichtig, damit Gespräche nicht durch spürbare Pausen unterbrochen werden. Für Dragon Copilot setzt Microsoft zudem MAI-Transcribe-1.5 ein. Das Modell transkribiert gesprochene Sprache und unterstützt mehrsprachige Arbeitsabläufe in 58 Sprachen. Es ersetzt dort nach Angaben des Unternehmens das zuvor verwendete Transkriptionsmodell.