Microsoft lance MAI-Voice-2-Flash, avec une baisse maximale des coûts des GPU de 89 %

MSFT0,85%
Key Takeaways
  • Microsoft a publié en aperçu public le 23 juillet MAI-Voice-2-Flash et MAI-Image-2.5-Pro, avec des réductions de coûts significatives.
  • Les centres de service client de Microsoft ont atteint une réduction de 89 % des coûts de calcul après avoir adopté MAI-Voice-2-Flash pour le traitement de la parole.
  • MAI-Code-1-Flash peut fonctionner sur des GPU H100 et A100 plus anciens tout en conservant des performances équivalentes à GPT-5.6 sur des tâches Excel.

Microsoft a publié le 23 juillet deux nouveaux modèles en accès public : MAI-Image-2.5-Pro et MAI-Voice-2-Flash ; dans le même temps, l’entreprise a dévoilé des données internes : après le passage du centre d’assistance à MAI-Voice-2-Flash, les coûts de calcul baissent de 89 %. Le PDG de Microsoft, Satya Nadella, affirme que lorsqu’il arrive à équilibrer ou à dépasser les performances de solutions de pointe avec ses propres modèles, il oriente alors le trafic vers MAI.

Positionnement des fonctionnalités et tarification de MAI-Image-2.5-Pro et MAI-Voice-2-Flash

MAI-Image-2.5-Pro est positionné comme une génération d’images haut de gamme ; son prix est de 5 dollars pour 170k de tokens d’entrée texte et de 106 dollars pour 1 million de tokens de sortie d’images. Bing Image Creator a déjà basculé intégralement sur MAI-Image-2.5 ; WPP, responsable mondial des créations, Rob Reilly, cite dans l’annonce de Microsoft : « une avancée majeure pour les outils de génération de contenus ».

MAI-Voice-2-Flash est positionné pour des scénarios de traitement intensif de la voix (comme les centres d’assistance) ; il est deux fois plus rapide que son prédécesseur et affiche des coûts inférieurs de 32 % ; après adoption de ce modèle par le centre d’assistance, les coûts de calcul baissent de 89 %. Cette annonce révèle aussi les résultats de déploiement de Bing Image Creator, PowerPoint (coûts GPU inférieurs de 84 % à ceux de GPT-Image-2), OneDrive (taux de stockage +26 %, latence -25 %) et Dragon Copilot (taux d’erreurs -50 %).

Résultats concrets de l’économie de coûts GPU

Microsoft a dévoilé les performances dans chaque scénario, comme suit :

MAI-Voice-2-Flash (voix du centre d’assistance) : coûts de calcul -89 % ; deux fois plus rapide que le prédécesseur, coûts -32 %

MAI-Image-2.5-Pro (PowerPoint) : coûts GPU inférieurs de 84 % à ceux d’OpenAI GPT-Image-2

OneDrive après changement de modèle : taux de stockage amélioré de 26 %, latence réduite d’environ 25 %

Dragon Copilot (MAI-Transcribe-1.5, transcription médicale) : dessert 170k professionnels de santé ; au trimestre, traite 28 millions d’enregistrements patients ; erreurs de transcription et de reconnaissance de la langue en baisse relative de 50 % sur 58 langues de transcription et de détection linguistique

MAI-Code-1-Flash (GitHub Copilot) : taux d’adoption du code supérieur d’environ 10 % à GPT-5.4 Mini et Claude Haiku 4.5 ; consommation de tokens inférieure de 10 % ; peut fonctionner sur GPU H100 et A100

Stratégie de “volant” de Nadella et logique de flux pour remplacer des modèles de pointe par MAI

Sur X, Nadella a publié un billet intitulé « Dissémination de pointe et contrôle », exposant la stratégie de modèles de Microsoft : lorsque les modèles de l’entreprise égalent ou dépassent ceux des solutions de remplacement de pointe, le trafic est dirigé vers MAI afin de fournir un service à plus grande échelle pour un coût plus faible. Cette stratégie repose sur la méthodologie du « hill-climbing » : faire en sorte que les données, le modèle et le produit forment un « système assorti » qui s’itère en continu, plutôt que de dépendre d’un seul entraînement qui déciderait du sort.

Il a aussi indiqué que le système d’évaluation « doit continuer à progresser même en retirant n’importe quel modèle » — conserver la mémoire et les compétences en dehors du modèle, afin de constituer un véritable pouvoir de contrôle maîtrisé par Microsoft. Après un entraînement supplémentaire dans l’environnement d’apprentissage par renforcement d’Excel, MAI-Code-1-Flash peut tourner sur les anciens GPU H100 et A100, égalant GPT-5.6 sur la majorité des tâches Excel, tout en libérant le tout dernier cluster GB200 pour des demandes d’entraînement plutôt que des requêtes de service.

Questions fréquentes

Quel est le prix de MAI-Image-2.5-Pro et MAI-Voice-2-Flash ?

MAI-Image-2.5-Pro coûte 5 dollars pour 1 million de tokens d’entrée texte et 106 dollars pour 1 million de tokens de sortie d’images ; il est déjà disponible en accès public sur Azure. MAI-Voice-2-Flash est deux fois plus rapide que son prédécesseur et ses coûts sont inférieurs de 32 % ; les détails du prix sont à confirmer via l’annonce officielle Azure.

De combien Microsoft dit que les coûts GPU ont baissé au maximum après le passage aux modèles MAI ?

D’après des données internes publiées par Microsoft : après le passage du centre d’assistance à MAI-Voice-2-Flash, les coûts de calcul baissent de 89 % ; après adoption de PowerPoint du modèle MAI image, les coûts GPU sont inférieurs de 84 % à ceux de GPT-Image-2 ; après le passage de Dragon Copilot à MAI-Transcribe-1.5, le taux d’erreurs de transcription et de reconnaissance de la langue baisse relativement de 50 %. Toutefois, tous ces chiffres proviennent d’évaluations internes de Microsoft et ne correspondent pas à des tests indépendants de référence effectués par un tiers.

Comment les clients professionnels peuvent-ils utiliser la méthode d’entraînement MAI de Microsoft via Azure ?

Microsoft, via ses produits Foundry et Frontier Tuning sur Azure, permet aux clients professionnels d’entraîner à l’aide de leurs propres données des modèles dédiés ; Microsoft souligne que ces modèles sont entraînés à partir de « données d’entreprise propres et traçables, sans distillation via des modèles tiers », afin de répondre aux questions de conformité liées à l’origine des données d’entraînement.

Avertissement : Les informations figurant sur cette page peuvent provenir de sources tierces et sont fournies à titre indicatif uniquement. Elles ne reflètent pas les points de vue ou opinions de Gate et ne constituent pas un conseil financier, d’investissement ou juridique. Le trading des actifs virtuels comporte des risques élevés. Veuillez ne pas vous fonder uniquement sur les informations de cette page pour prendre vos décisions. Pour en savoir plus, consultez l’avertissement.
Commentaire
0/400
Aucun commentaire