Microsoft 23 липня опублікувала дві нові моделі для публічного прев’ю: MAI-Image-2.5-Pro і MAI-Voice-2-Flash; водночас розкрила внутрішні дані, згідно з якими після того, як центр підтримки перейшов на MAI-Voice-2-Flash, витрати на обчислювальні потужності знизилися на 89%. Генеральний директор Microsoft Сатья Наделла заявив, що коли власні моделі демонструють рівність або перевершують передові рішення, він спрямовує на MAI трафік.
Функціональне призначення та ціноутворення MAI-Image-2.5-Pro і MAI-Voice-2-Flash
MAI-Image-2.5-Pro орієнтована на преміальне створення зображень; ціна становить 5 доларів за кожен мільйон token-вводу з тексту та 106 доларів за кожен мільйон token-виводу зображень; Bing Image Creator повністю перейшов на MAI-Image-2.5, а WPP глобальний директор із креативу Роб Райлі в заяві Microsoft назвав це «значним проривом для інструментів створення контенту».
MAI-Voice-2-Flash призначена для сценаріїв масової обробки голосу (зокрема кол-центрів), швидша за попередника вдвічі та має на 32% нижчу вартість; після заміни кол-центром цієї моделі витрати на обчислювальні потужності знизилися на 89%. Також у повідомленні одночасно розкрито результати розгортання Bing Image Creator, PowerPoint (GPU-витрати на 84% нижчі за GPT-Image-2), OneDrive (збережуваність +26%, затримка -25%) і Dragon Copilot (частота помилок -50%).
Конкретні досягнення з економії GPU-витрат
Microsoft у своїй заяві розкрила ефективність у таких сценаріях:
MAI-Voice-2-Flash (голос для кол-центру): витрати на обчислювальні потужності знижено на 89%; швидша за попередника вдвічі, вартість нижча на 32%
MAI-Image-2.5-Pro (PowerPoint): GPU-вартість нижча за OpenAI GPT-Image-2 на 84%
OneDrive після заміни моделі: збережуваність підвищено на 26%, затримку знижено приблизно на 25%
Dragon Copilot (MAI-Transcribe-1.5, медична транскрипція): обслуговує 170 тис. медичних працівників; за минулий квартал оброблено 28 млн записів пацієнтів; під час транскрипції та розпізнавання мов для 58 мов частота помилок порівняно знизилася на 50%
MAI-Code-1-Flash (GitHub Copilot): частка прийнятого коду вища за GPT-5.4 Mini і Claude Haiku 4.5 приблизно на 10%; споживання token менше на 10%; може працювати на GPU H100 і навіть A100
Логіка «віткового» бою Наделли та принцип спрямування трафіку на MAI замість передових моделей
Наделла в X опублікував допис під заголовком «Передове розповсюдження та контроль», де виклав модельну стратегію Microsoft: коли власні моделі демонструють рівність або перевершують передові замінники, він спрямовує трафік на MAI, щоб надавати послуги в масштабі та з нижчою вартістю. Підтримує цю стратегію методологія «hill-climbing»: щоб дані, моделі й продукт «вкладалися в узгоджену систему» та формували безперервний ітераційний «віток», а не покладалися на одноразове навчання, яке визначає, хто «вижив», а хто — ні.
Він також зазначив, що система оцінювання «має продовжувати рости вгору, навіть якщо прибрати будь-яку з моделей» — тобто зберігати пам’ять і навички поза моделями, формуючи справжній контроль, який Microsoft реально опановує. Після додаткового тренування MAI-Code-1-Flash у середовищі підкріпленого навчання Excel вона може зрівнювати GPT-5.6 у більшості завдань Excel на старіших GPU H100 і A100, водночас звільняючи найновіший кластер GB200 для тренування, а не для запитів сервісу.
Поширені запитання
Яке ціноутворення MAI-Image-2.5-Pro і MAI-Voice-2-Flash?
MAI-Image-2.5-Pro коштує 5 доларів за кожен мільйон текстових token-вводу та 106 доларів за кожен мільйон token-виводу зображень; доступна в публічному прев’ю в Azure. MAI-Voice-2-Flash швидша за попередника вдвічі та має на 32% нижчу вартість; деталі ціни відповідають офіційному повідомленню Azure.
На скільки максимум, за словами Microsoft, падає GPU-вартість після переходу на MAI-моделі?
Згідно з внутрішніми даними, оприлюдненими Microsoft: після переходу кол-центру на MAI-Voice-2-Flash витрати на обчислювальні потужності знизилися на 89%; після того як PowerPoint перейшов на MAI-зображувальну модель, GPU-вартість знизилася на 84% порівняно з GPT-Image-2; після заміни Dragon Copilot на MAI-Transcribe-1.5 частота помилок під час транскрипції та розпізнавання мов відносно знизилася на 50%. Втім усі наведені цифри походять із внутрішніх оцінок Microsoft і не є незалежними базовими тестами від третьої сторони.
Як корпоративні клієнти можуть використовувати Azure для MAI-методу навчання Microsoft?
Microsoft через продукти Foundry та Frontier Tuning у Azure дає корпоративним клієнтам можливість навчати моделі на власних даних для створення власних моделей; Microsoft підкреслює, що ці моделі навчаються на «чистих і відстежуваних корпоративних даних без перегонки третіми моделями», щоб відповісти на запитання щодо відповідності джерелам навчальних даних.