أعلنت شركة مايكروسوفت في 23 يوليو إصدار نموذجين جديدين لدخول مرحلة المعاينة العامة: MAI-Image-2.5-Pro و MAI-Voice-2-Flash؛ وفي الوقت نفسه كشفت عن بيانات داخلية تفيد بأن مركز خدمة العملاء، بعد اعتماده MAI-Voice-2-Flash، خفض تكلفة الحوسبة بنسبة 89%. قال الرئيس التنفيذي لشركة مايكروسوفت ساتيا ناديلّا إن توجيه حركة المرور إلى نماذج MAI يحدث عندما تتعادل نماذجهم أو تتفوق على الحلول الرائدة.
تحديد الوظائف والتسعير لـ MAI-Image-2.5-Pro و MAI-Voice-2-Flash
يستهدف MAI-Image-2.5-Pro توليد الصور عالي المستوى، ويتراوح تسعيره بين 5 دولارات لكل مليون رمز إدخال نصي (token) و106 دولارات لكل مليون رمز إخراج صور (token)؛ وقد تم اعتماد Bing Image Creator بالكامل ليستخدم MAI-Image-2.5، وقال المدير الإبداعي العالمي في WPP روب رِيلي في إعلان مايكروسوفت إنه «قفزة كبيرة في أدوات إنشاء المحتوى».
يستهدف MAI-Voice-2-Flash سيناريوهات معالجة كميات كبيرة من الصوت (مثل مراكز خدمة العملاء)، وهو أسرع بمرّة واحدة من النسخة السابقة وأقل تكلفة بنسبة 32%؛ وبعد انتقال مركز خدمة العملاء إلى هذا النموذج، انخفضت تكلفة الحوسبة بنسبة 89%. كما كشفت هذه الإعلانات في الوقت ذاته عن نتائج نشر كل من Bing Image Creator وPowerPoint (انخفاض تكلفة وحدة معالجة الرسومات GPU مقارنةً بـ GPT-Image-2 بنسبة 84%) وOneDrive (معدل التخزين +26%، التأخير -25%) وDragon Copilot (انخفاض معدل الأخطاء -50%).
النتائج المحددة لتوفير تكاليف GPU
تتلخص نتائج كل سيناريو كما وردت في إعلان مايكروسوفت على النحو التالي:
MAI-Voice-2-Flash (صوت مركز خدمة العملاء): خفض تكلفة الحوسبة بنسبة 89%؛ أسرع بمرّة من النسخة السابقة وتكلفته أقل بنسبة 32%
MAI-Image-2.5-Pro (PowerPoint): تكلفة GPU أقل بنسبة 84% مقارنةً بـ OpenAI GPT-Image-2
OneDrive بعد تبديل النموذج: زيادة معدل التخزين بنسبة 26%، وتقليل التأخير بنحو 25%
Dragon Copilot (MAI-Transcribe-1.5، النسخ الطبي): يخدم 170 ألفًا من العاملين في القطاع الصحي؛ وفي الربع السابق عالج 28 مليونًا من سجلات المرضى؛ وتراجع معدل أخطاء الترجمة النصية والتعرّف على اللغة نسبيًا بنسبة 50% عبر 58 لغة
MAI-Code-1-Flash (GitHub Copilot): ارتفع معدل اعتماد الكود بنحو 10% مقارنةً بـ GPT-5.4 Mini وClaude Haiku 4.5؛ واستهلاك الرموز (Token) أقل بنسبة 10%؛ ويمكن تشغيله على وحدات H100 وحتى A100 GPU
استراتيجية «عجلة التحسين» لدى ناديلّا ومنطق توجيه التدفق لاستبدال النماذج الرائدة عبر MAI
كتب ناديلّا على منصة X تحت عنوان «الانتشار المتقدم والتحكم» مبينًا استراتيجية نماذج مايكروسوفت: عندما تتفوق نماذجهم أو تتعادل مع الحلول الرائدة البديلة، فإنهم يوجهون حركة المرور إلى MAI، لتقديم الخدمة على نطاق واسع وبكلفة أقل. وتستند هذه الاستراتيجية إلى منهجية «hill-climbing»: جعل البيانات والنماذج والمنتجات تشكل «نظامًا متكاملًا» يخلق حلقة تحسين مستمرة بدلًا من الاعتماد على تدريب واحد يحدد المصير.
وأضاف أنه حتى في أنظمة التقييم «يجب أن تستمر عملية الصعود للأعلى حتى لو أزلت أي نموذج»، أي الاحتفاظ بالذاكرة والمهارات خارج النموذج ذاته، بما يمنح مايكروسوفت السيطرة الفعلية. وبإجراء تحسينات إضافية لـ MAI-Code-1-Flash في بيئة التعلم المعزز داخل Excel، يمكن تشغيله على وحدات H100 وA100 الأقدم، وتحقيق مستوى يعادل GPT-5.6 في معظم مهام Excel، مع تحرير أحدث عنقود GB200 لاستخدامات التدريب وليس لطلبات الخدمة.
الأسئلة الشائعة
ما هي أسعار MAI-Image-2.5-Pro و MAI-Voice-2-Flash على التوالي؟
يبلغ تسعير MAI-Image-2.5-Pro 5 دولارات لكل مليون رمز إدخال نصي (token) و106 دولارات لكل مليون رمز إخراج صور (token)، وهو متاح بالفعل ضمن معاينة Azure العامة. يكون MAI-Voice-2-Flash أسرع بمرّة من النسخة السابقة وأقل تكلفة بنسبة 32%، وتفاصيل التسعير الدقيقة وفقًا للإعلان الرسمي في Azure.
إلى كم يمكن أن تنخفض تكلفة GPU بحد أقصى بعد انتقال مايكروسوفت إلى نماذج MAI؟
استنادًا إلى البيانات الداخلية التي نشرتها مايكروسوفت، بعد أن انتقل مركز خدمة العملاء إلى MAI-Voice-2-Flash انخفضت تكلفة الحوسبة بنسبة 89%؛ وبعد أن انتقلت PowerPoint إلى نموذج MAI للصورة، انخفضت تكلفة GPU مقارنةً بـ GPT-Image-2 بنسبة 84%؛ وبعد انتقال Dragon Copilot إلى MAI-Transcribe-1.5، انخفضت نسبيًا نسبة أخطاء النسخ والتعرّف على اللغة بنسبة 50%. ومع ذلك، فإن هذه الأرقام كلها ناتجة عن تقييمات مايكروسوفت الداخلية وليست اختبارات مستقلة كمعيار من جهة ثالثة.
كيف يمكن للعملاء من الشركات استخدام منهجية تدريب مايكروسوفت لـ MAI عبر Azure؟
تتيح مايكروسوفت عبر منتجات Foundry وFrontier Tuning في Azure للعملاء من الشركات تدريب نماذج مخصصة باستخدام بياناتهم الخاصة؛ وتؤكد مايكروسوفت أن هذه النماذج تتدرب على «بيانات مؤسسية نظيفة وقابلة للتتبّع»، دون إجراء «تقطير من نماذج طرف ثالث»، بما يرد على قضايا الامتثال المتعلقة بمصدر بيانات التدريب.