معظم من يقرأ درجة دعم اللغة العربية على AI Rank يفترض أنها رقم واحد قابل للمقارنة مباشرة بين أي أداتين. هذا افتراض خاطئ يقود لقرار اشتراك سيّئ: الدرجة نفسها تقيس أشياء مختلفة تماماً حسب نوع الأداة — فهم النص وتوليده، توليد الصوت والنطق، أو مجرد ترجمة واجهة الاستخدام.
الدليل واضح في كتالوج AI Rank نفسه: أدوات دبلجة وتوطين الفيديو تسجّل درجات عربية أعلى بكثير من أدوات توليد الفيديو البصري المحض في نفس الفئة، رغم أن كلتيهما «أدوات فيديو بالذكاء الاصطناعي».
ما الذي تقيسه درجة دعم اللغة العربية فعلياً؟
تقيس مدى نجاح الأداة في مهمتها الأساسية عند تطبيقها على مدخل أو مخرج عربي — لا شيئاً موحّداً عبر كل الأدوات. لأداة كتابة، هذا يعني جودة النص العربي المولَّد. لأداة دبلجة، يعني دقّة النطق والتزامن الصوتي بالعربية. لأداة توليد صور، يعني غالباً مدى فهم الأداة لوصف عربي مكتوب كـprompt، لا جودة أي نص يظهر داخل الصورة نفسها.
هذا يعني أن مقارنة درجة 8.5 لأداة دبلجة بدرجة 8.5 لأداة كتابة نصوص هي مقارنة بين مقياسين مختلفين يحملان نفس الرقم صدفة، لا حكماً على أيّهما «أفضل بالعربية» بمعنى واحد ثابت.
لماذا تتفوّق أدوات الدبلجة على أدوات الفيديو البصري في نفس الفئة؟
في فئة الفيديو على AI Rank، Rask AI وCamb.ai يسجّلان 8.6 في دعم العربية، وHeyGen 8.5 — الثلاثة أدوات دبلجة وتوليد فيديو بصوت مصاحب. بالمقابل، أدوات توليد فيديو من نص إلى مشهد بصري محض مثل Sora تسجّل 6.5 فقط، وKling AI تسجّل 6.0.
السبب بنيوي لا عرضي: أدوات الدبلجة بُنيت أصلاً حول نماذج تحويل نص لصوت (TTS) متعددة اللغات، وهذه التقنية تطوّرت بالعربية بشكل ملحوظ في السنوات الأخيرة. أما توليد الفيديو من نص لمشهد بصري فيعتمد على فهم الأداة لوصف المشهد لا على أي معالجة صوتية، وهذا الفهم للعربية تحديداً أقل نضجاً من نظيره الإنجليزي في معظم النماذج الحالية.
قاعدة قرار عملية: إن كان هدفك توطين فيديو أجنبي بصوت عربي، درجة دعم العربية هنا مؤشر موثوق فعلاً. إن كان هدفك توليد مشهد بصري جديد من وصف عربي، اختبر الأداة على وصف حقيقي من مشروعك قبل الشراء — الدرجة وحدها قد لا تعكس تجربتك.
هل ينطبق النمط نفسه على أدوات البرمجة؟
بشكل مختلف لكنه له تفسير مشابه. Claude Code يسجّل 8.0 في دعم العربية رغم أن مهمته الأساسية توليد كود، ليس نصاً عربياً. هذا لأن الدرجة هنا تقيس شيئاً ثالثاً: قدرة الأداة على فهم تعليمات أو تعليقات مكتوبة بالعربية داخل المهمة البرمجية نفسها — لا جودة الكود، ولا أي معيار لغوي بالمعنى المعتاد.
GitHub Copilot وCursor يسجّلان 7.5 لكل منهما — فارق صغير مقارنة بفارق أدوات الفيديو أعلاه، لأن قدرة فهم تعليمات عربية أقل تبايناً بين نماذج البرمجة الكبرى من قدرة توليد فيديو بصري من وصف عربي.
لماذا تسجّل Canva درجة أعلى من Midjourney رغم أن كلتيهما أداتا صورة؟
Canva يسجّل 8.5 في دعم العربية، بينما Midjourney يسجّل 6.5 — فارق يتكرّر نفس منطقه هنا أيضاً. Canva أداة تصميم تحتوي واجهة مترجمة بالكامل، وقوالب جاهزة، وكتابة نص عربي داخل التصميم نفسه بخطوط مضبوطة. Midjourney توليد صور خالص من prompt نصّي، بلا واجهة تصميم ولا كتابة نص داخل الصورة كميزة أساسية.
الخطأ الشائع هنا: افتراض أن Midjourney «ضعيف بالعربية» بمعنى عام. الأدق أنه لا يقيس نفس الشيء الذي تقيسه Canva — فهمه لوصف المشهد بالعربية شيء، وقدرة Canva على واجهة وقوالب عربية جاهزة شيء آخر تماماً.
هل يتكرّر النمط نفسه في أدوات الصوت والموسيقى؟
بدقّة. أدوات تفريغ الصوت لنص مثل AssemblyAI تسجّل 8.3 في دعم العربية، وDeepgram 8.2 — كلتاهما تعالجان كلاماً منطوقاً فعلياً، فدرجتهما تعكس دقّة فهم العربية المنطوقة مباشرة. في المقابل، Suno لتوليد الموسيقى يسجّل 6.5 فقط، لنفس سبب توليد الفيديو البصري: تأليف لحن موسيقي لا يتطلّب فهماً لغوياً عربياً بنفس القدر الذي يتطلّبه تفريغ كلام منطوق أو دبلجته.
سيناريو محدد يوضّح خطورة الخلط: وكالة تسويق تقارن أداة دبلجة بدرجة 8.6 مع أداة توليد موسيقى بدرجة 6.5، وتفترض أن الأولى «أفضل بالعربية» عموماً فتفضّلها حتى لمهمة تأليف موسيقى خلفية لا علاقة لها بالكلام المنطوق — قرار مبني على مقارنة رقمين لا يقيسان نفس الشيء.
كيف تقرأ درجة دعم العربية قبل الاشتراك بأي أداة؟
اسأل أولاً: ما المهمة الفعلية التي أحتاج العربية فيها من هذه الأداة تحديداً؟ ثم اربط السؤال بنوع الأداة:
- أداة كتابة أو محادثة: الدرجة تعكس جودة الفهم والتوليد النصّي مباشرة — مؤشر قوي وموثوق نسبياً.
- أداة دبلجة أو تحويل نص لصوت: الدرجة تعكس دقّة النطق والتزامن — مؤشر قوي أيضاً لأن هذا صلب عمل الأداة.
- أداة توليد صورة أو فيديو بصري: الدرجة تعكس فهم الوصف النصّي بالعربية فقط، لا جودة أي نص داخل الناتج — اختبر بنفسك قبل الاعتماد الكامل عليها.
- أداة برمجة: الدرجة تعكس فهم تعليمات عربية داخل المهمة، لا علاقة لها بجودة الكود الناتج نفسه.
راجع منهجية AI Rank الكاملة في التقييم لمعرفة كيف يُحسب كل معيار من المعايير الستة بالتفصيل قبل أن تعتمد على درجة واحدة بمعزل عن سياقها.
ما الخطأ الأكثر شيوعاً عند مقارنة درجتين من فئتين مختلفتين؟
افتراض أن أعلى درجة يعني أداة «أفضل بالعربية بشكل عام» قابلة للترتيب على مقياس واحد شامل. درجة 8.6 لأداة دبلجة و6.5 لأداة توليد فيديو بصري لا تعني أن الأولى «أفضل بالعربية» من الثانية بمعنى مطلق — تعنيان أن كل أداة تؤدّي جزءاً مختلفاً من العمل بمستوى نجاح مختلف في التعامل مع العربية.
القرار الصحيح عملياً: قارن الدرجات فقط بين أدوات تؤدّي نفس المهمة بالضبط — أداتي دبلجة ببعضهما، أو أداتي توليد فيديو بصري ببعضهما — لا عبر أنواع أدوات مختلفة داخل الفئة نفسها. صفحة الفئة الكاملة على AI Rank تتيح تصفية الأدوات ومقارنتها ضمن نفس النوع الفعلي، لا الفئة العامة وحدها.
