هل يفهم الذكاء الاصطناعي اللهجة السعودية والمصرية والخليجية؟ دقة تفريغ الاجتماعات بالأرقام

كم تبلغ نسبة الخطأ عند تفريغ الفصحى واللهجات المصرية والشامية والخليجية والمغاربية؟ أرقام منشورة، ولماذا تختلف عن وعود الشركات، وكيف ترفع دقة نتائجك.

نُشر في ٩ أكتوبر ٢٠٢٦

يقول كثير من مزودي التفريغ إن دقتهم تتجاوز 95% وإن لديهم «دعماً لجميع اللهجات». ثم تجرّب أداة على اجتماع حقيقي فتجد أخطاء كثيرة في الأسماء والأرقام والكلمات الإنجليزية. لماذا؟ هذا المقال يجمع الأرقام المنشورة ويشرح الفجوة.

الأرقام المنشورة حسب اللهجة

تعرض مقارنة VexaScribe (آخر تحقق: 23 أغسطس 2026) تقديرات لنسبة الخطأ في الكلمات (WER) اعتماداً على نموذج Whisper large-v3 وبيانات FLEURS، وهي «أرقام تقريبية تعكس تفاوت جودة الصوت». أي أن نسبة 20% تعني أن واحدة من كل خمس كلمات تقريباً خاطئة:

  • الفصحى (MSA): 15–20% — «صالحة كمسودة بعد التحرير».
  • المصرية: 25–35% — مسودة تقريبية.
  • الشامية: 28–38% — مسودة تقريبية.
  • الخليجية: 30–40% — ضعيفة.
  • المغاربية: 35–50% — «غالباً غير قابلة للاستخدام».

هذا يطابق ما تقوله مصادر أخرى: يصعب على النماذج المدرَّبة على الفصحى فهم المصرية والشامية والخليجية دون ضبط على بيانات اللهجة.

لماذا تختلف الأرقام بين المصادر؟

  • بيانات الاختبار: مقاطع نظيفة بصوت قارئ تختلف جداً عن اجتماع فيه تقاطع وضجيج وتبديل بين العربية والإنجليزية.
  • ضبط النموذج: شركة Sestek، في اختبارها لدقة التعرف على الكلام بالعربية، أفادت بأن ضبط نموذجها على مكالمات خدمة عملاء بالمصرية قلّص الخطأ كثيراً مقارنةً بنماذج عامة. العبرة أن النموذج المخصص للهجتك وقطاعك يتفوق على العام. وهذا اختبار من شركة لها منتج، فاعتبره مؤشراً لا حكماً نهائياً.
  • تعريف «الدقة»: بعض الشركات تقيس على مجموعة اختبار محددة ثم تسوّق الرقم كأنه يشمل كل الأصوات.

الخلاصة العملية: لا تثق برقم، جرّب بصوتك

لا نعلن في SideClue رقم دقة لأي لهجة. نحن ندعم التعرف على الكلام بالعربية، لكن النتيجة تتأثر بمايكروفونك وغرفتك ولهجتك. ولهذا نوصي بتجربة الخطة المجانية على اجتماع حقيقي. وفي مكالمات الاجتماعات، نص تقريبي مع اقتراح مفيد في لحظته قد يكفي، بينما المحضر الرسمي يحتاج مراجعة بشرية دائماً.

ست طرق ترفع بها الدقة اليوم

  1. ميكروفون أقرب أو سماعة رأس بدل مايك اللابتوب.
  2. تحدث بالتناوب: التقاطع أكبر عدو للتفريغ.
  3. حدّد اللغة يدوياً إن عرفت أن الاجتماع بالعربية بدل الكشف التلقائي.
  4. جهّز مصطلحاتك: أسماء العملاء والمنتجات بالإنجليزية والعربية.
  5. قلّل الضجيج: أغلق المروحة والنافذة.
  6. راجع قبل المشاركة: خصوصاً الأرقام والأسماء والتواريخ.

للمقارنة بين الأدوات نفسها راجع أفضل تطبيقات تفريغ الاجتماعات بالعربي.

المصادر

الأسئلة الشائعة

ما دقة التفريغ الآلي للهجة المصرية؟
بحسب تقديرات VexaScribe المبنية على نموذج Whisper large-v3، تتراوح نسبة الخطأ في المصرية بين 25% و35%، أي مسودة تحتاج مراجعة. وقد تتحسن الدقة كثيراً عند ضبط النموذج على بيانات اللهجة، كما أظهر اختبار شركة Sestek على مكالمات خدمة العملاء.
أيّ اللهجات أصعب على الذكاء الاصطناعي؟
في التقديرات المنشورة تأتي المغاربية في الأصعب (35–50% خطأ)، ثم الخليجية (30–40%)، ثم الشامية (28–38%)، والمصرية (25–35%)، والفصحى الأسهل (15–20%).
كيف أرفع دقة تفريغ اجتماعاتي بالعربي؟
استخدم ميكروفوناً قريباً، واطلب من المشاركين عدم التحدث فوق بعضهم، وحدّد لغة الاجتماع مسبقاً بدل الكشف التلقائي، وأضف قائمة بأسماء ومصطلحات شركتك، وراجع النص قبل مشاركته.