أبحاث

M3، مقاسًا على اجتماعات حقيقية.

سجّل نظام تفريغ الاجتماعات العربية داخل MeetriX معدل خطأ على مستوى الأحرف قدره 1.62% على اجتماعات عمل عربية حقيقية متعددة اللهجات لها نصوص مرجعية تحقق منها بشر، وهو الأدنى بين الأنظمة السبعة المقارنة. إليك ما يعنيه ذلك لسجل اجتماعاتك، وكل ما قسناه لنقوله.

أبحاث

  • تاريخ النشر
  • الإصدارإصدار التقييم، سبتمبر 2026
  • إعدادLisan Research
1.62%معدل الخطأ على مستوى الأحرفمُقاس على الاجتماعات نفسها المتحقق منها بشريًا التي خضع لها كل نظام مقارن
28% إلى 83%معدل خطأ أدنى من كل نظام مقارنمُقاس، تقريبي، مقابل ست واجهات برمجية للتعرف على الكلام
نحو 45 ثانيةلتفريغ ساعة من الصوتبحسب تقرير الفريق، نحو 80 ضعف الزمن الحقيقي على معالج L4، معالجة دفعية لا مباشرة
7أنظمة قُيّمت على الصوت والمرجع والقواعد نفسهاM3 وست واجهات برمجية تجارية للتعرف على الكلام

ماذا تعني نسبة 1.62% لسجل الاجتماع؟

يكسب سجل الاجتماع الثقة تفصيلًا بعد تفصيل: الرقم في بند الميزانية، والاختصار في التحديث التقني، واسم المورّد، والجواب المكوّن من كلمة واحدة الذي حسم قرارًا. وقد رصد التقييم الذي تستند إليه هذه الصفحة تلك التفاصيل تحديدًا. فقد أحصى كل حرف أخطأ فيه نظام التفريغ أو أسقطه أو اختلقه مقارنة بما تحقق البشر من أنه قيل، عبر اجتماعات عمل حقيقية بعدة لهجات عربية مع مصطلحات إنجليزية داخل العربية. مُقاس. سجّل M3 نسبة 1.62%، أي نحو 16 حرفًا خاطئًا في كل 1,000 حرف. وسجّل أقرب نظام، Google chirp_3، نسبة 2.26%.

وبالنسبة إلى لجنة حكومية أو مجلس إدارة أو فريق مشروع، فإن القراءة العملية تكمن في الأمثلة أدناه: أي الأنظمة احتفظت بـ200 ملف وبالدرجتين 98 و94، وأيها احتفظت بمصطلحي Sprint Planning وVAT بصيغة سيجدها مربع البحث لاحقًا، وأيها كتبت SDK كما هي وأيها كتبتها بحروف عربية، وأيها لم تُنتج شيئًا لتحية تقل مدتها عن ثانية. تلك هي الإخفاقات التي تعيد مدوّن المحضر إلى التسجيل الصوتي، وقد بُني التقييم لرصدها.

يسجّل M3 أدنى معدل خطأ على مستوى الأحرف بين سبعة أنظمة على الاجتماعات نفسها المتحقق منها بشريًا

الأقل أفضل. معدل الخطأ على مستوى الأحرف (CER) بعد التطبيع المعجمي المحدد.

المصدر الصوتي نفسه، والنص المرجعي نفسه، وقواعد التقييم نفسها لكل نظام. تلقى كل نظام الصوت نفسه المفصول بحسب المشارك، فلا تدخل نسبة الكلام إلى المتحدثين في المقارنة. بيانات التقييم بتاريخ سبتمبر 2026. انظر فقرة «كيف جرى القياس» لقواعد التقييم.

سبعة أنظمة، ومجموعة تقييم واحدة، وقواعد واحدة. يأتي M3 عند 1.62%، يليه Google chirp_3 عند 2.26%، ثم Cohere عند 4.93%، وElevenLabs Scribe عند 5.01%، وDeepgram Nova-3 عند 6.09%، وGoogle latest_long عند 9.01%، وSonix عند 9.8%. ويضيف الجدول الدقة على مستوى الأحرف (100 ناقص معدل الخطأ) والانخفاض النسبي التقريبي لـM3 مقابل كل نظام، من نحو 28% مقابل chirp_3 إلى نحو 83% مقابل Sonix. اقرأ عمود الانخفاض بوصفه الفارق على مجموعة التقييم هذه، لا ترتيبًا للمزودين حسب الجودة.

معدل الخطأ على مستوى الأحرف والدقة على مستوى الأحرف للأنظمة السبعة، مع الانخفاض النسبي التقريبي لـ M3 مقابل كل نظام. معدل الخطأ الأقل أفضل. مُقاس على الاجتماعات نفسها المتحقق منها بشريًا؛ قواعد التقييم في فقرة كيف جرى القياس. الأفضل في العمود
الترتيبالنظاممعدل الخطأ على مستوى الأحرف (%)، الأقل أفضلالدقة على مستوى الأحرف (%)M3 مقابل هذا النظام
1M31.62 (الأفضل في العمود)98.38 (الأفضل في العمود)الأساس
2Google chirp_32.2697.74أقل بنحو 28%
3Cohere4.9395.07أقل بنحو 67%
4ElevenLabs Scribe5.0194.99أقل بنحو 68%
5Deepgram Nova-36.0993.91أقل بنحو 73%
6Google latest_long9.0190.99أقل بنحو 82%
7Sonix9.890.2أقل بنحو 83% (الأفضل في العمود)

أين يُخفق السجل، مقطعًا مقطعًا

تعرض البطاقات النص المرجعي المتحقق منه بشريًا ومخرجات كل نظام لمقاطع مفردة، منقولة حرفيًا من التقييم. أسماء المتحدثين تسميات افتراضية بديلة عن الأسماء الحقيقية. وتحمل كل بطاقة المقطع الصوتي المصدر: مقتطف من اجتماع داخلي في Lisan، وهو الصوت نفسه الذي فرّغته كل الأنظمة. واختيرت كل بطاقة لأن القارئ الذي لا يعرف العربية يستطيع رؤية الإخفاق فيها: خلية فارغة، أو رقم مفقود، أو مصطلح لاتيني بقي أو ضاع، أو انتقال إلى كتابة أخرى. وحيثما أخطأ M3 نفسه، يقول التعليق ذلك. وبموجب قواعد التقييم لا يُعد الرسم الصوتي للمصطلح الإنجليزي خطأ، فبعض الفروق تؤثر في القابلية للقراءة والبحث لا في معدل الخطأ.

مثال 1المصطلحات الإنجليزية
  • المتحدث Kareem Saleh
  • المقطع 38faf0f4_6
  • مدة المقطع 42.66 ث

SDK وrendering وeditor وChrome extension

المقطع الصوتيمقتطف من اجتماع داخلي في Lisan، وهو الصوت نفسه الذي فرّغته كل الأنظمة.
  • مصطلح محفوظ
  • نص غير مدعوم
  • إدراج حشو
  • لا نص
M3

صباح الخير بالنسبة لي امبارح كان معظم الشغل مع تيم العربي الجديد بخصوص الـ SDK (مصطلح محفوظ) اتسكر تقريبا مشكلتين و إلهن علاقة بالـ rendering (مصطلح محفوظ) الـ highlights (مصطلح محفوظ) بالإديتور اللي معمل له الـ Configuration (مصطلح محفوظ) من عندن بصفى مشكلة وحدة طلبنا منهم اجتماع مشان نكمل معهم اليوم ان شاء الله، كمان امبارح صرت اشتغل على موضوع الـ Chrome extension (مصطلح محفوظ) بين كوركتو و Lisan (مصطلح محفوظ) ما كثير يعني خلصت هذا الموضوع، اليوم ان شاء الله بدي كمل مثل ما قلت بخصوص العربي الجديد وكمان الـ Chrome extension مع كوركتو، يعطيكم العافية.

المرجع

صباح الخير، بالنسبة لي امبارح كان معظم الشغل مع تيم العربي الجديد بخصوص الـ SDK اتسكر تقريبا مشكلتين ولهم علاقة بالـ rendering للـ highlights بالـ editor اللي معمل له configuration من عندن بصفى مشكلة وحدة طلبنا منن اجتماع مشان نكمل معن اليوم ان شاء الله كمان امبارح صرت اشتغل على موضوع الـ Chrome extension بين كوركتا و Lisan ما كتير خلصت هذا الموضوع اليوم إن شاء الله بدي كمل متل ما قلت بخصوص العربي الجديد وكمان الـ (Chrome extension) مع العربي الجديد

لماذا يهم هذا المثال اجتماع متابعة يومي مليء بمفردات المطورين. يحتفظ M3 بمصطلحات SDK وrendering وhighlights وconfiguration وChrome extension وLisan بالحروف اللاتينية، وهي الصيغة التي سيجدها البحث في أرشيفك. ويحتفظ بها ElevenLabs Scribe أيضًا مع حشو كثيف. وchirp_3 كامل لكنه يكتبها صوتيًا، وهو ما تقبله قواعد التقييم.

  • محفوظ: SDK, rendering, highlights, Configuration, Chrome extension, Lisan
  • ElevenLabs Scribe: نص غير مدعوم
  • Deepgram Nova-3: محتوى ساقط
  • Google latest_long: محتوى ساقط
  • Sonix: محتوى ساقط
  • Cohere: محتوى ساقط
مثال 2الحشو والترقيم
  • المتحدث Rami Haddad
  • المقطع a3ef0ea8_735
  • مدة المقطع 20.81 ث

Sprint Planning وVAT

المقطع الصوتيمقتطف من اجتماع داخلي في Lisan، وهو الصوت نفسه الذي فرّغته كل الأنظمة.
  • مصطلح محفوظ
  • نص غير مدعوم
  • إدراج حشو
  • لا نص
M3

صباح الخير يعطيكم العافية. آآآه (إدراج حشو) امبارح كان في عندنا متابعة باجتماعات الـ Sprint Planning (مصطلح محفوظ) آآه (إدراج حشو) كان في كمان متابعة مع آآه (إدراج حشو) الشي المطلوب من هيئة الزكاة والضرائب بالسعودية آآه (إدراج حشو) موضوع الـ آآه (إدراج حشو) الـ VAT (مصطلح محفوظ) ضريبة القيمة المضافة. كنت عم بتابع بهدول المواضيع يعطيكم العافية.

المرجع

صباح الخير يعطيكم العافية امبارح كان في عنا متابعة باجتماعات السبرنت بلاننج كان في كمان متابعة مع الشي المطلوب من هيئة الزكاة والضرائب بالسعودية موضوع ال الزاد ضريبة القيمة المضافة كان كنت عم بتابع بهدول المواضيع يعطيكم العافية

لماذا يهم هذا المثال تحديث حالة يكثر فيه تردد المتحدث. يحتفظ M3 بمصطلحي Sprint Planning وVAT بالحروف اللاتينية مع الشرح العربي لـ VAT، بينما يطبع Cohere خمس علامات تردد، وتشوّه أنظمة عدة مصطلح VAT أو تحذفه. ملاحظة صريحة: يكتب M3 هنا أصوات تردد المتحدث بينما لا يحتوي النص المرجعي عليها، فلا يصلح هذا المقطع للقول إن M3 يزيل الحشو.

  • محفوظ: Sprint Planning, VAT
  • Cohere: نص غير مدعوم
  • ElevenLabs Scribe: نص غير مدعوم
  • Deepgram Nova-3: نص غير مدعوم
  • Google latest_long: نص غير مدعوم
  • Sonix: محتوى ساقط
  • Google latest_long: محتوى ساقط
مثال 3كلام قصير
  • المتحدث Omar Khalil
  • المقطع ce9f3a3a_10
  • مدة المقطع 0.71 ث

تحية منطوقة تقل مدتها عن ثانية

المقطع الصوتيمقتطف من اجتماع داخلي في Lisan، وهو الصوت نفسه الذي فرّغته كل الأنظمة.
  • مصطلح محفوظ
  • نص غير مدعوم
  • إدراج حشو
  • لا نص
M3

كيفكم؟

المرجع

كيفكم؟

لماذا يهم هذا المثال تحية تقل مدتها عن ثانية. تطابق مخرجات M3 وCohere وSonix وchirp_3 النص المرجعي تمامًا. لم يُنتج Deepgram Nova-3 وGoogle latest_long شيئًا، وهو ما يُحتسب حذفًا، وأنتج ElevenLabs Scribe كلمة إنجليزية لم تُقل.

  • ElevenLabs Scribe: نص غير مدعوم
  • Deepgram Nova-3: محتوى ساقط
  • Google latest_long: محتوى ساقط
مثال 4الأرقام والمصطلحات
  • المتحدث Tareq Faris
  • المقطع 38faf0f4_8
  • مدة المقطع 39.23 ث

الملفات وأرقام الجودة والعمل على النماذج

المقطع الصوتيمقتطف من اجتماع داخلي في Lisan، وهو الصوت نفسه الذي فرّغته كل الأنظمة.
  • مصطلح محفوظ
  • نص غير مدعوم
  • إدراج حشو
  • لا نص
M3

مساء الخير (غير مدعوم بالصوت) امبارح خلصت الملفات كلهم طلعوا جوا الـ تبع الـ translated (مصطلح محفوظ) اكسل هلأ هنن حوالي 200 (مصطلح محفوظ) file (مصطلح محفوظ) الدقة طلعت يعني بالـ style (مصطلح محفوظ) حوالي الـ 98 (مصطلح محفوظ) يعني بالـ translation (مصطلح محفوظ) كجودة عم بـ 94 (مصطلح محفوظ) هلأ هدا بعد طبعا عدة تعديلات هلأ اليوم بدي ارفع هلأ هي الـ version (مصطلح محفوظ) وكان في كمان شغل على الـ NBOE (مصطلح محفوظ) يعني حاولنا نعمل صاين تيونينغ هلأ اليوم كمان حتابع

المرجع

صباح الخير امبارح خلصت الملفات كلهم تبع لينا تبع TranslateX حوالي 200 file الدقه طلعت يعني بالـ style حوالي 98 يعني بالـ translation كجوده بال 94 هلا هذا بعد طبعا عده تعديلات هلا اليوم بدي ارفع هلا هي الـ version وكان في كمان شغل على MOE حاولنا نعمل fine-tunning، وسأتابع اليوم كمان

لماذا يهم هذا المثال ثلاثة أرقام منطوقة: 200 ملف، ودرجة 98 للأسلوب، ودرجة 94 لجودة الترجمة. يحتفظ M3 وCohere وchirp_3 بالأرقام الثلاثة. وفي مخرجات أخرى صار 94 هو 40، وصار 98 ثمانية، وحُذف 200، أو صار 98 هو 80 90. ومخرجات M3 هنا ليست خالية من الأخطاء: فهو يفتتح بتحية خاطئة ويخطئ في تهجئة مصطلحين إنجليزيين. وقد استُبدل الاسم الأول المنطوق باسم مستعار في النصوص المفرّغة.

  • محفوظ: translated, file, style, translation, version, NBOE, 200, 98, 94
  • Cohere: نص غير مدعوم
  • ElevenLabs Scribe: نص غير مدعوم
  • Deepgram Nova-3: نص غير مدعوم
  • Sonix: محتوى ساقط
  • Google latest_long: محتوى ساقط
  • Google chirp_3: محتوى ساقط
مثال 5المصطلحات الإنجليزية
  • المتحدث Kareem Saleh
  • المقطع d974dd6c_4
  • مدة المقطع 23.99 ث

SDK وdark theme وweb app وmonitoring

المقطع الصوتيمقتطف من اجتماع داخلي في Lisan، وهو الصوت نفسه الذي فرّغته كل الأنظمة.
  • مصطلح محفوظ
  • نص غير مدعوم
  • إدراج حشو
  • لا نص
M3

صباح الخير بالنسبة ليوم الخميس الشغل كان مع فضاءات كان في عندهم مشاكل العلاقة بالـ SDK (مصطلح محفوظ) والسججشنز اللي عم تطلع انحل اغلب الاخطاء صفيان وحدة بدنا نعمل كول عليها اليوم ان شاء الله كمان بدي اشتغل بنسخة الـ dark theme (مصطلح محفوظ) بالـ web app (مصطلح محفوظ) وكمان بدي اعمل مونتورنج للنسخة الجديدة تبع الاي اي ايجنتس يعطيكم العافية

المرجع

صباح الخير، بالنسبة ليوم الخميس الشغل كان مع فضاءات، كان في عندهم مشاكل العلاقة بالـ SDK والـ suggestions اللي عم تطلع، انحل اغلب الاخطاء، صفيان وحدة بدنا نعمل كول عليها اليوم إن شاء الله، كمان بدي اشتغل بالـ بنسخة الـ dark theme بالـ web app، وكمان بدي أعمل monitoring للنسخة الجديدة تبع الـ AI agents، يعطيكم العافية.

لماذا يهم هذا المثال مصطلحات منتج متتالية. يحتفظ M3 بمصطلحات SDK وdark theme وweb app بالحروف اللاتينية، ويكتب suggestions وmonitoring وAI agents صوتيًا، وهو ما تعده قواعد التقييم صحيحًا. ويحتفظ ElevenLabs Scribe بكل المصطلحات لاتينيًا. ويُسقط Sonix معظمها، ويشوّه Google latest_long معظم ما تبقى.

  • محفوظ: SDK, dark theme, web app
  • ElevenLabs Scribe: نص غير مدعوم
  • Sonix: محتوى ساقط
  • Google latest_long: محتوى ساقط
  • Deepgram Nova-3: محتوى ساقط
  • Google chirp_3: محتوى ساقط

كيف تصرّف كل نظام

نوعي. إلى جانب معدل الخطأ، دوّن المراجعون كيف تعامل كل نظام مع المصطلحات الإنجليزية داخل العربية، والمحتوى في بداية المقاطع، وأصوات الحشو ووسوم الأحداث، والترقيم والتكرار. لم تُحسب معدلات إجمالية منفصلة، وتعرض المصفوفة عبارة المراجعين في كل خلية حتى يمكن التحقق من مستويات قوي ومختلط وضعيف وغير مقيَّم مقارنة بالصياغة.

يستحق Google chirp_3 التقدير الذي تمنحه إياه المراجعة: تعامل قوي مع المصطلحات التقنية الإنجليزية داخل الكلام العربي، وفقدان منخفض للمحتوى، ومخرجات فارغة أقل بكثير من إعداد الإصدار الأول. وفي عدد من المقاطع النموذجية لا يقل اكتمالًا عن M3، ويقتصر الفرق على الكتابة الصوتية بدل الحروف اللاتينية. وحافظ ElevenLabs Scribe على المصطلحات الإنجليزية جيدًا على نحو خاص لكنه أنتج أصوات حشو زائفة متكررة وانتقالًا واحدًا إلى لغة أو كتابة غير متوقعة. وكان Cohere دقيقًا جدًا في العربية الفصحى، بينما رصدت المراجعة حذفًا في المحتوى ومصطلحات غير متسقة وترقيمًا مكررًا وحلقات تكرار. وأظهر Deepgram Nova-3 أخطاء في أسماء المشاركين وحذفًا في بداية المقاطع. وأصاب Google latest_long في رفض كثير من المقاطع الخالية من الكلام لكنه أغفل عددًا قليلًا من المقاطع التي تحتوي على كلام وحذف المصطلحات الإنجليزية كثيرًا. وأظهر Sonix أخطاء في الأسماء والمصطلحات الإنجليزية وحذفًا في بداية المقاطع وإفراطًا في علامات نهاية الجمل. ودعمت الأنظمة السبعة كلها اللهجات العربية الموجودة في الاجتماعات المقيَّمة.

سجّل M3 أدنى معدل خطأ على مستوى الأحرف، وبحسب ملاحظات المراجعين حافظ على المحتوى المهم للأعمال والأرقام والمصطلحات بموثوقية أكبر، ولم يُظهر الكثافة نفسها من آثار الحشو والوسوم والترقيم المكرر. ولم يُقيَّم تمييز المتحدثين لدى الأنظمة الخارجية؛ فقد تلقى كل منها صوتًا مفصولًا بحسب المشارك أعدّه مسار الالتقاط في M3، وقُيّم على التفريغ وحده.

تسعة معايير، وسبعة أنظمة، وعبارة واحدة في كل خلية. يُميَّز عمود M3 بخط العلامة التجارية فقط، ولا تُستخدم ألوان الحالة للتمييز. ويكرر الصف الأخير معدل الخطأ المُقاس للمرجعية.

قويمختلطضعيفغير مقيَّم
سلوك المخرجات الملاحظ بحسب المعيار والنظام، من ملاحظات المراجعين على مجموعة التقييم. تتبع المستويات قاعدة واحدة مستمدة من صياغة التقرير: قوي حيث يذكر المراجعون نتيجة إيجابية، وضعيف حيث يذكرون عيبًا، ومختلط حيث تكون الملاحظة مقيدة أو تقول إن المعيار لم يُقيَّم على حدة أو لم تُعزل مشكلة متكررة، وغير مقيَّم حيث لم يُقيَّم المعيار أصلًا. والعبارة معروضة في كل خلية. لم تُحسب معدلات إجمالية منفصلة.
M3CohereElevenLabs ScribeDeepgram Nova-3Google latest_longGoogle chirp_3Sonix
العربية الفصحىقويدقيق جدًا.قويدقيق جدًا.قويدقيق.قويدقيق.ضعيفأخطاء كثيرة.قويدقيق.قويدقيق.
الإنجليزية داخل العربيةقويحافظ على المصطلحات التقنية والتجارية الإنجليزية باتساق أكبر داخل الكلام العربي.ضعيفحُذفت المصطلحات التقنية والتجارية الإنجليزية أحيانًا أو نُقلت خطأ أو على نحو غير متسق داخل الكلام العربي.قويحُفظت المصطلحات التقنية الإنجليزية جيدًا على نحو خاص في المخرجات المراجعة.مختلطلم يُقيَّم أداء المصطلحات الإنجليزية على حدة؛ أظهرت الأمثلة المراجعة نقلًا غير متسق إلى جانب حذف في بداية المقاطع.ضعيفحُذفت المصطلحات التقنية الإنجليزية كثيرًا.قويحُفظت المصطلحات التقنية الإنجليزية بقوة داخل الكلام العربي.ضعيفنُقلت الأسماء والمصطلحات التقنية الإنجليزية خطأ أو حُذفت كثيرًا.
حذف النصقوييحافظ على المحتوى المهم للأعمال بموثوقية أكبر ويقلل فقدان الأرقام والمصطلحات وأسماء المؤسسات أو المنتجات المهمة.ضعيفقد يحذف المحتوى المهم للأعمال أو يشوّهه، بما في ذلك الأرقام والمصطلحات التقنية وأسماء المؤسسات أو المنتجات.مختلطلم يُحسب معدل حذف منفصل؛ كانت المشكلة النوعية الرئيسية إدراج محتوى شبيه بالحشو لا نمط حذف متكرر في بداية المقاطع.ضعيفلوحظ فقدان كبير للمحتوى، خصوصًا في بداية المقاطع المصدرية.مختلطأصاب في رفض كثير من المقاطع الخالية من الكلام، لكنه أغفل عددًا قليلًا من المقاطع التي تحتوي على كلام وحذف أحيانًا مصطلحات إنجليزية أو أرقامًا.قويلوحظ فقدان منخفض للمحتوى، مع مخرجات فارغة أقل بكثير من إعداد الإصدار الأول.ضعيفلوحظ فقدان للمحتوى خصوصًا في بداية المقاطع المصدرية.
علامات الترقيمقويأنتج حدود جمل أوضح من دون الكثافة نفسها من آثار الترقيم المكرر.ضعيفلوحظت أنماط ترقيم مكررة تقلل القابلية للقراءة في المخرجات المراجعة.مختلطلم يُقيَّم على حدة؛ تأثرت القابلية للقراءة بالإدراجات الشبيهة بالحشو أكثر من أي عيب ترقيم متكرر.مختلطلم يُقيَّم على حدة؛ لم يُعزل أي عيب ترقيم متكرر في المراجعة النوعية.مختلطلم يُقيَّم على حدة؛ لم يُعزل أي عيب ترقيم متكرر في المراجعة النوعية.مختلطلم يُقيَّم على حدة؛ لم يُبرَز أي عيب ترقيم متكرر في المراجعة النوعية.ضعيفكانت جودة الترقيم ضعيفة، مع إفراط في علامات نهاية الجمل في المخرجات المراجعة.
التهجئة والمصطلحاتقويينتج مصطلحات أعمال أكثر اتساقًا للقراءة والبحث.ضعيفقد تظهر المصطلحات التقنية والتجارية على نحو غير متسق أو بصيغة صوتية.مختلطعولجت المصطلحات التقنية الإنجليزية جيدًا، لكن الإدراجات الشبيهة بالحشو قللت نظافة النص عمومًا.ضعيفنُقلت أسماء المشاركين خطأ كثيرًا.ضعيفأُغفلت المصطلحات التقنية الإنجليزية كثيرًا، وحُذفت بعض الأرقام.قوينُقلت المصطلحات التقنية الإنجليزية بموثوقية داخل الكلام العربي.ضعيفكان الأداء ضعيفًا في أسماء المشاركين والمصطلحات التقنية الإنجليزية.
تكرار الكلماتقويأظهر مشكلات تكرار أقل بكثير في المخرجات المراجعة.ضعيفلوحظت حلقات تكرار للرموز والعبارات في المخرجات المراجعة.مختلطلم يُحسب معدل تكرار منفصل؛ كانت أصوات الحشو الزائفة المتكررة مشكلة الإدراج الأبرز.مختلطلم تُعزل أي مشكلة تكرار متكررة في المراجعة النوعية.مختلطلم تُعزل أي مشكلة تكرار متكررة في المراجعة النوعية.مختلطلم تُعزل أي مشكلة تكرار متكررة في المراجعة النوعية.مختلطلم تُعزل أي مشكلة تكرار كلمات متكررة؛ كان الترقيم مشكلة القابلية للقراءة الأبرز.
اللهجاتقويدعمت الأنظمة كلها اللهجات العربية الموجودة في الاجتماعات المقيَّمة.قويدعمت الأنظمة كلها اللهجات العربية الموجودة في الاجتماعات المقيَّمة.قويدعمت الأنظمة كلها اللهجات العربية الموجودة في الاجتماعات المقيَّمة.قويدعمت الأنظمة كلها اللهجات العربية الموجودة في الاجتماعات المقيَّمة.قويدعمت الأنظمة كلها اللهجات العربية الموجودة في الاجتماعات المقيَّمة.قويدعمت الأنظمة كلها اللهجات العربية الموجودة في الاجتماعات المقيَّمة.قويدعمت الأنظمة كلها اللهجات العربية الموجودة في الاجتماعات المقيَّمة.
تمييز المتحدثينقوييستخدم قنوات صوت مرتبطة بالمشاركين ومعلومات المشاركين من المنصة. بقيت نسبة الكلام إلى المتحدثين المقدمة من المنصة مرتبطة طوال الاجتماعات المقيَّمة.غير مقيَّملم يُقيَّم لدى الأنظمة الخارجية. تلقى كل نظام مقاطع الصوت نفسها المفصولة بحسب المشارك والمُعدّة بواسطة مسار الالتقاط في M3، وقُيّم على التفريغ وحده.غير مقيَّملم يُقيَّم لدى الأنظمة الخارجية. تلقى كل نظام مقاطع الصوت نفسها المفصولة بحسب المشارك والمُعدّة بواسطة مسار الالتقاط في M3، وقُيّم على التفريغ وحده.غير مقيَّملم يُقيَّم لدى الأنظمة الخارجية. تلقى كل نظام مقاطع الصوت نفسها المفصولة بحسب المشارك والمُعدّة بواسطة مسار الالتقاط في M3، وقُيّم على التفريغ وحده.غير مقيَّملم يُقيَّم لدى الأنظمة الخارجية. تلقى كل نظام مقاطع الصوت نفسها المفصولة بحسب المشارك والمُعدّة بواسطة مسار الالتقاط في M3، وقُيّم على التفريغ وحده.غير مقيَّملم يُقيَّم لدى الأنظمة الخارجية. تلقى كل نظام مقاطع الصوت نفسها المفصولة بحسب المشارك والمُعدّة بواسطة مسار الالتقاط في M3، وقُيّم على التفريغ وحده.غير مقيَّملم يُقيَّم لدى الأنظمة الخارجية. تلقى كل نظام مقاطع الصوت نفسها المفصولة بحسب المشارك والمُعدّة بواسطة مسار الالتقاط في M3، وقُيّم على التفريغ وحده.
أصوات الحشو ووسوم الأحداثقويلم يُظهر الكثافة نفسها من آثار الحشو أو الوسوم أو الترقيم المكرر في المراجعة.ضعيفلوحظت إدراجات شبيهة بالحشو ووسوم على نمط الأحداث وآثار ترقيم مكرر في المخرجات المراجعة.ضعيفلوحظت أصوات حشو زائفة متكررة مثل «آآآ»، وانتقل مقطع واحد إلى لغة أو كتابة غير متوقعة.مختلطلم يُعزل أي نمط متكرر لكلمات حشو أو وسوم أحداث في المراجعة النوعية.مختلطعالج كثيرًا من المقاطع الخالية من الكلام على نحو صحيح، لكنه رفض أيضًا عددًا قليلًا من المقاطع التي تحتوي على كلام.مختلطلم يُبرَز أي نمط متكرر لكلمات حشو أو وسوم أحداث في المراجعة النوعية.مختلطلم يُعزل أي نمط متكرر لوسوم الأحداث؛ كان الإفراط في الترقيم الأثر الأبرز.
معدل الخطأ على مستوى الأحرف، الأقل أفضل1.62%4.93%5.01%6.09%9.01%2.26%9.8%

السرعة، وما يغطيه الرقم

بحسب تقرير الفريق. يعالج مسار تفريغ الاجتماعات في M3 اجتماعًا مدته ساعة في نحو 45 ثانية على معالج رسومي L4، أي نحو 80 ضعف الزمن الحقيقي. وهذه معالجة دفعية لصوت مسجل، مقيسة على أساس مدة الاجتماع. وليست زمن استجابة مباشرًا: يدعم MeetriX أيضًا المعالجة المباشرة أثناء انعقاد الاجتماع، لكن التسليم المباشر يُقاس على حدة ولا يُنشر هنا رقم لزمن الاستجابة المباشر. والمعنى العملي لمسار إعداد المحاضر أن الرقم يصف مرحلة التفريغ وحدها: الزمن الذي يستغرقه M3 لمعالجة ساعة من الصوت المسجل بعد توفره، لا الزمن حتى تسليم النص، الذي يعتمد على بقية المسار؛ ويُحافَظ على هوية المتحدث والطوابع الزمنية وترتيب النص أثناء المعالجة (قدرة في المنتج).

ساعة من صوت الاجتماع في نحو 45 ثانية

نحو 80 ضعف الزمن الحقيقي، بحسب تقرير الفريق، على معالج رسومي L4.

معالجة دفعية بحسب تقرير الفريق لمسار تفريغ الاجتماعات في M3 على معالج رسومي L4. يصف معالجة صوت مسجل، لا زمن استجابة الكلام المباشر.

داخل MeetriX

قدرة في المنتج. يقيّم المعيار التفريغ وحده. وداخل MeetriX، يعمل M3 ضمن مسار أطول: يُلتقط الصوت مع هوية المشارك مرفقة به منذ لحظة الالتقاط؛ وتُعالج فترات الصمت والمداخلات القصيرة وحدود الكلام قبل التفريغ؛ وتُفرَّغ العربية متعددة اللهجات مع كتابة الأسماء والمصطلحات الإنجليزية بصيغتها التجارية المتعارف عليها؛ ويبقى كل مقطع مرتبطًا بمتحدثه ووقته في الاجتماع ومصدره الصوتي؛ وتنتج مرحلة ما بعد الاجتماع الملخص والنقاط الرئيسية والقرارات والخطوات التالية التي تُرسل بالبريد الإلكتروني إلى المشاركين وفق سياسات الوصول والموافقة والاحتفاظ لديك. وفي النشر الذي خضع للتقييم، لم يستدعِ مسار التفريغ أي خدمة تفريغ خارجية، ويمكن لـM3 العمل داخل بنية تحتية يتحكم فيها العميل فتبقى الأصوات والنصوص والملخصات داخل حدود حوكمة بياناتك. وبقيت نسبة الكلام إلى المتحدثين المقدمة من المنصة مرتبطة طوال كل اجتماع مقيَّم في مسار قنوات المشاركين؛ وهذا بيان تغطية، ولا يُبلَّغ عن معدل خطأ منسوب إلى المتحدثين.

ملاحظة

قدرة في المنتج لا معيار قياس. لم تُقيَّم الملخصات والمحاضر والتسليم في هذا التقييم. وتغطي أرقام معدل الخطأ في هذه الصفحة التفريغ وحده.

كيف جرى القياس

أُعطي كل نظام المادة نفسها وقُيّم بالقواعد نفسها. وتختصر الخطوات أدناه البروتوكول وقواعد التقييم، ونشاركها قبل أي برنامج تجريبي حتى تُقاس نتيجتك بالطريقة نفسها.

  1. المادة المصدرية

    اجتماعات عمل عربية حقيقية متعددة اللهجات، مع نصوص مرجعية تحقق منها بشر لكل مقطع مقيَّم.

  2. الصوت نفسه لكل نظام

    تلقت الأنظمة السبعة كلها الصوت المصدري نفسه، مقسمًا مسبقًا بواسطة مسار الالتقاط في M3 إلى مقاطع مفصولة بحسب المشارك. وقُيّمت الأنظمة الخارجية على التفريغ وحده؛ ولم يُستخدم تمييز المتحدثين لديها (فصل الصوت بحسب من يتكلم) ولم يُقيَّم. وأُنتج كل رقم للأنظمة المقارنة في هذه الصفحة بتشغيل واجهة المزود على صوت التقييم؛ ولم يُؤخذ أي رقم من منشورات المزودين.

  3. الإعدادات

    Google Cloud Speech-to-Text V2 بنموذج chirp_3 مع ar-XA؛ وGoogle Cloud Speech-to-Text V1 بنموذج latest_long مع ar-SA؛ وElevenLabs بنموذج scribe_v1 مع language_code=ara؛ وCohere وDeepgram Nova-3 وSonix.ai كما سُميت، من دون سلسلة نموذج إضافية. وM3 بوصفه نظام الاجتماعات الكامل مع قنوات صوت مرتبطة بالمشاركين من مسار الالتقاط الخاص به.

  4. المقياس

    معدل الخطأ على مستوى الأحرف = (عمليات الاستبدال + عمليات الحذف + عمليات الإدراج) مقسومًا على عدد حروف النص المرجعي المتحقق منه بشريًا، بعد التطبيع. والدقة على مستوى الأحرف = 100 ناقص معدل الخطأ.

  5. المكافئات

    تُعد الصيغة اللهجية وصيغتها الفصيحة الشيء نفسه ما دام المعنى واحدًا. وتُعد الكلمة الإنجليزية صحيحة سواء كُتبت بالحروف اللاتينية أو صوتيًا بالحروف العربية أو بكلمة عربية مكافئة. وتُقارن الأرقام بالقيمة (15 و١٥ وخمسة عشر الشيء نفسه) وتبقى ضمن المحتوى المقيَّم، وكذلك مصطلحات الأعمال الإنجليزية.

  6. ما يُهمل

    الترقيم كليًا؛ وحالة الأحرف اللاتينية؛ وتُطبَّع أشكال الحروف العربية مثل صور الألف؛ والمسافات، إلا أن المسافة المفقودة التي تدمج كلمتين تُحتسب خطأ واحدًا.

  7. الفروق المتبقية

    يُعد كل حرف مفقود أو مضاف أو مستبدل خطأ. ولا تدخل في معدل الخطأ إلا المقاطع ذات النص المرجعي المتحقق منه. ويُحتسب المخرج الفارغ مقابل نص مرجعي يحتوي على كلام حذفًا؛ ويُحتسب المخرج الإضافي غير المدعوم إدراجًا.

  8. المراجعة النوعية

    سجّل المراجعون لكل نظام حذف المحتوى، والأسماء والمصطلحات الإنجليزية، والإدراجات الشبيهة بالحشو، والتغيرات اللغوية غير المتوقعة، والترقيم المكرر، وحلقات التكرار. ولم تُحسب معدلات إجمالية منفصلة.

خريطة الأدلة

الادعاءالنطاقالحالة
معدل خطأ على مستوى الأحرف 1.62% لـ M3 مقابل 2.26% لـ Google chirp_3، و4.93% لـ Cohere، و5.01% لـ ElevenLabs Scribe، و6.09% لـ Deepgram Nova-3، و9.01% لـ Google latest_long، و9.8% لـ Sonix؛ وانخفاضات نسبية تقريبية قدرها 28% و67% و68% و73% و82% و83%.مجموعة التقييم نفسها من اجتماعات حقيقية متحقق منها بشريًا، بالنص المرجعي نفسه وقواعد التقييم نفسها.مُقاس.
أظهر Deepgram Nova-3 أخطاء في أسماء المشاركين وحذفًا في بداية المقاطع؛ وحافظ ElevenLabs Scribe على المصطلحات التقنية الإنجليزية جيدًا لكنه أنتج أصوات حشو زائفة متكررة وانتقالًا واحدًا غير متوقع في اللغة أو الكتابة؛ وعالج Google latest_long كثيرًا من المقاطع الخالية من الكلام بشكل صحيح لكنه أغفل عددًا قليلًا من المقاطع التي تحتوي على كلام وحذف المصطلحات الإنجليزية كثيرًا مع حذف عرضي للأرقام؛ وتعامل Google chirp_3 بقوة مع المصطلحات التقنية الإنجليزية وأظهر فقدانًا منخفضًا للمحتوى؛ وأظهر Sonix أخطاء في الأسماء والمصطلحات التقنية الإنجليزية وحذفًا في بداية المقاطع وإفراطًا في علامات نهاية الجمل.مراجعة نوعية لمجموعة التقييم نفسها.مُلاحظ نوعيًا؛ لم تُحسب معدلات إجمالية منفصلة.
بقيت نسبة الكلام إلى المتحدثين المقدمة من المنصة مرتبطة طوال كل اجتماع مقيَّم.مسار قنوات المشاركين في M3؛ قُيّمت الأنظمة الخارجية على التفريغ وحده.مُقاس لمسار قنوات المشاركين في M3.
معالجة دفعية بنحو 80 ضعف الزمن الحقيقي؛ نحو 45 ثانية لكل ساعة من صوت الاجتماع.مسار تفريغ الاجتماعات في M3 لاجتماع مدته ساعة على معالج رسومي L4.بحسب تقرير الفريق؛ معالجة دفعية لا زمن استجابة مباشرًا.
لا استدعاء لخدمة تفريغ خارجية.مسار التفريغ الذي خضع للتقييم.تم التحقق منه في النشر الذي خضع للتقييم.

الحدود

  • مجموعة تقييم واحدة. يأتي كل رقم لمعدل الخطأ من مجموعة تقييم واحدة من اجتماعات حقيقية متحقق منها بشريًا. وتبيّن كيف تقارنت الأنظمة السبعة على تلك المادة، لا معدلًا عامًا لأي منها. اجتماعاتك ومزيج لهجاتك وميكروفوناتك هي المعيار الذي يهم.
  • لقطة زمنية. استُدعيت الواجهات المقارنة في سبتمبر 2026 بالإعدادات المذكورة في فقرة «كيف جرى القياس». ويحدّث المزودون نماذجهم، فتصف الأرقام تلك الإصدارات في ذلك التاريخ.
  • هامش ضيق في الصدارة. الفارق مع Google chirp_3 هو 0.64 نقطة مئوية، وفي عدد من المقاطع النموذجية لا يقل chirp_3 اكتمالًا عن M3.
  • سرعة المعالجة بحسب تقرير الفريق. رقما 45 ثانية لكل ساعة و80 ضعفًا أبلغ عنهما الفريق لإعداد عتادي واحد، وليسا جزءًا من المعيار المقيَّم. ولم يُقس زمن الاستجابة المباشر.
  • الملاحظات النوعية بلا معدلات إجمالية. تتبع مستويات المصفوفة قاعدة واحدة مطبقة على صياغة ملاحظات المراجعين، وتُعرض مع عباراتها حتى يمكن الطعن فيها.
  • لم يُقيَّم تمييز المتحدثين لدى الأنظمة الخارجية. تلقى كل نظام خارجي صوتًا مفصولًا بحسب المشارك أعدّه M3. تعزل المقارنة التفريغ ولا تقول شيئًا عن كيفية نسبة تلك الأنظمة الكلام إلى المتحدثين على صوت مختلط. ونتيجة نسبة الكلام إلى المتحدثين لدى M3 بيان تغطية؛ ولا يُبلَّغ عن معدل خطأ منسوب إلى المتحدثين.
  • M3 ليس خاليًا من الأخطاء. تعرض الأمثلة أصوات تردد مكتوبة لا يحتوي عليها النص المرجعي، وكلمات مضافة لا ترد فيه.
  • الخطوات التالية. توسّع مرحلة التقييم التالية الاختبار ليشمل مؤسسات إضافية ومنصات اجتماعات ولهجات وظروفًا صوتية ومصطلحات خاصة بالعملاء. ويمكنك تقييم M3 على اجتماعاتك الآن.
النتائج الكاملة للأنظمة السبعة
النتائج الكاملة للأنظمة السبعة. مُقاسة على الاجتماعات نفسها المتحقق منها بشريًا، بالنص المرجعي نفسه وقواعد التقييم نفسها؛ انظر فقرة كيف جرى القياس. الأفضل في العمود
الترتيبالنظامتفصيل البروتوكولمعدل الخطأ على مستوى الأحرف (%)، الأقل أفضلالدقة على مستوى الأحرف (%)الانخفاض النسبي لـ M3، تقريبي (%)الانخفاض المطلق بالنقاط
1Complete M3 meeting systemComplete M3 meeting system; participant-linked audio channels supplied by the M3 capture workflow1.62 (الأفضل في العمود)98.38 (الأفضل في العمود)الأساسالأساس
2Google Cloud Speech-to-Text V2 (chirp_3)chirp_3, ar-XA2.2697.74280.64
3CohereCohere (no model string given in the white paper)4.9395.07673.31
4ElevenLabs Scribe v1scribe_v1, language_code=ara5.0194.99683.39
5Deepgram Nova-3Deepgram Nova-3 (no further model string given)6.0993.91734.47
6Google Cloud Speech-to-Text V1 (latest_long)latest_long, ar-SA9.0190.99827.39
7Sonix.aiSonix.ai (no model string given)9.890.283 (الأفضل في العمود)8.18 (الأفضل في العمود)

التقرير الأصلي منشور على lisan.com. استشهد بتلك الصفحة.

للاستشهاد بهذه الصفحة

Lisan Research (2026). M3: Arabic meeting transcription, measured on real meetings. Evaluation Edition, September 2026. Lisan, 15 September 2026. https://lisan.com/company/research/m3/
BibTeX
@techreport{lisan2026m3,
  author = {Lisan Research},
  title = {M3: Arabic meeting transcription, measured on real meetings},
  institution = {Lisan},
  year = {2026},
  month = {September},
  type = {Evaluation report},
  note = {Evaluation Edition, September 2026. Published 15 September 2026},
  url = {https://lisan.com/company/research/m3/},
}

شغّل M3 على اجتماعاتك أنت

يشغّل البرنامج التجريبي M3 على عينة من اجتماعاتك مقابل نص مرجعي متحقق منه بشريًا، مع مشاركة قواعد التقييم قبل التشغيل، فتُقاس نتيجتك بالطريقة نفسها التي قيس بها هذا التقرير. أو ابدأ مجانًا وأحضره إلى اجتماعك التالي.

أسئلة شائعة

ماذا يعني معدل خطأ على مستوى الأحرف قدره 1.62% عمليًا؟

نحو 16 حرفًا خاطئًا في كل 1,000 حرف، بعد المكافئات المنشورة (تُعد الصيغ اللهجية والفصيحة، والإنجليزية اللاتينية والصوتية، وصيغ الأرقام الشيء نفسه). قيس على اجتماعات عمل عربية حقيقية متعددة اللهجات لها نصوص مرجعية تحقق منها بشر، على المادة نفسها التي خضعت لها الأنظمة الستة المقارنة. وهو نتيجةٌ على مجموعة تقييم واحدة، لا ضمانٌ لكل قاعة.

هل هذا هو رقم معدل الخطأ في الكلمات الذي كان منشورًا على هذا الموقع؟

لا. لم يعد ذلك الرقم معتمدًا، وقد حل هذا التقييم محله. يبلّغ هذا التقييم عن معدل الخطأ على مستوى الأحرف مقابل ستة أنظمة مسماة بقواعد تقييم منشورة، ويحل محل كل رقم دقة سابق لـMeetriX على هذا الموقع.

هل تحقق طرف مستقل من التقييم؟

لا. أجرته Lisan Research. ويُنشر البروتوكول وقواعد التقييم والأمثلة وخريطة الأدلة حتى يمكن إعادة التقييم، والبرنامج التجريبي على اجتماعاتك هو الطريقة للتحقق منه على مادتك.

هل يرسل MeetriX صوتنا إلى واجهة برمجية سحابية للتعرف على الكلام؟

في النشر الذي خضع للتقييم لم يستدعِ مسار التفريغ أي خدمة تفريغ خارجية (تم التحقق منه في النشر الذي خضع للتقييم). وبوصفه قدرة في المنتج، يمكن لـM3 العمل داخل بنية تحتية يتحكم فيها العميل فتبقى الأصوات والنصوص والملخصات داخل حدود حوكمة بياناتك؛ وخيارات النشر في صفحة الأمان (بالإنجليزية).

كيف نشغّل برنامجًا تجريبيًا؟

احجز برنامجًا تجريبيًا أو راسل support@lisan.com. نتفق على عينة من اجتماعاتك، ونعدّ نصًا مرجعيًا متحقق منه بشريًا، ونشاركك قواعد التقييم قبل التشغيل، ونبلّغ عن النتيجة بالطريقة نفسها التي تعرضها هذه الصفحة.