L3: التدقيق اللغوي العربي مقابل 26 إعدادًا من النماذج اللغوية الكبيرة
على معيار من جمل عربية حقيقية راجعها خبير لغوي، بلغ L3 نسبة 80.29% على مقياس F0.5 للتعديلات، مقابل 44.68% لنموذج Claude Fable 5.1، أقوى إعدادات النماذج اللغوية الكبيرة التي اختبرناها.
80.29%مقياس F0.5 للتعديلاتمقيس · التالي 44.68% لنموذج Claude Fable 5.1
84.54%دقة الرصدمقيس · التالي 64.21% لنموذج Claude Fable 5.1
66.85%استدعاء الرصدمقيس · التالي 41.08% لنموذج GPT-5.6 Sol
96.38%دقة التصحيح بعد التطبيعمقيس · مشروطة برصد صحيح
55.96%التطابق التام للجملةمقيس · Claude Fable 5.1 بنسبة 27.98%
98.84%ROUGE-1 F1مقيس · تداخل الكلمات مع المرجع · Claude Fable 5.1 بنسبة 96.56%
52.28رمزًا في الثانيةمقيس · الثاني بعد Qwen 3.8 27B على Groq بمعدل 66.98
0.000014كيلوواط ساعة لكل 1,000 رمز، على نطاق المسرّعمقيس على NVIDIA A10 · 0.000042 بمعامل المنظومة الكاملة بثلاثة أضعاف، وهو تقدير
يجمع F0.5 بين الدقة والاستدعاء مع ترجيح الدقة. والدقة نسبة التغييرات المقترحة التي وقعت حيث غيّر الخبير اللغوي النص أيضًا؛ والاستدعاء نسبة تعديلات الخبير التي وجدها النظام. التعريفات الكاملة في المنهجية.
يتصدر L3 مقياس F0.5 للتعديلات بنسبة 80.29% مقابل 44.68% لـ Claude Fable 5.1
مقياس F0.5 للتعديلات، رصد المقاطع بحدودها الدقيقة، أفضل عشرة إعدادات. الأعلى أفضل. يرجّح F0.5 الدقة على الاستدعاء، لأن التغييرات غير الضرورية أعلى كلفة من التعديلات الفائتة.
رصد المقاطع بحدودها الدقيقة، بمتوسط جزئي، أي بتجميع كل مقاطع التعديل قبل حساب النسبة. مخرج واحد لكل نظام، والاقتراح الأول فقط من L3، والتعليمات الحرفية نفسها المكونة من أربعة أسطر. وكل درجات المنافسين من تشغيلنا نحن لخدمة كل مزود، لا من منشورات المزودين. انظر المنهجية؛ ويعرض الجدول كل الإعدادات.
احتلّ L3، محرك Lisan اللغوي، المرتبة الأولى في كل مقياس رئيسي في هذا التقييم: دقة رصد المقاطع بحدودها الدقيقة، والاستدعاء، وF1، وF0.5، ودقة التصحيح الحرفية وبعد التطبيع، والتطابق التام للجملة، وROUGE-1 وROUGE-L. وبلغ على F0.5 نسبة 80.29%، بفارق 35.61 نقطة عن Claude Fable 5.1 الذي بلغ 44.68%. مقيس.
وقد تغيّر المنافس الأقوى بتغيّر المقياس، وهو أمر يستحق أن يُقال بوضوح. فكان Claude Fable 5.1 التالي في الدقة وفي F0.5. وكان Claude Opus 5 التالي في F1 بنسبة 34.58% مقابل 74.66% لـ L3. وكان GPT-5.6 Sol التالي في الاستدعاء بنسبة 41.08% مقابل 66.85%. ولم يحلّ أي إعداد من النماذج اللغوية الكبيرة ثانيًا في كل المقاييس.
مهمتان لا مهمة واحدة
التدقيق اللغوي قراران متتابعان. على النظام أن يحدد أولًا موضع الخطأ في النص، ثم يقرر ما الذي يضعه مكانه. ونحن نقيس المهمتين كلًّا على حدة، لأن نظامًا ما قد يجيد إحداهما ويقصّر في الأخرى.
يُقاس الرصد على المقاطع بحدودها الدقيقة. فكل تعديل مرجعي يشغل مقطعًا من الجملة الأصلية محددًا بمواضع الحروف، ولا يحصل النظام على نقطة رصد إلا إذا غيّر ذلك المقطع نفسه بالضبط. أما تغيير كلمة مجاورة، أو نصف الكلمة الصحيحة، فيُحسب فواتًا وإنذارًا كاذبًا في آن واحد. وتُعامَل الإضافات مواضعَ صفرية العرض، وقد يُعدّ تغيير علامة الترقيم مقطعًا مستقلًا.
ولا يُقاس التصحيح إلا حيث نجح الرصد. فمن بين المقاطع التي حددها النظام تحديدًا صحيحًا، نسأل: كم بديلًا منها طابق مرجع الخبير اللغوي، حرفًا بحرف أولًا، ثم بعد التطبيع العربي. ولهذا تبقى دقة التصحيح رقمًا مشروطًا، ونصرّح بذلك حيثما ورد.
المقياس الرئيسي هو F0.5، الذي يجمع بين الدقة والاستدعاء مع ترجيح الدقة. ففي التدقيق المؤسسي، يكلّف التغيير غير الضروري عادةً أكثر مما يكلّف التعديل الفائت: إذ لا بد من مراجعته ورفضه، وربما التراجع عنه يدويًا. ويعبّر F0.5 عن هذا التفاوت. ونورد إلى جانبه F1 والدقة والاستدعاء، حتى لا يُطلب من أحد أن يقبل هذا الترجيح دون دليل.
L3 هو النظام الوحيد الذي يجمع بين دقة تتجاوز 80% واستدعاء يتجاوز 60%
الدقة في مقابل الاستدعاء لكل إعداد له صف نتائج. الأعلى أفضل على المحورين. الاستدعاء على المحور الأفقي والدقة على المحور الرأسي؛ ويشير الربع المظلل إلى دقة تتجاوز 80% مع استدعاء يتجاوز 60%.
رصد المقاطع بحدودها الدقيقة. خطوط إرشادية عند دقة 80% واستدعاء 60%. شُغّل GPT-6 Astra بإعدادي استدلال، ولا تحمل ملاحق التقرير إلا صفًا واحدًا له، فيظهر نقطة واحدة. النقاط المسماة: L3، وClaude Fable 5.1 (أدق نموذج لغوي كبير)، وGPT-5.6 Sol (أعلى استدعاء بين النماذج)، وClaude Opus 5 (أفضل F1 بين النماذج).
الدقة والاستدعاء
L3 هو النظام الوحيد الذي يجمع بين دقة تتجاوز 80% واستدعاء يتجاوز 60% على هذا المعيار. فدقته البالغة 84.54% تعني أن معظم التغييرات التي اقترحها وقعت على مقطع غيّره الخبير اللغوي أيضًا. واستدعاؤه البالغ 66.85% يعني أنه أصاب أغلب التعديلات المرجعية وفاته باقيها. مقيس.
وتقصّر النماذج اللغوية الكبيرة بطريقتين مختلفتين. فكان Claude Fable 5.1 الأدق بنسبة 64.21%، لكنه لم يجد سوى 20.15% من التعديلات المرجعية: غيّر قليلًا، وكان ما غيّره صائبًا في الغالب. وأصاب GPT-5.6 Sol أكبر حصة من التعديلات المرجعية بين النماذج بنسبة 41.08%، لكن بدقة 25.03%، أي إن معظم تغييراته لم تكن مسوّغة. وتتجمع معظم الإعدادات الأخرى في الزاوية السفلى اليسرى من المخطط، متقاربةً على المحورين.
هذا الشكل هو الحجة العملية لاعتماد F0.5 بدلًا من عدّ التصحيحات الخام. فالنظام الحذر ذو الدقة العالية والاستدعاء المنخفض يترك الأخطاء في الوثيقة. والنظام المندفع ذو الملامح المعاكسة يملأ قائمة المراجعة بتغييرات يضطر المحرر إلى رفضها. ويكافئ المعيار النظام القادر على الأمرين معًا، ونظام واحد فعل ذلك.
بعد رصد صحيح، يطابق بديل L3 المرجع في 96.38% من الحالات، بفارق 1.84 نقطة عن Claude Fable 5.1
دقة التصحيح، حرفيًا وبعد التطبيع العربي، مشروطة برصد صحيح. الأعلى أفضل. يبدأ المحور من 70%.
مشروطة برصد صحيح، فاقرأ هذه النسب إلى جانب الاستدعاء: تنطبق نسب Claude Fable 5.1 على مقاطع مرصودة أقل بكثير من مقاطع L3. عشرة إعدادات مرتبة بحسب النسبة بعد التطبيع. مفتاح الرسم: البديل الحرفي، وبعد التطبيع العربي.
جودة التصحيح بعد الرصد
متى حدد L3 مقطعًا تحديدًا صحيحًا، طابق بديله المرجع حرفًا بحرف في 89.79% من الحالات، وفي 96.38% منها بعد التطبيع العربي. ويزيل التطبيع التشكيل والتطويل، ويوحّد صور الألف والهمزة والتاء المربوطة، حتى لا يُحكم على اقتراح صحيح بالخطأ بسبب حركة زائدة أو ناقصة. مقيس.
هذه الأرقام مشروطة، والتحفظ هنا ليس مجرد إجراء شكلي. فقد بلغ Claude Fable 5.1 نسبة 89.07% حرفيًا و94.54% بعد التطبيع، بفارق 1.84 نقطة خلف L3 في النسبة المطبّعة. غير أن هذه النسب لا تنطبق إلا على المقاطع التي رصدها، وهي جزء صغير من التعديلات المرجعية. فالنظام الذي يغيّر قليلًا ويحسن ما يغيّره قد يسجّل دقة مشروطة عالية وهو يترك معظم الأخطاء في مكانها. تخبرك دقة التصحيح بمدى الثقة في اقتراح مقبول؛ ويخبرك الاستدعاء بمقدار ما بلغه النظام من الوثيقة. ولا يغني أحد الرقمين عن الآخر.
يطابق L3 الجملة المرجعية كاملة في 55.96% من الجمل، ضعف نسبة Claude Fable 5.1 البالغة 27.98%
التطابق التام على مستوى الجملة، أفضل عشرة إعدادات. الأعلى أفضل. نسبة الجمل التي يطابق مخرجها الكامل المرجع الكامل حرفًا بحرف.
صارم عن قصد: تعديل فائت واحد، أو تعديل زائد واحد، أو حرف مختلف واحد يجعل الجملة خاطئة. يتعادل GPT-5.6 Terra وGemini 2.5 Flash عند 18.49% ويحتفظان بترتيب المصدر. نسب فقط؛ لا أعداد جمل في الشكل.
الدقة على مستوى الجملة كاملة
تصف مقاييس المقاطع التعديلات، أما المحررون فيتسلمون جملًا. ويطرح التطابق التام للجملة السؤال من طرف إلى طرف: بعد أن ينتهي النظام، هل الجملة كلها مطابقة لما كان الخبير اللغوي سيكتبه؟ اجتاز L3 هذا الحد في 55.96% من الجمل، أي ضعف نسبة Claude Fable 5.1 البالغة 27.98%. مقيس.
والمقياس صارم بحكم تصميمه. فحركة زائدة واحدة، أو نقطة ناقصة واحدة، أو خطأ واحد لم يُمسّ، يُسقط الجملة كلها، ولهذا تقع كل النسب هنا دون نسب التصحيح المشروطة أعلاه بكثير. وهو ملخص مفيد لسلسلة المعالجة كاملة، لا معدل خطأ، ولا يحل محل التحليل على مستوى المقاطع.
يحافظ L3 على نص المرجع وهو يصححه: 98.84% على ROUGE-1 F1 مقابل 96.56% لـ Claude Fable 5.1
ROUGE-1 F1 في مقابل مرجع الخبير اللغوي، أفضل عشرة إعدادات. الأعلى أفضل. تداخل الكلمات على مستوى الجملة بعد إزالة التشكيل والتطويل؛ يمتد المحور من 95 إلى 100.
يعرض المحور من 95 إلى 100؛ وتتجاوز الأنظمة العشرة كلها 95. أما ROUGE-L الذي يشترط ترتيب الكلمات أيضًا فيظهر في التلميح والجدول. متوسط كلي لكل جملة.
الأمانة للمرجع
يقيس ROUGE مقدار ما يبقى من الجملة المرجعية في المخرج، أيًا كان ما يقوله تقييم التعديلات. وتعني القيم العالية أن النظام صحح النص من غير أن يعيد كتابته. سجّل L3 نسبة 98.84% على ROUGE-1 F1 و98.83% على ROUGE-L F1، متقدمًا على Claude Fable 5.1 بفارق 2.28 و2.29 نقطة. مقيس.
وهنا تفصيلان مهمان. يبدأ المحور من 95 لأن كل نظام في العشرة الأوائل يتجاوزه؛ فعلى محور كامل تبدو العلامات متطابقة، أما مخطط أعمدة مقطوع المحور فيبالغ. كما أن قيمتي ROUGE-1 وROUGE-L لدى L3 تكادان تتطابقان، ونقرأ ذلك على أنه احتفاظ بمفردات المرجع وبترتيبها معًا: يغيّر المحرك الخطأ ويترك بنية الجملة على حالها. ويروي مقياس التداخل المجموعي القديم، المحتفظ به للتتبع لا مقياسًا رئيسيًا، القصة نفسها بنسبة 91.45% مقابل 88.93%.
كيف تبدو التصحيحات
تصف الأرقام المعيار، وتُظهره الجمل. البطاقات أدناه مأخوذة من صفوف المعيار، وتعرض النص الأصلي، ومرجع الخبير اللغوي، ومخرج L3، ومخرجات عدد من إعدادات النماذج اللغوية الكبيرة، كما وردت حرفيًا. تأتي الأخطاء الصريحة أولًا. أما البطاقتان الأخيرتان فموسومتان بعبارة «معيار تحريري»: الجملة الأصلية سليمة نحويًا، والمرجع يطبّق الاصطلاح التحريري الذي التزمه الخبير اللغوي، وقد طُلب من النماذج ألا تعيد الصياغة. تُظهر هذه الصفوف ما تفعله الطبقة التحريرية في المحرك، لا إخفاق النماذج في النحو، وتصرّح التعليقات بذلك.
وثمة تنبيه، من باب الأمانة، يسري على البطاقات كلها. قدّم كل نظام مخرجًا واحدًا لكل جملة، وقدّم L3 اقتراحه الأول فقط، وكانت النماذج مقيدة بتعليمات صارمة. وحيثما طابق نموذج المرجع، تقول البطاقة ذلك.
مثال 1
خطأ صريح
خطآن في كرسي الهمزة ونقطة ختامية ناقصة؛ طابق L3 المرجع تمامًا، وصححت النماذج المعروضة الهمزة الثانية وتركت الأولى.
النص الأصلي
نعم يمكن لكتاب واحد يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيئ (مقطع خاطئ) له طريقه إلى النجاح (مقطع خاطئ)
المرجع
نعم يمكن لكتاب واحد يقرؤه (تصحيح) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح. (تصحيح)
L3
مطابق
نعم يمكن لكتاب واحد يقرؤه (تصحيح) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح. (تصحيح)
Claude Fable 5.1
جزئي
نعم يمكن لكتاب واحد يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح (مقطع خاطئ)
Claude Opus 5
جزئي
نعم يمكن لكتاب واحد يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح (مقطع خاطئ)
GPT-6 Astra
جزئي
نعم يمكن لكتاب واحد أن يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح. (تصحيح)
GPT-5.6 Sol
جزئي
نعم يمكن لكتاب واحد أن يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح (مقطع خاطئ)
Gemini 3.1 Pro
جزئي
نعم يمكن لكتاب واحد يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح (مقطع خاطئ)
DeepSeek V4 Pro
جزئي
نعم يمكن لكتاب واحد يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح (مقطع خاطئ)
لماذا المرجع صحيح
تقع الهمزة على حامل مختلف بحسب الحركات المحيطة بها: ففي «يقرؤه» يجب أن تُكتب على واو لأن الهمزة نفسها مضمومة، والضمة أقوى من فتحة الحرف الذي قبلها، وفي «يضيء» يجب أن تُكتب مفردة على السطر بعد حرف مدّ؛ وقد استُخدم في الكلمتين حامل خاطئ، كما يختم المرجع الجملة بنقطة.
موضع الهمزة
الترقيم
مثال 2
خطأ صريح
قاعدة كلاسيكية لموضع الهمزة داخل مصطلح تقني شائع جدًا؛ ولم يصل أي إعداد من النماذج اللغوية الكبيرة إلى رسم المرجع.
النص الأصلي
ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟
المرجع
ما المقصود بالتحليلات التنبئية (تصحيح)؟
L3
مطابق
ما المقصود بالتحليلات التنبئية (تصحيح)؟
Claude Fable 5.1
دون تغيير
ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟
Claude Opus 5
دون تغيير
ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟
GPT-6 Astra
دون تغيير
ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟
GPT-5.6 Sol
دون تغيير
ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟
Gemini 3.1 Pro
دون تغيير
ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟
DeepSeek V4 Pro
دون تغيير
ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟
لماذا المرجع صحيح
حين يتحول الاسم «تنبؤ» إلى الصفة «تنبئية» تنتقل الهمزة من حامل الواو إلى حامل الياء؛ وقد أبقى النص الأصلي رسم الاسم داخل الصفة، وهو خطأ إملائي تركته النماذج اللغوية الكبيرة كلها من غير مساس.
موضع الهمزة
مثال 3
خطأ صريح
الأعداد من ثلاثة إلى عشرة تخالف المعدود في التذكير والتأنيث؛ طابقت خمسة إعدادات من 26 المرجع، ومنها Gemini 3.1 Pro بين المخرجات المعروضة، وترك الباقي العدد كما كُتب.
النص الأصلي
وكجزء من التقييم، حصل مستشفى آدم فيتال على تصنيف خمس نجوم (مقطع خاطئ)، وهو أعلى تصنيف متاح، ضمن فئة تجربة المرضى وسلامتهم.
المرجع
وكجزء من التقييم، حصل مستشفى آدم فيتال على تصنيف خمسة نجوم (تصحيح)، وهو أعلى تصنيف متاح، ضمن فئة تجربة المرضى وسلامتهم.
L3
مطابق
وكجزء من التقييم، حصل مستشفى آدم فيتال على تصنيف خمسة نجوم (تصحيح)، وهو أعلى تصنيف متاح، ضمن فئة تجربة المرضى وسلامتهم.
Claude Fable 5.1
دون تغيير
وكجزء من التقييم، حصل مستشفى آدم فيتال على تصنيف خمس نجوم (مقطع خاطئ)، وهو أعلى تصنيف متاح، ضمن فئة تجربة المرضى وسلامتهم.
Claude Opus 5
دون تغيير
وكجزء من التقييم، حصل مستشفى آدم فيتال على تصنيف خمس نجوم (مقطع خاطئ)، وهو أعلى تصنيف متاح، ضمن فئة تجربة المرضى وسلامتهم.
GPT-6 Astra
دون تغيير
وكجزء من التقييم، حصل مستشفى آدم فيتال على تصنيف خمس نجوم (مقطع خاطئ)، وهو أعلى تصنيف متاح، ضمن فئة تجربة المرضى وسلامتهم.
GPT-5.6 Sol
دون تغيير
وكجزء من التقييم، حصل مستشفى آدم فيتال على تصنيف خمس نجوم (مقطع خاطئ)، وهو أعلى تصنيف متاح، ضمن فئتي تجربة المرضى وسلامتهم.
Gemini 3.1 Pro
مطابق
وكجزء من التقييم، حصل مستشفى آدم فيتال على تصنيف خمسة نجوم (تصحيح)، وهو أعلى تصنيف متاح، ضمن فئة تجربة المرضى وسلامتهم.
DeepSeek V4 Pro
دون تغيير
وكجزء من التقييم، حصل مستشفى آدم فيتال على تصنيف خمس نجوم (مقطع خاطئ)، وهو أعلى تصنيف متاح، ضمن فئة تجربة المرضى وسلامتهم.
لماذا المرجع صحيح
تخالف الأعداد من ثلاثة إلى عشرة في العربية جنس المعدود؛ و«نجم» مذكر، فيجب أن يأتي العدد «خمسة» بصيغة المؤنث المختومة بالتاء المربوطة.
مطابقة العدد للمعدود
مثال 4
خطأ صريح
اسم مؤنث يبدو مذكرًا؛ طابقت عدة إعدادات المرجع هنا، ومنها Claude Fable 5.1.
النص الأصلي
كيف لأحد أن يمتلك مثل هذا الكبرياء (مقطع خاطئ)؟
المرجع
كيف لأحد أن يمتلك مثل هذه الكبرياء (تصحيح)؟
L3
مطابق
كيف لأحد أن يمتلك مثل هذه الكبرياء (تصحيح)؟
Claude Fable 5.1
مطابق
كيف لأحد أن يمتلك مثل هذه الكبرياء (تصحيح)؟
Claude Opus 5
دون تغيير
كيف لأحد أن يمتلك مثل هذا الكبرياء (مقطع خاطئ)؟
GPT-6 Astra
مطابق
كيف لأحد أن يمتلك مثل هذه الكبرياء (تصحيح)؟
GPT-5.6 Sol
دون تغيير
كيف لأحد أن يمتلك مثل هذا الكبرياء (مقطع خاطئ)؟
Gemini 3.1 Pro
مطابق
كيف لأحد أن يمتلك مثل هذه الكبرياء (تصحيح)؟
DeepSeek V4 Pro
دون تغيير
كيف لأحد أن يمتلك مثل هذا الكبرياء (مقطع خاطئ)؟
لماذا المرجع صحيح
«الكبرياء» اسم مؤنث في العربية، لأن الألف الممدودة في آخره ألف تأنيث، فيجب أن يأتي اسم الإشارة بصيغة المؤنث «هذه».
المطابقة في الجنس
مثال 5
خطأ صريح
نص مشوّه بشدة؛ استعادت معظم النماذج الكلمات، وطابق Gemini 3.1 Pro المرجع من بين المخرجات المعروضة (كما طابقه GPT-5.6 Luna في النتائج الكاملة)، وطابقه L3 حرفًا بحرف.
تأتي اللغة (تصحيح) العربية (تصحيح) في (تصحيح) المركز (تصحيح) الخامس (تصحيح) كأكثر (تصحيح) اللغات (تصحيح) تحدثا (تصحيح) في العالم (تصحيح). (تصحيح)
L3
مطابق
تأتي اللغة (تصحيح) العربية (تصحيح) في (تصحيح) المركز (تصحيح) الخامس (تصحيح) كأكثر (تصحيح) اللغات (تصحيح) تحدثا (تصحيح) في العالم (تصحيح). (تصحيح)
Claude Fable 5.1
جزئي
تأتي اللغة (تصحيح) العربية (تصحيح) في (تصحيح) المركز (تصحيح) الخامس (تصحيح) كأكثر (تصحيح) اللغات (تصحيح) تحدثا (تصحيح) في العالم (تصحيح)
Claude Opus 5
جزئي
تأتي اللغة (تصحيح) العربية (تصحيح) في (تصحيح) المركز (تصحيح) الخامس (تصحيح) كأكثر (تصحيح) اللغات (تصحيح) تحدثا (تصحيح) في العالم (تصحيح)
GPT-6 Astra
جزئي
تأتي اللغة (تصحيح) العربية (تصحيح) في (تصحيح) المركز (تصحيح) الخامس (تصحيح) كأكثر (تصحيح) اللغات (تصحيح) تحدثا (تصحيح) في العالم (تصحيح)
GPT-5.6 Sol
جزئي
تأتي اللغة (تصحيح) العربية (تصحيح) في (تصحيح) المركز (تصحيح) الخامس (تصحيح) كأكثر (تصحيح) اللغات (تصحيح) تحدثا (تصحيح) في العالم (تصحيح)
Gemini 3.1 Pro
مطابق
تأتي اللغة (تصحيح) العربية (تصحيح) في (تصحيح) المركز (تصحيح) الخامس (تصحيح) كأكثر (تصحيح) اللغات (تصحيح) تحدثا (تصحيح) في العالم (تصحيح). (تصحيح)
DeepSeek V4 Pro
جزئي
تأتي اللغة (تصحيح) العربية (تصحيح) في (تصحيح) الوقت (يختلف عن المرجع) الحالي (يختلف عن المرجع) كأكثر (تصحيح) اللغات (تصحيح) تحدثا (تصحيح) في العالم (تصحيح)
لماذا المرجع صحيح
النص الأصلي جملة كثيرة الأخطاء الطباعية، ومعناها أن اللغة العربية تأتي في المركز الخامس بين أكثر اللغات تحدثًا في العالم: كلمات عدة أُسقطت منها حروف، أو تكررت فيها حروف، أو نقصتها همزة، أو أخطأت في نهاياتها؛ ويعيد المرجع كل كلمة إلى رسمها الصحيح ويضيف نقطة ختامية.
الإملاء
الترقيم
مثال 6
أخطاء صريحة، مع تعديل تحريري واحد
يتضمن تغييرًا تحريريًا
ستة تصويبات في جملة واحدة، أحدها تحريري؛ صحح GPT-6 Astra كل الأخطاء الصريحة ولم يختلف عن المرجع إلا في اصطلاح الفعل المبني للمجهول.
النص الأصلي
تحدث ايلون مسك (مقطع خاطئ) مع المشاركون (مقطع خاطئ) في مؤتمر الإقتصاد (مقطع خاطئ) العالمي وتم إعلان (مقطع خاطئ) استثمارات بقيمة ثلاث (مقطع خاطئ) وثلاثين مليار (مقطع خاطئ).
المرجع
تحدث إيلون ماسك (تصحيح) مع المشاركين (تصحيح) في مؤتمر الاقتصاد (تصحيح) العالمي وأعلنت (تصحيح) استثمارات بقيمة ثلاثة (تصحيح) وثلاثين مليارا (تصحيح).
L3
مطابق بعد التطبيع
تحدث إيلون ماسك (تصحيح) مع المشاركين (تصحيح) في مؤتمر الاقتصاد (تصحيح) العالمي وأُعْلِنت (يختلف عن المرجع في التشكيل أو الرسم فقط) استثمارات بقيمة ثلاثة (تصحيح) وثلاثين ملياراً. (يختلف عن المرجع في التشكيل أو الرسم فقط)
Claude Fable 5.1
جزئي
تحدث إيلون مسك (يختلف عن المرجع) مع المشاركين (تصحيح) في مؤتمر الاقتصاد (تصحيح) العالمي وتم إعلان (مقطع خاطئ) استثمارات بقيمة ثلاثة (تصحيح) وثلاثين مليارا (تصحيح).
Claude Opus 5
جزئي
تحدث إيلون مسك (يختلف عن المرجع) مع المشاركين (تصحيح) في مؤتمر الاقتصاد (تصحيح) العالمي وتم إعلان (مقطع خاطئ) استثمارات بقيمة ثلاثة (تصحيح) وثلاثين مليارا (تصحيح).
GPT-6 Astra
جزئي
تحدث إيلون ماسك (تصحيح) مع المشاركين (تصحيح) في مؤتمر الاقتصاد (تصحيح) العالمي وتم إعلان (مقطع خاطئ) استثمارات بقيمة ثلاثة (تصحيح) وثلاثين مليارا (تصحيح).
GPT-5.6 Sol
جزئي
تحدث إيلون ماسك (تصحيح) مع المشاركين (تصحيح) في مؤتمر الاقتصاد (تصحيح) العالمي وتم إعلان (مقطع خاطئ) استثمارات بقيمة ثلاثة (تصحيح) وثلاثين مليار (مقطع خاطئ).
Gemini 3.1 Pro
جزئي
تحدث إيلون مسك (يختلف عن المرجع) مع المشاركين (تصحيح) في مؤتمر الاقتصاد (تصحيح) العالمي وتم إعلان (مقطع خاطئ) استثمارات بقيمة ثلاثة (تصحيح) وثلاثين مليارا (تصحيح).
DeepSeek V4 Pro
جزئي
تحدث إيلون ماسك (تصحيح) مع المشاركين (تصحيح) في مؤتمر الاقتصاد (تصحيح) العالمي وتم إعلان (مقطع خاطئ) استثمارات بقيمة ثلاثة (تصحيح) وثلاثين مليار (مقطع خاطئ).
لماذا المرجع صحيح
تجمع جملة قصيرة واحدة ستة تصويبات: يُكتب اسم إيلون ماسك بالرسم المعياري، ويأخذ الاسم بعد حرف الجر «مع» علامة الجر (الياء والنون لا الواو والنون)، وتبدأ كلمة «الاقتصاد» بألف وصل من غير همزة لأن حركتها الأولى تسقط في الدرج، ويأتي العدد «ثلاثة» بصيغة المؤنث لأن الأعداد من ثلاثة إلى عشرة تخالف المعدود في الجنس، ويُنصب المعدود «مليارًا» تمييزًا بعد العدد المركب، ويفضّل المحرر أيضًا الفعل المبني للمجهول المباشر على تركيب «تم» مع المصدر.
الإملاء (اسم علم)
الإعراب
الإملاء (همزة الوصل)
مطابقة العدد للمعدود
نصب التمييز
معيار تحريري (فعل بدل «تم» والمصدر)
مثال 7
معيار تحريري
معيار تحريري لا خطأ: يفضّل المرجع صيغة المبني للمجهول المباشرة على «تم» مع المصدر، وأبقت النماذج التركيب كما هو التزامًا بتعليمات عدم إعادة الصياغة.
النص الأصلي
تم بناء (مقطع خاطئ) هذا النموذج عام 2024.
المرجع
بني (تصحيح) هذا النموذج عام 2024.
L3
مطابق بعد التطبيع
بُنِي (يختلف عن المرجع في التشكيل أو الرسم فقط) هذا النموذج عام 2024.
Claude Fable 5.1
دون تغيير
تم بناء (مقطع خاطئ) هذا النموذج عام 2024.
Claude Opus 5
دون تغيير
تم بناء (مقطع خاطئ) هذا النموذج عام 2024.
GPT-6 Astra
دون تغيير
تم بناء (مقطع خاطئ) هذا النموذج عام 2024.
GPT-5.6 Sol
دون تغيير
تم بناء (مقطع خاطئ) هذا النموذج عام 2024.
Gemini 3.1 Pro
دون تغيير
تم بناء (مقطع خاطئ) هذا النموذج عام 2024.
DeepSeek V4 Pro
دون تغيير
تم بناء (مقطع خاطئ) هذا النموذج في عام 2024.
لماذا المرجع صحيح
«تم بناء هذا النموذج» تركيب سليم نحويًا، لكن الأسلوب التحريري المعتمد يفضّل المبني للمجهول المباشر «بُني هذا النموذج»؛ وقد منعت التعليمات النماذج من إعادة الصياغة، فهذا اصطلاح أسلوبي يطبّقه المرجع لا خطأ صريح.
معيار تحريري
مثال 8
معيار تحريري
معيار تحريري: يوصي كثير من أدلة الأسلوب العربية بفعل آخر بمعنى «اعتبر»؛ الجملة الأصلية سليمة، وطُلب من النماذج ألا تعيد الصياغة.
النص الأصلي
لطالما اعتبر (مقطع خاطئ) مواطنو الإمارات الكويت وطنًا أخويًا، كما يرى مواطنو الكويت الإمارات امتدادًا طبيعيًا لأنفسهم.
المرجع
لطالما عد (تصحيح) مواطنو الإمارات الكويت وطنًا أخويًا، كما يرى مواطنو الكويت الإمارات امتدادًا طبيعيًا لأنفسهم.
L3
مطابق
لطالما عد (تصحيح) مواطنو الإمارات الكويت وطنًا أخويًا، كما يرى مواطنو الكويت الإمارات امتدادًا طبيعيًا لأنفسهم.
Claude Fable 5.1
دون تغيير
لطالما اعتبر (مقطع خاطئ) مواطنو الإمارات الكويت وطنًا أخويًا، كما يرى مواطنو الكويت الإمارات امتدادًا طبيعيًا لأنفسهم.
Claude Opus 5
دون تغيير
لطالما اعتبر (مقطع خاطئ) مواطنو الإمارات الكويت وطنًا أخويًا، كما يرى مواطنو الكويت الإمارات امتدادًا طبيعيًا لأنفسهم.
GPT-6 Astra
دون تغيير
لطالما اعتبر (مقطع خاطئ) مواطنو الإمارات الكويت وطنًا أخويًا، كما يرى مواطنو الكويت الإمارات امتدادًا طبيعيًا لأنفسهم.
GPT-5.6 Sol
دون تغيير
لطالما اعتبر (مقطع خاطئ) مواطنو الإمارات الكويت وطنًا أخويًا، كما يرى مواطنو الكويت الإمارات امتدادًا طبيعيًا لأنفسهم.
Gemini 3.1 Pro
دون تغيير
طالما اعتبر (مقطع خاطئ) مواطنو الإمارات الكويت وطنا أخويا، كما يرى مواطنو الكويت الإمارات امتدادا طبيعيا لأنفسهم.
DeepSeek V4 Pro
دون تغيير
لطالما اعتبر (مقطع خاطئ) مواطنو الإمارات الكويت وطناً أخوياً، كما يرى مواطنو الكويت الإمارات امتداداً طبيعياً لأنفسهم.
لماذا المرجع صحيح
يرى كثير من أدلة الأسلوب العربية أن «اعتبر» تعني بدقة «اتّعظ» أو «أخذ العبرة»، وتوصي بالفعل «عدّ» بمعنى «رأى» أو «حسب»؛ والجملة الأصلية سليمة، وقد منعت التعليمات النماذج من إعادة الصياغة، فهذا اصطلاح تحريري لا خطأ.
معيار تحريري
يحلّ L3 ثانيًا في معدل المعالجة، بعد Qwen 3.8 27B على Groq
رموز المخرج المصحح الموحدة في الثانية. الأعلى أفضل. زمن الطلب الفعلي من طرف إلى طرف، والمجزّئ نفسه لكل الأنظمة.
معدل معالجة خدمة التصحيح شاملًا عبء الطلب ومعالجة التعليمات، لا معدل فك الترميز الخام. Qwen 3.8 27B على Groq أسرع من L3 ويعرضه المخطط في المرتبة الأولى. عشرة إعدادات معروضة؛ ويسرد الجدول كلها من دون إجمالي الثواني.
السرعة
عالج L3 52.28 رمزًا موحدًا من المخرج في الثانية، بمعدل 1.041 ثانية للجملة المقيسة زمنيًا. وحلّ ثانيًا. فقد كان Qwen 3.8 27B على Groq أسرع، بمعدل 66.98 رمزًا في الثانية و0.828 ثانية للجملة، وهو يحتل الصف الأول من المخطط. وجاء Claude Haiku 4.5 ثالثًا بمعدل 33.43. أما Claude Fable 5.1، أقوى النماذج في الجودة، فعمل بمعدل 15.07 رمزًا في الثانية و3.585 ثانية للجملة. مقيس.
معدل المعالجة هنا هو معدل الخدمة. فلكل مخرج مصحح صالح، طبّقنا مجزّئ Lisan، وجمعنا عدد الرموز الموحدة، وقسمناه على زمن الطلب الفعلي من طرف إلى طرف، فيشمل الرقم عبء الطلب ومعالجة التعليمات لكل الأنظمة على السواء. وهو ليس سرعة فك الترميز، وليس المعدل المشبع بالدفعات المستخدم في قياس الطاقة أدناه؛ فالرقمان يصفان ظرفي تشغيل مختلفين ولا ينبغي مقارنتهما.
ولا يسير معدل المعالجة والجودة معًا بين الأنظمة المقارَنة. فقد حلّ Qwen 3.8 27B على Groq، أسرع الإعدادات، أخيرًا في مقياس التداخل المجموعي القديم بنسبة 75.81%. وعلى الطرف الآخر، بلغ متوسط Gemini 3 Flash 22.399 ثانية للجملة.
تقدير الطاقة للمنظومة الكاملة لـ L3 أقل من القيم المرجعية المستشهد بها للنماذج اللغوية الكبيرة بنحو 29 إلى 3,357 مرة
كيلوواط ساعة لكل 1,000 رمز معالج، مقياس لوغاريتمي: كل خط شبكة عشرة أضعاف سابقه. الأقل أفضل. L3 مقيس؛ والقيم المرجعية تقديرات مستشهد بها.
رقم L3 على نطاق المسرّع قياس مباشر على NVIDIA A10؛ ورقم المنظومة الكاملة يطبّق معامل عبء بثلاثة أضعاف. أما القيم المرجعية فقيم منشورة أو مشتقة لمنظومة الخدمة الكاملة، وهي تقديرات مستشهد بها لا قياسات للنماذج المختبرة عبر واجهاتها البرمجية. الشريط المظلل في صف L3 هو نطاق الحساسية من ضعفين إلى أربعة أضعاف.
الطاقة
قسنا L3 مباشرة على مسرّع NVIDIA A10 بسعة 24 غيغابايت: نسبة استغلال للمسرّع لا تقل عن 95%، وإحماء لمدة 30 ثانية، وحالة مستقرة لمدة 10 دقائق، وأخذ عينات القدرة بتردد 1 هرتز. وبلغ متوسط قدرة وحدة معالجة الرسوميات نحو 100 واط عند نحو 2,000 رمز في الثانية، أي 0.05 جول للرمز، أو نحو 0.000014 كيلوواط ساعة لكل 1,000 رمز. مقيس، على نطاق المسرّع.
يستثني هذا الرقم طاقة المضيف والتبريد والشبكات والتخزين وعبء المنشأة. ولمقارنة المثل بالمثل نضربه في ثلاثة، وهو معامل يقرّب حاصل ضرب 1.5 لفعالية استخدام الطاقة في 1.3 للتكرار والموثوقية في 1.5 لما تبقى من أعباء الخدمة والشبكة الكهربائية، فينتج تقدير للمنظومة الكاملة قدره 0.000042 كيلوواط ساعة لكل 1,000 رمز.
الطاقة لكل 1,000 رمز معالج، وهي القيم المرسومة أعلاه. عمود الواط ساعة هو قيمة الكيلوواط ساعة مضروبة في 1,000 لتُقرأ الأرقام دون أصفار بادئة. L3 مقيس؛ والقيم المرجعية تقديرات مستشهد بها لا قياسات للنماذج المختبرة.
النظام
كيلوواط ساعة لكل 1,000 رمز
واط ساعة لكل 1,000 رمز
نسبةً إلى خط الأساس
الدليل والنطاق
L3
0.000014
0.014
قبل معامل الثلاثة أضعاف
قياس مباشر على NVIDIA A10 بسعة 24 غيغابايت، نطاق المسرّع
L3
0.000042
0.042
1x، خط الأساس
تطبيع للمنظومة الكاملة بثلاثة أضعاف، خط الأساس للمقارنة
Gemini Apps
0.0012
1.2
28.6x
إفصاح Google عن منظومة الخدمة الكاملة، مستشهد به
GPT-4o-mini
0.0061
6.1
145.2x
تقدير IFP School، محوّل خطيًا ومطبّع، مستشهد به
GPT-5 medium
0.074
74
1,761.9x
تقدير IFP School، محوّل خطيًا ومطبّع، مستشهد به
GPT-5 high
0.141
141
3,357.1x
تقدير IFP School، محوّل خطيًا ومطبّع، مستشهد به
أما أرقام النماذج اللغوية الكبيرة فتقديرات مستشهد بها لا قياسات، لأن مزودي الواجهات البرمجية لا يتيحون قياسات للطاقة. فإفصاح Google عن 0.24 واط ساعة لطلب نصي وسيط في Gemini Apps، بافتراض 200 رمز، يعطي 0.0012 كيلوواط ساعة لكل 1,000 رمز، وهو رقم للمنظومة الكاملة أصلًا. وقيم IFP School لكل استعلام، وهي 0.61 واط ساعة لـ GPT-4o-mini و7.4 واط ساعة لـ GPT-5 medium و14.1 واط ساعة لـ GPT-5 high عند 300 رمز، بعد تحويلها خطيًا إلى مقياس 1,000 رمز وضربها في معامل الثلاثة أضعاف نفسه، تعطي 0.0061 و0.074 و0.141 كيلوواط ساعة. وعلى هذا الأساس يقل تقدير المنظومة الكاملة لـ L3 عن القيم المرجعية بنحو 29 إلى 3,357 مرة. وقد رُبطت النماذج المختبرة التي لا رقم منشورًا لها بهذه القيم المرجعية بحسب فئة القدرة على سبيل التقدير الافتراضي؛ وذلك الربط مقارنة، لا قياس لأي نموذج بعينه.
والنتيجة حساسة لمعامل العبء، ولذلك نعرض النطاق لا نقطة الوسط وحدها. فعند الضعفين يكون تقدير L3 هو 0.000028 كيلوواط ساعة، ويكون التفوق على أكثر القيم المرجعية تحفظًا، وهو Gemini Apps، 42.9 مرة. وعند أربعة أضعاف يكون 0.000056 كيلوواط ساعة و21.4 مرة. وعبر هذا النطاق كله يظل L3 أكفأ في الطاقة من أدنى القيم المرجعية بما لا يقل عن 21 مرة. ومقارنة Gemini Apps هي التي ندافع عنها أولًا، لأنها تستند إلى إفصاح من المزود نفسه لا إلى تقدير طرف ثالث.
حساسية تقدير المنظومة الكاملة لـ L3 لمعامل العبء. Gemini Apps أدنى القيم المرجعية المستشهد بها وGPT-5 high أعلاها؛ وأيًّا كان المعامل المختار بين الضعفين وأربعة الأضعاف، يظل L3 أقل من أدنى قيمة مرجعية بما لا يقل عن 21 مرة.
معامل العبء
كيلوواط ساعة لكل 1,000 رمز لـ L3
التفوق على Gemini Apps (0.0012)
التفوق على GPT-5 high (0.141)
2x
0.000028
42.9x
5,036x
3x، المعتمد في التقرير
0.000042
28.6x
3,357x
4x
0.000056
21.4x
2,518x
كيف قيس رقم L3 على نطاق المسرّع، وفق منهجية الطاقة في التقرير.
القياس
القيمة
المسرّع المرجعي
NVIDIA A10 بسعة 24 غيغابايت
نسبة الاستغلال في الحالة المستقرة
لا تقل عن 95%
الإحماء ونافذة القياس
إحماء لمدة 30 ثانية، ثم حالة مستقرة لمدة 10 دقائق
أخذ عينات القدرة
بتردد 1 هرتز خلال نافذة الحالة المستقرة
متوسط قدرة وحدة معالجة الرسوميات
نحو 100 واط
معدل المعالجة المستدام
نحو 2,000 رمز في الثانية، بدفعات مشبعة
الطاقة لكل رمز
0.05 جول
الطاقة لكل 1,000 رمز
50 جول = 0.01389 واط ساعة = 0.0000139 كيلوواط ساعة، ويرد في التقرير بصيغة 0.000014
معامل المنظومة الكاملة
3x، وهو تقريب لحاصل 1.5 (فعالية استخدام الطاقة) × 1.3 (التكرار والموثوقية) × 1.5 (ما تبقى من أعباء الخدمة والشبكة الكهربائية)
المستثنى من نطاق المسرّع
طاقة المضيف والتبريد والشبكات والتخزين وعبء المنشأة
المنهجية
1
بناء المعيار
جُزّئت المادة المصدرية بمجزّئ الجمل المستخدم في المحرك. وراجع خبير لغوي كل جملة، فإما كتب مرجعًا مصححًا، وإما أبقى النص الأصلي كما هو حين لم يلزم تعديل. والنتيجة معيار من جمل عربية حقيقية راجعها خبير لغوي، في أزواج من نص أصلي ومرجع. وبعض الصفوف لا تحمل أي تعديل مرجعي، فيُقاس كل نظام أيضًا على تركه النص الصحيح دون مساس.
2
التعليمات
تلقّى كل نموذج لغوي كبير التعليمات العربية ذاتها المكونة من أربعة أسطر، حرفيًا:
صحح الأخطاء في كل جملة من الجمل التالية إن وجدت.
لا تعد صياغة الجملة أو تحذف من كلماتها فقط صحح الأخطاء الإملائية أو القواعدية بها.
لا تضف التشكيل إلى الكلمات.
إذا لم تجد خطأ، أعد الجملة نفسها تماماً.
قيّدت التعليمات النموذج بالتصحيح الإملائي والنحوي، ومنعت إعادة الصياغة وحذف الكلمات، ومنعت إضافة التشكيل، واشترطت إعادة الجملة الأصلية كما هي عند عدم وجود خطأ.
3
المخرج الواحد
مخرج نهائي واحد مقيّم لكل صف ولكل إعداد. ولم تُستخدم إعادة المحاولة عند أعطال النقل أو التحقق إلا للحصول على استجابة صالحة، لا لحساب متوسط عدة توليدات أو اختيار أفضلها. ولم يُستخدم من L3 إلا التصحيح الأول المقترح، ليطابق مخرجه القيد المفروض على النماذج.
4
توحيد المخرجات
أعادت بعض النماذج تعليقات أو تصريحًا بأن النص صحيح أصلًا. وحددت سلسلة الإعداد هذه الأغلفة وأعادتها إلى الجملة الأصلية حيث لزم، حتى لا تُقيَّم التعليقات تعديلات عربية. ولكل إعداد مخرج نهائي غير فارغ لكل صف؛ ولم يُستبعد أي صف.
5
تقييم المقاطع بحدودها الدقيقة
مقيّم ProofreadingEvaluator المكتوب بلغة Java مدعومًا بـ ArabicWordTokenizer وTextCorrectionExtractor. تُجزّأ الجملة الأصلية والمرجع والمخرج؛ وتُستخرج التعديلات المرجعية (من الأصل إلى المرجع) وتعديلات النظام (من الأصل إلى المخرج)؛ ويُمثَّل كل تعديل بفاصلته الدقيقة في النص الأصلي، والإضافات مواضع صفرية العرض؛ وتُطابَق تعديلات النظام والمرجع بتطابق الحدود في النص الأصلي من غير اشتراط تطابق نوع العملية؛ وتُجمَع حالات الرصد الصحيح والإنذار الكاذب والفائت عبر كل الجمل قبل حساب المقاييس (متوسط جزئي). حيث TP حالات الرصد الصحيح، وFP الإنذارات الكاذبة، وFN التعديلات الفائتة: Precision = TP / (TP + FP)، Recall = TP / (TP + FN)، F1 = 2PR / (P + R)، F0.5 = 1.25PR / (0.25P + R). ولا تُحسب الحالات السلبية الصحيحة، لأن عدد المقاطع غير الخاطئة الممكنة غير محدد جيدًا. ووحدة التقييم مقطع مستخرج من النص الأصلي، لا حرف متغير.
6
دقة التصحيح
تُقاس فقط على حالات الرصد الصحيح. الحرفية تعني تطابق البديل مع بديل المرجع حرفًا بحرف. وبعد التطبيع تُقارَن الصورتان بعد تطبيع عربي يزيل التشكيل والتطويل ويوحّد صور الألف والهمزة والتاء المربوطة.
7
التطابق التام للجملة
نسبة الصفوف التي يطابق مخرجها الكامل المرجع الكامل تمامًا.
8
ROUGE
يُزال التشكيل والتطويل، ويُجزّأ النصان بـ ArabicWordTokenizer. يستخدم ROUGE-1 تداخل الكلمات المفردة بعدّ التكرار؛ ويستخدم ROUGE-L أطول متتابعة رموز مشتركة مع حفظ الترتيب. الدقة والاستدعاء وF1 لكل جملة، بمتوسط كلي.
9
التداخل المجموعي القديم
الرموز المشتركة الفريدة على أطوال قائمتي الرموز كاملتين، بمتوسط كلي لكل جملة. محتفظ به للتتبع، لا مقياسًا رئيسيًا للدقة.
10
معدل المعالجة
لكل مخرج مصحح صالح، يُطبَّق مجزّئ Lisan ويُقسَم عدد الرموز الموحدة المتراكم على زمن الطلب الفعلي من طرف إلى طرف. وهذا معدل معالجة خدمة النص المصحح، ويشمل عبء الطلب ومعالجة التعليمات. وصفّ Qwen 3.8 27B مقيس على عتاد Groq.
11
الطاقة
كيلوواط ساعة لكل 1,000 رمز معالج. قِيس L3 على NVIDIA A10 بسعة 24 غيغابايت في الظروف المذكورة في قسم الطاقة؛ ومعامل المنظومة الكاملة ثلاثة أضعاف؛ والقيم المرجعية من إفصاح Google عن Gemini Apps ومن قيم IFP School لكل استعلام محوَّلة إلى مقياس 1,000 رمز؛ وربط بحسب الفئة للنماذج التي لا رقم منشورًا لها؛ وحساسية من ضعفين إلى أربعة أضعاف من العبء.
12
درجات المنافسين
أُنتج كل رقم للنماذج اللغوية الكبيرة من تشغيل فريق البحث في Lisan لخدمة المزود، مع الاستضافة كما وردت في القائمة. ولم يؤخذ أي رقم من نتائج منشورة لدى المزود.
الأنظمة الخاضعة للاختبار
يضم ميدان المقارنة 26 إعدادًا من النماذج اللغوية الكبيرة من ستة مزودين، إلى جانب L3. وشُغّل GPT-6 Astra بإعدادي استدلال، ولا تحمل ملاحق التقرير إلا صفًا واحدًا له. وفيما يلي التجميع كما ورد في التقرير:
Lisan: L3، محرك Lisan اللغوي، مقيّمًا على اقتراحه الأول فقط.
Anthropic: Claude Opus 5، Claude Sonnet 5، Claude Haiku 4.5، Claude Fable 5.1.
تلقّى كل إعداد الجمل نفسها، والتعليمات نفسها، وقاعدة المخرج الواحد نفسها، والمقيّم نفسه.
الأدلة
الادعاء
النطاق
الحالة
80.29% على F0.5 للتعديلات، الأول بين كل الإعدادات
رصد المقاطع بحدودها الدقيقة، متوسط جزئي، مخرج واحد لكل نظام
مقيس
دقة 84.54% واستدعاء 66.85%؛ النظام الوحيد فوق 80% و60% معًا
البروتوكول نفسه
مقيس
دقة تصحيح 89.79% حرفيًا و96.38% بعد التطبيع
مشروطة برصد صحيح
مقيس
تطابق تام للجملة 55.96%، ضعف نسبة Claude Fable 5.1 البالغة 27.98%
لكل صف، صارم، حرفًا بحرف
مقيس
98.84% على ROUGE-1 F1 و98.83% على ROUGE-L F1
متوسط كلي لكل جملة بعد التطبيع
مقيس
52.28 رمزًا في الثانية، الثاني بعد Qwen 3.8 27B على Groq بمعدل 66.98
معدل الخدمة شاملًا عبء الطلب
مقيس
0.000014 كيلوواط ساعة لكل 1,000 رمز
NVIDIA A10، دفعات مشبعة، نطاق المسرّع
مقيس
0.000042 كيلوواط ساعة لكل 1,000 رمز للمنظومة الكاملة، أقل من القيم المرجعية بنحو 29 إلى 3,357 مرة
معامل ثلاثة أضعاف؛ القيم المرجعية تقديرات مستشهد بها لا قياسات للنماذج المختبرة
مقيس لـ L3، تقديرات مستشهد بها للقيم المرجعية
كل تصحيح مصحوب بشرح؛ ويُنشر المحرك داخل مقر المؤسسة
منتج WriteX
إمكانية في المنتج
القيود
منعت التعليمات إعادة الصياغة، فالصفوف التي يطبّق فيها المرجع اصطلاحًا تحريريًا تميل لصالح المعيار الذي التزمه الخبير اللغوي. تُظهر تلك الصفوف تطبيق L3 لذلك المعيار، لا إخفاق النماذج في النحو. وثمة صفان آخران يخصان قاعدتين معياريتين في اختيار حرف الجر، والاستعمال الذي تخطّئانه شائع في العربية المعاصرة؛ يعدّه المرجع خطأ، وقد يخالفه قارئ متأنٍّ.
القيم المرجعية للطاقة تقديرات مستشهد بها، لا قياسات للنماذج المختبرة عبر واجهاتها البرمجية. ومعامل المنظومة الكاملة بثلاثة أضعاف اختيار التقرير، وقد رُبطت النماذج التي لا رقم منشورًا لها بقيمة مرجعية بحسب فئة القدرة على سبيل التقدير الافتراضي.
يشمل معدل المعالجة عبء الطلب ومعالجة التعليمات، ويعكس منظومة الخدمة لدى كل مزود وقت التشغيل، لا النموذج منفردًا.
هذه لقطة معيار واحدة بتاريخ 9 سبتمبر 2026، بمرجع واحد من خبير لغوي لكل جملة ومخرج واحد لكل نظام. وتتغير واجهات النماذج؛ فالأرقام تصف تلك اللقطة.
صمم فريق البحث في Lisan التقييم ونفّذه. ولم يُتحقق منه بصورة مستقلة. والتعريفات والتعليمات الحرفية وكل النسب منشورة كاملة ليتسنى تكرار البروتوكول على مادة أخرى؛ أما جمل المعيار نفسها فمتاحة للباحثين عند الطلب.
L3 ليس كاملًا. فقد فاتته تعديلات مرجعية، واقترح تغييرات لم يُجرِها الخبير اللغوي؛ وتصف دقة 84.54% واستدعاء 66.85% الجانبين.
الإصدار 1.0 من التقرير. وستُوثَّق التصويبات واللقطات اللاحقة بإصدارات على هذه الصفحة.
النتائج الكاملة
النتائج الكاملة، تاريخ التقييم 9 سبتمبر 2026 · الإصدار 1.0. نسب فقط؛ لا تُنشر أعداد المقاطع ولا إجمالي الثواني. انظر المنهجية.
الملحق أ: نتائج المقاطع بحدودها الدقيقة، كل الإعدادات
كل الصفوف بترتيب F0.5. نسب فقط. الأفضل في العمود
الترتيب
النظام
ملاحظات
الدقة
الاستدعاء
F1
F0.5
التصحيح الحرفي
التصحيح بعد التطبيع
التطابق التام للجملة
1
L3
مخرج واحد، الاقتراح الأول فقط
84.54 (الأفضل في العمود)
66.85 (الأفضل في العمود)
74.66 (الأفضل في العمود)
80.29 (الأفضل في العمود)
89.79 (الأفضل في العمود)
96.38 (الأفضل في العمود)
55.96 (الأفضل في العمود)
2
Claude Fable 5.1
مخرج واحد
64.21
20.15
30.68
44.68
89.07
94.54
27.98
3
Claude Opus 5
مخرج واحد
39.19
30.95
34.58
37.21
86.12
90.39
21.65
4
Gemini 3.5 Flash-Lite
مخرج واحد
43.39
21.70
28.93
36.16
81.73
89.34
24.33
5
Gemini 3.8 Flash
مخرج واحد
33.87
30.18
31.92
33.06
84.67
91.97
16.55
6
GPT-5.6 Terra
مخرج واحد
32.56
32.60
32.58
32.57
85.47
89.53
18.49
7
Gemini 3.1 Pro
مخرج واحد، إصدار معاينة
33.12
28.96
30.90
32.20
87.45
91.25
15.82
8
GPT-6 Astra
مخرج واحد
31.35
34.80
32.99
31.98
85.76
91.46
18.98
9
Gemini 3 Flash
مخرج واحد، إصدار معاينة
31.05
35.02
32.92
31.77
83.65
91.19
19.22
10
Gemini 2.5 Flash
مخرج واحد
34.65
23.24
27.82
31.55
77.73
89.57
18.49
11
DeepSeek V4 Pro
مخرج واحد
31.60
28.08
29.74
30.83
85.88
90.98
16.30
12
GPT-5.6 Luna
مخرج واحد
28.28
36.78
31.98
29.65
86.53
90.72
15.57
13
Claude Sonnet 5
مخرج واحد
29.66
26.10
27.77
28.87
81.86
87.76
15.82
14
DeepSeek V4 Flash
مخرج واحد
28.30
31.17
29.66
28.83
74.91
85.51
15.33
15
GPT-5.1 (medium reasoning)
مخرج واحد
26.61
38.33
31.41
28.34
83.05
87.93
7.06
16
GPT-5.6 Sol
مخرج واحد
25.03
41.08
31.11
27.15
82.84
87.40
10.95
17
GPT-5.4 (high reasoning)
مخرج واحد
24.40
37.22
29.48
26.21
84.02
88.46
7.54
18
Qwen 3.6 27B on Groq
مخرج واحد، على Groq
24.31
24.34
24.33
24.32
76.92
80.54
12.65
19
GPT-4o-mini
مخرج واحد
23.13
26.87
24.86
23.79
76.64
82.38
9.73
20
Gemma 3 27B
مخرج واحد، على Bedrock
21.81
35.02
26.88
23.59
69.18
81.76
5.84
21
Qwen 3.8 27B on Groq
مخرج واحد، على Groq
23.45
22.47
22.95
23.25
72.55
82.35
16.06
22
gpt-oss-120b
مخرج واحد، على Groq
21.74
26.43
23.86
22.54
72.08
77.50
8.76
23
Claude Haiku 4.5
مخرج واحد
20.57
27.20
23.42
21.62
76.52
80.16
7.54
24
Llama 4 Maverick
مخرج واحد
17.10
33.04
22.54
18.93
73.67
78.67
2.68
25
Llama 3.1 70B
مخرج واحد، على Bedrock
16.57
22.91
19.23
17.54
75.48
80.29
7.06
26
Llama 3.3 70B
مخرج واحد
11.27
27.42
15.97
12.77
67.47
72.69
1.70
الملحق ب: ROUGE، كل الإعدادات
مرتبة بحسب ROUGE-1 F1. الأفضل في العمود
الترتيب
النظام
ROUGE-1 P
ROUGE-1 R
ROUGE-1 F1
ROUGE-L P
ROUGE-L R
ROUGE-L F1
1
L3
98.98 (الأفضل في العمود)
98.70 (الأفضل في العمود)
98.84 (الأفضل في العمود)
98.97 (الأفضل في العمود)
98.70 (الأفضل في العمود)
98.83 (الأفضل في العمود)
2
Claude Fable 5.1
96.79
96.38
96.56
96.76
96.35
96.54
3
Gemini 3.1 Pro
96.62
96.35
96.47
96.60
96.33
96.45
4
Gemini 3 Flash
96.51
96.37
96.42
96.47
96.33
96.38
5
Gemini 3.8 Flash
96.52
96.32
96.41
96.49
96.30
96.38
6
GPT-6 Astra
96.51
96.32
96.40
96.47
96.28
96.36
7
Gemini 3.5 Flash-Lite
96.58
96.10
96.32
96.55
96.08
96.30
8
Gemini 2.5 Flash
96.45
96.11
96.27
96.42
96.08
96.24
9
Claude Opus 5
95.98
96.04
95.99
95.93
95.99
95.94
10
GPT-5.6 Terra
95.88
95.85
95.85
95.81
95.77
95.77
11
GPT-5.6 Luna
95.84
95.80
95.80
95.79
95.76
95.76
12
DeepSeek V4 Flash
95.65
95.68
95.65
95.61
95.64
95.61
13
DeepSeek V4 Pro
95.54
95.39
95.44
95.47
95.31
95.37
14
GPT-5.6 Sol
95.24
95.49
95.34
95.16
95.41
95.26
15
GPT-5.1 (medium reasoning)
95.50
95.22
95.34
95.40
95.12
95.24
16
Claude Sonnet 5
95.30
95.07
95.17
95.24
95.02
95.11
17
GPT-5.4 (high reasoning)
94.95
95.16
95.03
94.89
95.10
94.98
18
Qwen 3.8 27B on Groq
95.17
94.86
94.99
95.09
94.79
94.92
19
Qwen 3.6 27B on Groq
94.93
94.52
94.70
94.89
94.48
94.66
20
GPT-4o-mini
95.00
94.21
94.58
94.93
94.13
94.50
21
Gemma 3 27B
94.37
93.72
94.01
94.24
93.60
93.89
22
gpt-oss-120b
94.21
93.75
93.96
94.13
93.67
93.87
23
Claude Haiku 4.5
94.17
93.51
93.81
94.13
93.48
93.78
24
Llama 3.1 70B
94.47
93.08
93.72
94.30
92.91
93.55
25
Llama 4 Maverick
93.89
92.35
93.07
93.79
92.25
92.96
26
Llama 3.3 70B
93.10
89.30
91.07
92.96
89.16
90.93
الملحق ج: التداخل المجموعي القديم، كل الإعدادات
محتفظ به للتتبع، لا مقياسًا رئيسيًا. الأفضل في العمود
الترتيب
النظام
الدقة المجموعية
الاستدعاء المجموعي
F1 المجموعي
1
L3
91.47 (الأفضل في العمود)
91.44 (الأفضل في العمود)
91.45 (الأفضل في العمود)
2
Claude Fable 5.1
89.00
88.89
88.93
3
Gemini 3.1 Pro
88.85
88.86
88.84
4
Gemini 3.8 Flash
88.76
88.82
88.78
5
Gemini 3 Flash
88.73
88.83
88.77
6
GPT-6 Astra
88.66
88.79
88.71
7
Gemini 2.5 Flash
88.73
88.63
88.67
8
Gemini 3.5 Flash-Lite
88.57
88.61
88.58
9
Claude Opus 5
88.08
88.34
88.20
10
GPT-5.6 Luna
87.96
88.10
88.02
11
GPT-5.6 Terra
87.95
88.05
87.99
12
DeepSeek V4 Flash
87.61
87.80
87.64
13
Claude Sonnet 5
87.52
87.54
87.52
14
GPT-5.6 Sol
87.38
87.54
87.45
15
DeepSeek V4 Pro
87.08
87.82
87.33
16
GPT-5.1 (medium reasoning)
87.27
87.34
87.29
17
GPT-5.4 (high reasoning)
87.13
87.27
87.19
18
GPT-4o-mini
86.47
86.58
86.50
19
Qwen 3.6 27B on Groq
86.43
86.79
86.42
20
Gemma 3 27B
86.21
86.13
86.14
21
gpt-oss-120b
85.95
86.08
86.00
22
Claude Haiku 4.5
85.92
86.12
85.99
23
Llama 3.1 70B
84.92
85.11
84.96
24
Llama 4 Maverick
84.41
84.72
84.54
25
Llama 3.3 70B
80.60
81.30
80.92
26
Qwen 3.8 27B on Groq
74.96
77.88
75.81
الملحق د: معدل المعالجة، كل الإعدادات
الترتيب بحسب الرموز في الثانية؛ ويحتفظ Qwen 3.6 27B على Groq وClaude Opus 5 بترتيب التقرير. ولا يُنشر إجمالي الثواني. الأفضل في العمود
الترتيب
النظام
رموز في الثانية
مللي ثانية للرمز
ثوانٍ للجملة
1
Qwen 3.8 27B on Groq
66.98 (الأفضل في العمود)
14.931 (الأفضل في العمود)
0.828 (الأفضل في العمود)
2
L3
52.28
19.128
1.041
3
Claude Haiku 4.5
33.43
29.915
1.619
4
gpt-oss-120b
26.44
37.818
2.022
5
GPT-4o-mini
23.27
42.979
2.319
6
Llama 3.1 70B
23.00
43.485
2.324
7
GPT-5.4 (high reasoning)
22.73
43.993
2.331
8
GPT-5.1 (medium reasoning)
21.67
46.142
2.432
9
DeepSeek V4 Flash
21.16
47.268
2.585
10
DeepSeek V4 Pro
20.71
48.294
2.580
11
GPT-5.6 Terra
16.28
61.417
3.353
12
Gemini 2.5 Flash
16.05
62.298
3.389
13
Claude Fable 5.1
15.07
66.352
3.585
14
Gemma 3 27B
14.56
68.679
3.726
15
GPT-5.6 Luna
12.58
79.482
4.340
16
Claude Sonnet 5
12.29
81.386
4.379
17
GPT-5.6 Sol
8.38
119.350
6.545
18
Gemini 3.1 Pro
8.05
124.234
6.762
19
Qwen 3.6 27B on Groq
7.90
126.561
8.558
20
Claude Opus 5
7.43
134.669
7.221
21
Gemini 3.8 Flash
6.25
159.996
8.720
22
Llama 3.3 70B
5.98
167.334
8.785
23
Llama 4 Maverick
5.53
180.761
9.724
24
GPT-6 Astra
3.93
254.394
13.874
25
Gemini 3.5 Flash-Lite
2.91
343.283
18.663
26
Gemini 3 Flash
2.43
410.775
22.399
الاستشهاد بهذا التقرير
يُرجى الاستشهاد بالتقرير بعنوانه الأصلي، وهو يختلف عن عنوان هذه الصفحة (تبقى الصيغة بالإنجليزية لتوحيد الاستشهاد):
للاستشهاد بهذه الصفحة
Lisan Research (2026). Arabic Language Checking Evaluation: the Lisan Engine and 26 Large Language Model Configurations. Evaluation report, version 1.0, evaluation snapshot 9 September 2026. Lisan. https://lisan.com/company/research/l3/
BibTeX
@techreport{lisan2026l3,
type = {Evaluation report},
author = {Lisan Research},
title = {Arabic Language Checking Evaluation: the Lisan Engine and 26 Large Language Model Configurations},
institution = {Lisan},
year = {2026},
month = sep,
number = {Version 1.0},
note = {Evaluation snapshot 9 September 2026. Published 15 September 2026.},
url = {https://lisan.com/company/research/l3/},
}
دقّق نصوصك بنفسك
المعيار معيارنا؛ أما وثائقك فهي الاختبار الذي يهم. محرر WriteX مجاني في البداية، ويمكن للمؤسسات تشغيل L3 على بنيتها التحتية ضمن مشروع تجريبي، وتُرسل أسئلة المنهجية إلى support@lisan.com.
لأن التغيير غير الضروري في التدقيق اللغوي يكلّف عادةً أكثر من التعديل الفائت: فلا بد من مراجعته ورفضه، وربما التراجع عنه يدويًا. ويرجّح F0.5 الدقة على الاستدعاء تعبيرًا عن ذلك. وننشر F1 والدقة والاستدعاء أيضًا، ويتصدر L3 المقاييس الأربعة كلها، فاختيار المقياس الرئيسي لا يغيّر الترتيب في القمة.
هل تُحقق من هذا التقييم بصورة مستقلة؟
لا. فقد صممه فريق البحث في Lisan ونفّذه. وما نقدّمه بدلًا من ذلك هو المنهجية كاملة: التعليمات الحرفية، وقاعدة المخرج الواحد، وتعريفات تقييم المقاطع بحدودها الدقيقة، وخطوات التطبيع، وكل نسبة في الملاحق. ويمكن لأي جهة تملك مجموعة عربية راجعها خبير لغوي أن تكرر البروتوكول، ومحرر WriteX متاح مجانًا لهذا الغرض.
لماذا تسجّل النماذج اللغوية الكبيرة استدعاءً منخفضًا؟
تظهر أسباب عدة في الصفوف. فالتقييم صارم: لا يحصل النموذج على نقطة إلا إذا غيّر المقطع الذي غيّره الخبير اللغوي بالضبط، وقد يُعدّ تغيير علامة الترقيم مقطعًا مستقلًا. ومنعت التعليمات إعادة الصياغة والتشكيل، فتُركت صفوف المعيار التحريري والقواعد الكلاسيكية، مثل مواضع الهمزة داخل المصطلحات التقنية الشائعة، في الغالب من غير مساس. وتختلف الملامح: غيّر Claude Fable 5.1 قليلًا وأصاب غالبًا، بينما غيّر GPT-5.6 Sol كثيرًا وأخطأ غالبًا. واستدعاء 20.15% و41.08% هما طرفا ذلك النطاق.
هل تعني نسبة 96.38% أن دقة L3 هي 96%؟
لا. فتلك النسبة مشروطة: من بين المقاطع التي حددها L3 تحديدًا صحيحًا، حمل 96.38% منها البديل الصحيح بعد التطبيع العربي. وكان استدعاؤه 66.85%، وتطابقه الصارم على مستوى الجملة كاملة 55.96%. فاقرأ الأرقام الثلاثة معًا.
على ماذا تستند مقارنة الطاقة؟
رقم L3 قياس مباشر على NVIDIA A10 مع تطبيق معامل منظومة كاملة بثلاثة أضعاف. أما أرقام النماذج اللغوية الكبيرة فقيم مرجعية مستشهد بها: إفصاح Google عن Gemini Apps وتقديرات IFP School لكل استعلام، محوَّلة إلى مقياس 1,000 رمز. وهي ليست قياسات للنماذج المختبرة عبر واجهاتها البرمجية، ونعرض نطاق الحساسية من ضعفين إلى أربعة أضعاف ليرى القارئ مقدار أثر المعامل.