تقنيات التقييم الرقمي

القياس النفسي للأسئلة: معامل السهولة ومعامل التمييز وكيف تقرأهما

رقمان يكشفان جودة أي سؤال خلال ثوانٍ — ومثال محسوب يُظهر سؤالاً بمعامل سهولة مثالي يخفي خللاً جوهرياً.

القياس النفسي للأسئلة: معامل السهولة ومعامل التمييز
تحليل القياس النفسي وتوزيع إجابات الطلاب والتمييز بين الأسئلة في منصة EvaliX.

القياس النفسي للأسئلة: معامل السهولة ومعامل التمييز وكيف تقرأهما

في نهاية كل فصل دراسي يتكرر النقاش نفسه في مجالس الأقسام: طالب يعترض على سؤال، وعضو هيئة التدريس يدافع عنه، ورئيس القسم يبحث عن أساس يحسم به الخلاف. وفي أغلب الحالات ينتهي النقاش إلى انطباعات: «السؤال واضح»، «الطلاب لم يذاكروا»، «الصياغة فيها لبس».

المفارقة أن الحسم متاح ولا يحتاج إلى خبير قياس. رقمان يُحسبان من بيانات الاختبار نفسه — معامل السهولة ومعامل التمييز — يكفيان لتحويل الخلاف من انطباع إلى دليل. وثالث، هو تحليل البدائل، يخبرك غالباً لماذا اختلّ السؤال، لا أنه اختلّ فقط.

هذا المقال يشرح كيف يُحسب كل مؤشر، وكيف يُقرأ، وأين يخطئ الناس في تفسيره، مع مثال محسوب من دفعة حقيقية الحجم، ومصفوفة قرار تصلح لأن تُعتمد داخل القسم، وخمسة تحذيرات تمنعك من إعدام سؤال سليم.

أبرز النقاط

  • معامل السهولة يقيس كم أجاب بشكل صحيح؛ معامل التمييز يقيس من أجاب بشكل صحيح. الثاني أهم بكثير، ومع ذلك أقل استخداماً.
  • الصعوبة ليست فضيلة. السؤال الذي يخطئ فيه الجميع لا يقيس شيئاً، تماماً كالسؤال الذي يصيبه الجميع.
  • معامل التمييز السالب هو أخطر مؤشر في التقرير كله، ويعني في معظم الحالات خطأً في مفتاح الإجابة أو غموضاً في الصياغة — لا ضعفاً في الطلاب.
  • البديل الذي لا يختاره أحد لا يزيد صعوبة السؤال، بل يقلّص عدد البدائل الفعلية ويرفع أثر التخمين.
  • المؤشرات أدوات فحص لا أحكام نهائية؛ اقرأها في ضوء حجم العينة وطبيعة الاختبار قبل أن تتخذ قراراً.

لماذا لا يكفي حدس المؤلف؟

حين يضع عضو هيئة التدريس علامة «صعب» على سؤال أثناء التأليف، فهو يقدّر صعوبته من موقع من يعرف الإجابة. هذا التقدير أقرب إلى تخمين مدروس منه إلى قياس، وتُظهر بيانات أي بنك أسئلة نشط أن كثيراً من الأسئلة المصنّفة «صعبة» يجيب عنها الطلاب بسهولة، والعكس صحيح.

الفرق أن المؤشرات النفسية تُحسب من سلوك المتعلمين الفعلي، لا من انطباع المؤلف. وهذا يعني أن قيمتها تتراكم: كلما استُخدم السؤال في اختبارات أكثر، صار تقديره أدق.

معامل السهولة (Facility Index)

كيف يُحسب

نسبة الطلاب الذين أجابوا عن السؤال إجابة صحيحة:

p = عدد الإجابات الصحيحة ÷ عدد الطلاب

قيمته بين 0 و1. سؤال بمعامل 0.85 أجاب عنه 85% بشكل صحيح، أي أنه سهل. لاحظ المفارقة اللغوية: كلما ارتفع الرقم قلّت الصعوبة، وهذا مصدر التباس متكرر في المجالس.

كيف يُقرأ

المدى القراءة الإجراء المعتاد
أعلى من 0.90 سهل جداً يصلح للتمهيد أو للتقييم التكويني، لا للتمييز
0.40 – 0.80 المدى المنتج احتفظ به
0.20 – 0.40 صعب راجعه، وقد يبقى إن كان يميّز جيداً
أقل من 0.20 صعب جداً افحص المفتاح والصياغة قبل أي شيء

في أسئلة الاختيار من متعدد، انتبه إلى أرضية التخمين: في سؤال بأربعة بدائل، الطالب الذي لا يعرف شيئاً يصيب بنسبة 25%. لذلك فإن معامل سهولة قريب من 0.25 لا يعني أن السؤال «صعب جداً»، بل قد يعني أن الطلاب يخمّنون — وهو تشخيص مختلف تماماً.

الخطأ الشائع

اعتبار الصعوبة دليلاً على الجودة أو على «رفع المستوى». السؤال الذي يخطئ فيه 95% من الطلاب لا يفرّق بين طالب متمكّن وآخر غير متمكّن؛ الجميع خطأ. وهو من الناحية القياسية سؤال لا يحمل معلومة، مهما بدا رصيناً.

معامل التمييز (Discrimination Index)

هذا هو المؤشر الذي يجيب عن السؤال الحقيقي: هل يفرّق هذا السؤال بين من تعلّم ومن لم يتعلّم؟

الطريقة الأولى: مقارنة الفئتين

رتّب الطلاب حسب درجتهم الكلية، ثم خذ الشريحة العليا والشريحة الدنيا (يشيع استخدام 27% من كل طرف، وهو اختيار إحصائي يوازن بين حجم العينة ووضوح التباين):

D = نسبة الصحيح في الفئة العليا − نسبة الصحيح في الفئة الدنيا

قيمته بين −1 و+1.

الطريقة الثانية: الارتباط ثنائي التسلسل النقطي

معامل ارتباط بين الأداء في السؤال الواحد والدرجة الكلية. أدقّ من طريقة الفئتين لأنه يستخدم بيانات جميع الطلاب لا الأطراف فقط، وهو ما تحسبه الأنظمة الحديثة افتراضياً. القراءة العملية: قيمة 0.30 فأعلى جيدة، وما دون 0.15 يستدعي المراجعة.

ملاحظة تقنية: في الاختبارات القصيرة يجب استخدام الارتباط المصحّح — أي بعد استبعاد درجة السؤال نفسه من الدرجة الكلية — وإلا فإن السؤال يرتبط بنفسه ويُظهر تمييزاً مضخّماً.

كيف يُقرأ

المدى القراءة الإجراء
0.40 فأعلى تمييز ممتاز احتفظ به كما هو
0.30 – 0.39 تمييز جيد احتفظ به، وحسّن البدائل إن أمكن
0.20 – 0.29 تمييز حدّي يحتاج مراجعة
أقل من 0.20 تمييز ضعيف راجعه جذرياً أو أخرجه
قيمة سالبة إنذار أوقفه فوراً وافحص المفتاح

المعامل السالب يعني أن المتفوقين أخطأوا في السؤال أكثر من المتعثرين. هذا لا يحدث صدفة. الاحتمالات الثلاثة بالترتيب: خطأ في مفتاح الإجابة، أو صياغة تحمل معنيين يلتقط الطالب المتمكّن أعقدهما، أو سؤال يكافئ حفظاً سطحياً ويعاقب الفهم العميق.

لماذا يرتبط الرقمان ببعضهما؟

هناك قيد رياضي يغيب عن كثيرين: معامل التمييز مقيّد بمعامل السهولة. إذا أجاب جميع الطلاب إجابة صحيحة (p = 1.0)، فإن نسبة الصحيح في الفئة العليا تساوي نسبتها في الدنيا، ويصبح التمييز صفراً حتماً. الأمر نفسه إذا أخطأ الجميع.

أي أن التمييز يبلغ أقصاه حين يكون معامل السهولة في المنطقة الوسطى. ولهذا لا يُقرأ الرقمان منفصلين أبداً: سؤال بمعامل سهولة 0.95 وتمييز 0.05 ليس سؤالاً «سيئ التمييز»، بل سؤال سهل جداً لم يُترك له مجال ليميّز.

تحليل البدائل: أين يقع الخلل بالضبط

المؤشران السابقان يقولان إن السؤال معتلّ. توزيع اختيارات البدائل يقول لماذا.

  • البديل الميت: بديل يختاره أقل من 5% من الطلاب. لا يؤدي وظيفته، والسؤال عملياً صار بثلاثة بدائل بدل أربعة — وهو ما يرفع أرضية التخمين من 25% إلى 33%.
  • البديل الجاذب أكثر من المفتاح: إذا اختار الطلاب بديلاً خاطئاً بنسبة تفوق المفتاح، فأنت أمام أحد أمرين: خطأ في المفتاح، أو مفهوم بديل شائع لدى الدفعة يستحق أن يُدرّس صراحةً. كلاهما معلومة ثمينة.
  • بديل يفضّله المتفوقون: إذا كان بديل خاطئ يجذب الفئة العليا أكثر من الدنيا، فالمشكلة في دقة الصياغة لا في الطلاب.

مثال محسوب: ثلاثة أسئلة من دفعة 200 طالب

الفئة العليا والدنيا = 54 طالباً لكل منهما (27%).

السؤال 14 — نموذج سليم 120 إجابة صحيحة من 200، فمعامل السهولة 0.60. الفئة العليا: 48 صحيحة من 54 (0.89). الفئة الدنيا: 16 من 54 (0.30). إذاً D = 0.89 − 0.30 = 0.59. سؤال في المنطقة المنتجة وبتمييز ممتاز. أبقِه ولا تلمسه.

السؤال 7 — إنذار أحمر 84 صحيحة من 200، معامل السهولة 0.42 — رقم يبدو مثالياً للوهلة الأولى. لكن الفئة العليا: 19 من 54 (0.35)، والفئة الدنيا: 26 من 54 (0.48). إذاً D = −0.13. معامل سهولة سليم يخفي خللاً جوهرياً. هذا السؤال يجب إيقافه ومراجعة مفتاحه قبل اعتماد النتائج. وهو بالضبط السبب في أن معامل السهولة وحده لا يكفي.

السؤال 22 — بدائل معتلّة توزيع الاختيارات: المفتاح (أ) 42%، البديل (ب) 51%، البديل (ج) 5%، البديل (د) 2%. البديل (ب) يجذب أكثر من المفتاح نفسه — راجع المفتاح أولاً. وإن ثبت أن المفتاح صحيح، فأنت اكتشفت مفهوماً بديلاً يتقاسمه نصف الدفعة، وهذه نتيجة تعليمية أهم من الدرجة. أما (ج) و(د) فبديلان ميتان يجب استبدالهما.

مصفوفة قرار للقسم

اعتمد هذه القاعدة كسياسة مكتوبة، لا كاجتهاد فردي:

  1. معامل تمييز سالب ← أوقف السؤال فوراً، وراجع المفتاح، وأعد احتساب درجات الدفعة إن ثبت الخطأ.
  2. تمييز 0.40 فأعلى ومعامل سهولة بين 0.40 و0.80 ← معتمد. أدرجه في النواة الثابتة لبنك الأسئلة.
  3. تمييز بين 0.20 و0.39 ← مراجعة البدائل. غالباً الإصلاح في البدائل لا في متن السؤال.
  4. معامل سهولة أعلى من 0.90 ← انقله إلى الاختبارات التكوينية، أو أبقِه كسؤال تمهيدي مقصود في بداية الاختبار.
  5. معامل سهولة أقل من 0.20 ← افحص بالترتيب: المفتاح، ثم الصياغة، ثم تغطية المحتوى في التدريس. الاحتمال الثالث ليس عيباً في السؤال بل معلومة عن المقرر.
  6. أي تعديل ← يُحفظ كإصدار جديد للسؤال، ولا يُكتب فوق الإصدار المستخدم في اختبارات سابقة.

خمسة تحذيرات قبل أن تحكم على سؤال

1. حجم العينة. المؤشرات المحسوبة على 20 طالباً غير مستقرة. اعتبرها إشارة أولية فقط، ولا تبنِ قرار حذف على أقل من 50 استجابة، والأفضل 100 فأكثر.

2. طبيعة الاختبار. في اختبارات الإتقان — حيث المفترض أن يتجاوز الجميع حداً معيّناً — ارتفاع معامل السهولة نتيجة مطلوبة لا خلل. والتمييز في هذه الحالة يكون منخفضاً بحكم قلة التباين، وهذا متوقع.

3. دائرية المحك. معامل التمييز يقارن السؤال بالدرجة الكلية للاختبار. فإذا كان الاختبار ككل ضعيف البناء، صار المحك نفسه غير موثوق. لذا تُقرأ مؤشرات الأسئلة بعد التأكد من ثبات الاختبار إجمالاً.

4. توقيت السؤال. سؤال في آخر اختبار مضغوط زمنياً قد يظهر بمعامل سهولة منخفض لأن الطلاب لم يصلوا إليه، لا لأنه صعب. افحص نسبة من لم يجيبوا إطلاقاً قبل الحكم.

5. المؤشر ليس حكماً. هذه أدوات فحص توجّه انتباه المراجع البشري إلى الأسئلة التي تستحق النظر. القرار النهائي بإبقاء سؤال أو إخراجه يبقى قراراً أكاديمياً يتخذه القسم.

ما الذي يتطلبه هذا من النظام؟

قراءة هذه المؤشرات يدوياً بعد كل اختبار غير واقعية في مؤسسة بعشرات المقررات. لتصبح ممارسة مستمرة، يحتاج النظام إلى:

  • حساب المؤشرات تلقائياً من البيانات الحية بعد كل تطبيق، لا الاعتماد على تصنيف صعوبة يدوي.
  • تراكم القيم عبر التطبيقات المتعددة للسؤال الواحد بدل حسابها من اختبار واحد فقط.
  • إبراز الأسئلة المعتلّة تلقائياً في لوحة القسم بدل انتظار من يبحث عنها.
  • ربط أي تعديل بدورة إصدارات تحفظ سلامة التقارير التاريخية.
  • إعادة احتساب درجات الدفعة كاملة في عملية واحدة موثوقة عند تصحيح مفتاح.

كيف تعالج EvaliX هذا

تحسب EvaliX معامل السهولة ومعامل التمييز لكل سؤال تلقائياً من الاستجابات الفعلية، وتراكم القيم عبر كل تطبيق للسؤال بدل الاكتفاء بلقطة اختبار واحد. وتعرض لوحة القسم الأسئلة المعتلّة — التمييز السالب، والبدائل الميتة، والبدائل التي تفوق المفتاح جاذبية — دون أن يبحث عنها أحد.

وحين يُصحَّح مفتاح إجابة، يشغّل النظام إعادة احتساب ذرّية لدرجات الدفعة كاملة، ويحفظ التعديل كإصدار جديد للسؤال، فتبقى التقارير السابقة سليمة كما صدرت.

اطلب عرضاً توضيحياً لتشاهد تقرير تحليل الفقرات على بيانات اختبار من مؤسستك.

الأسئلة الشائعة

كم عدد الطلاب اللازم لحساب هذه المؤشرات؟

لا يوجد حد قاطع، لكن القيم تصبح مستقرة بشكل مقبول عند 100 استجابة فأكثر. بين 50 و100 تُقرأ كإشارة تستدعي النظر، وأقل من 50 تُعامل كمؤشر أولي لا يُبنى عليه قرار حذف.

هل تنطبق هذه المؤشرات على الأسئلة المقالية؟

معامل التمييز نعم، بصيغته الارتباطية، لأنه يعمل مع الدرجات المتدرجة لا الثنائية فقط. أما معامل السهولة فيُستبدل بمتوسط الدرجة على السؤال منسوباً إلى درجته العظمى. وتحليل البدائل لا ينطبق بطبيعته، ويُستعاض عنه بتحليل توزيع الدرجات على معيار التقدير.

سؤال معامل تمييزه ممتاز لكنه لا يقيس مخرج تعلم مهم — هل أبقيه؟

لا. المؤشرات النفسية تقيس كفاءة السؤال إحصائياً، لا صدقه المحتوائي. سؤال ممتاز التمييز يقيس مخرجاً هامشياً يزيد ثبات الاختبار ويضعف صدقه. المواءمة مع مخرجات التعلم شرط سابق على التحليل الإحصائي لا بديل عنه.