المشاريع
    بيانات مفتوحة · CC BY 4.0

    قائمة تلوث TurkishMMLU

    أسئلة اختبار موجودة حرفيًا على الويب التركي

    113 من أسئلة مجموعة اختبار TurkishMMLU الـ900 (12.6%) تظهر حرفيًا في متن ويب تركي يضم 527 مليون كلمة. يحتوي هذا المستودع على قائمة تلك الأسئلة وطريقة الكشف وسكربت إعادة الإنتاج، لكي تتمكن النماذج المدرَّبة على نصوص الويب التركية من الإبلاغ عن درجة TurkishMMLU على مجموعة فرعية منقّاة أيضًا.

    0 / 900

    أسئلة ملوّثة · العتبة الصارمة (n = 13)

    12.6% من مجموعة الاختبار · المتن الممسوح: 526,593,877 كلمة

    900
    الأسئلة الممسوحة
    787
    أسئلة نظيفة (n = 13)
    28.0%
    العتبة المتساهلة (n = 8)
    527M
    المتن (كلمات)
    13 / 8
    النوافذ (كلمات)
    CC BY 4.0
    الترخيص
    لماذا يهم

    الحفظ ليس قدرة

    إذا ورد سؤال معياري حرفيًا في متن التدريب، فإن معرفة النموذج به حفظٌ لا قدرة. هذا الخطر قائم في كل متن مجموع من الويب التركي؛ فمعظم الأسئلة مصدرها مواقع الكتب المدرسية والامتحانات التجريبية، ولذلك توجد نسخ منها على الويب.

    الأثر في قياسنا الخاص

    ثلث المكسب المبلَّغ عنه كان من التلوث

    كل الأسئلة الـ900
    +6.27
    بعد إزالة الأسئلة الملوّثة
    +4.14

    قيس مكسب نموذج تدريب مستمر عن أساسه بـ+6.27 نقطة على الأسئلة الـ900 كلها، و+4.14 نقطة بعد إزالة الأسئلة الملوّثة.

    الطريقة

    مطابقة تامة لنوافذ من n كلمة

    المعيار نفسه المستخدم في التقارير التقنية لـGPT-3 وLlama.

    01

    التطبيع

    يُطبَّع نص السؤال: NFC، أحرف تركية صغيرة (İ→i وI→ı)، تُستبدل علامات الترقيم والأحرف غير الرقمية بمسافات، ثم يُقسَّم إلى كلمات.

    02

    النوافذ

    تُستخرج من كل سؤال جميع النوافذ المتتالية ذات n كلمة؛ تؤخذ النوافذ من نص السؤال والخيارات (حتى 5 خيارات).

    03

    المسح

    يُبثّ المتن بالتطبيع نفسه؛ وإذا وردت أي نافذة حرفيًا في المتن عُدّ السؤال ملوّثًا. استهلاك الذاكرة مستقل عن حجم المتن.

    العتبةالمعنىملوّثالنسبة
    n = 13صارمةالتطابق بالمصادفة شبه مستحيل؛ المعيار القياسي.11312.6%
    n = 8متساهلةحساسة للتسرّب الجزئي أو المُعاد صياغته؛ إيجابيات خاطئة محتملة (جمل نمطية).25228.0%

    المتن الممسوح: 526,593,877 كلمة من نص ويب تركي (أول 4.3 GB بترتيب البث). مفتاح الإجابة ليس نصًا ولا يُمسح. القائمة حدّ أدنى: الأسئلة المُعاد صياغتها أو المتسرّبة في أجزاء أقصر من 13 كلمة تفلت من العتبة الصارمة.

    توزيع المواد

    الأسئلة الملوّثة بحسب المادة

    n = 13 · 113 سؤالًا

    الثقافة الدينية والأخلاق
    26
    الفيزياء
    22
    الأحياء
    19
    الكيمياء
    15
    التاريخ
    15
    اللغة التركية وآدابها
    10
    الفلسفة
    3
    الجغرافيا
    3
    صيغة القائمة

    فهرس وبصمة فقط

    يحمل كل سجل الموضع في مجموعة البيانات المصدر، وبصمة SHA-256 لنص السؤال، ووسم المادة. حتى لو تغيّر ترتيب المجموعة يمكن مطابقة السؤال بالبصمة.

    index

    الموضع في Hugging Face AYueksel/TurkishMMLU، إعداد All، تقسيم test.

    sha256_soru

    بصمة SHA-256 لحقل question (بعد strip، بترميز UTF-8).

    konu

    وسم المادة من مجموعة البيانات المصدر.

    لا يوجد نص أسئلة في هذا المستودع. TurkishMMLU مجموعة بيانات ذات وصول مقيّد؛ وتحمل هذه القائمة الفهارس والبصمات فقط، ومن لديه وصول إلى المجموعة يطابق بالبصمة ويجد السؤال في نسخته.
    turkishmmlu_kirlilik.json
    {
      "kaynak_kume": "AYueksel/TurkishMMLU (config All, split test)",
      "taranan_soru": 900,
      "kulliyat_kelime": 526593877,
      "kirli_13": [
        {"index": 0, "sha256_soru": "e84db08c…", "konu": "Biology"},
        …
      ],
      "kirli_8": [ … ]
    }
    الاستخدام

    اشتقّ المجموعة النظيفة في ثلاث خطوات

    حمّل القائمة، طابق البصمات مع المجموعة، رشّح الأسئلة الملوّثة: 900 → 787.

    python · datasets
    import json, hashlib
    from datasets import load_dataset
    
    ds = load_dataset("AYueksel/TurkishMMLU", "All", split="test")
    k = json.load(open("turkishmmlu_kirlilik.json", encoding="utf-8"))
    kirli = {r["sha256_soru"] for r in k["kirli_13"]}
    
    def ozet(q): return hashlib.sha256(q.strip().encode("utf-8")).hexdigest()
    temiz = ds.filter(lambda ex: ozet(ex["question"]) not in kirli)
    print(len(ds), "->", len(temiz))   # 900 -> 787
    الإبلاغ الموصى به

    إلى جانب الدرجة على المجموعة الكاملة، أبلغ عن درجة النظيف-787 والفرق بينهما. الفرق الكبير يعني أن متن النموذج رأى هذه الأسئلة.

    إعادة الإنتاج
    $ python kirlilik_denetimi.py <kulliyat.txt> <etiket>
    امسح متنك الخاص

    يبثّ السكربت المتن سطرًا سطرًا. إذا مسحت متنك الخاص فستختلف قائمتك عن قائمتنا: قد يغيب سؤال من هذه القائمة عن متنك، وقد يوجد فيه سؤال ليس فيها.

    الحدود

    القيود المعروفة

    01

    القائمة نسبية إلى متننا. النموذج المدرَّب على شريحة أخرى من الويب التركي تلوثه مختلف؛ لكن المصادر نفسها موجودة في كل شريحة، فسيكون التداخل عاليًا.

    02

    مُسح نص الأسئلة والخيارات؛ أما مفتاح الإجابة فليس نصًا ولا يمكن مسحه. النسخ المُعاد صياغتها تفلت من العتبة الصارمة؛ والقائمة حدّ أدنى.

    03

    العتبة الصارمة n = 13 تفوّت النسخ المُعاد صياغتها؛ ولهذا تُقدَّم قائمة n = 8، لكنها تحوي إيجابيات خاطئة.

    04

    إذا تغيّر ترتيب المجموعة المصدر يصبح index غير صالح؛ استخدم sha256_soru.

    الاستشهاد

    إذا استخدمت هذه القائمة

    citation
    eCloud Tech. (2026). TurkishMMLU Kirlilik Listesi: Türkçe web külliyatında
    birebir geçen test soruları. https://github.com/ecloudtechnology/turkishmmlu-kirlilik

    الترخيص: القائمة والسكربت CC BY 4.0. لـTurkishMMLU نفسه: Yüksel, A. وآخرون (2024), TurkishMMLU. للتواصل: [email protected]

    أبلغ عن درجة TurkishMMLU على المجموعة النظيفة أيضًا

    القائمة وسكربت المسح مفتوحان بترخيص CC BY 4.0. تواصل معنا للتعاون في القياس المعياري والتقييم للغة التركية.