قائمة تلوث TurkishMMLU
أسئلة اختبار موجودة حرفيًا على الويب التركي
113 من أسئلة مجموعة اختبار TurkishMMLU الـ900 (12.6%) تظهر حرفيًا في متن ويب تركي يضم 527 مليون كلمة. يحتوي هذا المستودع على قائمة تلك الأسئلة وطريقة الكشف وسكربت إعادة الإنتاج، لكي تتمكن النماذج المدرَّبة على نصوص الويب التركية من الإبلاغ عن درجة TurkishMMLU على مجموعة فرعية منقّاة أيضًا.
أسئلة ملوّثة · العتبة الصارمة (n = 13)
12.6% من مجموعة الاختبار · المتن الممسوح: 526,593,877 كلمة
الحفظ ليس قدرة
إذا ورد سؤال معياري حرفيًا في متن التدريب، فإن معرفة النموذج به حفظٌ لا قدرة. هذا الخطر قائم في كل متن مجموع من الويب التركي؛ فمعظم الأسئلة مصدرها مواقع الكتب المدرسية والامتحانات التجريبية، ولذلك توجد نسخ منها على الويب.
ثلث المكسب المبلَّغ عنه كان من التلوث
قيس مكسب نموذج تدريب مستمر عن أساسه بـ+6.27 نقطة على الأسئلة الـ900 كلها، و+4.14 نقطة بعد إزالة الأسئلة الملوّثة.
مطابقة تامة لنوافذ من n كلمة
المعيار نفسه المستخدم في التقارير التقنية لـGPT-3 وLlama.
التطبيع
يُطبَّع نص السؤال: NFC، أحرف تركية صغيرة (İ→i وI→ı)، تُستبدل علامات الترقيم والأحرف غير الرقمية بمسافات، ثم يُقسَّم إلى كلمات.
النوافذ
تُستخرج من كل سؤال جميع النوافذ المتتالية ذات n كلمة؛ تؤخذ النوافذ من نص السؤال والخيارات (حتى 5 خيارات).
المسح
يُبثّ المتن بالتطبيع نفسه؛ وإذا وردت أي نافذة حرفيًا في المتن عُدّ السؤال ملوّثًا. استهلاك الذاكرة مستقل عن حجم المتن.
| العتبة | المعنى | ملوّث | النسبة |
|---|---|---|---|
| n = 13صارمة | التطابق بالمصادفة شبه مستحيل؛ المعيار القياسي. | 113 | 12.6% |
| n = 8متساهلة | حساسة للتسرّب الجزئي أو المُعاد صياغته؛ إيجابيات خاطئة محتملة (جمل نمطية). | 252 | 28.0% |
المتن الممسوح: 526,593,877 كلمة من نص ويب تركي (أول 4.3 GB بترتيب البث). مفتاح الإجابة ليس نصًا ولا يُمسح. القائمة حدّ أدنى: الأسئلة المُعاد صياغتها أو المتسرّبة في أجزاء أقصر من 13 كلمة تفلت من العتبة الصارمة.
الأسئلة الملوّثة بحسب المادة
n = 13 · 113 سؤالًا
فهرس وبصمة فقط
يحمل كل سجل الموضع في مجموعة البيانات المصدر، وبصمة SHA-256 لنص السؤال، ووسم المادة. حتى لو تغيّر ترتيب المجموعة يمكن مطابقة السؤال بالبصمة.
indexالموضع في Hugging Face AYueksel/TurkishMMLU، إعداد All، تقسيم test.
sha256_soruبصمة SHA-256 لحقل question (بعد strip، بترميز UTF-8).
konuوسم المادة من مجموعة البيانات المصدر.
{
"kaynak_kume": "AYueksel/TurkishMMLU (config All, split test)",
"taranan_soru": 900,
"kulliyat_kelime": 526593877,
"kirli_13": [
{"index": 0, "sha256_soru": "e84db08c…", "konu": "Biology"},
…
],
"kirli_8": [ … ]
}اشتقّ المجموعة النظيفة في ثلاث خطوات
حمّل القائمة، طابق البصمات مع المجموعة، رشّح الأسئلة الملوّثة: 900 → 787.
import json, hashlib
from datasets import load_dataset
ds = load_dataset("AYueksel/TurkishMMLU", "All", split="test")
k = json.load(open("turkishmmlu_kirlilik.json", encoding="utf-8"))
kirli = {r["sha256_soru"] for r in k["kirli_13"]}
def ozet(q): return hashlib.sha256(q.strip().encode("utf-8")).hexdigest()
temiz = ds.filter(lambda ex: ozet(ex["question"]) not in kirli)
print(len(ds), "->", len(temiz)) # 900 -> 787إلى جانب الدرجة على المجموعة الكاملة، أبلغ عن درجة النظيف-787 والفرق بينهما. الفرق الكبير يعني أن متن النموذج رأى هذه الأسئلة.
$ python kirlilik_denetimi.py <kulliyat.txt> <etiket>يبثّ السكربت المتن سطرًا سطرًا. إذا مسحت متنك الخاص فستختلف قائمتك عن قائمتنا: قد يغيب سؤال من هذه القائمة عن متنك، وقد يوجد فيه سؤال ليس فيها.
القيود المعروفة
القائمة نسبية إلى متننا. النموذج المدرَّب على شريحة أخرى من الويب التركي تلوثه مختلف؛ لكن المصادر نفسها موجودة في كل شريحة، فسيكون التداخل عاليًا.
مُسح نص الأسئلة والخيارات؛ أما مفتاح الإجابة فليس نصًا ولا يمكن مسحه. النسخ المُعاد صياغتها تفلت من العتبة الصارمة؛ والقائمة حدّ أدنى.
العتبة الصارمة n = 13 تفوّت النسخ المُعاد صياغتها؛ ولهذا تُقدَّم قائمة n = 8، لكنها تحوي إيجابيات خاطئة.
إذا تغيّر ترتيب المجموعة المصدر يصبح index غير صالح؛ استخدم sha256_soru.
إذا استخدمت هذه القائمة
eCloud Tech. (2026). TurkishMMLU Kirlilik Listesi: Türkçe web külliyatında birebir geçen test soruları. https://github.com/ecloudtechnology/turkishmmlu-kirlilik
الترخيص: القائمة والسكربت CC BY 4.0. لـTurkishMMLU نفسه: Yüksel, A. وآخرون (2024), TurkishMMLU. للتواصل: [email protected]
أبلغ عن درجة TurkishMMLU على المجموعة النظيفة أيضًا
القائمة وسكربت المسح مفتوحان بترخيص CC BY 4.0. تواصل معنا للتعاون في القياس المعياري والتقييم للغة التركية.