TurkishMMLU Kirlilik Listesi
Türkçe web'de aynen bulunan test soruları
TurkishMMLU test kümesindeki 900 sorunun 113'ü (%12,6), 527 milyon kelimelik bir Türkçe web külliyatında birebir geçmektedir. Bu depo o soruların listesini, bulunma yöntemini ve yeniden üretim betiğini içerir; amaç, Türkçe web metniyle eğitilen modellerin TurkishMMLU puanlarını kirlilik dışı bırakılmış bir alt kümede de raporlayabilmesidir.
Kirli soru · katı eşik (n = 13)
Test kümesinin %12,6'sı · taranan külliyat 526.593.877 kelime
Ezber, yetenek değildir
Bir kıyas sorusu eğitim külliyatında aynen geçiyorsa, modelin o soruyu bilmesi yetenek değil ezberdir. Türkçe web'den toplanan her külliyat için bu risk vardır; soruların büyük kısmı ders kitabı ve deneme sınavı sitelerinden geldiği için web'de kopyaları bulunur.
Raporlanan farkın üçte biri kirlilikten geliyordu
Bir devam-eğitimi modelinin tabanına göre farkı tüm 900 soruda +6,27 puan, kirli sorular çıkarılınca +4,14 puan ölçüldü.
n kelimelik pencere birebir eşleşmesi
GPT-3 ve Llama teknik raporlarındaki ölçütün aynısı.
Normalizasyon
Soru metni normalize edilir: NFC, Türkçe küçük harf (İ→i, I→ı), noktalama ve sayı dışı karakterler boşluğa çevrilir, kelimelere ayrılır.
Pencereler
Her sorudan ardışık n kelimelik tüm pencereler çıkarılır; pencereler soru metni ve şıklardan (en çok 5 şık) alınır.
Tarama
Külliyat aynı normalizasyonla akıtılır; herhangi bir pencere külliyatta birebir geçiyorsa soru kirli sayılır. Bellek kullanımı külliyat boyutundan bağımsızdır.
| Eşik | Anlamı | Kirli soru | Oran |
|---|---|---|---|
| n = 13katı | Tesadüfi eşleşme pratikte imkânsız; standart ölçüt. | 113 | %12,6 |
| n = 8gevşek | Kısmi / yeniden ifade edilmiş sızıntıya duyarlı; yanlış pozitif olası (kalıp cümleler). | 252 | %28,0 |
Taranan külliyat: 526.593.877 kelimelik Türkçe web metni (akış sırasıyla ilk 4,3 GB). Cevap anahtarı metin olmadığı için taranmaz. Liste bir alt sınırdır: yeniden ifade edilmiş ya da 13 kelimeden kısa parçalar hâlinde sızan sorular katı eşikte yakalanmaz.
Kirli soruların konulara dağılımı
n = 13 · 113 soru
Yalnızca dizin ve özet
Her kayıt, kaynak kümedeki sırayı, soru metninin SHA-256 özetini ve konu etiketini taşır. Kümenin sıralaması değişse bile soru özetle eşleştirilebilir.
indexHugging Face AYueksel/TurkishMMLU, config All, split test içindeki sıra.
sha256_soruquestion alanının (strip sonrası, UTF-8) SHA-256 özeti.
konuKaynak kümedeki konu etiketi.
{
"kaynak_kume": "AYueksel/TurkishMMLU (config All, split test)",
"taranan_soru": 900,
"kulliyat_kelime": 526593877,
"kirli_13": [
{"index": 0, "sha256_soru": "e84db08c…", "konu": "Biology"},
…
],
"kirli_8": [ … ]
}Temiz alt kümeyi üç adımda türetin
Listeyi yükleyin, özetleri kümeyle eşleştirin, kirli soruları süzün: 900 → 787.
import json, hashlib
from datasets import load_dataset
ds = load_dataset("AYueksel/TurkishMMLU", "All", split="test")
k = json.load(open("turkishmmlu_kirlilik.json", encoding="utf-8"))
kirli = {r["sha256_soru"] for r in k["kirli_13"]}
def ozet(q): return hashlib.sha256(q.strip().encode("utf-8")).hexdigest()
temiz = ds.filter(lambda ex: ozet(ex["question"]) not in kirli)
print(len(ds), "->", len(temiz)) # 900 -> 787Tam kümedeki puanın yanında temiz-787 puanı ve iki puan arasındaki fark. Fark büyükse modelin külliyatı bu soruları görmüştür.
$ python kirlilik_denetimi.py <kulliyat.txt> <etiket>Betik külliyatı satır satır akıtır. Kendi külliyatınızı taratırsanız listeniz bizimkinden farklı çıkar: bu listede olan bir soru sizin külliyatınızda olmayabilir, olmayan bir soru olabilir.
Bilinen sınırlar
Liste bizim külliyatımıza göredir. Türkçe web'in başka bir kesitiyle eğitilen bir modelin kirliliği farklıdır; ama aynı kaynaklar her kesitte bulunduğu için örtüşme yüksek olacaktır.
Soru ve şık metinleri tarandı; cevap anahtarı metin olmadığından taranamaz. Yeniden ifade edilmiş kopyalar katı eşikte kaçar; liste bir alt sınırdır.
n = 13 katı eşiği yeniden ifade edilmiş kopyaları kaçırır; n = 8 listesi bu yüzden verilmiştir, ama yanlış pozitif içerir.
Kaynak kümenin sıralaması değişirse index geçersizleşir; sha256_soru kullanın.
Bu listeyi kullanırsanız
eCloud Tech. (2026). TurkishMMLU Kirlilik Listesi: Türkçe web külliyatında birebir geçen test soruları. https://github.com/ecloudtechnology/turkishmmlu-kirlilik
Lisans: liste ve betik CC BY 4.0. TurkishMMLU'nun kendisi için: Yüksel, A. vd. (2024), TurkishMMLU. İletişim: [email protected]
Aynı ölçüm disiplini
TurkishMMLU puanınızı temiz alt kümede de raporlayın
Liste ve tarama betiği CC BY 4.0 ile açıktır. Türkçe kıyas ve değerlendirme çalışmalarında iş birliği için bizimle iletişime geçebilirsiniz.