TurkMorfBench
Ein Benchmark türkischer Morphologie: Suffixgenerierung an realen und Kunststämmen
TurkMorfBench misst, wie gut ein Sprachmodell das türkische Suffixsystem beherrscht: Vokalharmonie, Konsonantenassimilation, Konsonantenerweichung und Bindekonsonanten. 512 Items, 8 Suffixaufgaben, 64 Stämme; 40 reale, 24 Kunststämme (Wug). Zwei Messmodi: freie Generierung und Forced Choice zwischen phonologischen Distraktoren.
Items
8 Aufgaben × 64 Stämme · 320 real + 192 Kunststämme
Wurde die Regel gelernt oder die Form auswendig?
Das richtige Suffix an einem realen Wort zu bilden, ist auch durch Auswendiglernen möglich: Das Modell hat die Form kitabı zehntausende Male im Korpus gesehen. Ein Kunststamm kommt in keinem Korpus vor; das Modell bildet das richtige Suffix nur, wenn es die Regel kennt. Der Abstand zwischen beiden zeigt, ob das Modell Regeln oder Formen gelernt hat.
Dies ist eine Anpassung des seit 1958 in der Spracherwerbsforschung verwendeten Wug-Tests an türkische Suffixe.
Diese Stämme kommen in keinem Korpus vor; das richtige Suffix kann nur aus Regelwissen stammen. Die Kunststämme wurden in Mustern gewählt, die keinen Vokalausfall auslösen, reproduzierbar mit Seed 1337.
Acht Suffixaufgaben
Jede Aufgabe wird auf alle 64 Stämme angewendet: 8 × 64 = 512 Items.
| Aufgabe | Schlüssel | Suffix | Beispiel (real) | Beispiel (Kunststamm) |
|---|---|---|---|---|
| Plural | cogul | -ler/-lar | kapı → kapılar | kuntaş → kuntaşlar |
| Dativ | hal_yonelme | -e/-a (+y) | çocuk → çocuğa | brelak → brelağa |
| Lokativ | hal_bulunma | -de/-da/-te/-ta | çölgap → çölgapta | yontuç → yontuçta |
| Ablativ | hal_ayrilma | -den/-dan/-ten/-tan | kuş → kuştan | krint → krintten |
| Akkusativ | hal_belirtme | -i/-ı/-u/-ü (+y) | ağaç → ağacı | dratok → dratoğu |
| Possessiv, 1. Sg. | iyelik_1sg | -im/-ım/-um/-üm (+m) | masa → masam | çölgap → çölgabım |
| Possessiv, 1. Pl. | iyelik_1pl | -imiz/… (+miz) | ev → evimiz | glodek → glodeğimiz |
| Possessiv, 3. Sg. | iyelik_3sg | -i/… (+si) | araba → arabası | fönük → fönüğü |
Die Abdeckung beschränkt sich auf regelmäßige Stämme; einsilbige t/k-Stämme (süt, kat) und Sonderfälle wie nk→ng bleiben bewusst außen vor.
Vier phonologische Regeln
Vokalharmonie
Zweifache Harmonie (-ler/-lar) und vierfache Harmonie (-i/-ı/-u/-ü).
Konsonantenassimilation
Nach stimmlosem Konsonanten -de → -te und -den → -ten.
Konsonantenerweichung
p/ç/t/k → b/c/d/ğ vor vokalisch anlautendem Suffix.
Bindekonsonanten
-y-, -s-, -m- an vokalisch auslautenden Stämmen.
Auf drei unabhängigen Wegen verifiziert
Erweichung ist im Türkischen lexikalisch: kitap → kitabı, aber süt → sütü. Reale Stämme wurden daher auf solche mit unstrittigem Erweichungsverhalten beschränkt; für Kunststämme gilt eine einzige dokumentierte Konvention: Ein mehrsilbiger Kunststamm auf p/ç/t/k wird vor vokalisch anlautendem Suffix erweicht. Der Benchmark misst das nicht, er setzt es voraus.
Generator-Engine
morfbench_v2.py: eine phonologische Engine, die Vokalharmonie, Assimilation, Erweichung und Bindekonsonanten anwendet; der Stammpool ist von Vokalausfall- und Ausnahmewörtern bereinigt.
Unabhängige Regeltabelle
kural_denetimi.py: ein zweiter, getrennt von der Engine geschriebener Generator; er leitet jede Antwort neu ab und vergleicht: 512/512.
Morphologischer Analysator
crosscheck.py: Antworten zu realen Wörtern werden mit dem türkischen Morphologieanalysator zeyrek zerlegt; fehlt das erwartete Suffix-Tag in der Analyse, gilt das Item als verdächtig.
Die erste Version (329 Items, 7 Aufgaben) wurde nie veröffentlicht; sie enthielt 18 falsche Goldantworten bei realen Stämmen (etwa çocuka, südü, renği) und eine inkonsistente Regel für Kunststämme. v2 behebt diese Fehler, ergänzt die Akkusativaufgabe und erhöht die Stammzahl von 47 auf 64. Alle berichteten Zahlen wurden mit v2 gemessen.
Zwei Modi, zwei verschiedene Fragen
Generierung
Das Modell sieht die Frage (füge dem Wort çocuk das Dativsuffix -e/-a an; schreibe nur das Wort) und antwortet frei; Satzzeichen und Groß-/Kleinschreibung werden entfernt, dann wird exakte Übereinstimmung mit Gold verlangt. Misst Formattreue zusammen mit Wissen; nicht instruierte Basismodelle schneiden hier schlecht ab.
Forced Choice
Zwischen Goldantwort und phonologischen Distraktoren (çocuğa / çocuğe / çocuka …) wird die Option mit der höchsten Log-Likelihood gewählt. Formattreue fällt weg; nur Wissen wird gemessen. Items ohne baubare Distraktoren werden übersprungen.
Qwen3-32B und Erk-32B an denselben Items
Jede Differenz trägt ein gepaartes Bootstrap-95 %-Konfidenzintervall aus 10.000 Ziehungen; ein Intervall mit Null wird als nicht nachweisbar geschrieben.
Forced Choice · 502 Items (für 10 ließ sich kein Distraktor bauen)
| Modell | Gesamt (502) | Real (312) | Kunststämme (190) |
|---|---|---|---|
| Qwen3-32B | 89,44 % | 94,55 % | 81,05 % |
| Erk-32B · LoRA 0,40 | 89,84 %+0,40 [−1,20, +2,19]nicht nachweisbar | 95,19 %+0,64 [−0,64, +1,92]nicht nachweisbar | 81,05 %0,00 [0,00, 0,00]nicht nachweisbar |
| Erk-32B · LoRA 0,75veröffentlicht | 91,43 %+1,99 [−0,20, +4,18]nicht nachweisbar | 96,47 %+1,92 [−0,32, +4,17]nicht nachweisbar | 83,16 %+2,11 [−2,11, +6,32]nicht nachweisbar |
| Erk-32B · LoRA 0,80 | 91,83 %+2,39 [+0,20, +4,78] | 97,12 %+2,56 [+0,64, +4,81] | 83,16 %+2,11 [−2,63, +6,84]nicht nachweisbar |
Generierung · 512 Items, exakte Übereinstimmung, Qwen3-Denkmodus an
| Modell | Gesamt (512) |
|---|---|
| Qwen3-32B | 31,64 % |
| Erk-32B · LoRA 0,40 | 55,86 %+24,22 [+18,95, +29,49] |
| Erk-32B · LoRA 0,75 | 61,52 %+29,88 [+24,61, +35,16] |
| Erk-32B · LoRA 0,75 · Identitäts-Systempromptveröffentlicht | 59,38 %+27,73 [+22,46, +33,01] |
| Erk-32B · LoRA 0,40 · Identitäts-Systemprompt | 49,02 %+17,38 [+11,91, +22,85] |
Der Abstand von rund 28 Punkten zwischen den Modi ist Formattreue: Das Basismodell bleibt im Denkblock und schreibt das Wort nie; im Forced Choice weiß dasselbe Modell 89 %. Der Einfluss des Systemprompts auf den Generierungswert hängt von der Skala ab (−2,15 bei 0,75, nicht nachweisbar; −6,84 bei 0,40, signifikant); messen Sie mit der Konfiguration, die Sie ausrollen.
Was der Benchmark messen soll
Qwen3-32B · Forced Choice · Genauigkeit
Beim Basismodell liegt die Genauigkeit an realen Wörtern bei 94,55 %, an Kunststämmen bei 81,05 %: Das Modell kennt Formen weit besser als Regeln. Bei einem Continued-Pretraining-Modell (Erk-32B) löste sich der Kunststamm-Wert auf keiner Skala von der Basis; türkisches Continued Pretraining hat das Suffixsystem nicht messbar verändert.
Mit zwei Befehlen messen
Ausgabe: Genauigkeit gesamt / real / Kunststämme und ein Vorhersagevektor pro Item (JSON). Für den Vergleich zweier Modelle an denselben Items liefert bootstrap.py gepaarte Konfidenzintervalle.
$ pip install torch transformers$ python turkmorfbench_olc.py --model Qwen/Qwen3-32B --kip zorunlu$ python turkmorfbench_olc.py --model Qwen/Qwen3-32B --kip uretim
{"kok": "çocuk", "gorev": "hal_yonelme", "cevap": "çocuğa", "tip": "gercek",
"soru": "'çocuk' kelimesine -e/-a yönelme eki ekle. Sadece kelimeyi yaz.",
"kural": "yönelme + ünlü uyumu + yumuşama"}kokDas Stammwort (Wurzel).
gorevSchlüssel der Suffixaufgabe (cogul, hal_yonelme, …).
cevapGoldantwort.
tipgercek (real) oder wug (Kunststamm).
soruDer dem Modell gezeigte Prompt.
kuralDie im Item geprüften phonologischen Regeln; für Teilmengenanalysen.
Bekannte Einschränkungen
Die Abdeckung beschränkt sich auf regelmäßige Stämme; lexikalische Ausnahmen (Vokalausfall burun → burnu, nicht erweichende Einsilber, nk→ng) sind bewusst ausgeschlossen.
Die Konvention für Kunststämme ist eine Annahme; die Produktivität der Erweichung kann zwischen Sprechern variieren. Der Kunststamm-Wert ist relativ zu dieser Annahme.
Mit 24 Kunststämmen ist die Teilmenge klein (192 Items, ±5 Punkte); bei kleinen Differenzen ist nicht nachweisbar zu erwarten.
Beschränkt auf die türkische Nominalflexion; keine Verbflexion, Derivation oder Syntax.
Wenn Sie diesen Benchmark verwenden
eCloud Tech. (2026). TurkMorfBench: Gerçek ve uydurma gövdelerde Türkçe ek üretimi kıyası (v2). https://github.com/ecloudtechnology/turkmorfbench
Lizenz: Daten und Skripte CC BY 4.0. Kontakt: [email protected]
Messen Sie Ihr Modell mit TurkMorfBench
Daten und Skripte sind unter CC BY 4.0 offen. Für eine Zusammenarbeit bei der Evaluation türkischer Modelle nehmen Sie Kontakt mit uns auf.