Projekte
    Offener Benchmark-Datensatz · CC BY 4.0

    TurkMorfBench

    Ein Benchmark türkischer Morphologie: Suffixgenerierung an realen und Kunststämmen

    TurkMorfBench misst, wie gut ein Sprachmodell das türkische Suffixsystem beherrscht: Vokalharmonie, Konsonantenassimilation, Konsonantenerweichung und Bindekonsonanten. 512 Items, 8 Suffixaufgaben, 64 Stämme; 40 reale, 24 Kunststämme (Wug). Zwei Messmodi: freie Generierung und Forced Choice zwischen phonologischen Distraktoren.

    0

    Items

    8 Aufgaben × 64 Stämme · 320 real + 192 Kunststämme

    8
    Suffixaufgaben
    64
    Stämme
    40
    Reale Stämme
    24
    Kunststämme
    2
    Messmodi
    CC BY 4.0
    Lizenz
    Warum Kunststämme

    Wurde die Regel gelernt oder die Form auswendig?

    Das richtige Suffix an einem realen Wort zu bilden, ist auch durch Auswendiglernen möglich: Das Modell hat die Form kitabı zehntausende Male im Korpus gesehen. Ein Kunststamm kommt in keinem Korpus vor; das Modell bildet das richtige Suffix nur, wenn es die Regel kennt. Der Abstand zwischen beiden zeigt, ob das Modell Regeln oder Formen gelernt hat.

    Dies ist eine Anpassung des seit 1958 in der Spracherwerbsforschung verwendeten Wug-Tests an türkische Suffixe.

    Beispiele für Kunststämme
    çölgapzelbikpürsatbrelakkuntaşglodekfönükdratok

    Diese Stämme kommen in keinem Korpus vor; das richtige Suffix kann nur aus Regelwissen stammen. Die Kunststämme wurden in Mustern gewählt, die keinen Vokalausfall auslösen, reproduzierbar mit Seed 1337.

    Abdeckung

    Acht Suffixaufgaben

    Jede Aufgabe wird auf alle 64 Stämme angewendet: 8 × 64 = 512 Items.

    AufgabeSchlüsselSuffixBeispiel (real)Beispiel (Kunststamm)
    Pluralcogul-ler/-larkapı → kapılarkuntaş → kuntaşlar
    Dativhal_yonelme-e/-a (+y)çocuk → çocuğabrelak → brelağa
    Lokativhal_bulunma-de/-da/-te/-taçölgap → çölgaptayontuç → yontuçta
    Ablativhal_ayrilma-den/-dan/-ten/-tankuş → kuştankrint → krintten
    Akkusativhal_belirtme-i/-ı/-u/-ü (+y)ağaç → ağacıdratok → dratoğu
    Possessiv, 1. Sg.iyelik_1sg-im/-ım/-um/-üm (+m)masa → masamçölgap → çölgabım
    Possessiv, 1. Pl.iyelik_1pl-imiz/… (+miz)ev → evimizglodek → glodeğimiz
    Possessiv, 3. Sg.iyelik_3sg-i/… (+si)araba → arabasıfönük → fönüğü

    Die Abdeckung beschränkt sich auf regelmäßige Stämme; einsilbige t/k-Stämme (süt, kat) und Sonderfälle wie nk→ng bleiben bewusst außen vor.

    Geprüfte Regeln

    Vier phonologische Regeln

    Vokalharmonie

    Zweifache Harmonie (-ler/-lar) und vierfache Harmonie (-i/-ı/-u/-ü).

    Konsonantenassimilation

    Nach stimmlosem Konsonanten -de → -te und -den → -ten.

    Konsonantenerweichung

    p/ç/t/k → b/c/d/ğ vor vokalisch anlautendem Suffix.

    Bindekonsonanten

    -y-, -s-, -m- an vokalisch auslautenden Stämmen.

    Goldantworten

    Auf drei unabhängigen Wegen verifiziert

    Erweichung ist im Türkischen lexikalisch: kitap → kitabı, aber süt → sütü. Reale Stämme wurden daher auf solche mit unstrittigem Erweichungsverhalten beschränkt; für Kunststämme gilt eine einzige dokumentierte Konvention: Ein mehrsilbiger Kunststamm auf p/ç/t/k wird vor vokalisch anlautendem Suffix erweicht. Der Benchmark misst das nicht, er setzt es voraus.

    01

    Generator-Engine

    morfbench_v2.py: eine phonologische Engine, die Vokalharmonie, Assimilation, Erweichung und Bindekonsonanten anwendet; der Stammpool ist von Vokalausfall- und Ausnahmewörtern bereinigt.

    02

    Unabhängige Regeltabelle

    kural_denetimi.py: ein zweiter, getrennt von der Engine geschriebener Generator; er leitet jede Antwort neu ab und vergleicht: 512/512.

    03

    Morphologischer Analysator

    crosscheck.py: Antworten zu realen Wörtern werden mit dem türkischen Morphologieanalysator zeyrek zerlegt; fehlt das erwartete Suffix-Tag in der Analyse, gilt das Item als verdächtig.

    Versionshinweis · v1 → v2

    Die erste Version (329 Items, 7 Aufgaben) wurde nie veröffentlicht; sie enthielt 18 falsche Goldantworten bei realen Stämmen (etwa çocuka, südü, renği) und eine inkonsistente Regel für Kunststämme. v2 behebt diese Fehler, ergänzt die Akkusativaufgabe und erhöht die Stammzahl von 47 auf 64. Alle berichteten Zahlen wurden mit v2 gemessen.

    Messmodi

    Zwei Modi, zwei verschiedene Fragen

    01

    Generierung

    Das Modell sieht die Frage (füge dem Wort çocuk das Dativsuffix -e/-a an; schreibe nur das Wort) und antwortet frei; Satzzeichen und Groß-/Kleinschreibung werden entfernt, dann wird exakte Übereinstimmung mit Gold verlangt. Misst Formattreue zusammen mit Wissen; nicht instruierte Basismodelle schneiden hier schlecht ab.

    02

    Forced Choice

    Zwischen Goldantwort und phonologischen Distraktoren (çocuğa / çocuğe / çocuka …) wird die Option mit der höchsten Log-Likelihood gewählt. Formattreue fällt weg; nur Wissen wird gemessen. Items ohne baubare Distraktoren werden übersprungen.

    Der Abstand zwischen beiden Modi ist aufschlussreich: Ein von uns gemessenes Continued-Pretraining-Modell schlug seine Basis in der Generierung um +36 Punkte, im Forced Choice um +3,7. Der Großteil der Differenz war Formattreue, nicht Wissen. Berichten Sie den Generierungswert nicht allein.
    Ergebnisse (v2)

    Qwen3-32B und Erk-32B an denselben Items

    Jede Differenz trägt ein gepaartes Bootstrap-95 %-Konfidenzintervall aus 10.000 Ziehungen; ein Intervall mit Null wird als nicht nachweisbar geschrieben.

    Forced Choice · 502 Items (für 10 ließ sich kein Distraktor bauen)

    ModellGesamt (502)Real (312)Kunststämme (190)
    Qwen3-32B89,44 %94,55 %81,05 %
    Erk-32B · LoRA 0,4089,84 %+0,40 [−1,20, +2,19]nicht nachweisbar95,19 %+0,64 [−0,64, +1,92]nicht nachweisbar81,05 %0,00 [0,00, 0,00]nicht nachweisbar
    Erk-32B · LoRA 0,75veröffentlicht91,43 %+1,99 [−0,20, +4,18]nicht nachweisbar96,47 %+1,92 [−0,32, +4,17]nicht nachweisbar83,16 %+2,11 [−2,11, +6,32]nicht nachweisbar
    Erk-32B · LoRA 0,8091,83 %+2,39 [+0,20, +4,78]97,12 %+2,56 [+0,64, +4,81]83,16 %+2,11 [−2,63, +6,84]nicht nachweisbar

    Generierung · 512 Items, exakte Übereinstimmung, Qwen3-Denkmodus an

    ModellGesamt (512)
    Qwen3-32B31,64 %
    Erk-32B · LoRA 0,4055,86 %+24,22 [+18,95, +29,49]
    Erk-32B · LoRA 0,7561,52 %+29,88 [+24,61, +35,16]
    Erk-32B · LoRA 0,75 · Identitäts-Systempromptveröffentlicht59,38 %+27,73 [+22,46, +33,01]
    Erk-32B · LoRA 0,40 · Identitäts-Systemprompt49,02 %+17,38 [+11,91, +22,85]

    Der Abstand von rund 28 Punkten zwischen den Modi ist Formattreue: Das Basismodell bleibt im Denkblock und schreibt das Wort nie; im Forced Choice weiß dasselbe Modell 89 %. Der Einfluss des Systemprompts auf den Generierungswert hängt von der Skala ab (−2,15 bei 0,75, nicht nachweisbar; −6,84 bei 0,40, signifikant); messen Sie mit der Konfiguration, die Sie ausrollen.

    Die Lücke real–Kunststamm

    Was der Benchmark messen soll

    Qwen3-32B · Forced Choice · Genauigkeit

    Real
    94,55 %
    Kunststämme
    81,05 %

    Beim Basismodell liegt die Genauigkeit an realen Wörtern bei 94,55 %, an Kunststämmen bei 81,05 %: Das Modell kennt Formen weit besser als Regeln. Bei einem Continued-Pretraining-Modell (Erk-32B) löste sich der Kunststamm-Wert auf keiner Skala von der Basis; türkisches Continued Pretraining hat das Suffixsystem nicht messbar verändert.

    Verwendung

    Mit zwei Befehlen messen

    Ausgabe: Genauigkeit gesamt / real / Kunststämme und ein Vorhersagevektor pro Item (JSON). Für den Vergleich zweier Modelle an denselben Items liefert bootstrap.py gepaarte Konfidenzintervalle.

    bash
    $ pip install torch transformers$ python turkmorfbench_olc.py --model Qwen/Qwen3-32B --kip zorunlu$ python turkmorfbench_olc.py --model Qwen/Qwen3-32B --kip uretim
    turkmorfbench.json
    {"kok": "çocuk", "gorev": "hal_yonelme", "cevap": "çocuğa", "tip": "gercek",
     "soru": "'çocuk' kelimesine -e/-a yönelme eki ekle. Sadece kelimeyi yaz.",
     "kural": "yönelme + ünlü uyumu + yumuşama"}
    kok

    Das Stammwort (Wurzel).

    gorev

    Schlüssel der Suffixaufgabe (cogul, hal_yonelme, …).

    cevap

    Goldantwort.

    tip

    gercek (real) oder wug (Kunststamm).

    soru

    Der dem Modell gezeigte Prompt.

    kural

    Die im Item geprüften phonologischen Regeln; für Teilmengenanalysen.

    Grenzen

    Bekannte Einschränkungen

    01

    Die Abdeckung beschränkt sich auf regelmäßige Stämme; lexikalische Ausnahmen (Vokalausfall burun → burnu, nicht erweichende Einsilber, nk→ng) sind bewusst ausgeschlossen.

    02

    Die Konvention für Kunststämme ist eine Annahme; die Produktivität der Erweichung kann zwischen Sprechern variieren. Der Kunststamm-Wert ist relativ zu dieser Annahme.

    03

    Mit 24 Kunststämmen ist die Teilmenge klein (192 Items, ±5 Punkte); bei kleinen Differenzen ist nicht nachweisbar zu erwarten.

    04

    Beschränkt auf die türkische Nominalflexion; keine Verbflexion, Derivation oder Syntax.

    Zitation

    Wenn Sie diesen Benchmark verwenden

    citation
    eCloud Tech. (2026). TurkMorfBench: Gerçek ve uydurma gövdelerde Türkçe ek
    üretimi kıyası (v2). https://github.com/ecloudtechnology/turkmorfbench

    Lizenz: Daten und Skripte CC BY 4.0. Kontakt: [email protected]

    Messen Sie Ihr Modell mit TurkMorfBench

    Daten und Skripte sind unter CC BY 4.0 offen. Für eine Zusammenarbeit bei der Evaluation türkischer Modelle nehmen Sie Kontakt mit uns auf.