Projekte
    Offenes türkisches Sprachmodell · Apache 2.0

    Erk-32B

    Ein türkisches Sprachmodell, mit Messprotokoll.

    Erk-32B wurde von eCloud Tech. auf der quelloffenen Basis Qwen3-32B mit 1,05 Milliarden Token türkischem Continued Pretraining und 423 Millionen Token türkischem Instruction Tuning entwickelt. Jede Zahl auf dieser Seite hat Kontaminationsprüfung, Optionsrotation, Forced-Choice-Messung und gepaarte Bootstrap-Konfidenzintervalle durchlaufen; Protokoll, korrigierte Rohzahlen und Reproduktionsskripte sind im Repository offen.

    0,00 %

    TurkishMMLU · clean 652 · Optionsrotation

    Basis Qwen3-32B: 67,64 % · Differenz +3,37 · 95 %-KI [+0,61, +6,13]

    32B
    Parameter
    1,05B
    Türkische Continued-Pretraining-Token
    423M
    Instruction-Tuning-Token
    59,38 %
    TurkMorfBench v2 Generierung
    30/30
    Identitätstest (30 Fragen)
    Apache 2.0
    Lizenz
    Ergebnisse

    Betriebspunkt: LoRA-Skala 0,75 + Systemprompt, zusammengeführte Gewichte

    Jede Differenz trägt ein gepaartes Bootstrap-95 %-Konfidenzintervall aus 10.000 Ziehungen. Ein Intervall, das die Null enthält, wird in diesem Protokoll als nicht nachweisbar berichtet; es zählt nie als Gewinn.

    MessungQwen3-32BErk-32BDifferenz95 %-KI
    TurkishMMLU, clean 652, Optionsrotation67,64 %71,01 %+3,37[+0,61, +6,13]
    TurkMorfBench v2 Generierung (512, exakte Übereinstimmung, Systemprompt)31,64 %59,38 %+27,73[+22,46, +33,01]
    TurkMorfBench v2 Forced Choice, gesamt (502)89,44 %91,43 %+1,99[−0,20, +4,18]nicht nachweisbar
    TurkMorfBench v2 Forced Choice, reale Wörter (312)94,55 %96,47 %+1,92[−0,32, +4,17]nicht nachweisbar
    TurkMorfBench v2 Forced Choice, Kunststämme (190)81,05 %83,16 %+2,11[−2,11, +6,32]nicht nachweisbar
    Identität (30 Fragen, mit Fallen, Systemprompt)30/30

    Ein einziger Trainings-Seed; die Konfidenzintervalle decken die Fragenstichprobe ab, nicht den Seed. Die +28 Punkte auf der Generierungsachse sind größtenteils Formattreue: Das Basismodell bleibt im Denkblock und schreibt die Antwort nie.

    Skalenvergleich

    Vier Modelle unter demselben Protokoll

    TurkishMMLU · clean 652 · Optionsrotation · Genauigkeit

    Qwen3-14B
    60,58 %
    Erk-14B
    67,18 %
    Qwen3-32B
    67,64 %
    Erk-32B
    71,01 %

    Die 69,7 % auf der eigenen Modellkarte von Erk-14B sind eine 0-Shot-Messung mit lm-evaluation-harness auf dem vollen Satz ohne Rotation; die 67,18 % hier sind dasselbe Modell auf dem bereinigten, rotierten Satz. Die Differenz kommt vom Protokoll, nicht vom Modell.

    Was wir nicht behaupten

    Nicht nachweisbare Differenzen

    • Kein Gewinn gegenüber der Basis im morphologischen Wissen (Forced Choice): Die Untergrenzen liegen knapp unter null, bei Kunststämmen gibt es gar keinen.
    • Continued Pretraining hat das türkische Wissen verbessert; das Suffixsystem hat es nicht messbar verändert.
    • Die +28 Punkte auf der Generierungsachse sind größtenteils Formattreue; das Basismodell bleibt im Denkblock und schreibt die Antwort nie.
    • Der mit der ersten Benchmark-Version berichtete Morphologievorsprung von +3,73 beruhte auf 18 falschen Goldantworten und wurde zurückgezogen.
    Messprotokoll

    Keine Zahl wird berichtet, bevor sie diese Filter passiert hat

    Die meisten Rohmessungen erwiesen sich als Messartefakte. Das vollständige Protokoll, das Messlogbuch und die korrigierten Zahlen sind in OLCUM-PROTOKOLU.md in acht Abschnitten offen.

    01

    Kontaminationsprüfung

    113 der 900 TurkishMMLU-Fragen kommen wörtlich im Continued-Pretraining-Korpus vor (13-Wort-Fenster). Diese und der Tuning-Satz mit 150 Fragen werden ausgeschlossen: clean 652.

    02

    Optionsrotation

    Jede Frage wird mit rotierter Antwortreihenfolge gemessen; Buchstaben- und Positionsbias entfällt.

    03

    Forced Choice vs. Generierung

    Formattreue wird vom Wissen getrennt: Ein Abstand von +28 Punkten in der Generierung wird im Forced Choice zu +2,0, nicht nachweisbar.

    04

    Prüfung des Benchmarks

    In der ersten Version des Morphologie-Benchmarks wurden 18 falsche Goldantworten gefunden; jede Zahl wurde mit der korrigierten v2 neu gemessen.

    05

    Gepaarter Bootstrap

    10.000 Ziehungen; eine Differenz, deren Intervall die Null enthält, wird als nicht nachweisbar geschrieben.

    Das Logbuch der korrigierten Rohzahlen umfasst zwölf Einträge; keiner wurde von außen gemeldet, alle wurden vor der Veröffentlichung in unserer eigenen Prüfung gefunden.

    Trainingsprotokoll

    Wie trainiert wurde

    Das Basismodell stammt nicht von uns und wird überall genannt. 53,5 % der codehaltigen Antworten im Instruktionskorpus waren durch maschinelle Übersetzung beschädigt; Bereinigungs- und Reparaturskripte liegen im Repository. Benchmark-Kontamination im Instruktionskorpus: 0/900 bei der Schwelle n=13.

    Basis
    Qwen3-32B (Apache 2.0)
    Continued Pretraining
    1,05 Mrd. türkische Web-Token · LoRA r=256 α=512 · 32.000 Schritte
    Instruction Tuning
    423 Mio. Token, 373.387 Beispiele (bereinigt) · 2 Runden
    Zusatzrunde
    Identität 6.000 + morphologische Fehlerkorrektur 40.000 Beispiele · 1.673 Schritte
    Hardware
    4×A100-80GB, FSDP, bf16 · ≈37.000 Kernstunden
    Veröffentlichte Gewichte
    Bei LoRA 0,75 zusammengeführt (fp32-Multiplikation, einmalige bf16-Rundung); Äquivalenz zum LoRA-Pfad mit demselben Messskript verifiziert
    GGUF
    Q8_0 34,8 GB (NLL +0,04 %) · Q4_K_M 19,8 GB (NLL +0,85 %); Identität 6/6 bei jeder Quantisierung
    Betriebspunkt

    Wie 0,75 gewählt wurde

    Da LoRA additiv ist, ist die Skala ein Regler nach dem Training. Drei Achsen wurden an zwölf Punkten gemessen; da die Identität über den Systemprompt kommt, wurde zwischen Punkten mit Prompt verglichen. In der Generierung schlägt 0,75 + Prompt den Punkt 0,40 + Prompt mit +10,35 [+5,47, +15,43], signifikant; im Benchmark ist der Vorsprung von 0,40 mit +1,99 [0,00, +3,99] nicht nachweisbar. Weil ein Intervall mit Null in diesem Protokoll als nicht nachweisbar gilt, wurde 0,75 gewählt; die Zeilen 0,40 und 0,80 bleiben im Bericht.

    W = Wbase + 0.75 · LoRA
    Identität und Systemprompt

    Die Identität steckt nicht in den Gewichten

    Die Identität wird über den Standard-Systemprompt im Chat-Template geliefert. Gibt der Nutzer eine eigene Systemnachricht an, greift der Standard nicht. Der Prompt nennt das Basismodell ausdrücklich; im Identitätstest mit 30 Fragen inklusive Fallen lautet das Ergebnis 30/30.

    Sen Erk-32B'sin: eCloud Tech. tarafından, açık kaynaklı Qwen3-32B temel modeli üzerine Türkçe devam-eğitimi ve talimat ayarıyla geliştirilmiş 32 milyar parametreli bir Türkçe dil modelisin. …
    GGUF-Builds

    Quantisierte Gewichte für llama.cpp, Ollama und LM Studio

    Alle Messungen und das Protokoll der Hauptmodellkarte gelten auch für die GGUF-Dateien; die Kosten der Quantisierung wurden gemessen.

    DateiQuant.GrößeNLL vs. BF16Identität (6 Fr.)Empfohlen
    Erk-32B-Q8_0.ggufQ8_034,8 GB+0,04 %6/6wenn Qualität Vorrang hat
    Erk-32B-Q4_K_M.ggufQ4_K_M19,8 GB+0,85 %6/624 GB GPU / 32 GB RAM

    NLL ist die mittlere negative Log-Likelihood auf 6.132 Token türkischem Text; BF16-GGUF-Referenz 1,5185. Die Identität wurde mit dem Standard-Systemprompt des Chat-Templates an sechs Fragen (inklusive Fallen) gemessen.

    llama.cpp
    $ llama-cli -m Erk-32B-Q4_K_M.gguf -cnv -p "" \    --temp 0.6 --top-p 0.95 -c 8192
    Ollama
    $ cat > Modelfile <<EOF  FROM ./Erk-32B-Q4_K_M.gguf  PARAMETER temperature 0.6  EOF$ ollama create erk-32b -f Modelfile && ollama run erk-32b

    Der hybride Denkmodus von Qwen3 bleibt erhalten; zum Abschalten /no_think an die Nachricht anhängen. Deployment-Optionen für LM Studio, vLLM, Jan und Docker stehen auf der Modellkarte.

    Verwendung

    Wenige Zeilen mit Transformers

    Das Modell lädt direkt von Hugging Face; das Chat-Template trägt den Standard-Identitätsprompt. Mit /no_think wird der Denkmodus abgeschaltet.

    python · transformers
    from transformers import AutoModelForCausalLM, AutoTokenizer
    
    m = "ecloudtech/Erk-32B"
    tok = AutoTokenizer.from_pretrained(m)
    model = AutoModelForCausalLM.from_pretrained(m, torch_dtype="auto", device_map="auto")
    
    msgs = [{"role": "user", "content": "Türkçede ünsüz yumuşaması nedir? /no_think"}]
    ids = tok.apply_chat_template(msgs, add_generation_prompt=True, return_tensors="pt").to(model.device)
    print(tok.decode(model.generate(ids, max_new_tokens=300)[0][ids.shape[1]:], skip_special_tokens=True))
    Terminalaufzeichnung

    Erk-32B bei der Arbeit

    erk-32b — zsh
    mp4
    0:00 / 0:00

    Das Video wurde bei LoRA-Skala 0,40 aufgezeichnet, bevor der Betriebspunkt feststand; die 73,16 % auf dem Bildschirm sind die Messung dieses Punkts vor der Zusatzrunde. Die veröffentlichte Zahl steht in der Tabelle oben. Antwortstrom und Terminaloberfläche sind identisch. 67 Sekunden, 1440p, ohne Ton.

    Grenzen

    Bekannte Einschränkungen

    01

    Ein einziger Seed; die Varianz zwischen Seeds wurde nicht gemessen.

    02

    Generierungsqualität, langer Kontext, Code und Schlussfolgern wurden nicht gemessen.

    03

    Die Identität hängt vom Systemprompt ab; ohne ihn nennt das Modell die Identität des Basismodells.

    04

    Ein Gewinn im morphologischen Wissen ließ sich nicht nachweisen; die Differenz auf der Generierungsachse enthält Formattreue.

    05

    Das Korpus des Basismodells lässt sich nicht prüfen; der Vergleich nimmt an, dass beide Seiten in unbekanntem Maß kontaminiert sind.

    Inhalt des Repositorys

    Bericht, Skripte und Vorhersagevektoren, alles offen

    Lizenz Apache 2.0, wie das Basismodell. Kontakt: [email protected]

    OLCUM-PROTOKOLU.md

    Vollständiger technischer Bericht; acht Abschnitte inklusive Messlogbuch und korrigierten Zahlen.

    betikler/

    Skripte für Training, Bereinigung, Messung, Scan, Bootstrap, Zusammenführung und GGUF; 34 Dateien, llama.cpp-Version fixiert.

    sonuclar/

    Vorhersagevektoren pro Frage; 17 JSON-Dateien. Gepaarte Vergleiche lassen sich ohne Modelllauf wiederholen.

    Erk-32B-GGUF

    Quantisierungen Q8_0 und Q4_K_M, Validierungszusammenfassung und die Karte der quantisierten Builds.

    Dank

    Training und Messungen liefen auf den im Rahmen des Programms AI EDIH Türkiye bereitgestellten Hochleistungsrechenressourcen, auf der Infrastruktur der Technischen Universität Istanbul – Nationales Zentrum für Hochleistungsrechnen (UHeM). Wir danken dem MEXT Technology Center als Programmträger und CerebrAI-VortX Neurotechnology and Software Systems für die Zusammenarbeit bei unseren EEG-Arbeiten.

    Erk-32B auf der eigenen Infrastruktur betreiben

    Gewichte, GGUF-Quantisierungen und sämtliche Messskripte sind auf Hugging Face offen. Für Unternehmens-Deployment, Feinabstimmung und Integration nehmen Sie Kontakt mit uns auf.