Erk-32B
Ein türkisches Sprachmodell, mit Messprotokoll.
Erk-32B wurde von eCloud Tech. auf der quelloffenen Basis Qwen3-32B mit 1,05 Milliarden Token türkischem Continued Pretraining und 423 Millionen Token türkischem Instruction Tuning entwickelt. Jede Zahl auf dieser Seite hat Kontaminationsprüfung, Optionsrotation, Forced-Choice-Messung und gepaarte Bootstrap-Konfidenzintervalle durchlaufen; Protokoll, korrigierte Rohzahlen und Reproduktionsskripte sind im Repository offen.
TurkishMMLU · clean 652 · Optionsrotation
Basis Qwen3-32B: 67,64 % · Differenz +3,37 · 95 %-KI [+0,61, +6,13]
Betriebspunkt: LoRA-Skala 0,75 + Systemprompt, zusammengeführte Gewichte
Jede Differenz trägt ein gepaartes Bootstrap-95 %-Konfidenzintervall aus 10.000 Ziehungen. Ein Intervall, das die Null enthält, wird in diesem Protokoll als nicht nachweisbar berichtet; es zählt nie als Gewinn.
| Messung | Qwen3-32B | Erk-32B | Differenz | 95 %-KI |
|---|---|---|---|---|
| TurkishMMLU, clean 652, Optionsrotation | 67,64 % | 71,01 % | +3,37 | [+0,61, +6,13] |
| TurkMorfBench v2 Generierung (512, exakte Übereinstimmung, Systemprompt) | 31,64 % | 59,38 % | +27,73 | [+22,46, +33,01] |
| TurkMorfBench v2 Forced Choice, gesamt (502) | 89,44 % | 91,43 % | +1,99 | [−0,20, +4,18]nicht nachweisbar |
| TurkMorfBench v2 Forced Choice, reale Wörter (312) | 94,55 % | 96,47 % | +1,92 | [−0,32, +4,17]nicht nachweisbar |
| TurkMorfBench v2 Forced Choice, Kunststämme (190) | 81,05 % | 83,16 % | +2,11 | [−2,11, +6,32]nicht nachweisbar |
| Identität (30 Fragen, mit Fallen, Systemprompt) | — | 30/30 | — | — |
Ein einziger Trainings-Seed; die Konfidenzintervalle decken die Fragenstichprobe ab, nicht den Seed. Die +28 Punkte auf der Generierungsachse sind größtenteils Formattreue: Das Basismodell bleibt im Denkblock und schreibt die Antwort nie.
Vier Modelle unter demselben Protokoll
TurkishMMLU · clean 652 · Optionsrotation · Genauigkeit
Die 69,7 % auf der eigenen Modellkarte von Erk-14B sind eine 0-Shot-Messung mit lm-evaluation-harness auf dem vollen Satz ohne Rotation; die 67,18 % hier sind dasselbe Modell auf dem bereinigten, rotierten Satz. Die Differenz kommt vom Protokoll, nicht vom Modell.
Nicht nachweisbare Differenzen
- Kein Gewinn gegenüber der Basis im morphologischen Wissen (Forced Choice): Die Untergrenzen liegen knapp unter null, bei Kunststämmen gibt es gar keinen.
- Continued Pretraining hat das türkische Wissen verbessert; das Suffixsystem hat es nicht messbar verändert.
- Die +28 Punkte auf der Generierungsachse sind größtenteils Formattreue; das Basismodell bleibt im Denkblock und schreibt die Antwort nie.
- Der mit der ersten Benchmark-Version berichtete Morphologievorsprung von +3,73 beruhte auf 18 falschen Goldantworten und wurde zurückgezogen.
Keine Zahl wird berichtet, bevor sie diese Filter passiert hat
Die meisten Rohmessungen erwiesen sich als Messartefakte. Das vollständige Protokoll, das Messlogbuch und die korrigierten Zahlen sind in OLCUM-PROTOKOLU.md in acht Abschnitten offen.
Kontaminationsprüfung
113 der 900 TurkishMMLU-Fragen kommen wörtlich im Continued-Pretraining-Korpus vor (13-Wort-Fenster). Diese und der Tuning-Satz mit 150 Fragen werden ausgeschlossen: clean 652.
Optionsrotation
Jede Frage wird mit rotierter Antwortreihenfolge gemessen; Buchstaben- und Positionsbias entfällt.
Forced Choice vs. Generierung
Formattreue wird vom Wissen getrennt: Ein Abstand von +28 Punkten in der Generierung wird im Forced Choice zu +2,0, nicht nachweisbar.
Prüfung des Benchmarks
In der ersten Version des Morphologie-Benchmarks wurden 18 falsche Goldantworten gefunden; jede Zahl wurde mit der korrigierten v2 neu gemessen.
Gepaarter Bootstrap
10.000 Ziehungen; eine Differenz, deren Intervall die Null enthält, wird als nicht nachweisbar geschrieben.
Das Logbuch der korrigierten Rohzahlen umfasst zwölf Einträge; keiner wurde von außen gemeldet, alle wurden vor der Veröffentlichung in unserer eigenen Prüfung gefunden.
Wie trainiert wurde
Das Basismodell stammt nicht von uns und wird überall genannt. 53,5 % der codehaltigen Antworten im Instruktionskorpus waren durch maschinelle Übersetzung beschädigt; Bereinigungs- und Reparaturskripte liegen im Repository. Benchmark-Kontamination im Instruktionskorpus: 0/900 bei der Schwelle n=13.
- Basis
- Qwen3-32B (Apache 2.0)
- Continued Pretraining
- 1,05 Mrd. türkische Web-Token · LoRA r=256 α=512 · 32.000 Schritte
- Instruction Tuning
- 423 Mio. Token, 373.387 Beispiele (bereinigt) · 2 Runden
- Zusatzrunde
- Identität 6.000 + morphologische Fehlerkorrektur 40.000 Beispiele · 1.673 Schritte
- Hardware
- 4×A100-80GB, FSDP, bf16 · ≈37.000 Kernstunden
- Veröffentlichte Gewichte
- Bei LoRA 0,75 zusammengeführt (fp32-Multiplikation, einmalige bf16-Rundung); Äquivalenz zum LoRA-Pfad mit demselben Messskript verifiziert
- GGUF
- Q8_0 34,8 GB (NLL +0,04 %) · Q4_K_M 19,8 GB (NLL +0,85 %); Identität 6/6 bei jeder Quantisierung
Wie 0,75 gewählt wurde
Da LoRA additiv ist, ist die Skala ein Regler nach dem Training. Drei Achsen wurden an zwölf Punkten gemessen; da die Identität über den Systemprompt kommt, wurde zwischen Punkten mit Prompt verglichen. In der Generierung schlägt 0,75 + Prompt den Punkt 0,40 + Prompt mit +10,35 [+5,47, +15,43], signifikant; im Benchmark ist der Vorsprung von 0,40 mit +1,99 [0,00, +3,99] nicht nachweisbar. Weil ein Intervall mit Null in diesem Protokoll als nicht nachweisbar gilt, wurde 0,75 gewählt; die Zeilen 0,40 und 0,80 bleiben im Bericht.
Die Identität steckt nicht in den Gewichten
Die Identität wird über den Standard-Systemprompt im Chat-Template geliefert. Gibt der Nutzer eine eigene Systemnachricht an, greift der Standard nicht. Der Prompt nennt das Basismodell ausdrücklich; im Identitätstest mit 30 Fragen inklusive Fallen lautet das Ergebnis 30/30.
Sen Erk-32B'sin: eCloud Tech. tarafından, açık kaynaklı Qwen3-32B temel modeli üzerine Türkçe devam-eğitimi ve talimat ayarıyla geliştirilmiş 32 milyar parametreli bir Türkçe dil modelisin. …Quantisierte Gewichte für llama.cpp, Ollama und LM Studio
Alle Messungen und das Protokoll der Hauptmodellkarte gelten auch für die GGUF-Dateien; die Kosten der Quantisierung wurden gemessen.
| Datei | Quant. | Größe | NLL vs. BF16 | Identität (6 Fr.) | Empfohlen |
|---|---|---|---|---|---|
| Erk-32B-Q8_0.gguf | Q8_0 | 34,8 GB | +0,04 % | 6/6 | wenn Qualität Vorrang hat |
| Erk-32B-Q4_K_M.gguf | Q4_K_M | 19,8 GB | +0,85 % | 6/6 | 24 GB GPU / 32 GB RAM |
NLL ist die mittlere negative Log-Likelihood auf 6.132 Token türkischem Text; BF16-GGUF-Referenz 1,5185. Die Identität wurde mit dem Standard-Systemprompt des Chat-Templates an sechs Fragen (inklusive Fallen) gemessen.
$ llama-cli -m Erk-32B-Q4_K_M.gguf -cnv -p "" \ --temp 0.6 --top-p 0.95 -c 8192
$ cat > Modelfile <<EOF FROM ./Erk-32B-Q4_K_M.gguf PARAMETER temperature 0.6 EOF$ ollama create erk-32b -f Modelfile && ollama run erk-32b
Der hybride Denkmodus von Qwen3 bleibt erhalten; zum Abschalten /no_think an die Nachricht anhängen. Deployment-Optionen für LM Studio, vLLM, Jan und Docker stehen auf der Modellkarte.
Wenige Zeilen mit Transformers
Das Modell lädt direkt von Hugging Face; das Chat-Template trägt den Standard-Identitätsprompt. Mit /no_think wird der Denkmodus abgeschaltet.
from transformers import AutoModelForCausalLM, AutoTokenizer
m = "ecloudtech/Erk-32B"
tok = AutoTokenizer.from_pretrained(m)
model = AutoModelForCausalLM.from_pretrained(m, torch_dtype="auto", device_map="auto")
msgs = [{"role": "user", "content": "Türkçede ünsüz yumuşaması nedir? /no_think"}]
ids = tok.apply_chat_template(msgs, add_generation_prompt=True, return_tensors="pt").to(model.device)
print(tok.decode(model.generate(ids, max_new_tokens=300)[0][ids.shape[1]:], skip_special_tokens=True))Erk-32B bei der Arbeit
Das Video wurde bei LoRA-Skala 0,40 aufgezeichnet, bevor der Betriebspunkt feststand; die 73,16 % auf dem Bildschirm sind die Messung dieses Punkts vor der Zusatzrunde. Die veröffentlichte Zahl steht in der Tabelle oben. Antwortstrom und Terminaloberfläche sind identisch. 67 Sekunden, 1440p, ohne Ton.
Bekannte Einschränkungen
Ein einziger Seed; die Varianz zwischen Seeds wurde nicht gemessen.
Generierungsqualität, langer Kontext, Code und Schlussfolgern wurden nicht gemessen.
Die Identität hängt vom Systemprompt ab; ohne ihn nennt das Modell die Identität des Basismodells.
Ein Gewinn im morphologischen Wissen ließ sich nicht nachweisen; die Differenz auf der Generierungsachse enthält Formattreue.
Das Korpus des Basismodells lässt sich nicht prüfen; der Vergleich nimmt an, dass beide Seiten in unbekanntem Maß kontaminiert sind.
Bericht, Skripte und Vorhersagevektoren, alles offen
Lizenz Apache 2.0, wie das Basismodell. Kontakt: [email protected]
OLCUM-PROTOKOLU.md
Vollständiger technischer Bericht; acht Abschnitte inklusive Messlogbuch und korrigierten Zahlen.
betikler/
Skripte für Training, Bereinigung, Messung, Scan, Bootstrap, Zusammenführung und GGUF; 34 Dateien, llama.cpp-Version fixiert.
sonuclar/
Vorhersagevektoren pro Frage; 17 JSON-Dateien. Gepaarte Vergleiche lassen sich ohne Modelllauf wiederholen.
Erk-32B-GGUF
Quantisierungen Q8_0 und Q4_K_M, Validierungszusammenfassung und die Karte der quantisierten Builds.
Die offenen Benchmarks, auf denen die Messung beruht
Training und Messungen liefen auf den im Rahmen des Programms AI EDIH Türkiye bereitgestellten Hochleistungsrechenressourcen, auf der Infrastruktur der Technischen Universität Istanbul – Nationales Zentrum für Hochleistungsrechnen (UHeM). Wir danken dem MEXT Technology Center als Programmträger und CerebrAI-VortX Neurotechnology and Software Systems für die Zusammenarbeit bei unseren EEG-Arbeiten.
Erk-32B auf der eigenen Infrastruktur betreiben
Gewichte, GGUF-Quantisierungen und sämtliche Messskripte sind auf Hugging Face offen. Für Unternehmens-Deployment, Feinabstimmung und Integration nehmen Sie Kontakt mit uns auf.