Erk-32B
نموذج لغوي تركي، ببروتوكول قياس.
طوّرت eCloud Tech. نموذج Erk-32B على أساس Qwen3-32B مفتوح المصدر بـ1.05 مليار رمز من التدريب المسبق المستمر بالتركية و423 مليون رمز من ضبط التعليمات بالتركية. كل رقم في هذه الصفحة اجتاز تدقيق التلوث وتدوير الخيارات وقياس الاختيار القسري وفواصل ثقة بوتستراب مزدوجة؛ البروتوكول والأرقام الخام المصحّحة وسكربتات إعادة الإنتاج مفتوحة في المستودع.
TurkishMMLU · نظيف 652 · تدوير الخيارات
الأساس Qwen3-32B: 67.64% · الفرق +3.37 · فاصل ثقة 95% [+0.61, +6.13]
نقطة التشغيل: مقياس LoRA بقيمة 0.75 + موجّه نظام، أوزان مدمجة
يحمل كل فرق فاصل ثقة 95% ببوتستراب مزدوج من 10,000 إعادة معاينة. الفاصل الذي يحتوي الصفر يُبلَّغ عنه في هذا البروتوكول على أنه غير مُثبَت؛ ولا يُحتسب أبدًا مكسبًا.
| القياس | Qwen3-32B | Erk-32B | الفرق | فاصل ثقة 95% |
|---|---|---|---|---|
| TurkishMMLU، نظيف 652، تدوير الخيارات | 67.64% | 71.01% | +3.37 | [+0.61, +6.13] |
| توليد TurkMorfBench v2 (512، مطابقة تامة، موجّه نظام) | 31.64% | 59.38% | +27.73 | [+22.46, +33.01] |
| اختيار قسري TurkMorfBench v2، الإجمالي (502) | 89.44% | 91.43% | +1.99 | [−0.20, +4.18]غير مُثبَت |
| اختيار قسري TurkMorfBench v2، كلمات حقيقية (312) | 94.55% | 96.47% | +1.92 | [−0.32, +4.17]غير مُثبَت |
| اختيار قسري TurkMorfBench v2، جذوع مصطنعة (190) | 81.05% | 83.16% | +2.11 | [−2.11, +6.32]غير مُثبَت |
| الهوية (30 سؤالًا، مع أسئلة خادعة، موجّه نظام) | — | 30/30 | — | — |
بذرة تدريب واحدة؛ فواصل الثقة تغطي معاينة الأسئلة لا البذرة. النقاط الـ28+ على محور التوليد هي في معظمها التزام بالصيغة: النموذج الأساسي يبقى داخل كتلة التفكير ولا يكتب الإجابة.
أربعة نماذج وفق البروتوكول نفسه
TurkishMMLU · نظيف 652 · تدوير الخيارات · الدقة
نسبة 69.7% على بطاقة Erk-14B الخاصة هي قياس 0-shot بأداة lm-evaluation-harness على المجموعة الكاملة دون تدوير؛ أما 67.18% هنا فهي النموذج نفسه مقيسًا على المجموعة المنقّاة والمدوّرة. الفرق نابع من البروتوكول لا من النموذج.
فروق تعذّر إثباتها
- لم يُثبَت فرق عن الأساس في المعرفة الصرفية (اختيار قسري): الحدود الدنيا تحت الصفر مباشرة، وعلى الجذوع المصطنعة لا فرق البتة.
- حسّن التدريب المستمر المعرفة بالتركية؛ لكنه لم يغيّر نظام اللواحق بشكل قابل للقياس.
- النقاط الـ28+ على محور التوليد هي في معظمها التزام بالصيغة؛ النموذج الأساسي يبقى داخل كتلة التفكير ولا يكتب الإجابة.
- تفوّق الصرف بمقدار +3.73 الذي أُبلغ عنه مع الإصدار الأول من المعيار استند إلى 18 إجابة ذهبية خاطئة وقد سُحب.
لا يُبلَّغ عن أي رقم قبل اجتياز هذه المرشّحات
تبيّن أن معظم القياسات الخام كانت آثارًا قياسية. البروتوكول الكامل وسجل القياس والأرقام المصحّحة مفتوحة في ملف OLCUM-PROTOKOLU.md في ثمانية أقسام.
تدقيق التلوث
113 من أسئلة TurkishMMLU الـ900 تظهر حرفيًا في متن التدريب المستمر (نافذة 13 كلمة). تُستبعد هذه مع مجموعة الضبط ذات الـ150 سؤالًا: نظيف 652.
تدوير الخيارات
يُقاس كل سؤال بترتيب خيارات مدوّر؛ فيُزال انحياز الحرف والموضع.
الاختيار القسري مقابل التوليد
يُفصل الالتزام بالصيغة عن المعرفة: فجوة +28 نقطة في التوليد تصبح +2.0 في الاختيار القسري، غير مُثبَتة.
تدقيق المعيار نفسه
وُجدت 18 إجابة ذهبية خاطئة في الإصدار الأول من معيار الصرف؛ فأُعيد قياس كل رقم بالإصدار v2 المصحّح.
بوتستراب مزدوج
10,000 إعادة معاينة؛ الفرق الذي يحتوي فاصله الصفر يُكتب على أنه غير مُثبَت.
يضم سجل الأرقام الخام المصحّحة اثني عشر بندًا؛ لم يُبلَّغ عن أي منها من الخارج، بل وُجدت جميعها في تدقيقنا الذاتي قبل النشر.
كيف جرى التدريب
النموذج الأساسي ليس من إنتاجنا ويُذكر في كل موضع. 53.5% من الإجابات المحتوية على كود في متن التعليمات كانت متضررة بالترجمة الآلية؛ سكربتات التنظيف والإصلاح في المستودع. تلوث المعيار في متن التعليمات: 0/900 عند العتبة n=13.
- الأساس
- Qwen3-32B (Apache 2.0)
- التدريب المستمر
- 1.05 مليار رمز ويب تركي · LoRA r=256 α=512 · 32,000 خطوة
- ضبط التعليمات
- 423 مليون رمز، 373,387 مثالًا (منظّفة) · جولتان
- جولة إضافية
- هوية 6,000 + تصحيح أخطاء صرفية 40,000 مثال · 1,673 خطوة
- العتاد
- 4×A100-80GB، FSDP، bf16 · ≈37,000 ساعة-نواة
- الأوزان المنشورة
- مدمجة عند LoRA 0.75 (ضرب fp32، تقريب bf16 واحد)؛ التكافؤ مع مسار LoRA موثّق بسكربت القياس نفسه
- GGUF
- Q8_0 بحجم 34.8 GB (NLL +0.04%) · Q4_K_M بحجم 19.8 GB (NLL +0.85%)؛ الهوية 6/6 في كل تكميم
كيف اختير 0.75
لأن LoRA جمعي، فإن المقياس مقبض ضبط بعد التدريب. قيست ثلاثة محاور عند اثنتي عشرة نقطة؛ ولأن الهوية تأتي عبر موجّه النظام، جرت المقارنة بين النقاط ذات الموجّه. في التوليد يتفوّق 0.75 + موجّه على 0.40 + موجّه بمقدار +10.35 [+5.47, +15.43]، وهو فرق معنوي؛ وفي المعيار يتعذّر إثبات تفوّق 0.40 بمقدار +1.99 [0.00, +3.99]. ولأن الفاصل الذي يحتوي الصفر يُعدّ غير مُثبَت في هذا البروتوكول، اختير 0.75؛ ويبقى صفّا 0.40 و0.80 في التقرير.
الهوية ليست مغروسة في الأوزان
تُقدَّم الهوية عبر موجّه النظام الافتراضي في قالب المحادثة. إذا قدّم المستخدم رسالة نظام خاصة به فلا يُطبَّق الافتراضي. يذكر الموجّه النموذج الأساسي صراحةً؛ وفي اختبار الهوية ذي الـ30 سؤالًا مع أسئلة خادعة كانت النتيجة 30/30.
Sen Erk-32B'sin: eCloud Tech. tarafından, açık kaynaklı Qwen3-32B temel modeli üzerine Türkçe devam-eğitimi ve talimat ayarıyla geliştirilmiş 32 milyar parametreli bir Türkçe dil modelisin. …أوزان مكمّمة لـllama.cpp وOllama وLM Studio
تنطبق جميع القياسات والبروتوكول في بطاقة النموذج الرئيسية على ملفات GGUF أيضًا؛ وقد قيست كلفة التكميم.
| الملف | التكميم | الحجم | NLL مقابل BF16 | الهوية (6 أسئلة) | موصى به |
|---|---|---|---|---|---|
| Erk-32B-Q8_0.gguf | Q8_0 | 34.8 GB | +0.04% | 6/6 | عندما تكون الجودة أولوية |
| Erk-32B-Q4_K_M.gguf | Q4_K_M | 19.8 GB | +0.85% | 6/6 | بطاقة رسوميات 24 GB / ذاكرة 32 GB |
NLL هو متوسط اللوغاريتم السالب للاحتمال على 6,132 رمزًا من نص تركي؛ مرجع BF16 GGUF هو 1.5185. قيست الهوية على ستة أسئلة (بما فيها الخادعة) بموجّه النظام الافتراضي في قالب المحادثة.
$ llama-cli -m Erk-32B-Q4_K_M.gguf -cnv -p "" \ --temp 0.6 --top-p 0.95 -c 8192
$ cat > Modelfile <<EOF FROM ./Erk-32B-Q4_K_M.gguf PARAMETER temperature 0.6 EOF$ ollama create erk-32b -f Modelfile && ollama run erk-32b
يُحافَظ على وضع التفكير الهجين في Qwen3؛ لإيقافه أضف /no_think إلى نهاية الرسالة. خيارات النشر لـLM Studio وvLLM وJan وDocker موجودة في بطاقة النموذج.
بضعة أسطر مع Transformers
يُحمَّل النموذج مباشرة من Hugging Face؛ ويحمل قالب المحادثة موجّه الهوية الافتراضي. استخدم /no_think لإيقاف وضع التفكير.
from transformers import AutoModelForCausalLM, AutoTokenizer
m = "ecloudtech/Erk-32B"
tok = AutoTokenizer.from_pretrained(m)
model = AutoModelForCausalLM.from_pretrained(m, torch_dtype="auto", device_map="auto")
msgs = [{"role": "user", "content": "Türkçede ünsüz yumuşaması nedir? /no_think"}]
ids = tok.apply_chat_template(msgs, add_generation_prompt=True, return_tensors="pt").to(model.device)
print(tok.decode(model.generate(ids, max_new_tokens=300)[0][ids.shape[1]:], skip_special_tokens=True))Erk-32B أثناء العمل
سُجّل الفيديو عند مقياس LoRA بقيمة 0.40 قبل تثبيت نقطة التشغيل؛ ونسبة 73.16% الظاهرة على الشاشة هي قياس تلك النقطة قبل الجولة الإضافية. الرقم المنشور في الجدول أعلاه. تدفّق الإجابة وواجهة الطرفية متطابقان. 67 ثانية، 1440p، بلا صوت.
القيود المعروفة
بذرة واحدة؛ لم يُقَس التباين بين البذور.
لم تُقَس جودة التوليد ولا السياق الطويل ولا الكود ولا الاستدلال.
تعتمد الهوية على موجّه النظام؛ وعند النشر دونه يذكر النموذج هوية النموذج الأساسي.
لم يُثبَت مكسب في المعرفة الصرفية؛ والفرق على محور التوليد يتضمن الالتزام بالصيغة.
لا يمكن تدقيق متن النموذج الأساسي؛ تفترض المقارنة أن الطرفين ملوّثان بدرجة غير معلومة.
التقرير والسكربتات ومتجهات التنبؤ، كلها مفتوحة
الترخيص Apache 2.0، كالنموذج الأساسي. للتواصل: [email protected]
OLCUM-PROTOKOLU.md
التقرير التقني الكامل؛ ثمانية أقسام تشمل سجل القياس والأرقام المصحّحة.
betikler/
سكربتات التدريب والتنظيف والقياس والمسح والبوتستراب والدمج وGGUF؛ 34 ملفًا، إصدار llama.cpp مثبّت.
sonuclar/
متجهات التنبؤ لكل سؤال؛ 17 ملف JSON. يمكن إعادة المقارنات المزدوجة دون تشغيل النموذج.
Erk-32B-GGUF
تكميمات Q8_0 وQ4_K_M، وملخص التحقق، وبطاقة الإصدارات المكمّمة.
المعايير المفتوحة التي يستند إليها القياس
جرى التدريب والقياس على موارد الحوسبة عالية الأداء المقدَّمة في إطار برنامج AI EDIH Türkiye، على بنية جامعة إسطنبول التقنية – المركز الوطني للحوسبة عالية الأداء (UHeM). نشكر مركز MEXT للتكنولوجيا، الجهة المشغّلة للبرنامج، وشركة CerebrAI-VortX لتقنيات الأعصاب وأنظمة البرمجيات على تعاونها في أعمالنا الخاصة بتخطيط الدماغ.
شغّل Erk-32B على بنيتك التحتية
الأوزان وتكميمات GGUF وجميع سكربتات القياس مفتوحة على Hugging Face. تواصل معنا للنشر المؤسسي والضبط الدقيق والتكامل.