المشاريع
    نموذج لغوي تركي مفتوح · Apache 2.0

    Erk-32B

    نموذج لغوي تركي، ببروتوكول قياس.

    طوّرت eCloud Tech. نموذج Erk-32B على أساس Qwen3-32B مفتوح المصدر بـ1.05 مليار رمز من التدريب المسبق المستمر بالتركية و423 مليون رمز من ضبط التعليمات بالتركية. كل رقم في هذه الصفحة اجتاز تدقيق التلوث وتدوير الخيارات وقياس الاختيار القسري وفواصل ثقة بوتستراب مزدوجة؛ البروتوكول والأرقام الخام المصحّحة وسكربتات إعادة الإنتاج مفتوحة في المستودع.

    0.00%

    TurkishMMLU · نظيف 652 · تدوير الخيارات

    الأساس Qwen3-32B: 67.64% · الفرق +3.37 · فاصل ثقة 95% [+0.61, +6.13]

    32B
    مُعامِل
    1.05B
    رموز التدريب المستمر بالتركية
    423M
    رموز ضبط التعليمات
    59.38%
    توليد TurkMorfBench v2
    30/30
    اختبار الهوية (30 سؤالًا)
    Apache 2.0
    الترخيص
    النتائج

    نقطة التشغيل: مقياس LoRA بقيمة 0.75 + موجّه نظام، أوزان مدمجة

    يحمل كل فرق فاصل ثقة 95% ببوتستراب مزدوج من 10,000 إعادة معاينة. الفاصل الذي يحتوي الصفر يُبلَّغ عنه في هذا البروتوكول على أنه غير مُثبَت؛ ولا يُحتسب أبدًا مكسبًا.

    القياسQwen3-32BErk-32Bالفرقفاصل ثقة 95%
    TurkishMMLU، نظيف 652، تدوير الخيارات67.64%71.01%+3.37[+0.61, +6.13]
    توليد TurkMorfBench v2 (512، مطابقة تامة، موجّه نظام)31.64%59.38%+27.73[+22.46, +33.01]
    اختيار قسري TurkMorfBench v2، الإجمالي (502)89.44%91.43%+1.99[−0.20, +4.18]غير مُثبَت
    اختيار قسري TurkMorfBench v2، كلمات حقيقية (312)94.55%96.47%+1.92[−0.32, +4.17]غير مُثبَت
    اختيار قسري TurkMorfBench v2، جذوع مصطنعة (190)81.05%83.16%+2.11[−2.11, +6.32]غير مُثبَت
    الهوية (30 سؤالًا، مع أسئلة خادعة، موجّه نظام)30/30

    بذرة تدريب واحدة؛ فواصل الثقة تغطي معاينة الأسئلة لا البذرة. النقاط الـ28+ على محور التوليد هي في معظمها التزام بالصيغة: النموذج الأساسي يبقى داخل كتلة التفكير ولا يكتب الإجابة.

    مقارنة الحجم

    أربعة نماذج وفق البروتوكول نفسه

    TurkishMMLU · نظيف 652 · تدوير الخيارات · الدقة

    Qwen3-14B
    60.58%
    Erk-14B
    67.18%
    Qwen3-32B
    67.64%
    Erk-32B
    71.01%

    نسبة 69.7% على بطاقة Erk-14B الخاصة هي قياس 0-shot بأداة lm-evaluation-harness على المجموعة الكاملة دون تدوير؛ أما 67.18% هنا فهي النموذج نفسه مقيسًا على المجموعة المنقّاة والمدوّرة. الفرق نابع من البروتوكول لا من النموذج.

    ما لا ندّعيه

    فروق تعذّر إثباتها

    • لم يُثبَت فرق عن الأساس في المعرفة الصرفية (اختيار قسري): الحدود الدنيا تحت الصفر مباشرة، وعلى الجذوع المصطنعة لا فرق البتة.
    • حسّن التدريب المستمر المعرفة بالتركية؛ لكنه لم يغيّر نظام اللواحق بشكل قابل للقياس.
    • النقاط الـ28+ على محور التوليد هي في معظمها التزام بالصيغة؛ النموذج الأساسي يبقى داخل كتلة التفكير ولا يكتب الإجابة.
    • تفوّق الصرف بمقدار +3.73 الذي أُبلغ عنه مع الإصدار الأول من المعيار استند إلى 18 إجابة ذهبية خاطئة وقد سُحب.
    بروتوكول القياس

    لا يُبلَّغ عن أي رقم قبل اجتياز هذه المرشّحات

    تبيّن أن معظم القياسات الخام كانت آثارًا قياسية. البروتوكول الكامل وسجل القياس والأرقام المصحّحة مفتوحة في ملف OLCUM-PROTOKOLU.md في ثمانية أقسام.

    01

    تدقيق التلوث

    113 من أسئلة TurkishMMLU الـ900 تظهر حرفيًا في متن التدريب المستمر (نافذة 13 كلمة). تُستبعد هذه مع مجموعة الضبط ذات الـ150 سؤالًا: نظيف 652.

    02

    تدوير الخيارات

    يُقاس كل سؤال بترتيب خيارات مدوّر؛ فيُزال انحياز الحرف والموضع.

    03

    الاختيار القسري مقابل التوليد

    يُفصل الالتزام بالصيغة عن المعرفة: فجوة +28 نقطة في التوليد تصبح +2.0 في الاختيار القسري، غير مُثبَتة.

    04

    تدقيق المعيار نفسه

    وُجدت 18 إجابة ذهبية خاطئة في الإصدار الأول من معيار الصرف؛ فأُعيد قياس كل رقم بالإصدار v2 المصحّح.

    05

    بوتستراب مزدوج

    10,000 إعادة معاينة؛ الفرق الذي يحتوي فاصله الصفر يُكتب على أنه غير مُثبَت.

    يضم سجل الأرقام الخام المصحّحة اثني عشر بندًا؛ لم يُبلَّغ عن أي منها من الخارج، بل وُجدت جميعها في تدقيقنا الذاتي قبل النشر.

    سجل التدريب

    كيف جرى التدريب

    النموذج الأساسي ليس من إنتاجنا ويُذكر في كل موضع. 53.5% من الإجابات المحتوية على كود في متن التعليمات كانت متضررة بالترجمة الآلية؛ سكربتات التنظيف والإصلاح في المستودع. تلوث المعيار في متن التعليمات: 0/900 عند العتبة n=13.

    الأساس
    Qwen3-32B (Apache 2.0)
    التدريب المستمر
    1.05 مليار رمز ويب تركي · LoRA r=256 α=512 · 32,000 خطوة
    ضبط التعليمات
    423 مليون رمز، 373,387 مثالًا (منظّفة) · جولتان
    جولة إضافية
    هوية 6,000 + تصحيح أخطاء صرفية 40,000 مثال · 1,673 خطوة
    العتاد
    4×A100-80GB، FSDP، bf16 · ≈37,000 ساعة-نواة
    الأوزان المنشورة
    مدمجة عند LoRA 0.75 (ضرب fp32، تقريب bf16 واحد)؛ التكافؤ مع مسار LoRA موثّق بسكربت القياس نفسه
    GGUF
    Q8_0 بحجم 34.8 GB (NLL +0.04%) · Q4_K_M بحجم 19.8 GB (NLL +0.85%)؛ الهوية 6/6 في كل تكميم
    نقطة التشغيل

    كيف اختير 0.75

    لأن LoRA جمعي، فإن المقياس مقبض ضبط بعد التدريب. قيست ثلاثة محاور عند اثنتي عشرة نقطة؛ ولأن الهوية تأتي عبر موجّه النظام، جرت المقارنة بين النقاط ذات الموجّه. في التوليد يتفوّق 0.75 + موجّه على 0.40 + موجّه بمقدار +10.35 [+5.47, +15.43]، وهو فرق معنوي؛ وفي المعيار يتعذّر إثبات تفوّق 0.40 بمقدار +1.99 [0.00, +3.99]. ولأن الفاصل الذي يحتوي الصفر يُعدّ غير مُثبَت في هذا البروتوكول، اختير 0.75؛ ويبقى صفّا 0.40 و0.80 في التقرير.

    W = Wbase + 0.75 · LoRA
    الهوية وموجّه النظام

    الهوية ليست مغروسة في الأوزان

    تُقدَّم الهوية عبر موجّه النظام الافتراضي في قالب المحادثة. إذا قدّم المستخدم رسالة نظام خاصة به فلا يُطبَّق الافتراضي. يذكر الموجّه النموذج الأساسي صراحةً؛ وفي اختبار الهوية ذي الـ30 سؤالًا مع أسئلة خادعة كانت النتيجة 30/30.

    Sen Erk-32B'sin: eCloud Tech. tarafından, açık kaynaklı Qwen3-32B temel modeli üzerine Türkçe devam-eğitimi ve talimat ayarıyla geliştirilmiş 32 milyar parametreli bir Türkçe dil modelisin. …
    إصدارات GGUF

    أوزان مكمّمة لـllama.cpp وOllama وLM Studio

    تنطبق جميع القياسات والبروتوكول في بطاقة النموذج الرئيسية على ملفات GGUF أيضًا؛ وقد قيست كلفة التكميم.

    الملفالتكميمالحجمNLL مقابل BF16الهوية (6 أسئلة)موصى به
    Erk-32B-Q8_0.ggufQ8_034.8 GB+0.04%6/6عندما تكون الجودة أولوية
    Erk-32B-Q4_K_M.ggufQ4_K_M19.8 GB+0.85%6/6بطاقة رسوميات 24 GB / ذاكرة 32 GB

    NLL هو متوسط اللوغاريتم السالب للاحتمال على 6,132 رمزًا من نص تركي؛ مرجع BF16 GGUF هو 1.5185. قيست الهوية على ستة أسئلة (بما فيها الخادعة) بموجّه النظام الافتراضي في قالب المحادثة.

    llama.cpp
    $ llama-cli -m Erk-32B-Q4_K_M.gguf -cnv -p "" \    --temp 0.6 --top-p 0.95 -c 8192
    Ollama
    $ cat > Modelfile <<EOF  FROM ./Erk-32B-Q4_K_M.gguf  PARAMETER temperature 0.6  EOF$ ollama create erk-32b -f Modelfile && ollama run erk-32b

    يُحافَظ على وضع التفكير الهجين في Qwen3؛ لإيقافه أضف /no_think إلى نهاية الرسالة. خيارات النشر لـLM Studio وvLLM وJan وDocker موجودة في بطاقة النموذج.

    الاستخدام

    بضعة أسطر مع Transformers

    يُحمَّل النموذج مباشرة من Hugging Face؛ ويحمل قالب المحادثة موجّه الهوية الافتراضي. استخدم /no_think لإيقاف وضع التفكير.

    python · transformers
    from transformers import AutoModelForCausalLM, AutoTokenizer
    
    m = "ecloudtech/Erk-32B"
    tok = AutoTokenizer.from_pretrained(m)
    model = AutoModelForCausalLM.from_pretrained(m, torch_dtype="auto", device_map="auto")
    
    msgs = [{"role": "user", "content": "Türkçede ünsüz yumuşaması nedir? /no_think"}]
    ids = tok.apply_chat_template(msgs, add_generation_prompt=True, return_tensors="pt").to(model.device)
    print(tok.decode(model.generate(ids, max_new_tokens=300)[0][ids.shape[1]:], skip_special_tokens=True))
    تسجيل الطرفية

    Erk-32B أثناء العمل

    erk-32b — zsh
    mp4
    0:00 / 0:00

    سُجّل الفيديو عند مقياس LoRA بقيمة 0.40 قبل تثبيت نقطة التشغيل؛ ونسبة 73.16% الظاهرة على الشاشة هي قياس تلك النقطة قبل الجولة الإضافية. الرقم المنشور في الجدول أعلاه. تدفّق الإجابة وواجهة الطرفية متطابقان. 67 ثانية، 1440p، بلا صوت.

    الحدود

    القيود المعروفة

    01

    بذرة واحدة؛ لم يُقَس التباين بين البذور.

    02

    لم تُقَس جودة التوليد ولا السياق الطويل ولا الكود ولا الاستدلال.

    03

    تعتمد الهوية على موجّه النظام؛ وعند النشر دونه يذكر النموذج هوية النموذج الأساسي.

    04

    لم يُثبَت مكسب في المعرفة الصرفية؛ والفرق على محور التوليد يتضمن الالتزام بالصيغة.

    05

    لا يمكن تدقيق متن النموذج الأساسي؛ تفترض المقارنة أن الطرفين ملوّثان بدرجة غير معلومة.

    محتوى المستودع

    التقرير والسكربتات ومتجهات التنبؤ، كلها مفتوحة

    الترخيص Apache 2.0، كالنموذج الأساسي. للتواصل: [email protected]

    OLCUM-PROTOKOLU.md

    التقرير التقني الكامل؛ ثمانية أقسام تشمل سجل القياس والأرقام المصحّحة.

    betikler/

    سكربتات التدريب والتنظيف والقياس والمسح والبوتستراب والدمج وGGUF؛ 34 ملفًا، إصدار llama.cpp مثبّت.

    sonuclar/

    متجهات التنبؤ لكل سؤال؛ 17 ملف JSON. يمكن إعادة المقارنات المزدوجة دون تشغيل النموذج.

    Erk-32B-GGUF

    تكميمات Q8_0 وQ4_K_M، وملخص التحقق، وبطاقة الإصدارات المكمّمة.

    شكر وتقدير

    جرى التدريب والقياس على موارد الحوسبة عالية الأداء المقدَّمة في إطار برنامج AI EDIH Türkiye، على بنية جامعة إسطنبول التقنية – المركز الوطني للحوسبة عالية الأداء (UHeM). نشكر مركز MEXT للتكنولوجيا، الجهة المشغّلة للبرنامج، وشركة CerebrAI-VortX لتقنيات الأعصاب وأنظمة البرمجيات على تعاونها في أعمالنا الخاصة بتخطيط الدماغ.

    شغّل Erk-32B على بنيتك التحتية

    الأوزان وتكميمات GGUF وجميع سكربتات القياس مفتوحة على Hugging Face. تواصل معنا للنشر المؤسسي والضبط الدقيق والتكامل.