📊 Türkçe MMLU Benchmark Karşılaştırması
Bu model, alibayram/yapay_zeka_turkce_mmlu_model_cevaplari veri seti ve Türkçe MMLU ölçüm betiği (olcum.py) kullanılarak değerlendirilmiştir.
google/gemma-3-1b-it base modeli üzerinden [Endezyar/siyer_datasets] veri seti eğiltilmişdi. Lakin sistem çıktıları tatmin edici değildi. Yapılan testlerde başarı oranı %25 rastlantı sınırının altında kalmıştır.
Ne var ki base model kendi haliyle teste sokulduğundan hemen hemen aynı sonuçlar alınmış ve sorunun veri setinden değil modelden olduğu sonucuna varılmıştır.
📈 Karşılaştırma Tablosu
Table with columns: Model, Model Türü, MMLU Başarı Skoru (%), Test Süresi (sn)| Model | Model Türü | MMLU Başarı Skoru (%) | Test Süresi (sn) |
|---|
| google/gemma-3-1b-it | Base Model | %22.37 | 3704.42 saniye |
Benchmark Sonuçları
Table with columns: Metrik, Değer| Metrik | Değer |
|---|
| Soru Sayısı | 6200 |
| Doğru Cevap Sayısı | 1387 |
| Başarı Oranı | %22.37 |
| Toplam Süre | 3704.42 saniye |
Uploaded finetuned model
- Developed by: Endezyar
- License: apache-2.0
- Finetuned from model : unsloth/gemma-3-1b-it-unsloth-bnb-4bit
This gemma3_text model was trained 2x faster with Unsloth and Huggingface's TRL library.