Model Bilgileri
Eğitim Veri Seti Hakkında
Model, 7 istatistik modülünü kapsayan 400 soru-cevap çiftiyle eğitilmiştir. Veri setindeki her örnek, modelin iç muhakeme sürecini (thinking) ve nihai açıklamasını (content) ayrı alanlar olarak içerir — ancak bu varyantın eğitiminde yalnızca nihai açıklama (content) kullanılmış, thinking alanı eğitim hedefine dahil edilmemiştir. Bu sayede model, ara adımları göstermeden doğrudan ve daha kısa cevaplar üretir.
Kapsanan Konular:
Table with columns: Modül, Konu, Soru Sayısı| Modül | Konu | Soru Sayısı |
|---|
| 1 | İstatistiğin Temelleri | 51 |
| 2 | Betimsel İstatistik | 50 |
| 3 | Olasılık | 55 |
| 4 | Olasılık Dağılımları | 51 |
| 5 | Örnekleme ve Tahmin | 59 |
| 6 | Hipotez Testleri | 89 |
Kullanım
from transformers import AutoTokenizer, AutoModelForCausalLM
model_id = "Toivo0/gemma-3-finetune"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id)
messages = [{"role": "user", "content": "Hipotez testinde p-değeri ne anlama gelir?"}]
prompt = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=512, do_sample=False)
response = tokenizer.decode(outputs[0][inputs.input_ids.shape[1]:], skip_special_tokens=True)
print(response)
📊 Türkçe MMLU Benchmark Sonuçları
Bu model, 6200 sorudan oluşan Türkçe MMLU benchmark testi ile taban model ve fine-tune edilmiş model üzerinde karşılaştırmalı olarak test edilmiştir.
📈 Genel Başarı Karşılaştırması
Table with columns: Model, Toplam Başarı Oranı (%), Doğru Cevap / Toplam Soru, Test Süresi| Model | Toplam Başarı Oranı (%) | Doğru Cevap / Toplam Soru | Test Süresi |
|---|
Base Model (gemma-3-1b-it) | %24.56 | 1523 / 6200 | 4544 s |
Fine-Tuned Model (gemma-3-finetune) | %23.69 | 1469 / 6200 | 6715 s |
| Fark | -0.87% | -54 Soru | - |
🏆 En Çok Gelişim Gösteren Alanlar (Top 10)
Table with columns: Kategori, Base (%), Fine-Tuned (%), Gelişim| Kategori | Base (%) | Fine-Tuned (%) | Gelişim |
|---|
| Turizm ve Seyahat Hizmetleri | %16.00 | %28.00 | +12.00% |
| Ehliyet Sınavı | %24.00 | %31.00 | +7.00% |
| KPSS Denemeleri | %20.00 | %26.00 | +6.00% |
| Medya ve İletişim | %17.00 | %23.00 | |
📉 En Çok Düşüş Gösteren Alanlar (Top 5)
Table with columns: Kategori, Base (%), Fine-Tuned (%), Düşüş| Kategori | Base (%) | Fine-Tuned (%) | Düşüş |
|---|
| Özel Koruma ve Güvenlik | %36.00 | %25.00 | -11.00% |
| İşletme Yönetimi | %27.00 | %16.00 | -11.00% |
| Tıbbi Dokümantasyon ve Sekreterlik | %33.00 | %23.00 | -10.00% |
| Kamu Yönetimi | %27.00 | %20.00 | |
📚 Tüm Kategorilerin Detaylı Başarı Tablosu
Table with columns: Bölüm / Kategori, Base Model (%), Fine-Tuned Model (%), Fark (%)| Bölüm / Kategori | Base Model (%) | Fine-Tuned Model (%) | Fark (%) |
|---|
| AUZEF | %28.00 | %26.00 | -2.00% |
| Acil Durum ve Afet Yönetimi | %28.00 | %27.00 | -1.00% |
| Adalet | %21.00 | %24.00 | +3.00% |
| Aşçılık | %21.00 | %25.00 | +4.00% |
Sonuç Yorumu
Bu fine-tune, istatistik alanına özel bir eğitimdir. MMLU testi ise 62 farklı genel bilgi kategorisini ölçmektedir. Genel başarıda gözlemlenen -0.87%'lik düşüş, 1B parametreli küçük bir modelde alan-spesifik fine-tuning'in beklenen bir sonucudur.
This gemma3_text model was trained 2x faster with Unsloth and Huggingface's TRL library.