Model, Türkçe MMLU değerlendirme seti üzerinde test edilmiştir. Aynı soru kümesi üzerinde, referans olarak llama3.1:8b modeliyle de karşılaştırılmıştır.
Sonuç: magibu-sondaj-model, aynı 6.200 soruluk Türkçe MMLU setinde llama3.1:8b'ye göre +6.02 puan daha yüksek başarı elde etmiştir (%57.02 vs %51.00), ancak yaklaşık 2.1 kat daha yavaş yanıt vermektedir (~1.51 sn/soru vs ~0.71 sn/soru). Daha küçük parametre boyutuna (4.3B vs 8B) rağmen daha yüksek başarı göstermesi, fine-tuning'in Türkçe soru-cevap görevindeki katkısına işaret etmektedir. Yanıt süresi farkı donanım/yükleme koşullarından kaynaklanıyor olabilir; kesin bir çıkarım için aynı donanım üzerinde tekrar ölçüm önerilir.
Her iki model de aynı Türkçe MMLU soru setinde (6.200 soru), aynı prompt formatı ve aynı değerlendirme betiği ile test edilmiştir: