📋 Model Detayları
🎯 Eğitim Süreci ve Veri Seti
Eğitim sürecinde, web scraping yöntemiyle toplanan ve Hugging Face üzerinde paylaşılan yaklaşık 1.000 adetlik yapılandırılmış Türkçe yemek tarifi veri seti kullanılmıştır. Model, Unsloth kütüphanesi kullanılarak optimize edilmiş ve fine-tune işleminden geçirilmiştir.
Bu qwen3_5 modeli, Unsloth sayesinde 2 kat daha hızlı eğitilmiştir.
📊 MMLU Benchmark Sonuçları ve Karşılaştırma
Modelin dil becerilerini ve genel bilgi seviyesini ölçmek için Türkçe MMLU veri seti kullanılarak benchmark testi uygulanmıştır.
Modelimiz belirli bir niş alana (yemek tarifleri) odaklanacak şekilde fine-tune edilmiş olmasına rağmen, genel geçer bilgileri ölçen MMLU testinde temel modelle birebir aynı skoru almıştır. Bu durum, modelin yeni alanda (tarif üretme) uzmanlaşırken, genel dil ve bilgi yeteneklerinde herhangi bir performans kaybı veya körelme (catastrophic forgetting) yaşamadığını kanıtlamaktadır.
Not: Çıkarım (inference) süreleri incelendiğinde, Fine-Tuned modelin ham modele kıyasla daha uzun sürede testi tamamladığı görülmektedir. Bu durum, temel modelin üzerine ek bir LoRA katmanının (adaptörünün) yüklenmesi ve hesaplamalara dahil edilmesinden kaynaklanan beklenen bir zaman maliyetidir.
Aşağıdaki tablo, temel model ile fine-tune edilmiş modelin karşılaştırmalı MMLU performansını ve test sürelerini göstermektedir:
Table with columns: Model Versiyonu, Toplam Soru, Geçen Süre, Doğru Cevap, Başarı Oranı| Model Versiyonu | Toplam Soru | Geçen Süre | Doğru Cevap | Başarı Oranı |
|---|
| Qwen3.5-4B (Ham Model) | 6200 | 9431.2 sn | 1151 | % 18.56 |
| Qwen3.5-4B-Recipe-LoRA (Fine-Tuned) | 6200 | 14473.1 sn | 1151 | % 18.56 |
💻 Kullanım (Inference)
Bu modeli projenizde kullanmak için aşağıdaki örnek kodu inceleyebilirsiniz:
from unsloth import FastVisionModel
model, tokenizer = FastVisionModel.from_pretrained(
"nypgd/qwen3.5-4b-recipe-lora",
load_in_4bit = True,
)
FastVisionModel.for_inference(model)
prompt = "Cold Brew Tarifi nasıl yapılır? Tarifini verebilir misin?"