Eğitim
Table | |
|---|
| Temel model | unsloth/Qwen3-4B-Instruct-2507-unsloth-bnb-4bit |
| Yöntem | LoRA (4-bit QLoRA), Unsloth |
| Veri seti | ssilistre/carnegie-dost-kazanma-tr — 1001 kayıt |
| Rank / alpha | 16 / 32 |
| Dropout | 0 |
| Hedef modüller | q_proj k_proj v_proj o_proj gate_proj up_proj down_proj |
| Adım | 60 (≈ 1 epoch) |
| Etkili batch | 8 (2 × 4 accumulation) |
| Sekans uzunluğu | 1024, packing (bfd) |
| Öğrenme oranı | 2e-4, linear, %5 warmup |
| Optimizer | adamw_8bit, weight decay 0.01 |
| Donanım | Tesla T4 |
| Adaptör boyutu | 132 MB |
Loss
adım 10 → 2.331
adım 20 → 1.935
adım 30 → 1.830
adım 40 → 1.749
adım 50 → 1.754
adım 60 → 1.742
Son 20 adımda loss düzleşti ve geri yükselmedi — model bir epoch içinde yakınsadı, ezberleme (overfitting) belirtisi yok.
Adım sayısı veri setinin token toplamına göre seçildi: 1001 örnek ≈ 499 bin token, 60 adım × 8192 token/adım ≈ 0,98 epoch.
Kullanım
from unsloth import FastLanguageModel
model, tokenizer = FastLanguageModel.from_pretrained(
"ssilistre/carnegie-dost-kazanma-lora",
max_seq_length=1024,
load_in_4bit=True,
)
FastLanguageModel.for_inference(model)
msgs = [{"role": "user",
"content": "Ekip arkadaşım sürekli işleri geç teslim ediyor. Ona bunu nasıl söylemeliyim?"}]
inputs = tokenizer.apply_chat_template(msgs, add_generation_prompt=True, return_tensors="pt").to("cuda")
out = model.generate(input_ids=inputs, max_new_tokens=300, temperature=0.7, top_p=0.9, do_sample=True)
print(tokenizer.decode(out[0][inputs.shape[1]:], skip_special_tokens=True))
PEFT ile:
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer
base = AutoModelForCausalLM.from_pretrained("unsloth/Qwen3-4B-Instruct-2507", device_map="auto")
model = PeftModel.from_pretrained(base, "ssilistre/carnegie-dost-kazanma-lora")
tokenizer = AutoTokenizer.from_pretrained("ssilistre/carnegie-dost-kazanma-lora")
Sınırlamalar
- Eğitim verisi bir dil modeli tarafından yazıldı ve uzman denetiminden geçmedi. Çıktılar profesyonel psikolojik danışmanlık yerine geçmez.
- Kısa eğitim. Tek epoch, 60 adım. Üslup ve konu yönelimi aktarıldı, derin bir uzmanlık değil.
- Dar alan. Yalnızca kişilerarası iletişim konusunda uyarlandı. Diğer konularda temel modelin davranışı geçerlidir ve ince ayar bir katkı sağlamaz.
- Dönemsel bakış açısı. Veri seti 1936'da yazılmış bir kişisel gelişim kitabının ilkelerinden türetildi. Eskimiş yaklaşımlar veri hazırlanırken çağdaş dille yeniden çerçevelendi, ancak izleri kalmış olabilir.
- Temel modelin sınırları geçerli. Yanlış bilgi üretebilir, kaynak uydurabilir, güncel olayları bilmez.
- 4-bit temel model. Adaptör 4-bit nicelenmiş bir taban üzerinde eğitildi; 16-bit tabanla kullanıldığında davranış bir miktar değişebilir.
Benchmark Sonuçları
Table with columns: Benchmark, Metrik, Base (Qwen3-4B-Instruct-2507), Bu model (LoRA), Fark| Benchmark | Metrik | Base (Qwen3-4B-Instruct-2507) | Bu model (LoRA) | Fark |
|---|
| Türkçe MMLU (~6.2K soru) | doğruluk % | 66.13 | 59.94 | -6.19 |
| XCOPA-tr (500 soru) | doğruluk % | 91.80 | 82.40 | -9.40 |
| turkish_nuance (66 soru) | ort. anlamsal benzerlik | 58.86 | 50.37 | -8.50 |
MMLU: farkın en büyük olduğu 10 bölüm
Table with columns: Bölüm, Base, LoRA, Fark| Bölüm | Base | LoRA | Fark |
|---|
| Çocuk Gelişimi | 75.00 | 60.00 | -15.00 |
| Okul Öncesi Öğretmenliği | 79.00 | 65.00 | -14.00 |
| Lojistik | 69.00 | 55.00 | -14.00 |
| Felsefe | 72.00 | 58.00 | -14.00 |
| TUS |
Metodoloji
- Değerlendirme kodu: olcum.py uyarlaması — aynı prompt, aynı cevap kontrolü (harf eşleşme +
paraphrase-multilingual-mpnet-base-v2 anlamsal fallback), transformers + PEFT ile.
- Üretim: greedy decode, MCQ max_new_tokens=42, açık uçlu max_new_tokens=256, batch=32, chat template uygulanmış.
- Donanım: NVIDIA A100-SXM4-40GB; süreler (sn): {'base': 240, 'lora': 523}.
- Açık uçlu setler (turkish_nuance/creativity/reasoning, llm-eval-pipeline) beklenen cevapla kosinüs benzerliğiyle puanlanır (0-100); doğruluk yüzdesiyle karıştırılmamalı.
- Yorum: LoRA tüm setlerde base'in altında kaldı. Dar alanlı (iletişim/insan ilişkileri) veriyle 3 epoch eğitim genel yeteneklerde gerileme (catastrophic forgetting) yaratmış görünüyor; açık uçlu cevaplarda ayrıca eğitim şemasından sızan
<tool_call> artifact'ları benzerlik skorunu düşürüyor. Bu, küçük ve dar veri setiyle yapılan fine-tune'un bilinen riskidir ve sonuçlar dürüstçe raporlanmıştır.