Eğitim
Table | |
|---|
| Temel model | unsloth/Qwen3-4B-Instruct-2507-unsloth-bnb-4bit |
| Yöntem | LoRA (4-bit QLoRA), Unsloth |
| Veri seti | ssilistre/carnegie-dost-kazanma-tr — 1001 kayıt |
| Rank / alpha | 16 / 32 |
| Dropout | 0 |
| Hedef modüller | q_proj k_proj v_proj o_proj gate_proj up_proj down_proj |
| Adım | 60 (≈ 1 epoch) |
| Etkili batch | 8 (2 × 4 accumulation) |
| Sekans uzunluğu | 1024, packing (bfd) |
| Öğrenme oranı | 2e-4, linear, %5 warmup |
| Optimizer | adamw_8bit, weight decay 0.01 |
| Donanım | Tesla T4 |
| Adaptör boyutu | 132 MB |
Loss
adım 10 → 2.331
adım 20 → 1.935
adım 30 → 1.830
adım 40 → 1.749
adım 50 → 1.754
adım 60 → 1.742
Son 20 adımda loss düzleşti ve geri yükselmedi — model bir epoch içinde yakınsadı, ezberleme (overfitting) belirtisi yok.
Adım sayısı veri setinin token toplamına göre seçildi: 1001 örnek ≈ 499 bin token, 60 adım × 8192 token/adım ≈ 0,98 epoch.
Kullanım
from unsloth import FastLanguageModel
model, tokenizer = FastLanguageModel.from_pretrained(
"ssilistre/carnegie-dost-kazanma-lora",
max_seq_length=1024,
load_in_4bit=True,
)
FastLanguageModel.for_inference(model)
msgs = [{"role": "user",
"content": "Ekip arkadaşım sürekli işleri geç teslim ediyor. Ona bunu nasıl söylemeliyim?"}]
inputs = tokenizer.apply_chat_template(msgs, add_generation_prompt=True, return_tensors="pt").to("cuda")
out = model.generate(input_ids=inputs, max_new_tokens=300, temperature=0.7, top_p=0.9, do_sample=True)
print(tokenizer.decode(out[0][inputs.shape[1]:], skip_special_tokens=True))
PEFT ile:
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer
base = AutoModelForCausalLM.from_pretrained("unsloth/Qwen3-4B-Instruct-2507", device_map="auto")
model = PeftModel.from_pretrained(base, "ssilistre/carnegie-dost-kazanma-lora")
tokenizer = AutoTokenizer.from_pretrained("ssilistre/carnegie-dost-kazanma-lora")
Sınırlamalar
- Eğitim verisi bir dil modeli tarafından yazıldı ve uzman denetiminden geçmedi. Çıktılar profesyonel psikolojik danışmanlık yerine geçmez.
- Kısa eğitim. Tek epoch, 60 adım. Üslup ve konu yönelimi aktarıldı, derin bir uzmanlık değil.
- Dar alan. Yalnızca kişilerarası iletişim konusunda uyarlandı. Diğer konularda temel modelin davranışı geçerlidir ve ince ayar bir katkı sağlamaz.
- Dönemsel bakış açısı. Veri seti 1936'da yazılmış bir kişisel gelişim kitabının ilkelerinden türetildi. Eskimiş yaklaşımlar veri hazırlanırken çağdaş dille yeniden çerçevelendi, ancak izleri kalmış olabilir.
- Temel modelin sınırları geçerli. Yanlış bilgi üretebilir, kaynak uydurabilir, güncel olayları bilmez.
- 4-bit temel model. Adaptör 4-bit nicelenmiş bir taban üzerinde eğitildi; 16-bit tabanla kullanıldığında davranış bir miktar değişebilir.
Benchmark Sonuçları
Table with columns: Benchmark, Metrik, Base (Qwen3-4B-Instruct-2507), Bu model (LoRA), Fark| Benchmark | Metrik | Base (Qwen3-4B-Instruct-2507) | Bu model (LoRA) | Fark |
|---|
| Türkçe MMLU (~6.2K soru) | doğruluk % | 66.13 | 59.94 | -6.19 |
| XCOPA-tr (500 soru) | doğruluk % | 91.80 | 82.40 | -9.40 |
| turkish_nuance (66 soru) | ort. anlamsal benzerlik | 58.86 | 50.37 | -8.50 |
MMLU: farkın en büyük olduğu 10 bölüm
Table with columns: Bölüm, Base, LoRA, Fark| Bölüm | Base | LoRA | Fark |
|---|
| Çocuk Gelişimi | 75.00 | 60.00 | -15.00 |
| Okul Öncesi Öğretmenliği | 79.00 | 65.00 | -14.00 |
| Lojistik | 69.00 | 55.00 | -14.00 |
| Felsefe | 72.00 | 58.00 | -14.00 |
| TUS |
Diğer modellerle kıyas (Türkçe MMLU, tam set ~6.2K)
Table with columns: Model, Boyut, Doğruluk %| Model | Boyut | Doğruluk % |
|---|
| gpt-4o | — | 84.84 |
| qwen3:32b | 32.8B | 75.98 |
| gemma3:12b | 12.2B | 70.74 |
| qwen3:8b | 8.2B | 67.56 |
| Qwen/Qwen3-4B-Instruct-2507 (base, bu repo ölçümü) | 4B | 66.13 |
| qwen2.5:7b | 7.6B |
Diğer skorlar resmî liderlik tablosundan; aynı olcum.py
protokolü. Liderlik tablosu modelleri çoğunlukla Q4 gguf (Ollama) veya API
ile, bu reponun base/LoRA ölçümleri bf16 + transformers ile koşuldu —
kıyas yaklaşıktır.
Lokal doğrulama (kısıtlı örneklem)
Table with columns: Benchmark, Base, Bu model (LoRA), Fark| Benchmark | Base | Bu model (LoRA) | Fark |
|---|
| Türkçe MMLU (620 soru; bölüm başına 10, seed=42) | 64.03 | 57.90 | -6.13 |
Apple M5 Pro (MPS, bf16) üzerinde aynı değerlendirme zinciriyle yeniden
koşuldu; tam koşudaki -6.19 fark lokalde -6.13 olarak tekrarlandı.
Metodoloji
- Değerlendirme kodu: olcum.py uyarlaması — aynı prompt, aynı cevap kontrolü (harf eşleşme +
paraphrase-multilingual-mpnet-base-v2 anlamsal fallback), transformers + PEFT ile.
- Üretim: greedy decode, MCQ max_new_tokens=42, açık uçlu max_new_tokens=256, batch=32, chat template uygulanmış.
- Donanım: NVIDIA A100-SXM4-40GB; süreler (sn): {'base': 240, 'lora': 523}.
- Açık uçlu setler (turkish_nuance/creativity/reasoning, llm-eval-pipeline) beklenen cevapla kosinüs benzerliğiyle puanlanır (0-100); doğruluk yüzdesiyle karıştırılmamalı.
- Yorum: LoRA tüm setlerde base'in altında kaldı. Dar alanlı (iletişim/insan ilişkileri) veriyle 3 epoch eğitim genel yeteneklerde gerileme (catastrophic forgetting) yaratmış görünüyor; açık uçlu cevaplarda ayrıca eğitim şemasından sızan
<tool_call> artifact'ları benzerlik skorunu düşürüyor. Bu, küçük ve dar veri setiyle yapılan fine-tune'un bilinen riskidir ve sonuçlar dürüstçe raporlanmıştır.
Senaryo Benchmark'ı — İnsan İlişkileri
ssilistre/carnegie-benchmark-tr üzerindeki 100 Türkçe insan ilişkileri senaryo MCQ'su. Genel MMLU'dan farkı: fine-tune'un asıl amacını (Carnegie iletişim ilkeleri) ölçer, held-out (taze + eğitime dedup).
Table with columns: Metrik, Base (Qwen3-4B-Instruct-2507), Bu model (LoRA), Fark| Metrik | Base (Qwen3-4B-Instruct-2507) | Bu model (LoRA) | Fark |
|---|
| Genel doğruluk % | 97.00 | 93.00 | -4.00 |
Kategori bazlı
Table with columns: Kategori, Base, LoRA, Fark| Kategori | Base | LoRA | Fark |
|---|
| Anlaşmazlık yönetimi | 100.00 | 95.00 | -5.00 |
| Eleştiri & geri bildirim | 95.00 | 95.00 | +0.00 |
| Karşındakinin bakışı | 90.00 | 85.00 | -5.00 |
| Takdir & ilgi | 100.00 | 90.00 | -10.00 |
|
Çoklu model karşılaştırması (aynı 100 soru)
Table with columns: Model, Genel doğruluk, Doğru/Toplam| Model | Genel doğruluk | Doğru/Toplam |
|---|
| google/gemma-2-9b-it | %100.00 | 100/100 |
| Qwen3-4B-Instruct-2507 (base) | %97.00 | 97/100 |
| Qwen2.5-7B-Instruct | %97.00 | 97/100 |
| Bu model (carnegie-dost-kazanma-lora) | %93.00 | 93/100 |
| Qwen2.5-3B-Instruct | %87.00 | 87/100 |
| meta-llama/Llama-3.1-8B-Instruct | erişilemedi (gated) |
Metodoloji
- MMLU tarzı skorlama (harf eşleşme + anlamsal fallback), greedy decode, chat template.
- Held-out: sorular eğitim setine Jaccard dedup'tan geçti.
- Yorum: LoRA ile base benzer; güçlü base modeli bu MCQ formatında zaten Carnegie-uyumlu yaklaşımı seçebiliyor. MCQ tanıma ölçer, üretim değil; ceiling etkisiyle güçlü modeller ayrışmıyor. Sonuç dürüstçe raporlanmıştır.