Bu model nedir?
Luck-Spark V-300-MoE, Dr. Zeon tarafından sıfırdan eğitilen küçük bir Mixture-of-Experts dil modelidir. Mimari, Hugging Face MixtralForCausalLM iskeletini kullanır; ölçek ise bilinçli olarak tek bir Kaggle T4×2 oturumunda taşınabilir olacak şekilde seçilmiştir.
Amaç büyük bir genel model kopyalamak değil. Amaç şudur:
- ~300M parametrede seyrek uzman yönlendirmesinin gerçekten öğrenilip öğrenilmediğini görmek
- Türkçe + İngilizce + matematik + kod karışımını aynı küçük modelde dengelemek
- Ücretsiz Kaggle GPU kotasıyla oturumlar arası gerçek resume yapılabilen bir eğitim hattı kurmak
Bu repo, o hattın canlı ağırlıklarıdır.
Mimari
Table | |
|---|
| Mimari | Mixtral (decoder-only, MoE FFN) |
| Toplam parametre | ~294.6M |
| Katman | 12 |
| Gizli boyut | 768 |
| Dikkat başı | 12 |
| KV başı (GQA) | 4 |
| Yerel uzman | 4 |
| Token başına uzman | 2 |
| Uzman FFN | 2048 |
| Router aux loss | 0.005 |
| Bağlam | 1024 |
| RoPE θ | 10.000 |
| Sözlük | 32.004 |
| Tokenizer | ahmetggg/luck-spark-l-100m-base |
| Gömme paylaşımı | kapalı (tie_word_embeddings=false) |
Her token’da 4 uzmandan 2’si açılır. Küçük ölçekte 4 uzman, büyük Mixtral’daki 8 uzmanlık çeşitliliği vermez. Bu bilinçli bir donanım takasıdır: T4 belleğinde eğitim açılsın, yönlendirme yine gerçek bir MoE problemi olarak kalsın.
Eğitim verisi
Akışkan (streaming) karışım. Oranlar hedef token payıdır; doküman örnekleme olasılıkları ortalama doküman uzunluğuna göre düzeltilmiştir.
Table with columns: Kaynak, Hedef token payı, Rol| Kaynak | Hedef token payı | Rol |
|---|
HuggingFaceFW/fineweb-edu (sample-10BT) | %55 | İngilizce eğitim metni |
| ytu-ce-cosmos/Cosmos-Turkish-Corpus-v1.0 | %20 | Türkçe |
| open-web-math/open-web-math | %15 | matematik |
| codeparrot/codeparrot-clean | %5 | kod |
HuggingFaceTB/cosmopedia (openstax) | %5 |
Dokümanlar tokenize edilir, EOS eklenir, sonra 1024 token’lık bloklara paketlenir. Padding yok; her adımda sabit uzunluk.
Sınır. Tokenizer önce Türkçe ağırlıklı 100M taban için üretilmiştir. Karışımın büyük kısmı İngilizce olduğu için bu sözlük ideal değildir. Kod ve matematik token ekonomisi ileride ayrı bir sözlükle yeniden ele alınacaktır.
Eğitim düzeni
Table | |
|---|
| Donanım | Kaggle Tesla T4 × 2 |
| Paralelizm | torchrun, 2 süreç |
| Hassasiyet | T4’te FP16 (BF16 yoksa) |
| Batch / GPU | 2 |
| Gradient accumulation | 16 |
| Effective batch | 65.536 token / adım |
| Optimizasyon | AdamW (β1=0.9, β2=0.95) |
| Öğrenme hızı |
Kaggle oturumu yaklaşık 12 saatle sınırlıdır. Süre dolmadan güvenli checkpoint alınır; bir sonraki oturum aynı adımdan devam eder.
Checkpoint biçimi
Transformers’ın varsayılan Mixtral kayıt yoluna güvenilmez. Her kayıtta runtime state_dict doğrudan model.safetensors olarak yazılır ve luck_spark_checkpoint.json damgası konur. Yükleme strict=True ile yapılır. Damgasız eski klasörler yok sayılır.
Hub’da biriken checkpoint şişmesini önlemek için yalnızca son birkaç kayıt tutulur.
Resume’un sınırı. Ağırlık, optimizer ve scheduler oturumlar arasında taşınır. Streaming veri konumu birebir aynı yerden devam etmeyebilir. Yani ağırlık devamı gerçektir; veri konumunun birebir devamı garanti değildir.
Nasıl kullanılır?
Erken kontrol noktasıdır. Üretim sohbet botu değildir.
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
repo = "ahmetggg/Luck-spark-V-300-MoE"
tokenizer = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(
repo,
torch_dtype=torch.float16,
device_map="auto",
)
prompt = "Yapay zekânın günlük hayatı değiştirebileceği bir alanı anlat:"
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
output = model.generate(
**inputs,
max_new_tokens=64,
do_sample=True,
temperature=0.8,
top_p=0.95,
use_cache=False,
pad_token_id=tokenizer.pad_token_id,
eos_token_id=tokenizer.eos_token_id,
)
print(tokenizer.decode(output[0], skip_special_tokens=True))
Bağlam penceresi 1024 tokendir. Bundan uzun girdi kesilir veya anlamsızlaşır.
Ne beklemeli, ne beklememeli?
Bekle.
- Kısa Türkçe / İngilizce devam cümleleri
- Basit kalıp tamamlama
- Eğitim ilerledikçe daha az çöp token
Bekleme.
- Talimat takibi (instruct / chat finetune yok)
- Güvenilir çok adımlı matematik
- Temiz, çalışır kod
- Güncel bilgi
- 1024 token üstü tutarlı bellek
Ölçek kuralı kabaca şudur: ~300M parametreli bir model Chinchilla civarında birkaç milyar token görünce “küçük ama okunur taban” olmaya başlar. Birkaç yüz milyon token’da bebek dil modelidir. Bu kartı o mercekten okuyun.
Değerlendirme
Bu sürümde resmi kıyas tablosu yoktur. Eğitim sırasında yalnızca üretim sondası (TR / EN / matematik / kod promptları) çalışır. Sayısal tablo — held-out perplexity, basit matematik, kısa kod — 5B hedefinin ilerleyen dilimlerinde eklenecektir.
MoE sağlığı (uzman kullanım oranı, ölü uzman, router entropy) dahili loglardadır; henüz model kartına işlenmemiştir.
Sınırlamalar ve riskler
- Halüsinasyon üretir. Doğruluk iddiası yoktur.
- Eğitim verisi açık web kaynaklıdır; önyargı, hatalı bilgi ve istenmeyen kalıplar geçebilir.
- Küçük model olduğu için güvenlik hizalaması yoktur.
- Araştırma, eğitim ve hata ayıklama içindir. Tıbbi, hukuki, mali veya güvenlik-kritik işlerde kullanılmaz.
Seri
Yol haritası
- 5B token pretrain hedefini tamamlamak
- Held-out TR / EN perplexity ve küçük kıyas seti
- Uzman yük dengesini kartta yayınlamak
- Veri karışımına uygun sözlüğü yeniden değerlendirmek
- Ancak taban oturduktan sonra ayrı bir instruct sürümü
Atıf
@misc{luckspark-v300-moe,
title = {Luck-Spark V-300-MoE},
author = {Dr. Zeon},
year = {2026},
howpublished = {\url{https://huggingface.co/ahmetggg/Luck-spark-V-300-MoE}},
note = {From-scratch Mixtral-style MoE language model. Research preview.}
}
Lisans
MIT. Üstteki veri kümelerinin kendi lisanslarına da uyun.
Teşekkür
Eğitim, Kaggle ücretsiz T4×2 kotası ve Hugging Face Hub üzerinde yürütülmektedir. FineWeb-Edu, Cosmos Turkish Corpus, OpenWebMath, CodeParrot ve Cosmopedia sağlayıcılarına teşekkürler.