Fähigkeiten
- Deutsche Faktenabfragen (z. B. „Hauptstadt von Bayern" → „München")
- Rückfrage bzw. Zurückhaltung bei Unsicherheit statt erfundener Antworten
- Flüssiges, grammatisches Deutsch
Benchmark — deutsches MMLU (deutsche From-Scratch-Modelle)
Multiple-Choice per Log-Likelihood auf deutschem MMLU, verglichen mit anderen von Grund auf trainierten deutschen Modellen (faire Klasse):
Table with columns: Modell, Größe, Accuracy| Modell | Größe | Accuracy |
|---|
| Mankei-1B-Chat | 1,01 B | 23,0 % |
| gpt2-xl-wechsel-german | 1,56 B | 20,2 % |
| LLäMmlein-1B | 1,10 B | 20,0 % |
| german-gpt2 (dbmdz) | 0,12 B | 20,0 % |
Mankei-1B führt das deutsche From-Scratch-Feld an. Kleine From-Scratch-Modelle liegen bei reinem Faktenwissen generell nahe dem Zufallsniveau (25 %) — Mankeis Stärke sind deutscher Sprachfluss und souveräner lokaler Betrieb, nicht der Wissens-Benchmark.

Verwendung
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
tok = AutoTokenizer.from_pretrained("keyvan-ai/Mankei-1B-Chat")
model = AutoModelForCausalLM.from_pretrained("keyvan-ai/Mankei-1B-Chat", dtype=torch.bfloat16)
msgs = [{"role": "user", "content": "Was ist die Hauptstadt von Bayern?"}]
ids = tok.apply_chat_template(msgs, add_generation_prompt=True, return_tensors="pt")
out = model.generate(ids, max_new_tokens=64, temperature=0.7, top_p=0.9,
repetition_penalty=1.15, do_sample=True)
print(tok.decode(out[0][ids.shape[1]:], skip_special_tokens=True))
Empfohlenes Sampling: temperature 0.7 · top_p 0.9 · repetition_penalty 1.15.
Lokaler Betrieb (GGUF)
GGUF-Quantisierungen (f16 → Q3_K_M) direkt in diesem Repo — und gespiegelt im eigenen keyvan-ai/Mankei-1B-Chat-GGUF (Model-Tree):
# Ollama
ollama run hf.co/keyvan-ai/Mankei-1B-Chat:Q4_K_M
# llama.cpp
llama-cli -hf keyvan-ai/Mankei-1B-Chat:Q4_K_M
Empfohlenes Sampling: temperature 0.7 · top_p 0.9 · repetition_penalty 1.15.
Architektur
Llama-Architektur · 1,013 Mrd. Parameter · hidden 1536 · 32 Layer · 24/6 Heads (GQA) · SwiGLU · RMSNorm · RoPE θ 500 000 · Kontext 4096 · Vokabular 32 768 · tied embeddings.
Trainingsdaten
Pretraining auf offen lizenzierten, quellseitig dokumentierten deutschen und englischen Quellen (EN gezielt für Mathematik, Wissenschaft, Bildung):
Chat-SFT: selbst erzeugt und CC0, gegen ein festes Prüfset dekontaminiert.