Gebruik
vllm serve kamoo-ai/kamoo-one-135m-instruct --max-model-len 1024
from transformers import pipeline
pipe = pipeline("text-generation", model="kamoo-ai/kamoo-one-135m-instruct")
out = pipe([
{"role": "system", "content": "Je bent Kamoo, een behulpzame Nederlandstalige AI-assistent. Antwoord helder, feitelijk en beknopt."},
{"role": "user", "content": "Herschrijf naar eenvoudig Nederlands: De aanvraag wordt buiten behandeling gesteld."},
], max_new_tokens=80)
Geef altijd een systeemprompt mee die de taak stuurt; zonder systeemprompt
kan het model in de verkeerde taakmodus schieten.
Trainingsdetails
- Basis: kamoo-one-135m (v0.8-corpus, 7,3 mld Nederlandse tokens; zie de
model card van het basismodel voor de volledige datastamboom).
- SFT: 2 epochs over 2,9M tokens, assistant-only loss, lr 5e-5.
- SFT-data: kamoo-sft v0.3-everyday, 22.636 synthetische, getemplate
Nederlandse voorbeelden (geen klant- of persoonsdata).
Grenzen, eerlijk
Alles wat voor het basismodel geldt (geen betrouwbare parametrische feiten,
alleen Nederlands, 1.024 context), plus specifiek voor deze versie:
- Vorm is sterker dan trouw. Het model houdt zich goed aan formats
(JSON-schema's, B1-register, beknopt antwoorden) maar kan bij extractie
waarden invullen die niet letterlijk in de invoer staan. Controleer
extractie-output tegen de bron; gebruik het niet ongecontroleerd voor
gegevensinvoer.
- De SFT-data is volledig synthetisch/getemplated (v0.3); een versie met
meer gegronde en diverse voorbeelden is in ontwikkeling.
English summary
Instruction-tuned variant of the from-scratch Dutch 135M model
kamoo-one-135m. ChatML format, stops correctly, strong at format-following
(JSON, register rewriting, summarizing); extraction faithfulness is a known
limitation of the v0.3 templated SFT data. Apache-2.0. Built by
kamoo.
kamoo · kamoo.nl · platform.kamoo.nl