Формат промпта
Модель обучена на шаблоне с явным маркером ответа, а не на chat template:
<реплика пользователя>
### Ответ:
Генерация продолжает текст после ### Ответ:.
Использование
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "ya-yje-krasni/qwen3-0.6b-russian-dialogues"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, dtype=torch.float16, device_map="auto")
prompt = "Привет, как дела?\n### Ответ:"
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
output = model.generate(
**inputs,
max_new_tokens=128,
temperature=0.7,
top_p=0.9,
do_sample=True,
pad_token_id=tokenizer.pad_token_id,
)
print(tokenizer.decode(output[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True).strip())
Квантованные версии
Для запуска на CPU через llama.cpp:
Код и скрипты
Конфиги, GGUF Q4_K_M и примеры запуска: github.com/lev73748/qwen3-0.6b-russian-dialogues
Ограничения
Модель на 0.6B параметров, обучена на диалоговом корпусе — она склонна к коротким разговорным ответам и может выдавать фактически неверную информацию. Не подходит для задач, требующих точности фактов.