Қазақша
kaz-qwen-morphology-0.5b — қазақ сөзінің lemma, сөз табы және морфологиялық белгілерін болжауға арналған 20.2 МБ LoRA адаптері. Ол Qwen/Qwen2.5-0.5B-Instruct үстіне жүктеледі және бір сөзді мәтіндік сұрау арқылы талдайды.
Құрылымы мен оқыту деректері
Table with columns: Сипаттама, Мәні| Сипаттама | Мәні |
|---|
| Негізгі модель | Qwen/Qwen2.5-0.5B-Instruct |
| Адаптер | LoRA |
| Rank | 8 |
| Alpha | 16 |
| Кітапхана | PEFT 0.18.0 |
Fine-tune материалына 50,000-нан астам морфологиялық таңбаланған сөз және 7 сөз табы кірген. Ашық үлгі kaz-morphology-sample репозиторийінде; оқыту графында kazakh-morpho-grammar да көрсетілген.
Талдау нәтижесі генерацияланған мәтін түрінде қайтарылады.
Қалай іске қосады
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer
base_id = "Qwen/Qwen2.5-0.5B-Instruct"
adapter_id = "TilQazyna/kaz-qwen-morphology-0.5b"
base = AutoModelForCausalLM.from_pretrained(base_id)
tokenizer = AutoTokenizer.from_pretrained(adapter_id)
model = PeftModel.from_pretrained(base, adapter_id)
inputs = tokenizer("Сөзді талда: барды", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=64)
print(tokenizer.decode(output[0], skip_special_tokens=True))
Адаптер жеке толық модель емес: inference кезінде негізгі Qwen салмақтары мен PEFT бірге қажет.
Қолжетімділік
Карточка мен файлдар тізімі ашық көрінеді. Адаптер мен tokenizer файлдары «Request access» өтінімін TilQazyna командасы мақұлдағаннан кейін жүктеледі.
Байланысты репозиторийлер
Оқыту көздері — kazakh-morpho-grammar және kaz-morphology-sample. Туыстас грамматикалық адаптер — kaz-qwen-grammar-final.
Русский
kaz-qwen-morphology-0.5b — LoRA-адаптер объёмом 20.2 МБ, который предсказывает lemma, часть речи и морфологические признаки казахского слова. Он загружается поверх Qwen/Qwen2.5-0.5B-Instruct и получает отдельное слово в текстовом запросе.
Устройство и обучающие материалы
Table with columns: Характеристика, Значение| Характеристика | Значение |
|---|
| Базовая модель | Qwen/Qwen2.5-0.5B-Instruct |
| Тип адаптера | LoRA |
| Rank | 8 |
| Alpha | 16 |
| Библиотека | PEFT 0.18.0 |
Для fine-tune использовали свыше 50,000 морфологически размеченных слов по 7 частям речи. Публичный образец размещён в kaz-morphology-sample; в графе обучения также указан kazakh-morpho-grammar.
Как запустить
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer
base_id = "Qwen/Qwen2.5-0.5B-Instruct"
adapter_id = "TilQazyna/kaz-qwen-morphology-0.5b"
base = AutoModelForCausalLM.from_pretrained(base_id)
tokenizer = AutoTokenizer.from_pretrained(adapter_id)
model = PeftModel.from_pretrained(base, adapter_id)
inputs = tokenizer("Сөзді талда: барды", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=64)
print(tokenizer.decode(output[0], skip_special_tokens=True))
Адаптер не содержит полную базовую модель: для inference нужны веса Qwen и библиотека PEFT.
Доступ
Карточка и перечень файлов видны всем посетителям. Скачивание адаптера и tokenizer открывается после одобрения формы «Request access» командой TilQazyna.
Связанные репозитории
Источники обучения — kazakh-morpho-grammar и kaz-morphology-sample. Родственный грамматический адаптер — kaz-qwen-grammar-final.
English
kaz-qwen-morphology-0.5b is a 20.2 MB LoRA adapter that predicts the lemma, part of speech, and morphological features of a Kazakh word. It loads on top of Qwen/Qwen2.5-0.5B-Instruct and analyzes one word supplied through a text prompt.
Architecture and training material
Table with columns: Property, Value| Property | Value |
|---|
| Base model | Qwen/Qwen2.5-0.5B-Instruct |
| Adapter type | LoRA |
| Rank | 8 |
| Alpha | 16 |
| Library | PEFT 0.18.0 |
Fine-tuning used more than 50,000 morphologically annotated words across 7 parts of speech. A public sample is available in kaz-morphology-sample, and the training graph also identifies kazakh-morpho-grammar.
How to run
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer
base_id = "Qwen/Qwen2.5-0.5B-Instruct"
adapter_id = "TilQazyna/kaz-qwen-morphology-0.5b"
base = AutoModelForCausalLM.from_pretrained(base_id)
tokenizer = AutoTokenizer.from_pretrained(adapter_id)
model = PeftModel.from_pretrained(base, adapter_id)
inputs = tokenizer("Сөзді талда: барды", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=64)
print(tokenizer.decode(output[0], skip_special_tokens=True))
The adapter does not contain the complete base model. Inference requires the Qwen weights together with PEFT.
Access
The card and repository file list remain publicly visible. Adapter and tokenizer downloads are enabled after the TilQazyna team approves a “Request access” submission.
Training sources are kazakh-morpho-grammar and kaz-morphology-sample. The related grammar adapter is kaz-qwen-grammar-final.
Лицензия · License: apache-2.0 · TilQazyna