Қазақша
Til-kk-0.5B-256k-gec-exp085 — қазақша сөйлемдердегі грамматикалық және орфографиялық қателерді түзететін 1.72 ГБ GEC моделі. Ол 846M параметрлі Til-kk-0.5B-256k-exp080 моделінен fine-tune жасалған және кірісті => бөлгіші бар causal LM пішімінде өңдейді.
Құрылымы
Table with columns: Сипаттама, Мәні| Сипаттама | Мәні |
|---|
| Архитектура | DeepseekV3ForCausalLM |
| Параметр саны | 846M |
| Жасырын қабат өлшемі | 1280 |
| Қабат саны | 24 |
| Attention head саны | 10 |
| Сөздік | 256000 |
| Контекст | 4096 токен |
| Аралық қабат өлшемі | 5120 |
Бағалау нәтижелері
Table with columns: Тест, exact match, chrF, keep correct| Тест | exact match | chrF | keep correct |
|---|
test100 | 85.0 | 95.9 | 100.0 |
test100_v2 | 82.0 | 94.9 | 91.7 |
test100_v3 | 71.0 | 92.1 | 75.0 |
| Орташа exact match |
Әр тест жинағында 100 мысал бар. Модель sentence-level GEC үшін оқытылған; hard санатындағы нәтиже 24 мысалдың 9–17-сі аралығында қалған.
Оқыту қоспасында ережелік синтетика, адам белгілеген жұптар, дұрыс сөйлемдер және күрделі мысалдар қолданылған.
Қалай іске қосады
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "TilQazyna/Til-kk-0.5B-256k-gec-exp085"
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id, torch_dtype=torch.bfloat16
).eval()
sentence = "мен кітап оқыдым керек"
ids = tok(sentence + " => ", return_tensors="pt").input_ids
output = model.generate(
ids, max_new_tokens=96, do_sample=False,
eos_token_id=tok.eos_token_id, pad_token_id=1
)
text = tok.decode(output[0], skip_special_tokens=True)
print(text.split(" => ", 1)[-1].strip())
Модель түзетілген сөйлемді бөлгіштен кейін жалғастырады. Ол чатқа немесе ұзын құжатты тұтас өңдеуге оқытылмаған.
Қолжетімділік
Репозиторий карточкасы мен файлдар тізімі ашық. model.safetensors пен tokenizer файлдарын жүктеу үшін «Request access» батырмасы арқылы өтінім беріледі; оны TilQazyna командасы қарайды.
Байланысты репозиторийлер
Негізгі модель — Til-kk-0.5B-256k-exp080. Fine-tune үшін Til-GEC корпусы қолданылған.
Русский
Til-kk-0.5B-256k-gec-exp085 — GEC-модель объёмом 1.72 ГБ для исправления грамматики и орфографии в казахских предложениях. Её дообучили из модели Til-kk-0.5B-256k-exp080 с 846M параметров; вход и исправление разделяются строкой => в формате causal LM.
Устройство
Table with columns: Характеристика, Значение| Характеристика | Значение |
|---|
| Архитектура | DeepseekV3ForCausalLM |
| Параметров | 846M |
| Размер скрытого слоя | 1280 |
| Слоёв | 24 |
| Attention heads | 10 |
| Словарь | 256000 |
| Контекст | 4096 токенов |
| Размер промежуточного слоя | 5120 |
Результаты оценки
Table with columns: Тест, exact match, chrF, keep correct| Тест | exact match | chrF | keep correct |
|---|
test100 | 85.0 | 95.9 | 100.0 |
test100_v2 | 82.0 | 94.9 | 91.7 |
test100_v3 | 71.0 | 92.1 | 75.0 |
| Средний exact match |
В каждом тестовом наборе по 100 примеров. Модель обучена для sentence-level GEC; в категории hard она исправила от 9 до 17 из 24 примеров.
Как запустить
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "TilQazyna/Til-kk-0.5B-256k-gec-exp085"
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id, torch_dtype=torch.bfloat16
).eval()
sentence = "мен кітап оқыдым керек"
ids = tok(sentence + " => ", return_tensors="pt").input_ids
output = model.generate(
ids, max_new_tokens=96, do_sample=False,
eos_token_id=tok.eos_token_id, pad_token_id=1
)
text = tok.decode(output[0], skip_special_tokens=True)
print(text.split(" => ", 1)[-1].strip())
Модель продолжает вход исправленным предложением после разделителя. Она обучена на отдельных предложениях, без режима чата и обработки длинного документа целиком.
Доступ
Карточка и список содержимого доступны всем. Файл model.safetensors и tokenizer можно скачать после одобрения заявки «Request access» командой TilQazyna.
Связанные репозитории
Базовая модель — Til-kk-0.5B-256k-exp080. Для fine-tune использован корпус Til-GEC.
English
Til-kk-0.5B-256k-gec-exp085 is a 1.72 GB GEC model for correcting grammar and spelling in Kazakh sentences. It was fine-tuned from the 846M-parameter Til-kk-0.5B-256k-exp080, using a causal LM format that separates input and correction with =>.
Architecture
Table with columns: Property, Value| Property | Value |
|---|
| Architecture | DeepseekV3ForCausalLM |
| Parameters | 846M |
| Hidden size | 1280 |
| Hidden layers | 24 |
| Attention heads | 10 |
| Vocabulary | 256000 |
| Context length | 4096 tokens |
| Intermediate size | 5120 |
Evaluation results
Table with columns: Test, exact match, chrF, keep correct| Test | exact match | chrF | keep correct |
|---|
test100 | 85.0 | 95.9 | 100.0 |
test100_v2 | 82.0 | 94.9 | 91.7 |
test100_v3 | 71.0 | 92.1 | 75.0 |
| Average exact match |
Each test set contains 100 items. The model targets sentence-level GEC; performance on the hard bucket ranged from 9 to 17 corrected items out of 24.
How to run
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "TilQazyna/Til-kk-0.5B-256k-gec-exp085"
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id, torch_dtype=torch.bfloat16
).eval()
sentence = "мен кітап оқыдым керек"
ids = tok(sentence + " => ", return_tensors="pt").input_ids
output = model.generate(
ids, max_new_tokens=96, do_sample=False,
eos_token_id=tok.eos_token_id, pad_token_id=1
)
text = tok.decode(output[0], skip_special_tokens=True)
print(text.split(" => ", 1)[-1].strip())
The model completes the prompt with a corrected sentence after the separator. It was trained for individual sentences, without a chat mode or whole-document workflow.
Access
The card and file listing are visible to everyone. Downloading model.safetensors and tokenizer files requires approval of the “Request access” form by the TilQazyna team.
The base model is Til-kk-0.5B-256k-exp080. Fine-tuning used the Til-GEC corpus.
Лицензия · License: apache-2.0 · TilQazyna