Қазақша
Til-1B-multilingual-base-GEC — қазақ сөйлемдеріндегі грамматикалық және емле қателерін түзететін 941M параметрлі модель. Репозиторий көлемі — 1.89 ГБ. Ол Til-1B-multilingual-base негізінде Til-GEC деректерімен fine-tune жасалған.
Құрылымы мен нәтижелері
Table with columns: Сипаттама, Мәні| Сипаттама | Мәні |
|---|
| Архитектура | DeepseekV3ForCausalLM, MLA |
| Қабат саны | 24 |
| Контекст | 4096 токен |
| Формат | <қате мәтін> => <түзетілген мәтін> |
Table with columns: Тест, Exact match, chrF, Keep correct| Тест | Exact match | chrF | Keep correct |
|---|
| test100 | 78.0 | 93.9 | 100.0 |
| test100_v2 | 70.0 | 90.7 | 91.7 |
| test100_v3 | 71.0 | 94.4 | 83.3 |
| Орташа | 73.0 | | |
Іске қосу
from transformers import AutoModelForCausalLM, AutoTokenizer
repo = "TilQazyna/Til-1B-multilingual-base-GEC"
tokenizer = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(repo)
inputs = tokenizer("мен кітап оқыдым керек => ", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=96, do_sample=False)
print(tokenizer.decode(output[0], skip_special_tokens=True).split(" => ", 1)[-1])
Модель сөйлем деңгейіндегі қазақша GEC үшін оқытылған; сирек және күрделі қате түрлері қосымша тексеруді қажет етеді.
Қолжетімділік
Карточка мен файлдар тізімі ашық. Жүктеу үшін «Request access» өтінімін TilQazyna командасы мақұлдайды.
Байланысты репозиторийлер
Base-модель — Til-1B-multilingual-base, оқыту деректері — Til-GEC.
Русский
Til-1B-multilingual-base-GEC — модель на 941M параметров для исправления грамматических и орфографических ошибок в казахских предложениях. Объём репозитория — 1.89 ГБ. Это fine-tune Til-1B-multilingual-base на данных Til-GEC.
Устройство и результаты
Table with columns: Характеристика, Значение| Характеристика | Значение |
|---|
| Архитектура | DeepseekV3ForCausalLM, MLA |
| Слоёв | 24 |
| Контекст | 4096 токенов |
| Формат | <текст с ошибкой> => <исправленный текст> |
Table with columns: Тест, Exact match, chrF, Keep correct| Тест | Exact match | chrF | Keep correct |
|---|
| test100 | 78.0 | 93.9 | 100.0 |
| test100_v2 | 70.0 | 90.7 | 91.7 |
| test100_v3 | 71.0 | 94.4 | 83.3 |
| Среднее | 73.0 | | |
Как запустить
from transformers import AutoModelForCausalLM, AutoTokenizer
repo = "TilQazyna/Til-1B-multilingual-base-GEC"
tokenizer = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(repo)
inputs = tokenizer("мен кітап оқыдым керек => ", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=96, do_sample=False)
print(tokenizer.decode(output[0], skip_special_tokens=True).split(" => ", 1)[-1])
Модель обучена для GEC на уровне отдельных казахских предложений; редкие и сложные типы ошибок требуют дополнительной проверки.
Доступ
Карточка и перечень файлов открыты. Команда TilQazyna разрешает скачивание после рассмотрения заявки через «Request access».
Связанные репозитории
Базовая модель — Til-1B-multilingual-base, данные обучения — Til-GEC.
English
Til-1B-multilingual-base-GEC is a 941M-parameter model for correcting grammatical and spelling errors in Kazakh sentences. The repository occupies 1.89 GB. It fine-tunes Til-1B-multilingual-base on Til-GEC.
Architecture and results
Table with columns: Characteristic, Value| Characteristic | Value |
|---|
| Architecture | DeepseekV3ForCausalLM, MLA |
| Layers | 24 |
| Context | 4096 tokens |
| Format | <text with errors> => <corrected text> |
Table with columns: Test, Exact match, chrF, Keep correct| Test | Exact match | chrF | Keep correct |
|---|
| test100 | 78.0 | 93.9 | 100.0 |
| test100_v2 | 70.0 | 90.7 | 91.7 |
| test100_v3 | 71.0 | 94.4 | 83.3 |
| Average | 73.0 | | |
Usage
from transformers import AutoModelForCausalLM, AutoTokenizer
repo = "TilQazyna/Til-1B-multilingual-base-GEC"
tokenizer = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(repo)
inputs = tokenizer("мен кітап оқыдым керек => ", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=96, do_sample=False)
print(tokenizer.decode(output[0], skip_special_tokens=True).split(" => ", 1)[-1])
The model targets sentence-level Kazakh GEC; rare and difficult error types still require review.
Access
The card and file list are public. The TilQazyna team grants downloads after reviewing a request submitted through “Request access.”
The base checkpoint is Til-1B-multilingual-base, and the training dataset is Til-GEC.
Лицензия · License: apache-2.0 · TilQazyna