Қазақша
Til-Core-1B-GEC — қазақ мәтініндегі грамматикалық, орфографиялық және пунктуациялық қателерді аз өзгеріспен түзететін 1.25B параметрлі GEC моделі. Репозиторий көлемі — 5.01 ГБ; модель Til-Core-1B негізінде fine-tune жасалған.
Модель арнайы tag пішімін қолданады және дұрыс мәтінді көшіріп қайтару мысалдарымен үйретілген. Ол жалпы chat орнына қазақша GEC міндетіне арналған.
Құрылымы мен үйрету
Table with columns: Сипаттама, Мәні| Сипаттама | Мәні |
|---|
| Архитектура | LlamaForCausalLM |
| Параметр саны | 1.25B |
| Жасырын қабат өлшемі | 2048 |
| Қабат саны | 16 |
| Attention басы | 32 |
| Сөздік | 256003 токен |
| Контекст ұзындығы | 2048 токен |
| Үйрету жұбы | 22 021 |
| Identity мысалдарының үлесі | 20% |
| Epoch | 3 |
Кіріс <TASK_FIX><SRC>{text}<SEP> түрінде беріледі. Үйрету кезінде <SEP> таңбасына дейінгі бөлік loss есебінен шығарылған.
Бағалау
Table with columns: Бөлік немесе көрсеткіш, Нәтиже| Бөлік немесе көрсеткіш | Нәтиже |
|---|
| test chrF | 89.6 |
| Exact match | 27.5 |
| Keep-correct | 80.8 |
| organic chrF | 85.7 |
| synthetic chrF | 80.5 |
Нәтижелер sozkz GEC benchmark арқылы өлшенген. Модель сирек және күрделі қате түрлерін өткізіп алуы мүмкін. Шығысты бастапқы жолмен салыстырып тексеруге болады.
Іске қосу
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
repo = "TilQazyna/Til-Core-1B-GEC"
tokenizer = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(
repo, dtype=torch.bfloat16, device_map="auto"
).eval()
text = "Әйелдердың туу көрсеткіші жылдан-жылға өсуде."
prompt = f"<TASK_FIX><SRC>{text}<SEP>"
inputs = tokenizer(prompt, return_tensors="pt", add_special_tokens=False).to(model.device)
output = model.generate(**inputs, max_new_tokens=80, do_sample=False)
answer = output[0][inputs["input_ids"].shape[1]:]
print(tokenizer.decode(answer, skip_special_tokens=True).split("\n")[0])
Қолжетімділік
Карточка мен файлдар тізімі жалпыға көрінеді. Файлдарды жүктеу үшін «Request access» арқылы өтінім қалдырылады; TilQazyna командасы оны мақұлдаған соң қолжетімділік беріледі.
Байланысты репозиторийлер
Базалық checkpoint — Til-Core-1B. GEC деректерінің TilQazyna репозиторийі — Til-GEC.
Русский
Til-Core-1B-GEC — GEC-модель на 1.25B параметров для исправления грамматических, орфографических и пунктуационных ошибок в казахском тексте с минимальными правками. Репозиторий занимает 5.01 ГБ; модель получила fine-tune на основе Til-Core-1B.
Модель принимает специальный формат с тегами и обучена на примерах, где правильный текст нужно вернуть без изменений. Она предназначена для казахского GEC, а не для общего chat.
Устройство и обучение
Table with columns: Характеристика, Значение| Характеристика | Значение |
|---|
| Архитектура | LlamaForCausalLM |
| Параметров | 1.25B |
| Размер скрытого слоя | 2048 |
| Слоёв | 16 |
| Голов attention | 32 |
| Словарь | 256003 токена |
| Длина контекста | 2048 токенов |
| Обучающих пар | 22 021 |
| Доля identity-примеров | 20% |
Вход оформляется как <TASK_FIX><SRC>{text}<SEP>. При обучении часть до маркера <SEP> исключалась из расчёта loss.
Оценка
Table with columns: Часть или показатель, Результат| Часть или показатель | Результат |
|---|
| test chrF | 89.6 |
| Exact match | 27.5 |
| Keep-correct | 80.8 |
| organic chrF | 85.7 |
| synthetic chrF | 80.5 |
Метрики получены на sozkz GEC benchmark. Модель может пропускать редкие и сложные типы ошибок.
Как запустить
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
repo = "TilQazyna/Til-Core-1B-GEC"
tokenizer = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(
repo, dtype=torch.bfloat16, device_map="auto"
).eval()
text = "Әйелдердың туу көрсеткіші жылдан-жылға өсуде."
prompt = f"<TASK_FIX><SRC>{text}<SEP>"
inputs = tokenizer(prompt, return_tensors="pt", add_special_tokens=False).to(model.device)
output = model.generate(**inputs, max_new_tokens=80, do_sample=False)
answer = output[0][inputs["input_ids"].shape[1]:]
print(tokenizer.decode(answer, skip_special_tokens=True).split("\n")[0])
Доступ
Карточка и список файлов открыты для просмотра. Скачивание разрешается после одобрения заявки, отправленной через «Request access»; её рассматривает команда TilQazyna.
Связанные репозитории
Базовый checkpoint — Til-Core-1B. Репозиторий TilQazyna с данными GEC — Til-GEC.
English
Til-Core-1B-GEC is a 1.25B-parameter GEC model for minimal-edit correction of grammatical, spelling, and punctuation errors in Kazakh. The repository is 5.01 GB; the checkpoint was fine-tuned from Til-Core-1B.
The model accepts a dedicated tagged format and was trained with identity examples that require correct inputs to be copied unchanged. Its scope is Kazakh GEC rather than general chat.
Architecture and training
Table with columns: Property, Value| Property | Value |
|---|
| Architecture | LlamaForCausalLM |
| Parameters | 1.25B |
| Hidden size | 2048 |
| Layers | 16 |
| Attention heads | 32 |
| Vocabulary | 256003 tokens |
| Context length | 2048 tokens |
| Training pairs | 22 021 |
| Identity-example share | 20% |
Inputs use the form <TASK_FIX><SRC>{text}<SEP>. During training, tokens before <SEP> were masked out of the loss calculation.
Evaluation
Table with columns: Split or metric, Result| Split or metric | Result |
|---|
| test chrF | 89.6 |
| Exact match | 27.5 |
| Keep-correct | 80.8 |
| organic chrF | 85.7 |
| synthetic chrF | 80.5 |
The reported metrics come from the sozkz GEC benchmark. Rare and structurally complex error types may remain uncorrected.
Usage
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
repo = "TilQazyna/Til-Core-1B-GEC"
tokenizer = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(
repo, dtype=torch.bfloat16, device_map="auto"
).eval()
text = "Әйелдердың туу көрсеткіші жылдан-жылға өсуде."
prompt = f"<TASK_FIX><SRC>{text}<SEP>"
inputs = tokenizer(prompt, return_tensors="pt", add_special_tokens=False).to(model.device)
output = model.generate(**inputs, max_new_tokens=80, do_sample=False)
answer = output[0][inputs["input_ids"].shape[1]:]
print(tokenizer.decode(answer, skip_special_tokens=True).split("\n")[0])
Access
The model card and file list can be viewed publicly. Downloading requires approval of a submission made through “Request access”; the TilQazyna team reviews the request.
The base checkpoint is Til-Core-1B. TilQazyna's GEC data repository is Til-GEC.
Лицензия · License: apache-2.0 · TilQazyna