Қазақша
Til-1B-multilingual-base — қазақ, орыс, ағылшын тілдері, код және математика үшін нөлден оқытылған 941.1 M параметрлі base-модель. Репозиторий көлемі — 1.89 ГБ. Ол мәтінді жалғастыруға және GEC секілді кейінгі fine-tune жұмыстарына арналған.
Құрылымы мен деректері
Table with columns: Сипаттама, Мәні| Сипаттама | Мәні |
|---|
| Архитектура | DeepseekV3ForCausalLM, dense decoder және MLA |
| Параметр саны | 941.1 M |
| Жасырын қабат өлшемі | 1536 |
| Қабат саны | 24 |
| Attention head саны | 12 |
| Контекст | 4096 токен |
| Сөздік | 131 072 токен |
Оқыту корпусы 24.96 B токеннен тұрады: ағылшын — 5.00 B, орыс — 5.03 B, код — 5.00 B, математика — 5.00 B, қазақ — 4.93 B. Құжаттар q4 және q5 сапа сатыларынан алынған; q5 бөлігі learning-rate decay кезеңінің соңында берілген.
Бағалау
Table with columns: Домен, BPB| Домен | BPB |
|---|
| Орыс | 0.43 |
| Қазақ | 0.54 |
| Ағылшын | 0.67 |
| Код | 0.66 |
| Математика | 0.68 |
| Macro | 0.597 |
BPB белгіленген тест жинағында өлшенген, төмен мән жақсырақ. Модель instruction-tuned емес және мәтін жалғастыру режимінде жұмыс істейді.
Іске қосу
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "TilQazyna/Til-1B-multilingual-base"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id, torch_dtype=torch.bfloat16
).eval()
inputs = tokenizer("Қазақстанның астанасы —", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=40)
print(tokenizer.decode(output[0], skip_special_tokens=True))
Қолжетімділік
Карточка мен файлдар тізімі баршаға көрінеді. Файлдарды жүктеу үшін «Request access» арқылы өтінім беріліп, оны TilQazyna командасы қарайды.
Байланысты репозиторийлер
Оқыту деректері — Til-Corpus. Кіші нұсқа — Til-0.5B-multilingual-base, GEC нұсқасы — Til-1B-multilingual-base-GEC.
Русский
Til-1B-multilingual-base — базовая модель на 941.1 M параметров, обученная с нуля на казахском, русском, английском, коде и математике. Объём репозитория — 1.89 ГБ. Она продолжает текст и служит основой для последующего fine-tune, включая GEC.
Устройство и данные
Table with columns: Характеристика, Значение| Характеристика | Значение |
|---|
| Архитектура | DeepseekV3ForCausalLM, dense decoder и MLA |
| Параметров | 941.1 M |
| Размер скрытого слоя | 1536 |
| Слоёв | 24 |
| Attention heads | 12 |
| Контекст | 4096 токенов |
| Словарь | 131 072 токена |
Корпус обучения содержит 24.96 B токенов: английский — 5.00 B, русский — 5.03 B, код — 5.00 B, математика — 5.00 B, казахский — 4.93 B. Использованы документы уровней q4 и q5; часть q5 подана в конце фазы learning-rate decay.
Оценка
Table with columns: Домен, BPB| Домен | BPB |
|---|
| Русский | 0.43 |
| Казахский | 0.54 |
| Английский | 0.67 |
| Код | 0.66 |
| Математика | 0.68 |
| Macro | 0.597 |
BPB измерен на зафиксированном тестовом наборе, меньшее значение лучше. Модель не настроена на инструкции и работает в режиме продолжения текста.
Как запустить
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "TilQazyna/Til-1B-multilingual-base"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id, torch_dtype=torch.bfloat16
).eval()
inputs = tokenizer("Қазақстанның астанасы —", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=40)
print(tokenizer.decode(output[0], skip_special_tokens=True))
Доступ
Карточка и перечень файлов открыты всем. Скачивание доступно после одобрения заявки, отправленной кнопкой «Request access»; заявки проверяет команда TilQazyna.
Связанные репозитории
Данные обучения — Til-Corpus. Меньшая версия — Til-0.5B-multilingual-base, версия для GEC — Til-1B-multilingual-base-GEC.
English
Til-1B-multilingual-base is a 941.1 M-parameter base model trained from scratch on Kazakh, Russian, English, code, and mathematics. The repository occupies 1.89 GB. It generates text continuations and provides a checkpoint for downstream fine-tune work, including GEC.
Architecture and data
Table with columns: Characteristic, Value| Characteristic | Value |
|---|
| Architecture | DeepseekV3ForCausalLM, dense decoder with MLA |
| Parameters | 941.1 M |
| Hidden size | 1536 |
| Layers | 24 |
| Attention heads | 12 |
| Context | 4096 tokens |
| Vocabulary | 131,072 tokens |
The training corpus contains 24.96 B tokens: English contributes 5.00 B, Russian 5.03 B, code 5.00 B, mathematics 5.00 B, and Kazakh 4.93 B. It uses q4 and q5 documents, with q5 material placed at the end of the learning-rate decay phase.
Evaluation
Table with columns: Domain, BPB| Domain | BPB |
|---|
| Russian | 0.43 |
| Kazakh | 0.54 |
| English | 0.67 |
| Code | 0.66 |
| Mathematics | 0.68 |
| Macro | 0.597 |
BPB was measured on a fixed held-out set, and lower values are better. This checkpoint is not instruction-tuned and operates as a text-completion model.
Usage
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "TilQazyna/Til-1B-multilingual-base"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id, torch_dtype=torch.bfloat16
).eval()
inputs = tokenizer("Қазақстанның астанасы —", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=40)
print(tokenizer.decode(output[0], skip_special_tokens=True))
Access
The card and file listing are publicly visible. File downloads require approval after submitting the repository’s “Request access” form; the TilQazyna team reviews each application.
Training data comes from Til-Corpus. The smaller sibling is Til-0.5B-multilingual-base, and the GEC fine-tune is Til-1B-multilingual-base-GEC.
Лицензия · License: apache-2.0 · TilQazyna