Қазақша
tq-large-kaz-1 — қазақша аудионы мәтінге айналдыруға бейімделген Whisper Large v3 ASR моделі. Репозиторий көлемі — 6.18 ГБ; бағалау жиынындағы WER көрсеткіші 8.51%.
Құрылымы
Table with columns: Сипаттама, Мәні| Сипаттама | Мәні |
|---|
| Архитектура | WhisperForConditionalGeneration |
| Негізгі модель | openai/whisper-large-v3 |
| Қабат саны | 32 |
| Сөздік көлемі | 51866 |
| Салмақ пішімі | safetensors |
Салмақтар 2 safetensors бөлігіне бөлінген және индекс файлымен бірге жарияланған. Tokenizer, normalizer және аудионы алдын ала өңдеу конфигурациялары сол репозиторийде сақталған. Бұл файлдар Transformers арқылы тікелей жүктеуге жеткілікті.
Оқыту және бағалау
Модель audio2, audio3 және audio4 деректерінде fine-tune жасалған. Оқыту мен бағалау үлесі 97% және 3% болып бөлінген.
Table with columns: Параметр, Мәні| Параметр | Мәні |
|---|
| Batch size | 32 |
| Gradient accumulation | 2 |
| Learning rate | 1e-5 |
| Warmup қадамы | 500 |
| Max қадам | 8000 |
| Дәлдік | FP16 |
| Бағалау метрикасы | WER 8.51% |
Аудио 16 kHz жиілікке келтіріліп, log-Mel белгілері Whisper feature extractor арқылы алынған. Транскрипттер қазақ тілі баптауы бар Whisper tokenizer көмегімен өңделген.
Іске қосу
from transformers import pipeline
asr = pipeline(
"automatic-speech-recognition",
model="TilQazyna/tq-large-kaz-1",
)
result = asr("input.wav", generate_kwargs={"language": "kazakh"})
print(result["text"])
Код жергілікті input.wav файлын таниды; модельді жүктеу үшін алдын ала рұқсат берілген Hugging Face тіркелгісі қажет.
Қолжетімділік
Карточка мен файлдардың тізімі ашық көрінеді. Салмақтарды жүктеу «Request access» өтінімін TilQazyna командасы мақұлдағаннан кейін ашылады.
Байланысты репозиторийлер
Шағын нұсқасы — tq-small-kaz-1. Бағдарламадағы аудио деректер Til-Audio жинағында берілген.
Русский
tq-large-kaz-1 — модель ASR Whisper Large v3, дообученная для транскрибирования казахской речи. Репозиторий занимает 6.18 ГБ; WER на оценочной выборке — 8.51%.
Устройство
Table with columns: Характеристика, Значение| Характеристика | Значение |
|---|
| Архитектура | WhisperForConditionalGeneration |
| Базовая модель | openai/whisper-large-v3 |
| Слоёв | 32 |
| Размер словаря | 51866 |
| Формат весов | safetensors |
Веса разделены на 2 файла safetensors и опубликованы вместе с индексом. В репозитории также лежат tokenizer, normalizer и конфигурация предобработки аудио.
Обучение и оценка
Модель прошла fine-tune на данных audio2, audio3 и audio4. Данные разделили на обучающую и оценочную части в пропорции 97% и 3%.
Table with columns: Параметр, Значение| Параметр | Значение |
|---|
| Batch size | 32 |
| Gradient accumulation | 2 |
| Learning rate | 1e-5 |
| Шагов warmup | 500 |
| Max steps | 8000 |
| Точность | FP16 |
| Метрика оценки | WER 8.51% |
Аудио приводили к частоте 16 kHz, затем Whisper feature extractor извлекал log-Mel признаки. Транскрипты обрабатывал Whisper tokenizer с настройкой казахского языка.
Как запустить
from transformers import pipeline
asr = pipeline(
"automatic-speech-recognition",
model="TilQazyna/tq-large-kaz-1",
)
result = asr("input.wav", generate_kwargs={"language": "kazakh"})
print(result["text"])
Код распознаёт локальный файл input.wav; для загрузки модели нужна учётная запись Hugging Face с одобренным доступом.
Доступ
Карточка и список файлов видны всем. Веса становятся доступны после заявки через «Request access» и её одобрения командой TilQazyna.
Связанные репозитории
Меньшая версия модели опубликована как tq-small-kaz-1. Аудиоданные программы находятся в Til-Audio.
English
tq-large-kaz-1 is a Whisper Large v3 ASR model fine-tuned to transcribe Kazakh speech. The repository occupies 6.18 GB, and the reported WER on the evaluation split is 8.51%.
Architecture
Table with columns: Characteristic, Value| Characteristic | Value |
|---|
| Architecture | WhisperForConditionalGeneration |
| Base model | openai/whisper-large-v3 |
| Layers | 32 |
| Vocabulary size | 51866 |
| Weight format | safetensors |
The weights are split across 2 safetensors files and accompanied by an index. The repository also supplies the tokenizer, normalizer, and audio preprocessing configuration.
Training and evaluation
The model was fine-tuned on the audio2, audio3, and audio4 data sources. The combined data was divided into 97% training and 3% evaluation splits.
Table with columns: Setting, Value| Setting | Value |
|---|
| Batch size | 32 |
| Gradient accumulation | 2 |
| Learning rate | 1e-5 |
| Warmup steps | 500 |
| Max steps | 8000 |
| Precision | FP16 |
| Evaluation metric | WER 8.51% |
Audio was resampled to 16 kHz before the Whisper feature extractor produced log-Mel features. Transcripts were processed with the Whisper tokenizer configured for Kazakh.
Inference
from transformers import pipeline
asr = pipeline(
"automatic-speech-recognition",
model="TilQazyna/tq-large-kaz-1",
)
result = asr("input.wav", generate_kwargs={"language": "kazakh"})
print(result["text"])
The example transcribes a local input.wav file. Loading the model requires a Hugging Face account with approved access.
Access
The repository card and file listing remain visible to everyone. Weight downloads open after the TilQazyna team approves an application submitted through “Request access.”
The smaller model is available as tq-small-kaz-1. Program audio data is published in Til-Audio.
Лицензия · License: mit · TilQazyna