Қазақша
tq-small-kaz-1 — қазақша аудионы мәтінге айналдыруға бейімделген Whisper Small ASR моделі. Репозиторий көлемі — 968.9 МБ; бағалау жиынындағы WER көрсеткіші 12.22%.
Құрылымы
Table with columns: Сипаттама, Мәні| Сипаттама | Мәні |
|---|
| Архитектура | WhisperForConditionalGeneration |
| Негізгі модель | openai/whisper-small |
| Қабат саны | 12 |
| Сөздік көлемі | 51865 |
| Салмақ пішімі | safetensors |
Модель салмағы model.safetensors файлында жарияланған. Tokenizer, normalizer және аудионы алдын ала өңдеу конфигурациялары да осы репозиторийде сақталған. Файлдар Transformers жүктеу тәртібіне сай орналасқан.
Оқыту және бағалау
Модель audio2, audio3 және audio4 деректерінде fine-tune жасалған. Оқыту мен бағалау үлесі 90% және 10% болып бөлінген.
Table with columns: Параметр, Мәні| Параметр | Мәні |
|---|
| Batch size | 8 |
| Gradient accumulation | 2 |
| Learning rate | 1e-5 |
| Warmup қадамы | 500 |
| Max қадам | 4000 |
| Дәлдік | FP16 |
| Бағалау метрикасы | WER 12.22% |
Аудио 16 kHz жиілікке келтірілген, одан кейін Whisper feature extractor log-Mel белгілерін шығарған. Транскрипттер қазақ тілі баптауы бар Whisper tokenizer арқылы өңделген.
Іске қосу
from transformers import pipeline
asr = pipeline(
"automatic-speech-recognition",
model="TilQazyna/tq-small-kaz-1",
)
result = asr("input.wav", generate_kwargs={"language": "kazakh"})
print(result["text"])
Код жергілікті input.wav файлын таниды. Модельді жүктеу үшін Hugging Face жүйесіндегі рұқсат берілген тіркелгі қолданылады.
Қолжетімділік
Карточка мен файлдардың атаулары баршаға көрінеді. Салмақтар «Request access» арқылы берілген өтінімді TilQazyna командасы мақұлдағаннан кейін жүктеледі.
Байланысты репозиторийлер
Үлкен нұсқасы — tq-large-kaz-1. Бағдарламадағы аудио деректер Til-Audio жинағында берілген.
Русский
tq-small-kaz-1 — модель ASR Whisper Small, дообученная для транскрибирования казахской речи. Репозиторий занимает 968.9 МБ; WER на оценочной выборке — 12.22%.
Устройство
Table with columns: Характеристика, Значение| Характеристика | Значение |
|---|
| Архитектура | WhisperForConditionalGeneration |
| Базовая модель | openai/whisper-small |
| Слоёв | 12 |
| Размер словаря | 51865 |
| Формат весов | safetensors |
Веса модели опубликованы в model.safetensors. Репозиторий также содержит tokenizer, normalizer и конфигурацию предобработки аудио.
Обучение и оценка
Модель прошла fine-tune на данных audio2, audio3 и audio4. Данные разделили на обучающую и оценочную части в пропорции 90% и 10%.
Table with columns: Параметр, Значение| Параметр | Значение |
|---|
| Batch size | 8 |
| Gradient accumulation | 2 |
| Learning rate | 1e-5 |
| Шагов warmup | 500 |
| Max steps | 4000 |
| Точность | FP16 |
| Метрика оценки | WER 12.22% |
Аудио приводили к частоте 16 kHz, после чего Whisper feature extractor извлекал log-Mel признаки. Транскрипты обрабатывал Whisper tokenizer с настройкой казахского языка.
Как запустить
from transformers import pipeline
asr = pipeline(
"automatic-speech-recognition",
model="TilQazyna/tq-small-kaz-1",
)
result = asr("input.wav", generate_kwargs={"language": "kazakh"})
print(result["text"])
Код распознаёт локальный файл input.wav. Для загрузки модели используется учётная запись Hugging Face с одобренным доступом.
Доступ
Карточка и имена файлов открыты для просмотра. Веса скачиваются после заявки через «Request access» и решения команды TilQazyna.
Связанные репозитории
Большая версия опубликована как tq-large-kaz-1. Аудиоданные программы находятся в Til-Audio.
English
tq-small-kaz-1 is a Whisper Small ASR model fine-tuned to transcribe Kazakh speech. The repository occupies 968.9 MB, and the reported WER on the evaluation split is 12.22%.
Architecture
Table with columns: Characteristic, Value| Characteristic | Value |
|---|
| Architecture | WhisperForConditionalGeneration |
| Base model | openai/whisper-small |
| Layers | 12 |
| Vocabulary size | 51865 |
| Weight format | safetensors |
The model weights are published in model.safetensors. The repository also provides the tokenizer, normalizer, and audio preprocessing configuration.
Training and evaluation
The model was fine-tuned on the audio2, audio3, and audio4 data sources. The combined data was divided into 90% training and 10% evaluation splits.
Table with columns: Setting, Value| Setting | Value |
|---|
| Batch size | 8 |
| Gradient accumulation | 2 |
| Learning rate | 1e-5 |
| Warmup steps | 500 |
| Max steps | 4000 |
| Precision | FP16 |
| Evaluation metric | WER 12.22% |
Audio was resampled to 16 kHz before the Whisper feature extractor produced log-Mel features. Transcripts were processed with the Whisper tokenizer configured for Kazakh.
Inference
from transformers import pipeline
asr = pipeline(
"automatic-speech-recognition",
model="TilQazyna/tq-small-kaz-1",
)
result = asr("input.wav", generate_kwargs={"language": "kazakh"})
print(result["text"])
The example transcribes a local input.wav file. Loading the model requires a Hugging Face account with approved access.
Access
The repository card and file names are visible for inspection. Weight downloads open after the TilQazyna team approves an application submitted through “Request access.”
The larger model is available as tq-large-kaz-1. Program audio data is published in Til-Audio.
Лицензия · License: mit · TilQazyna