Model details
Table with columns: 항목, 내용| 항목 | 내용 |
|---|
| Task | Korean automatic speech recognition |
| Architecture | Whisper encoder-decoder Transformer |
| Parameters | 약 769M |
| Direct base model | seastar105/whisper-medium-komixv2 |
| Original ancestor | openai/whisper-medium |
| Fine-tuning | 전체 파라미터 파인튜닝(full fine-tuning), LoRA 아님 |
| Training compute dtype | BF16 |
| Distributed weights dtype | FP16 |
| Input | 16 kHz mono audio, Whisper 기본 입력 길이 최대 30초 |
| Output | 한국어 전사문 |
모델 계보는 다음과 같습니다.
openai/whisper-medium → seastar105/whisper-medium-komixv2 →
whisper-wesol-ko
직접 기반 모델은 OpenAI Whisper Medium을 여러 한국어 데이터셋으로 먼저
파인튜닝한 모델입니다. 따라서 본 모델은 아래의 추가 학습 데이터뿐 아니라 기반
모델과 원본 Whisper의 학습 데이터 및 한계도 함께 상속합니다.
Intended use
권장 용도:
- 한국어 회의, 상담, 콜센터, 전화망, 강의 음성 전사
- 한국어 대화체 및 일반 음성의 배치 전사
- 한국어 ASR 연구 및 추가 파인튜닝의 시작점
검증되지 않았거나 권장하지 않는 용도:
- 의료·법률·채용 등 오인식이 사람에게 중대한 영향을 주는 의사결정
- 화자 식별, 감정·성격·민감 속성 추론
- 동의 없이 수집한 음성의 감시 또는 대규모 전사
- 별도 VAD/화자 분리 없이 긴 다화자 녹음을 그대로 처리하는 용도
- 한국어 이외 언어의 품질이 중요한 서비스
Additional training data
본 추가 학습 단계에서는 다음 데이터를 사용했습니다.
시간은 소수점 첫째 자리로 반올림했습니다. 학습 데이터는 평가 및 개발 데이터와
ID·세션 단위로 분리했습니다. Zeroth test는 Zeroth train의 별도 split입니다.
Training procedure
Table with columns: 설정, 값| 설정 | 값 |
|---|
| Objective | 일반 배치: teacher-forced cross entropy |
| Noise-consistency step | 설정상 전체 iteration의 15% |
| Noise SNR | 0–20 dB에서 결정적으로 선택 |
| Noise loss | noisy CE + 0.5 × KL(detached clean distribution ‖ noisy distribution) |
| Optimizer | AdamW, weight decay 0.01 |
| Maximum learning rate | 2e-5 |
| LR schedule | 300 iteration linear warm-up 후 ReduceLROnPlateau(factor 0.5, patience 2, min LR 1e-6) |
| Micro batch / accumulation | 6 / 3 |
|
전체 도메인의 발화를 하나의 pool로 합쳐 비복원 셔플했습니다. 일반 iteration은
정답 전사에 대한 CE를 사용했습니다. 소음-consistency iteration에서는 같은 음성의
clean/noisy 두 view를 함께 계산하되, noisy view의 정답 CE와 clean view를 기준으로
한 KL loss를 사용했습니다. 지식증류 교사 모델은 사용하지 않았습니다.
Evaluation
평가는 2026-07-28에 수행했습니다.
Protocol
- decoding: greedy(
do_sample=False), language=ko, task=transcribe
- Transformers 추론 dtype: BF16
- 입력: 16 kHz, 최대 30초
- 정규화: Whisper
BasicTextNormalizer 적용 후 모든 공백 제거
- 세트 점수: 발화별 CER의 산술평균(macro CER)
- 전체 평균: 각 평가셋 CER의 동일 가중 산술평균
- 총 발화 수: 18,610개
전체 평균은 18,610개 문자를 한꺼번에 합산한 corpus CER가 아닙니다. 228개인 CV15도
3,000개인 AIHub 세트와 평균에서 같은 가중치를 받습니다.
Table with columns: 평가셋, 발화 수| 평가셋 | 발화 수 |
|---|
| Common Voice 15 Korean test | 228 |
| FLEURS Korean test | 382 |
| AIHub 저음질 전화망 test | 3,000 |
| AIHub 회의 test | 3,000 |
| AIHub 상담 test | 3,000 |
| AIHub 한국어 강의 test | 3,000 |
| KsponSpeech eval clean | 3,000 |
| KsponSpeech eval other | 3,000 |
Controlled local comparison
아래 세 모델은 같은 오디오, 전사, 정규화, decoding 조건에서 직접 측정했습니다.
Table with columns: Model, 8-set Avg., CV15, FLEURS, 전화, 회의, 상담, 강의, Kspon clean, Kspon other| Model | 8-set Avg. | CV15 | FLEURS | 전화 | 회의 | 상담 | 강의 | Kspon clean | Kspon other |
|---|
| seastar105/whisper-medium-komixv2 (direct base) | 7.03 | 6.75 | 4.49 | 5.82 | 9.45 | 5.54 | 8.42 | 8.08 | 7.66 |
동일 실행에서 본 모델은 기반 모델보다 8-set 평균 CER이 0.58%p 낮았습니다.
8개 중 7개 세트에서 개선됐지만 FLEURS는 4.49 → 4.73으로 악화됐습니다.
CT2 int8 배포본은 8-set 평균이 6.46%로 FP16 원본과 +0.02%p 차이였습니다.
단, 세트별로는 최대 0.17%p 차이가 있으므로 모든 데이터에서 무손실이라고
보장할 수는 없습니다.
Additional evaluations
Table with columns: Model, KOpenAudioBench (2,835), Zeroth Korean test (457)| Model | KOpenAudioBench (2,835) | Zeroth Korean test (457) |
|---|
| seastar105/whisper-medium-komixv2 | 3.94 | 6.24 |
| whisper-wesol-ko | 3.53 | 2.78 |
KOpenAudioBench는 본 추가 학습 단계에서 사용하지 않았습니다. Zeroth test는 학습에
사용한 Zeroth train의 held-out split입니다.
Published reference values
아래 값은 비교를 위해
seastar105/whisper-medium-komixv2 모델 카드에서
가져온 공개 수치입니다. 외부 모델은 같은 환경에서 재측정하지 않았으며, 우리
모델 행만 위 로컬 실행 결과입니다.
Table with columns: Model, Average, CV15, FLEURS, 전화, 회의, 상담, 강의, Kspon clean, Kspon other| Model | Average | CV15 | FLEURS | 전화 | 회의 | 상담 | 강의 | Kspon clean | Kspon other |
|---|
| whisper-small-komixv2 (published) | 7.36 | 7.07 | 4.19 | 5.60 | 9.67 | 5.50 | 8.55 | 9.26 | 9.07 |
|
공개 수치와 로컬 수치는 동일 실행 결과가 아니므로 직접적인 순위로 해석하면
안 됩니다.
Commercial/API reference
rtzr/Awesome-Korean-Speech-Recognition의
공개표와 겹치는 6개 열(회의·상담·전화·강의·Kspon clean/other)만 다시 평균하면
다음과 같습니다.
Table with columns: System, Common 6-set Avg. CER| System | Common 6-set Avg. CER |
|---|
| 리턴제로 | 5.90 |
| 리턴제로 Whisper | 6.55 |
| whisper-wesol-ko | 6.83 |
| Naver ClovaSpeech | 7.02 |
상용/API 값은 모델 버전, 후처리, 실행 시점이 달라 통제된 순위로 볼 수 없습니다.
본 모델은 해당 벤치마크의 주요 영역별 회의 세트를 평가하지 않았습니다.
Usage
아래 MODEL_ID를 실제 Hugging Face 저장소 이름으로 바꾸십시오.
import torch
from transformers import AutoProcessor, WhisperForConditionalGeneration
MODEL_ID = "tlstjdwns/whisper-wesol-ko"
processor = AutoProcessor.from_pretrained(MODEL_ID)
processor.tokenizer.set_prefix_tokens(language="ko", task="transcribe")
model = WhisperForConditionalGeneration.from_pretrained(
MODEL_ID,
dtype=torch.float16,
low_cpu_mem_usage=True,
).to("cuda")
model.eval()
model.generation_config.language = "ko"
model.generation_config.task = "transcribe"
model.generation_config.forced_decoder_ids = None
inputs = processor.feature_extractor(
audio,
sampling_rate=16_000,
return_tensors="pt",
)
input_features = inputs.input_features.to("cuda", dtype=torch.float16)
with torch.inference_mode():
token_ids = model.generate(
input_features,
max_new_tokens=256,
do_sample=False,
)
text = processor.batch_decode(token_ids, skip_special_tokens=True)[0]
print(text.strip())
30초보다 긴 파일은 chunking, VAD 또는 faster-whisper와 같은 별도 long-form
처리 방식을 사용하십시오. 한 번에 처음 30초만 넣는 코드는 전체 파일 전사를
보장하지 않습니다.
Limitations
- FLEURS Korean에서는 직접 기반 모델보다 CER이
0.24%p 높았습니다.
- 학습 도메인과 가까운 회의·상담·전화·강의에 유리한 in-domain 모델입니다.
낯선 방송, 방언, 아동, 노인, 의료·법률 전문용어, 코드 스위칭에 같은 성능을
기대하면 안 됩니다.
- 별도의 화자 분리, VAD, 실시간 streaming 기능을 포함하지 않습니다.
- Whisper 계열 특성상 무음, 매우 짧은 외침, 심한 소음 또는 도메인 밖 음성에서
실제로 말하지 않은 문장을 생성하거나 같은 문장을 반복할 수 있습니다.
- 공사장 소음 합성을 사용했지만, 모든 실제 건설 현장 환경에 대한 강건성을
보장하지 않습니다.
- 성별, 연령, 지역, 억양 등 인구통계 하위집단별 편향 평가는 수행하지 않았습니다.
- 독립적인 제3자 평가는 수행하지 않았습니다.
License and data notice
이 저장소의 라이선스 표시는 other입니다.
- 원본
openai/whisper-medium은 Apache-2.0으로 공개됐습니다.
- 직접 기반 모델
seastar105/whisper-medium-komixv2의 현재 모델 카드에는
별도의 라이선스가 명시돼 있지 않습니다.
- 추가 학습에는 AIHub 데이터가 사용됐으며 데이터셋별 이용조건이 적용될 수
있습니다.
공개 또는 상업 이용 전에 직접 기반 모델과 각 AIHub 데이터셋의 최신 이용조건을
확인해야 합니다.
Acknowledgements
Citation
이 모델 자체에 대한 논문은 없습니다. Whisper를 인용할 때는 다음 논문을
사용하십시오.
@article{radford2022whisper,
title={Robust Speech Recognition via Large-Scale Weak Supervision},
author={Radford, Alec and Kim, Jong Wook and Xu, Tao and Brockman, Greg and McLeavey, Christine and Sutskever, Ilya},
journal={arXiv preprint arXiv:2212.04356},
year={2022}
}