import torch
import librosa
from transformers import WhisperProcessor, WhisperForConditionalGeneration
device = "cuda" if torch.cuda.is_available() else "cpu"
processor = WhisperProcessor.from_pretrained("burkialisher5/Ormuri_ASR")
model = WhisperForConditionalGeneration.from_pretrained(
"burkialisher5/Ormuri_ASR",
torch_dtype=torch.float16 if device == "cuda" else torch.float32
).to(device)
audio, sr = librosa.load("path/to/ormuri_sample.wav", sr=16000)
input_features = processor(audio, sampling_rate=16000, return_tensors="pt").input_features.to(device)
if device == "cuda":
input_features = input_features.to(torch.float16)
forced_decoder_ids = processor.get_decoder_prompt_ids(language="pashto", task="transcribe")
with torch.no_grad():
predicted_ids = model.generate(input_features, forced_decoder_ids=forced_decoder_ids, max_new_tokens=225)
transcription = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]
print("Ormuri Transcription:", transcription)