import librosa
import torch
from transformers import AutoFeatureExtractor, AutoTokenizer, CohereAsrForConditionalGeneration
from peft import PeftModel
base_model_id = "CohereLabs/cohere-transcribe-arabic-07-2026"
adapter_repo = "amzilmustapha/cohere-darija-lora-10-7-26"
hf_token = "YOUR_HF_TOKEN"
feature_extractor = AutoFeatureExtractor.from_pretrained(base_model_id, trust_remote_code=True, token=hf_token)
tokenizer = AutoTokenizer.from_pretrained(base_model_id, trust_remote_code=True, token=hf_token)
base_model = CohereAsrForConditionalGeneration.from_pretrained(
base_model_id,
device_map="auto",
trust_remote_code=True,
token=hf_token
)
model = PeftModel.from_pretrained(base_model, adapter_repo, token=hf_token)
audio_file = "your_darija_audio.wav"
audio_array, sampling_rate = librosa.load(audio_file, sr=16000)
inputs = feature_extractor(audio_array, sampling_rate=16000, return_tensors="pt")
input_features = inputs.input_features.to(model.device)
with torch.no_grad():
generated_ids = model.generate(inputs=input_features, max_new_tokens=100)
transcription = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
print(transcription)