HF 아키텍처 클래스에 관하여
학습 모델은 QK-Norm(헤드별 RMSNorm, RoPE 이전) 을 사용합니다. HF LlamaForCausalLM 에는 QK-Norm이 없어
동일 구조를 지원하는 Qwen3ForCausalLM 클래스로 로드합니다. 가중치는 Qwen 과 무관한 독자 학습 결과이며,
클래스는 모델 구조(연산 그래프) 호환을 위해서만 사용됩니다. vLLM / llama.cpp 에서 그대로 로드 가능합니다.
사용
from transformers import AutoModelForCausalLM, AutoTokenizer
tok = AutoTokenizer.from_pretrained("cooler8/yejin-korean-3b-v2-base")
model = AutoModelForCausalLM.from_pretrained("cooler8/yejin-korean-3b-v2-base", torch_dtype="bfloat16", device_map="auto")
ids = tok("대한민국의 수도는", return_tensors="pt").to(model.device)
print(tok.decode(model.generate(**ids, max_new_tokens=50)[0]))
이 모델은 base 모델입니다 (지시문 튜닝 없음). SFT/DPO 버전: cooler8/yejin-korean-3b-v2-sft, cooler8/yejin-korean-3b-v2-dpo.
변환: step 34000 체크포인트, 2026-09-12 02:27 UTC