1. 사용
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "NotoriousH2/Qwen3-4B-Calendar-Agent-SFT"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, device_map="auto")
LoRA 파일과 토크나이저는 adapter/에 있습니다.
학습 설정은 training_config.json, 전체 학습 기록은 history.json에서 확인할 수 있습니다.
공개 병합 모델은 정해진 SFT 학습의 종료 체크포인트를 사용합니다.
이 저장소는 checkpoint-60(학습 step 60)을 포함합니다.
선택 근거: 60 step으로 설정한 SFT 학습의 최종 체크포인트
데이터 해시, dev 지표, 모델 해시는 selected_checkpoint.json에 있습니다.
공개 dev 원시 결과와 선택 summary는 각각 selection/dev_evaluation.json과 selection/dev_selection_summary.json에 있습니다.
dev 평가는 서버 시드 42와 VLLM_BATCH_INVARIANT=1을 사용합니다.
2. 평가
모든 모델은 같은 final 시나리오에서 실제 도구 루프로 평가했습니다.
Table with columns: 모델, Valid Tool Call, Policy Compliance, Task Success, Average Tool Calls| 모델 | Valid Tool Call | Policy Compliance | Task Success | Average Tool Calls |
|---|
| Base | 100.00% | 80.00% | 20.00% | 0.80 |
| SFT | 100.00% | 89.25% | 89.00% | 2.55 |
시나리오별 궤적과 판정 근거는 base_evaluation.json과 sft_evaluation.json에 있습니다.
3. 제한
이 모델은 합성 시나리오와 메모리 Calendar 환경에서 학습했습니다.
실제 일정 서비스의 인증, 권한, 개인정보, 장애 복구를 처리하지 않습니다.