출력 형식
{
"content": {"score": 4, "rationale": "내용 판단 근거"},
"organization": {"score": 3, "rationale": "구성 판단 근거"},
"expression": {"score": 4, "rationale": "표현 판단 근거"}
}
점수는 각 영역의 1~5 정수입니다. 모델은 대회 공식 시스템 프롬프트와
[prompt_text]/[essay_text] 형식의 사용자 입력을 전제로 학습됐습니다.
검증 결과
공개 validation 400건, temperature 0, seed 42 조건의 개발 모니터 결과입니다.
Table with columns: 지표, 결과| 지표 | 결과 |
|---|
| 유효 JSON | 390 / 400 (97.5%) |
| Macro integer RMSE | 0.95881 |
| Macro integer Spearman | 0.44608 |
지표는 유효 JSON 390건에서 계산됐습니다. 운영 측 비공개 test 또는 공식 순위 점수가 아닙니다.
모델 구성
- Base:
Qwen/Qwen3.5-9B
- Base revision:
21eca8a083a2121a92fba681f4a7c72cf20ff1a7
- Training: GRPO 20 steps, train 2,000건, seed 42
- LoRA: rank 32, alpha 64, dropout 0.05
- Weights: LoRA가 병합된 FP16 전체 가중치
- Context length: 4,096 tokens
- Chat template: thinking block을 닫고 JSON만 생성하는 고정 템플릿
vLLM 실행
vllm serve Mun2/qwen3.5-9b-korean-essay-scorer-vllm \
--host 0.0.0.0 \
--port 8000 \
--dtype bfloat16 \
--max-model-len 4096 \
--language-model-only
모델 저장소 자체의 config.json, tokenizer 및 chat template만으로도 로드되며,
--language-model-only는 텍스트 평가에서 비전 인코더 프로파일링을 생략하기 위한 선택 사항입니다.
제한 사항
- 포맷 실패가 완전히 제거되지는 않았으며 validation에서 2.5%였습니다.
- 점수·근거는 자동 평가 보조용이며 고위험 의사결정에 단독으로 사용하지 마십시오.
- 학습 데이터와 validation 원문 및 예측 결과는 이 저장소에 포함하지 않습니다.