Intended use
- 시설물 보고서의 지침 준수 여부에 대한 보조 검토
- 근거 조항, 적용 조건, 보고서 직접 인용, 부족한 점과 보완 방법을 포함한 JSON 생성
- 검토 초안 작성과 품질관리 지원
시설물 안전등급 결정, 법적 적합성 판단 또는 현장 기술자의 최종 결정을 대체하지 않습니다. 실제 사용 시 자격을 갖춘 기술자가 입력 원문, 적용 지침과 모델 결론을 확인해야 합니다.
Training
Mixed thinking SFT
Table with columns: 항목, 값| 항목 | 값 |
|---|
| 시작 체크포인트 | Qwen3.8-27B-Inspect-v01 |
| 원천 학습/내부 평가 사례 | 1,960 / 40 |
| thinking-on/off 학습 레코드 | 3,920 / 80 |
| 언어 모델 학습 파라미터 | 26,895,998,464 |
| epoch | 1 |
| learning rate | 1e-6 |
| 최대 길이 | 19,456 tokens |
| precision | BF16, TF32 |
thinking-on 정답은 짧은 수기검수 요약, </think>, 최종 JSON 순서이며, thinking-off 정답은 같은 최종 JSON만 포함합니다. 두 모드가 같은 업무 답변 계약을 공유하도록 구성했습니다.
Small GRPO
Table with columns: 항목, 값| 항목 | 값 |
|---|
| 실제 학습 프롬프트 | 8 |
| 프롬프트당 생성 | 3 |
| 총 생성 | 24 |
| steps | 8 |
| learning rate / beta | 5e-6 / 0.02 |
| LoRA | rank 8, alpha 16 |
| 대상 모듈 | full-attention q_proj, v_proj |
| LoRA 파라미터 | 3,014,656 |
보상은 thinking 종료 프로토콜, JSON 스키마, 종합판정, 근거 조항·페이지와 보고서 직접 인용을 함께 평가했습니다. LoRA 병합 후 851개 텍스트 텐서를 전수 비교했고, 16개 full-attention 층의 q_proj/v_proj 32개만 변경된 것을 확인했습니다.
학습 자료는 로컬 시설물 검토 레코드이며 비식별화된 보고서 발췌와 합성 사례를 포함합니다. 원문은 배포하지 않습니다. 독립 시설물 50건은 SFT 또는 GRPO의 gradient·보상 계산에 사용하지 않았지만, 공개 체크포인트 선택을 위한 사후 비교에는 사용했습니다.
Evaluation
Summary
공개 v01, mixed-thinking SFT 직후 모델, 이 저장소에 공개하는 1차 GRPO 병합 모델을 같은 조건으로 비교했습니다. v02 + GRPO가 이 저장소의 최종 가중치입니다.
Table with columns: 평가, 공개 v01, mixed SFT v02, v02 + GRPO (released)| 평가 | 공개 v01 | mixed SFT v02 | v02 + GRPO (released) |
|---|
| 시설물 50건, thinking-on 정확도 | 30/50 (60%) | 34/50 (68%) | 35/50 (70%) |
| 시설물 50건, thinking-on macro F1 | 0.463 | 0.526 | 0.531 |
thinking-on 정상 </think> 프로토콜 | 0/50 | 50/50 | 50/50 |
| thinking-on 엄격 스키마 | 46/50 |
결과는 기본 운영 모드인 thinking-on에서 최종 모델을 선택할 근거가 됐습니다. 반면 thinking-off 정확도는 mixed SFT 모델보다 2문항 낮으므로 모든 모드에서 일관되게 우월한 체크포인트는 아닙니다.
Facility review
학습 자료와 instruction, input, output, review summary, combined prompt 및 사례 ID의 정확 중복이 없는 독립 합성 테스트 50건을 사용했습니다. 정답 등급은 적정 17, 대체로 적정 6, 부분 적정 10, 미흡 14, 비적용 2, 판단보류 1건입니다. 평가는 vLLM 0.17.1, greedy decoding, temperature=0으로 실행했습니다.
thinking-on 조건은 enable_thinking=True, reasoning_effort="medium", 최대 4,096 생성 토큰입니다. 최종 모델의 상세 결과는 다음과 같습니다.
Table with columns: 지표, 결과| 지표 | 결과 |
|---|
| 6단계 종합판정 정확도 | 35/50 (70%) |
| 정확도 Wilson 95% 구간 | 56.2%–80.9% |
| macro F1 | 0.531 |
| JSON 파싱 / 엄격 JSON / 스키마 충족 | 50/50 / 50/50 / 50/50 |
| 허용 등급만 사용 | 50/50 |
| 근거 페이지 정확 일치 | 50/50 |
| 근거 문구 정확 일치 | 49/50 |
| 운영 추적성 충족 | 48/50 |
| 판정 포함 완전 운영 성공 | 35/50 |
mixed SFT v02 대비 1차 GRPO의 정확도 변화는 +2.0%p입니다. paired bootstrap 95% 구간은 0.0%p–+6.0%p, McNemar exact p=1.0으로, 이 작은 표본만으로 통계적으로 확정된 일반화 향상이라고 해석할 수는 없습니다.
thinking-off 조건에서 최종 모델은 정확도 35/50 (70%), macro F1 0.542, JSON 파싱 50/50, 스키마 충족 46/50을 기록했습니다. thinking-off 전용 운영에서는 mixed SFT v02의 37/50 (74%)이 더 높았습니다.
AIME 2024+2025
AIME 2024와 2025 각 30문항, 총 60문항을 vLLM 0.17.1, thinking mode, medium reasoning effort, greedy pass@1, 최대 8,192 생성 토큰으로 평가했습니다. 외부 도구는 사용하지 않았습니다.
Table with columns: 지표, mixed SFT v02, v02 + GRPO| 지표 | mixed SFT v02 | v02 + GRPO |
|---|
| 추출 답안 정확도 | 45/60 (75.0%) | 49/60 (81.7%) |
| 정확도 Wilson 95% 구간 | 62.8%–84.2% | 70.1%–89.4% |
| 답안 추출 성공 | 47/60 (78.3%) | 52/60 (86.7%) |
| AIME 2024 | 26/30 (86.7%) | 25/30 (83.3%) |
| AIME 2025 | 19/30 (63.3%) | 24/30 (80.0%) |
| 평균 생성 토큰 |
mixed SFT v02 대비 정확도 변화는 +6.7%p이며 paired bootstrap 95% 구간은 -5.0%p–+18.3%p, McNemar exact p=0.3877입니다. 토큰 한도 도달을 모두 오답으로 보는 보수 정책에서는 +10.0%p였고 paired bootstrap 95% 구간은 0.0%p–+20.0%p였습니다. 평가 규모가 작고 단일 greedy pass 결과이므로 수학 추론의 보편적 향상을 보장하지 않습니다.
Additional GRPO experiment not released
1차 GRPO 뒤 신규 비중복 사례 24건으로 24스텝, 프롬프트당 3개씩 총 72개 completion을 추가 생성한 후보도 평가했습니다. 시설물 주 지표와 AIME가 모두 1문항씩 낮아 이 저장소에는 포함하지 않았습니다.
Table with columns: 평가, 1차 GRPO (released), 추가 GRPO (not released)| 평가 | 1차 GRPO (released) | 추가 GRPO (not released) |
|---|
| 시설물 thinking-on 정확도 | 35/50 (70%) | 34/50 (68%) |
| 시설물 thinking-on macro F1 | 0.531 | 0.523 |
| 시설물 thinking-off 정확도 | 35/50 (70%) | 35/50 (70%) |
| 시설물 thinking-off macro F1 | 0.542 | 0.518 |
| AIME 추출 답안 정확도 | 49/60 (81.7%) | 48/60 (80.0%) |
| AIME 토큰 한도 도달 |
Usage
Transformers에서 Qwen3.5 아키텍처 지원 버전을 사용하십시오. 이 체크포인트의 로컬 검증에는 Transformers 5.14.1/5.15.0과 vLLM 0.17.1을 사용했습니다.
import torch
from transformers import AutoModelForImageTextToText, AutoProcessor
model_id = "nowdoor/Qwen3.8-27B-Inspect-v02"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForImageTextToText.from_pretrained(
model_id,
dtype=torch.bfloat16,
device_map="auto",
)
messages = [
{
"role": "system",
"content": (
"너는 시설물 안전점검·정밀안전진단 보고서를 지침에 따라 "
"의미 중심으로 검토하는 전문가다. 입력에 없는 사실은 추정하지 않는다."
),
},
{
"role": "user",
"content": "보고서 발췌와 검토 기준을 여기에 입력합니다.",
},
]
prompt = processor.apply_chat_template(
messages,
tokenize=False,
add_generation_prompt=True,
enable_thinking=True,
reasoning_effort="medium",
)
inputs = processor(text=prompt, return_tensors="pt").to(model.device)
with torch.inference_mode():
output = model.generate(**inputs, max_new_tokens=4096, do_sample=False)
new_tokens = output[:, inputs["input_ids"].shape[1]:]
print(processor.batch_decode(new_tokens, skip_special_tokens=True)[0])
BF16 가중치 자체가 약 55.6GB이므로 단일 GPU 추론에는 가중치와 KV cache를 수용할 수 있는 메모리가 필요합니다.
Limitations
- 시설물 50건 평가는 합성 독립 사례이며 실제 전체 보고서에 대한 외부 타당성을 보장하지 않습니다.
미흡, 비적용, 판단보류처럼 사례 수가 적거나 엄격한 판정은 추가 현장 데이터 평가가 필요합니다.
- thinking-off 정확도는 공개 v01보다 1문항 낮았습니다.
- 기준 ID와 결과 항목 수가 호출자가 기대하는 계약과 다를 수 있습니다.
- 보고서에 없는 사실이나 과도한 보완 근거를 생성할 수 있으므로 원문 대조가 필요합니다.
- 비전 인코더는 보존됐지만 이미지·영상 입력에 대한 별도 도메인 평가는 수행하지 않았습니다.
- GRPO 생성 수가 24개로 작아 강화학습 효과의 재현성과 일반화를 보장하지 않습니다.
License
Apache License 2.0. 원본 모델의 라이선스와 사용 조건도 함께 확인하십시오.