Base model
unsloth/Qwen2.5-3B-Instruct-bnb-4bit
Training data
Dataset: Azzindani/ID_Legal_QA_Syn
- Dataset asli: 500 baris
- Dataset setelah filter dan deduplikasi: 250 baris
- Training: 225 baris
- Holdout: 25 baris
- Dataset bersifat sintetis
- Lisensi dataset: CC BY 4.0
Training configuration
- Maximum sequence length: 768
- Epochs: 1
- Effective batch size: 8
- Learning rate: 0.0002
- LoRA rank: 16
- LoRA alpha: 16
- Quantization: 4-bit
- Random seed: 42
Quick metrics
- Train loss: 1.1898
- Holdout loss: 1.0257
- Holdout perplexity: 2.7890
- Training duration: 4.31 minutes
Metrics ini hanya berasal dari holdout kecil dan tidak membuktikan ketepatan hukum.
Usage
from peft import AutoPeftModelForCausalLM
from transformers import AutoTokenizer
repo_id = "icaluwu/HellanodikAI-Qwen2.5-3B-Legal-LoRA"
model = AutoPeftModelForCausalLM.from_pretrained(
repo_id,
device_map="auto",
)
tokenizer = AutoTokenizer.from_pretrained(repo_id)
Limitations
- Dataset pelatihan bersifat sintetis.
- Referensi peraturan dan ketepatan hukum belum diverifikasi secara menyeluruh oleh ahli.
- Model dapat menghasilkan informasi keliru, usang, atau tidak lengkap.
- Model tidak boleh digunakan sebagai pengganti nasihat hukum profesional.
- Model ini merupakan pilot berukuran kecil, bukan sistem hukum siap produksi.
Attribution
Dataset pelatihan: Azzindani/ID_Legal_QA_Syn, berlisensi CC BY 4.0.