Modelo base
Este modelo é um fine-tuning de
cemig-nlp-releases/energy-gpt-regulatorio-32B-v2, um modelo da família
Qwen3-32B já adaptado ao domínio de energia da CEMIG.
Pipeline de treinamento
A partir do modelo base, foi aplicado alinhamento por DPO (Direct Preference
Optimization) em um pipeline de RLAIF (Reinforcement Learning from AI
Feedback), com o objetivo de melhorar a segurança das respostas em perguntas
regulatórias e técnicas do setor de energia.
Dados de treinamento
O alinhamento de segurança (harmlessness) por DPO utilizou os pares de
preferência (chosen/rejected) do dataset
cemig-rl-releases/hh-rlhf-harmless-base-pt-BR,
versão em pt-BR do subconjunto harmless-base do
Anthropic HH-RLHF.
Uso
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "cemig-rl-releases/energy-gpt-regulatorio-32b-safe-v2"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, device_map="auto")
messages = [
{"role": "user", "content": "Explique a regulação de tarifas de energia."},
]
inputs = tokenizer.apply_chat_template(
messages, add_generation_prompt=True, return_tensors="pt"
).to(model.device)
outputs = model.generate(inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
Limitações
Modelo destinado a uso interno em tarefas do domínio regulatório de energia.
As respostas podem conter imprecisões e devem ser revisadas por especialistas
antes de qualquer uso em produção.