Por que ele importa
⭐ 45% mais dado renderam 0,19% de bpb. Ja ir de 151M para 345M parametros rendeu
2,76%. Nesta arquitetura o volume de tokens satura por volta de 43 tok/param — e a
escala continua pagando.
⭐ E o mesmo modelo, nos mesmos 15,00B tokens, mede 0,9167 se colhido no plato do WSD e
0,8223 decaido: o decaimento de LR sozinho vale 10,3% de bpb. Comparar marcos
intermediarios de modelos com schedules diferentes mede o schedule, nao o modelo.
Para que serve
Como modelo, ele e' ligeiramente pior que o principal — use o principal. Este aqui serve
para reproduzir a ablacao: e' o unico ponto que permite isolar o efeito do volume de
tokens com todo o resto fixo.
Detalhes: bpb medido.
Limitacoes
As mesmas do principal: modelo base, nao segue instrucoes, nao conversa, nao usa
ferramentas; 345M parametros e 2048 de contexto alucinam fatos com facilidade; herda os
vieses da web em portugues. bpb mede modelagem de linguagem, nao fluencia de resposta.