План обубления
- Первые 8% шагов — 100% FineWeb2-HQ
- Далее линейный рост:
p(ficbook): 0% → 30% до конца обучения
(p(fineweb): 100% → 70%)
Фанфики в фикбуке в среднем длиннее → доля токенов в ficbook немного выше, чем вероятность появления документа.
Онлайн-фильтры: короткие/пустые документы, нулевые/управляющие байты, экстремальные повторы символов.
Гиперпараметры обубления
Table | |
|---|
| Init | random (from-scratch) |
| Optimizer | AdamW 8-bit (β1=0.9, β2=0.95) |
| Peak LR | 3e-4 · cosine · warmup ~3% |
| Weight decay | 0.1 |
| Batch | 64 × grad_accum 2 (effective 128) |
| Sequence length | 2048 · packing |
| Precision | bf16 · gradient checkpointing |
| Stack | Unsloth + TRL SFTTrainer (CLM pretrain) |
Результаты:
Сомнительные.
Приблизительные значения NLL/PPL на паркетных выборках, похожих на обучающую выборку:
Table with columns: Датасет, loss, PPL| Датасет | loss | PPL |
|---|
| FineWeb2 | ~2.5 | ~13 |
| Ficbook | ~3.2 | ~23 |
Наблюдаемое поведение:
- Последовательные продолжения на русском языке (особенно при выборке +
repetition_penalty)
- При жадном декодировании без штрафа может возникнуть зацикливание (типично для небольших языковых моделей)
- Слабое соблюдение фактов / математических правил / инструкций (ожидаемо для базовой CLM с 100 миллионами параметров)
Наименее хуёвые результаты были с такими параметрами:
do_sample=True
temperature=0.7–0.9
top_p=0.9
repetition_penalty=1.1–1.2
max_new_tokens=64–256
Ограничения
- 116M глупих параметров
- Ебучие фанфики в датасете
- Мои глупенькие познания в обучении LLM
- Not suitable for safety-critical or factual QA without further alignment / retrieval