配方(可直接交给 mergekit)
merge_method: della_linear
base_model: Qwen/Qwen3.6-27B
models:
- model: DavidAU/Qwen3.6-27B-V1.1-FF711-Darker-Hero-GAIN-H2.0
parameters: { weight: 0.90, density: 0.85 }
- model: YFC-112358/Qwen3.6-27B-Della-Deckard-Isometry-Geodesic-v2
parameters: { weight: 0.80, density: 0.85 }
- model: nightmedia/Qwen3.6-27B-Seven
parameters: { weight: 0.25, density: 0.55 }
parameters:
epsilon: 0.30
lambda: 1.0
normalize: false
int8_mask: true
dtype: float32
out_dtype: bfloat16
tokenizer: { source: "Qwen/Qwen3.6-27B" }
merge_method: task_arithmetic
base_model: Qwen/Qwen3.6-27B
models:
- model: KyleHessling1/Qwopus3.6-27B-Fusion-BF16
parameters: { weight: 1.00, density: 1.00 }
- model: ./stage1-G
parameters:
weight: [1.0, 1.0, 1.0, 1.0]
density: 1.00
parameters:
epsilon: 0.30
lambda: 1.0
normalize: false
int8_mask: true
dtype: float32
out_dtype: bfloat16
tokenizer: { source: "Qwen/Qwen3.6-27B" }
实现上的诚实声明
- 没有落盘 stage1-G。两阶段在同一个行块里连着算:先得到
G = base + Σ Δ̃ᵢ,
立即用它算出 Δ_G = G − base 进入第二阶段。数学上与先落盘再读完全等价
(fp32 全程),但省了 ≈54 GB 的上传+下载。
- ε 自动收窄。mergekit 要求
density ± epsilon ∈ (0,1);第一阶段的 0.85+0.30
越界会直接抛错。本模型逐源把 ε 收窄到合法上限(保留 0.02 余量),期望密度仍精确
等于各自的 density(fable 与 v2 的 density 都是 0.85 ⇒ ε 都被收窄到 0.13)。第二阶段两个源的 density 都是 1.00、不做剪枝,
ε 自动归零 —— 那一段没有任何随机性。
融合健康读数(构造时实测)
Table with columns: 指标, 含义, 中位值| 指标 | 含义 | 中位值 |
|---|
| amp | ‖总增量‖ / ‖祖先权重‖ | 0.0202 |
| share | G 对 Qwopus 的质量比 | 26.002 |
| kill₂ | 第二阶段符号选举抹掉的非零占比 | 0.0% |
| cold_amp | ‖Qwen3.8·ColdFusion − Qwen3.6‖ / ‖Qwen3.6‖ | 0.1217 |
share = ‖w_G·Δ_G‖ / ‖Δ_qwopus‖。本配方不追求它小于 1:Qwopus 相对祖先的增量本就极小
(注意力/词表/输出头与祖先逐位相同,仅 MLP 相差 0.2~0.8%),所以 share 天然很大。
它在这里的作用只是诚实地给出两个来源的真实体量对比。
使用
from transformers import AutoModelForCausalLM, AutoTokenizer
m = AutoModelForCausalLM.from_pretrained("YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3", dtype="bfloat16", device_map="auto")
t = AutoTokenizer.from_pretrained("YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3")
采样建议从 temperature=0.7, top_p=0.8, top_k=20 起手。config/tokenizer 取自祖先仓。
与原始配方的偏离(补充声明)
-
第二阶段是纯线性叠加,不是 DELLA。 density: 1.00 让 MagPrune 退化成恒等映射(不排名、不伯努利采样、不 1/p 回缩),所以第二阶段严格等于 out = G + 1.00·(Qwopus − Qwen/Qwen3.6-27B),即 mergekit 的 task_arithmetic。这样做是因为逐源审计显示 Qwopus 相对祖先的增量集中在 MLP、幅度只有 0.2~0.8%:对这么小的增量再做 40% 剪枝,剪掉的是信号,留下的是噪声。
-
没有做 TIES 符号选举(等价于 della_linear)。v2 与 Fable 的任务向量近乎正交(cos ≈ 0.01),选举会以 Fable 为多数方向,抹掉 v2 保留元素中的约一半(实测 kill 约 13%,量级正好是 v2 的一半),等于把 v2 的正交特征投影掉。为完整保留它,本次关闭选举。