模型说明
WuQi-V3-Onyx-27b 是基于 Qwen3.8-27B(Apache 2.0)后训练得到的推理型高效Agentic模型,
由伍柒(WuQi)项目构建。模型在 Qwen3.8-27B 官方权重基础上,
使用 LoRA 在领域数据上完成后训练后合并部署。
当前为Preview预览版,版本号:伍柒叁型小黑 丙申甲子 (WuQi-V3-Onyx-27B-XXXIII_I)。
Alniyat-DSH-Bench-Basic Score
Table with columns: Eval Set, Difficulty Level, WuQi-V3-Onyx-27B, Qwen3.8-27B, DeepSeekV4Flash(0731)| Eval Set | Difficulty Level | WuQi-V3-Onyx-27B | Qwen3.8-27B | DeepSeekV4Flash(0731) |
|---|
| S01-S06 | simple | 100×6 | 100×6 | 100×6 |
| M01-M04 | medium | 100×4 | 100×4 | 100×4 |
| H01 | hard | 100 | 90 | 100 |
| H02 | hard | 100 | 100 | 100 |
| H03 | hard | 100 | 100 | 100 |
| H04 | hard | 85 | 85 | 85 |
| X01 | comprehensive | 100 | 100 | 100 |
| X02 | comprehensive | 65 | 30 | 100 |
| X03 | comprehensive | 100 | 90 | 100 |
| X04 | comprehensive | 100 | 100 | 100 |
| U1-01 | ultra_i | 85 | 100 | 100 |
| U1-02 | ultra_i | 100 | 100 | 100 |
| U1-03 | ultra_i | 100 | 95 | 100 |
| U1-04 | ultra_i | 100 | 100 | 100 |
| U2-01 | ultra_ii | 85 | 60 | 85 |
| U2-02 | ultra_ii | 90 | 100 | 100 |
| 总分 | | 2310 | 2250 | 2370 |
| 百分比 | | 96.2% | 93.8% | 98.8% |
Table with columns: Model, Input, Reason, Output, TotalOutput| Model | Input | Reason | Output | TotalOutput |
|---|
| WuQi-V3-Onyx-27B | 2,382,819 | 11,744 | 43,731 | 55,475 |
| Qwen3.8-27B | 3,038,830 | 85,305 | 48,910 | 134,215 |
| DeepSeekV4Flash(0731) | 334,784 | 88,894 | 87,006 | 175,900 |
Alniyat-DSH-Bench-Basic Introduction
Table with columns: 维度, 定义| 维度 | 定义 |
|---|
| 工具种类 | expected_calls 中工具数 |
| 总调用次数 | expected_calls 次数之和 |
| 任务阶段数 | 搜索/规划/编码/子代理/后台/验证/报告 各算 1 阶段 |
| 障碍数 | 数据损坏/权限拒绝/命令失败/误导数据/子代理冲突 各算 1 |
| 推理复杂度 | 直接执行/规划/协作/权衡/对抗绕行/假设验证循环 |
| 依赖链深度 | 后阶段重读前阶段产物的级数 |
Table with columns: 等级, 题数, 工具, 调用, 阶段, 障碍, 推理, 依赖链| 等级 | 题数 | 工具 | 调用 | 阶段 | 障碍 | 推理 | 依赖链 |
|---|
| simple | 6 | 1-2 | 1-3 | 1 | 0-1 | 直接执行(含规则坑) | 0 |
| medium | 4 | 3-4 | 4-8 | 2-3 |
训练基础
- 基座:Qwen3.8-27B(原生多模态保留)
- 后训练:LoRA
- 架构:qwen3_5(原生多模态)
- 上下文:262144(部署配置)
- 数据构成:伍柒逻辑(决策)& 美德(品格)+ CoT 优化 + DSH 定向 Agentic 适配
伍柒逻辑(决策)& 美德(品格)
规划执行、观测优先、灵活变通、交叉验证、权衡决策。
言辞有温度,判断讲科学,错误不逃避,协助高效,不干拒、不说教、不谄媚、不傲慢。
CoT 优化
思考精炼,高效推理:DeepSeekHarness实测,Reason开销显著降低86%,Output总开销降低60%。
DSH 定向 Agentic 适配
工具调用范式:针对 DSH(DeepSeek Harness)真实 agent 环境做定向覆盖 12 类工具(bash/read/write/glob/grep/run_code/web_search/web_fetch/todo_write/subagent/job_list/skill)。
长程任务:训练数据含多阶段 Agentic 轨迹(搜索→规划→编码→子代理→后台→验证)——长任务完成率显著优于基座。
实测成绩:AlniyatBench 基础任务(简单/中等)全满分;高难/综合任务接近 DeepSeekV4-0731 基线,相较于基座有显著性能及效率提升。
特别注意
部署时需使用专用sysprompt激活伍柒后训练成果,默认配置已做固化(chat_template 无 system 时自动注入),但 Harness 框架的 sysprompt 可能会覆盖默认配置,请注意。
sysprompt:"你是言辞有温度,判断讲科学,错误不逃避,高效协助用户有效处理问题的Agent伍柒。"
使用方式
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("WuQi-V3-Onyx-27b", trust_remote_code=True)
tokenizer = AutoTokenizer.from_pretrained("WuQi-V3-Onyx-27b")
License
本项目基于 Apache License 2.0 发布(见 LICENSE)。
基座模型 Qwen3.8-27B 版权归 Qwen 团队(Alibaba Cloud)所有。
海报

人物设定
人物性格参考:逻辑及美德
人物外观设定参考:
人物耳钉配饰参考: