单卡 48 GB RDNA3 全量 GPU 卸载 · GGUF UD-Q8_K_XL · MTP 投机解码 · 256K 上下文
medium 位于谷底。 两任务独立复现,low 产物稳定为 medium 的约 2 倍。这是本报告置信度最高的发现。xhigh 代价极高:比 medium 慢一个数量级,换来约 3 倍产物体量,且纯思考阶段长达 26–31 分钟无任何输出。| CPU | 2 × AMD EPYC 9334,64 核 / 128 线程 |
|---|---|
| 内存 | 1.0 TiB |
| GPU | 1 × AMD gfx1100(Navi31 XTW,RDNA3),96 CU,48 GB GDDR6,带宽 864 GB/s |
| GPU 备注 | 单卡环境,未做多卡张量并行 |
| 磁盘 | 需 ≥ 40 GB 可用空间存放 GGUF 权重 |
| ROCm | 7.2.4(/opt/rocm) |
|---|---|
| 推理引擎 | llama.cpp commit 7e4c0a9(2026-08-15),HIP 后端 |
| 编译参数 | GGML_HIP=ON · AMDGPU_TARGETS=gfx1100 · GGML_HIP_ROCWMMA_FATTN=ON · CMAKE_BUILD_TYPE=Release |
| 权限前置 | 运行用户需加入 render / video 组,以获得 /dev/kfd 与 /dev/dri/* 访问权限 |
| 模型来源 | ModelScope |
| 主权重 | Qwen3.8-27B-UD-Q8_K_XL.gguf(unsloth)· 31.46 GB |
|---|---|
| 视觉塔 | mmproj-BF16.gguf(unsloth)· 0.93 GB |
| MTP 草稿 | mtp-Qwen3.8-27B-Q8_0.gguf(ggml-org)· 3.16 GB |
| 架构 | Qwen3_5ForConditionalGeneration,64 层 = 16 ×(3 × Gated DeltaNet + 1 × Gated Attention) |
| 特性 | 原生图像 / 视频理解 · 256K 上下文(可扩 1M)· MTP 多 token 预测 · 词表 248,320 |
| 量化选型依据 | BF16 原版 55.6 GB 超出 48 GB 显存;UD-Q8_K_XL 对 embedding 与 lm_head 保留高精度,是可装下的最高精度档 |
llama-server \
-m Qwen3.8-27B-UD-Q8_K_XL.gguf \
--mmproj mmproj-BF16.gguf \
--spec-type draft-mtp -md mtp-Qwen3.8-27B-Q8_0.gguf \
-ngl 99 -ngld 99 \
-c 262144 \
-ctk q8_0 -ctv q8_0 -ctkd q8_0 -ctvd q8_0 \
-fa on \
-b 4096 -ub 1024 -t 32 --parallel 1 \
--jinja --reasoning-preserve
显存占用 47.17 / 51.52 GB(91.5%)。KV cache 量化为 q8_0 是为了在同一张卡上容纳 256K 上下文——f16 KV 在该长度需 17.2 GB,加模型会超显存。
带宽参考:864 GB/s ÷ 31.46 GB ≈ 27.5 tok/s 是无投机解码时的理论上限。MTP 通过把权重读取摊薄到多个 token 上突破了该上限。视觉能力实测通过——颜色、数量、几何关系识别全部正确。
temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0max_tokens=160000,确保 xhigh 不被截断low / medium / xhigh 三档,串行执行以避免并发争抢显存带宽任务 1:创建一个HTML,内容是SVG绘制一个鹈鹕骑自行车的2D动画
任务 2:创建一个HTML,内容是SVG绘制一个秦始皇骑北极熊的2D动画
| 鹈鹕骑自行车 | 秦始皇骑北极熊 | |||||
|---|---|---|---|---|---|---|
| low | medium | xhigh | low | medium | xhigh | |
| 输出 token | 12,285 | 6,522 | 59,586 | 7,667 | 6,180 | 51,268 |
| 生成速度 (tok/s) | 33.67 | 31.67 | 25.14 | 33.86 | 29.11 | 24.94 |
| MTP 接受率 (%) | 85.0 | 75.0 | 59.4 | 84.6 | 64.8 | 57.0 |
| 接受长度均值 | 3.55 | 3.25 | 2.78 | 3.54 | 2.94 | 2.71 |
| TTFT (秒) | 2.92 | 1.22 | 1.05 | 3.22 | 1.10 | 1.05 |
| 首个答案 token (秒) | 143.5 | 62.0 | 1,874.2 | 18.1 | 79.7 | 1,579.5 |
| 总耗时 (秒) | 367.7 | 207.2 | 2,371.2 | 229.6 | 213.4 | 2,056.9 |
| reasoning 字符 | 8,259 | 4,093 | 115,200 | 548 | 5,924 | 100,248 |
| answer 字符 | 19,866 | 10,408 | 32,034 | 18,948 | 9,461 | 31,331 |
| 产物体积 (字节) | 20,035 | 10,171 | 32,176 | 19,086 | 9,313 | 31,381 |
| circle | 21 | 10 | 42 | 40 | 28 | 80 |
| path | 31 | 8 | 32 | 13 | 12 | 36 |
| g 分组 | 21 | 18 | 41 | 17 | 8 | 65 |
| 渐变 | 3 | 0 | 5 | 0 | 2 | 6 |
| 简化措辞次数 | 0 | 3 | 21 | 0 | 3 | 20 |
| reasoning 中文占比 (%) | 16.2 | 0.0 | 0.2 | 67.2 | 0.0 | 0.4 |
下列为六次生成的实际产物,实时渲染。全部经校验:<!DOCTYPE> 至 </html> 结构闭合完整,含合法 <svg> 元素。
三档接受率严格单调(85.0/84.6% → 75.0/64.8% → 59.4/57.0%),两任务数值高度一致。思考文本越深入越发散,草稿模型越难预测,接受率下降直接转化为速度下降。速度差异全部可由此解释,无需引入其他因素。
medium 在谷底low / medium 产物比在三次独立测量中稳定落在 1.90× — 2.05×(含配置修正前 f16 KV 下的一次)。medium 是三档中唯一没有任何维度优势的档位:比 low 慢且产物小一半,比 xhigh 快十倍但细节差一个数量级。
medium 的 reasoning 中反复出现简化决策,且这些决策在产物中被忠实执行:
stepA / stepB 两组对比 low 的产物动画列表——walkFrontLeft / walkFrontRight / walkBackLeft / walkBackRight(四腿独立)、snowFall1–snowFall5(五层雪)、breathe、blink——它在生成过程中自然铺开,没有经过“先规划再执行”的收缩环节。简化措辞统计支持该方向:low 两任务均为 0 次,medium 均为 3 次,xhigh 为 20–21 次。
xhigh 简化措辞最多,产物却最大。合理解释是 xhigh 的预算足够“先砍再补、反复推翻重来”,而 medium 的预算刚好够做完简化决策、不够再展开回来。此为假说而非结论——验证需要每档 5 次以上的重复实验观察分布。两个 prompt 均为中文,但 reasoning 中文占比为 low 16.2% / 67.2%,medium 0.0% / 0.0%,xhigh 0.2% / 0.4%。深度思考几乎全程切换到英文。该现象稳定复现,成因未探究。
xhigh 的收敛行为xhigh 在两任务分别消耗 51,268 和 59,586 token 后自然收敛,未触及 160K 上限。reasoning 经重复率检测(>25 字符行去重):两任务均为 0.0% 重复,803 行全部唯一——不存在退化或死循环,是真实的逐坐标推演。代价是纯思考阶段 26.3 / 31.2 分钟内用户看不到任何输出。
low 两次跑出 8,853 与 12,285 token(差 39%),reasoning 长度差 277%,动画方案从纯 CSS 变为 CSS+SMIL 混用。本报告所有单项数值应视为量级参考而非精确值。medium 的简化倾向在逻辑推理、代码调试、需求分析类任务上可能反而是优点——那类场景需要收敛而非铺开。low −2.2%,medium +3.0%,方向相反)。| 场景 | 推荐档位 | 理由 |
|---|---|---|
| 创意 / 视觉生成 | low | 最快且产物最丰富,本测试中全面占优 |
| 需极致细节且可等 30+ 分钟 | xhigh | 产物约 3 倍体量,元素密度显著更高 |
| 本任务族 | 跳过 medium | 无任何维度优势 |
| 逻辑推理 / 调试 / 分析 | 未测 | medium 的收敛倾向在此类任务上可能翻身 |
xhigh 单次请求可达 6 万 token / 40 分钟,必须配置足够的 max_tokens 与超时,否则会在中途被截断并丢失全部产出(本测试初期即在 32K 处踩过该坑)。preserve_thinking 默认开启,历史 reasoning 会累积。单轮仅占上下文 4.7%,十余轮后 256K 窗口可能吃紧。