Qwen3.8-27B 本地部署与 reasoning_effort 测评报告

单卡 48 GB RDNA3 全量 GPU 卸载 · GGUF UD-Q8_K_XL · MTP 投机解码 · 256K 上下文

2026-08-15llama.cpp 7e4c0a9 ROCm 7.2.4gfx1100 每格 n=1

01结论摘要

  1. 部署可行。 27B 稠密多模态模型在单张 48 GB 工作站卡上全量 GPU 卸载运行,峰值 33.9 tok/s。
  2. MTP 投机解码是最大性能杠杆,实测提速 1.59×(20.17 → 32.10 tok/s),代价仅 3.16 GB 显存。
  3. 产物体量随 reasoning_effort 呈 U 形,medium 位于谷底。 两任务独立复现,low 产物稳定为 medium 的约 2 倍。这是本报告置信度最高的发现。
  4. MTP 接受率随思考深度单调下降(85% → 65–75% → 57–59%),是速度梯度的完整解释。
  5. xhigh 代价极高:比 medium 慢一个数量级,换来约 3 倍产物体量,且纯思考阶段长达 26–31 分钟无任何输出。

02环境配置

硬件

CPU2 × AMD EPYC 9334,64 核 / 128 线程
内存1.0 TiB
GPU1 × AMD gfx1100(Navi31 XTW,RDNA3),96 CU,48 GB GDDR6,带宽 864 GB/s
GPU 备注单卡环境,未做多卡张量并行
磁盘需 ≥ 40 GB 可用空间存放 GGUF 权重

软件

ROCm7.2.4(/opt/rocm
推理引擎llama.cpp commit 7e4c0a9(2026-08-15),HIP 后端
编译参数GGML_HIP=ON · AMDGPU_TARGETS=gfx1100 · GGML_HIP_ROCWMMA_FATTN=ON · CMAKE_BUILD_TYPE=Release
权限前置运行用户需加入 render / video 组,以获得 /dev/kfd/dev/dri/* 访问权限
模型来源ModelScope

模型

主权重Qwen3.8-27B-UD-Q8_K_XL.gguf(unsloth)· 31.46 GB
视觉塔mmproj-BF16.gguf(unsloth)· 0.93 GB
MTP 草稿mtp-Qwen3.8-27B-Q8_0.gguf(ggml-org)· 3.16 GB
架构Qwen3_5ForConditionalGeneration,64 层 = 16 ×(3 × Gated DeltaNet + 1 × Gated Attention)
特性原生图像 / 视频理解 · 256K 上下文(可扩 1M)· MTP 多 token 预测 · 词表 248,320
量化选型依据BF16 原版 55.6 GB 超出 48 GB 显存;UD-Q8_K_XL 对 embedding 与 lm_head 保留高精度,是可装下的最高精度档

服务配置(本报告全部数据的统一配置)

llama-server \
  -m Qwen3.8-27B-UD-Q8_K_XL.gguf \
  --mmproj mmproj-BF16.gguf \
  --spec-type draft-mtp  -md mtp-Qwen3.8-27B-Q8_0.gguf \
  -ngl 99  -ngld 99 \
  -c 262144 \
  -ctk q8_0  -ctv q8_0  -ctkd q8_0  -ctvd q8_0 \
  -fa on \
  -b 4096  -ub 1024  -t 32  --parallel 1 \
  --jinja  --reasoning-preserve

显存占用 47.17 / 51.52 GB(91.5%)。KV cache 量化为 q8_0 是为了在同一张卡上容纳 256K 上下文——f16 KV 在该长度需 17.2 GB,加模型会超显存。

03部署性能基线

预填充吞吐
763tok/s
5,370 token prompt
生成速度 · MTP 开
32.10tok/s
↑ 1.59× vs 关闭
生成速度 · MTP 关
20.17tok/s
基线
显存占用
91.5%
47.17 / 51.52 GB

带宽参考:864 GB/s ÷ 31.46 GB ≈ 27.5 tok/s 是无投机解码时的理论上限。MTP 通过把权重读取摊薄到多个 token 上突破了该上限。视觉能力实测通过——颜色、数量、几何关系识别全部正确。

04测试方法

任务 1创建一个HTML,内容是SVG绘制一个鹈鹕骑自行车的2D动画
任务 2创建一个HTML,内容是SVG绘制一个秦始皇骑北极熊的2D动画

05结果

鹈鹕骑自行车 秦始皇骑北极熊

完整数据表

鹈鹕骑自行车秦始皇骑北极熊
lowmediumxhighlowmediumxhigh
输出 token12,2856,52259,5867,6676,18051,268
生成速度 (tok/s)33.6731.6725.1433.8629.1124.94
MTP 接受率 (%)85.075.059.484.664.857.0
接受长度均值3.553.252.783.542.942.71
TTFT (秒)2.921.221.053.221.101.05
首个答案 token (秒)143.562.01,874.218.179.71,579.5
总耗时 (秒)367.7207.22,371.2229.6213.42,056.9
reasoning 字符8,2594,093115,2005485,924100,248
answer 字符19,86610,40832,03418,9489,46131,331
产物体积 (字节)20,03510,17132,17619,0869,31331,381
circle211042402880
path31832131236
g 分组21184117865
渐变305026
简化措辞次数03210320
reasoning 中文占比 (%)16.20.00.267.20.00.4

下列为六次生成的实际产物,实时渲染。全部经校验:<!DOCTYPE></html> 结构闭合完整,含合法 <svg> 元素。

07分析

7.1 速度:MTP 接受率是唯一驱动因素

三档接受率严格单调(85.0/84.6% → 75.0/64.8% → 59.4/57.0%),两任务数值高度一致。思考文本越深入越发散,草稿模型越难预测,接受率下降直接转化为速度下降。速度差异全部可由此解释,无需引入其他因素。

7.2 产物:U 形曲线,medium 在谷底

low / medium 产物比在三次独立测量中稳定落在 1.90× — 2.05×(含配置修正前 f16 KV 下的一次)。medium 是三档中唯一没有任何维度优势的档位:比 low 慢且产物小一半,比 xhigh 快十倍但细节差一个数量级。

7.3 机制假说:思考阶段的过早简化

medium 的 reasoning 中反复出现简化决策,且这些决策在产物中被忠实执行:

“Snowflakes… Keep it simple with just a small rotate” → 单层雪
“far legs offset x by +25” → 四条腿被简化为 stepA / stepB 两组
“Emperor sits on the bear, so include it in the bob group” → 骑手不再独立驱动

对比 low 的产物动画列表——walkFrontLeft / walkFrontRight / walkBackLeft / walkBackRight(四腿独立)、snowFall1snowFall5(五层雪)、breatheblink——它在生成过程中自然铺开,没有经过“先规划再执行”的收缩环节。简化措辞统计支持该方向:low 两任务均为 0 次medium 均为 3 次xhigh20–21 次

该假说存在明显反例:xhigh 简化措辞最多,产物却最大。合理解释是 xhigh 的预算足够“先砍再补、反复推翻重来”,而 medium 的预算刚好够做完简化决策、不够再展开回来。此为假说而非结论——验证需要每档 5 次以上的重复实验观察分布。

7.4 思考语言随深度切换

两个 prompt 均为中文,但 reasoning 中文占比为 low 16.2% / 67.2%,medium 0.0% / 0.0%,xhigh 0.2% / 0.4%。深度思考几乎全程切换到英文。该现象稳定复现,成因未探究。

7.5 xhigh 的收敛行为

xhigh 在两任务分别消耗 51,268 和 59,586 token 后自然收敛,未触及 160K 上限。reasoning 经重复率检测(>25 字符行去重):两任务均为 0.0% 重复,803 行全部唯一——不存在退化或死循环,是真实的逐坐标推演。代价是纯思考阶段 26.3 / 31.2 分钟内用户看不到任何输出。

08局限性

  1. 每格 n=1,运行间方差很大。 同一 prompt、同档位、同配置下 low 两次跑出 8,853 与 12,285 token(差 39%),reasoning 长度差 277%,动画方案从纯 CSS 变为 CSS+SMIL 混用。本报告所有单项数值应视为量级参考而非精确值。
  2. 仅 1.90–2.05× 的产物比值经三次独立测量确认,其余结论均为单次观测。
  3. 任务类型单一。 两任务同属 SVG 动画生成。medium 的简化倾向在逻辑推理、代码调试、需求分析类任务上可能反而是优点——那类场景需要收敛而非铺开。
  4. 产物质量以结构复杂度代理(字节数、元素数、动画数),未做视觉正确性或美学评分。元素多不必然等于效果好。
  5. 单卡环境,未测多卡张量并行。
  6. q8_0 KV 对输出内容的影响未做受控测量。 对照实验显示速度差异在噪声范围内(low −2.2%,medium +3.0%,方向相反)。

09建议

部署侧

使用侧

场景推荐档位理由
创意 / 视觉生成low最快且产物最丰富,本测试中全面占优
需极致细节且可等 30+ 分钟xhigh产物约 3 倍体量,元素密度显著更高
本任务族跳过 medium无任何维度优势
逻辑推理 / 调试 / 分析未测medium 的收敛倾向在此类任务上可能翻身

生产注意事项