Qwen3.6-27B (W8A8)

qwen3_5 架构模型 — Gated DeltaNet 线性注意力混合架构(3:1 线性 / 全注意力),带原生 MTP speculative head,27.78B 参数,作为 W8A8(INT8 权重,约 33 GB)提供服务。已在 Ascend 910B4(每卡 32 GB) 上通过 Alauda AI 的 InferNex 接入面,使用 vLLM-Ascend nightly 引擎完成验证。已验证的 8 卡拓扑为 TP=4 × 2 replicas,部署规格为 agg-base

模型标识

字段
发布方Qwen (Alibaba)
架构qwen3_5 — Gated DeltaNet 线性注意力混合架构 + 全注意力 + 原生 MTP(支持多模态)
参数量27.78B(64 layers,hidden 5120)
原生 dtypeBF16(约 54 GB);此处作为 W8A8(约 33 GB)提供服务
模型来源(W8A8)https://www.modelscope.cn/models/Eco-Tech/Qwen3.6-27B-w8a8

已验证硬件 × 技术栈

平台引擎版本 / 配置状态
Ascend 910B4 32 GB × 8(TP=4 × 2 replicas)vLLM-Ascendnightly-releases-v0.22.1rc-openeuler(vLLM 0.22.1,CANN 9.0.0)✅ 闭环、2 场景性能测试(n=3),agg-base
NOTE

qwen3_5(Gated DeltaNet 混合 + 多模态)只能在 vLLM-Ascend nightly 镜像上加载。请使用固定到发布版本nightly-releases-v0.22.1rc-openeuler 标签——持续变化的 nightly-main-openeuler 已漂移到一个损坏的构建,TP workers 会崩溃。原生 v0.18.0 无法提供服务。W8A8 量化可以节省 HBM(从而获得更大的 KV cache),但其本身不会加速 decode——瓶颈在于 nightly 引擎中的 qwen3_5 GDN/MTP decode 路径,而不是内存带宽。

模型配置

参数
Tensor parallelism (tensor-parallel-size)4
Replicas (instances)2 (= 8 cards)
max-model-len24576
max-num-batched-tokens8192
gpu-memory-utilization0.85(不是 0.90——在启用 MTP 且高并发时会 OOM)
max-num-seqs32(必需的保护上限)
max_tokens(输出,benchmark 固定)128
Quantizationascend(W8A8)
Prefix caching禁用(--no-enable-prefix-caching,GDN 要求)
Speculative decoding (MTP)qwen3_5_mtp,3 tokens

部署规格

此模型仅以 agg-base 方式提供服务——聚合,hermes-router 策略为 random(负载均衡),不使用 mooncake KV store。跨实例 KV store / 支持 KV-cache 感知路由的方式(agg-mc-kv目前还不能用于 Ascend 上的 qwen3_5 GDN 混合架构:该混合线性注意力 KV 池的 aligned-store 支持仍在上游开发中,因此启用后会导致引擎崩溃。

组件agg-base
hermes-router (EPP)✅ 已启动
路由策略random(负载均衡)
cache-indexer
mooncake KV store—(qwen3_5 不支持)

部署

自包含的 InferNex manifest(engine + hermes-router LLMInferenceServiceConfig,以及 LLMInferenceService,2 replicas × TP=4):

规格文件
agg-base(负载均衡)qwen3-6-27b-w8a8-agg-base-llmisvc.yaml
base=https://raw.githubusercontent.com/alauda/aml-docs/master/docs/en/plan/validated_models/assets/qwen3-6-27b-w8a8
# edit namespace / model.uri registry / image tag first, then:
kubectl apply -f $base/qwen3-6-27b-w8a8-agg-base-llmisvc.yaml
WARNING

在开始接收流量之前,请务必先预热 replicas(施加少量并发)。冷 replica 只会捕获 batch=1 的 decode graph;随后第一次并发突发会在热路径上捕获更大的 graph,并进入较慢的稳定状态。--max-num-seqs 32 上限是必需的保护措施——如果没有它,高并发可能会级联恶化到 256 并发 / >1 s ITL 的状态。请将 --gpu-memory-utilization 保持在 0.85,不要使用 0.90;在启用 MTP 且高并发时,0.90 会导致 OOM。

基准测试结果

闭环 aiperf 0.7.0TP=4 × 2 replicas(8 × 910B4),并发 4,agg-base,开启 MTP。两个场景——① 8k 系统提示词复用和 ② 17.5k 多轮对话——每个场景 240 个请求,输出固定为 128 tokens。每个场景运行 3 次(n=3,相同 trace + seed);全部 6 次运行均返回 240/240,且无错误。数值为跨运行均值。TTFT / E2E 的单位为 ms,ITL 的单位为 ms(按 chunk 统计;MTP 每个 chunk 约输出 ~3 tokens),TPS = total tokens/s。

场景 ① — 固定长度系统提示词复用(ISL ~8k / OSL 128)

部署规格TTFT 平均值 (ms)ITL 平均值 (ms)E2E 平均值 (ms)TPS(in+out)
agg-base150932.055775807

场景 ② — 多轮对话(ISL ~17.5k / OSL 128)

部署规格TTFT 平均值 (ms)ITL 平均值 (ms)E2E 平均值 (ms)TPS(in+out)
agg-base399945.397517408
NOTE

如何解读这些结果。 所有 6 次运行都在每个实例稳定保持 2 个 in-flight 请求的情况下完成了 240/240,且无错误;ITL 的可重复性很高(不同运行之间的波动约为 ~3–14%)。agg-base 是此模型唯一可用的部署规格——跨实例 KV store + 支持 KV-cache 感知路由的方式(agg-mc-kv)不能用于 qwen3_5 GDN 混合架构。ITL 按每个 chunk报告——由于 MTP speculative head 每个流式 chunk 约输出 ~3 tokens,按 token 计算的有效延迟大约是其三分之一。仅解码输出速率为 91.3 tok/s(场景 ①)/ 52.5 tok/s(场景 ②);TPS 列表示的是总 token(输入 + 输出)口径。ITL p90 为 45.0 ms(①)/ 78.4 ms(②),TTFT p90 为 2192 ms(①)/ 6290 ms(②)。在 17.5k 负载下,随着逐轮上下文被重新 prefill,TTFT 上升且尾部变宽(该模型不能使用 prefix caching)。这些是半规模数据(8 卡);总吞吐量随实例数量扩展。