镜像:
vllm-metax:0.25.0-maca.ai3.8.2.108-torch2.10-py310-kylinv11-amd64
模型:
DeepSeek-V4-Flash-0731-W8A8
配置:
TP=8
Expert Parallel enabled
max_num_seqs=8
max_num_batched_tokens=8192
现象:
默认 CUDA Graph 模式在 capture_model/_capture_cudagraphs 阶段,
MacaGemmMoe 内核触发 Xnack Error/ATU Fault 和 mcErrorIllegalAddress。
临时规避:
加入 --enforce-eager 后模型启动、普通对话及结构化工具调用均正常。
如果后续必须追求 CUDA Graph 性能,是不是要等新的镜像更新还是有别的方式可以解决?