请问下 modelscope.cn/models/metax-tech/DeepSeek-V4-Flash-FlexSMQ-AWQ-W8A8 这个量化模型在8卡沐曦C500上是否能够部署,如果要部署应使用哪个镜像,使用什么参数启动?
服务器:单机双路CPU,配备 8张沐曦(MetaX)C500-P GPU,单卡显存 64GB(总计512GB)。
驱动版本:Kernel Driver 3.3.12,MACA 3.2.1.10,BIOS 1.29.1.0。
@shuai_chen
请问下 modelscope.cn/models/metax-tech/DeepSeek-V4-Flash-FlexSMQ-AWQ-W8A8 这个量化模型在8卡沐曦C500上是否能够部署,如果要部署应使用哪个镜像,使用什么参数启动?
服务器:单机双路CPU,配备 8张沐曦(MetaX)C500-P GPU,单卡显存 64GB(总计512GB)。
驱动版本:Kernel Driver 3.3.12,MACA 3.2.1.10,BIOS 1.29.1.0。
@shuai_chen
尊敬的开发者您好,请使用vllm metax 0.24.0镜像,命令参考
export MACA_SMALL_PAGESIZE_ENABLE=1
export MACA_VLLM_ENABLE_MCTLASS_FUSED_MOE=1
export MACA_VLLM_ENABLE_MCTLASS_PYTHON_API=1
vllm serve /data/models/model_quant_opt/DeepSeek/DeepSeek-V4-flash_W8A8/ --trust-remote-code \
--kv-cache-dtype bfloat16 --block-size 256 --gpu-memory-utilization 0.85 \
--tokenizer-mode deepseek_v4 --tool-call-parser deepseek_v4 \
--enable-auto-tool-choice --reasoning-parser deepseek_v4 \
--compilation-config '{"cudagraph_mode":"FULL_AND_PIECEWISE", "custom_ops":["all"]}' \
--max-num-seq 32 -tp 8 --speculative_config '{"method": "mtp", "num_speculative_tokens": 1}'
你好,目前vllm metax 0.24.0 镜像有两个,什么时候能修复呢?
工具链 │ ❌ xgrammar 0.1.32 缺 normalize_tool_choice(0.24.0 镜像的 bug)
│ MTP 投机 │ ❌ checkpoint 权重布局与 0.24.0 模型不匹配(main_norm 结构差异)