DeepSeek-V4-Flash-FlexSMQ-AWQ-W8A8 这个模型在原生的dockers 环境里面是可以起的,但是工具解析的时候还是会有xgrammar的问题。 我升级了下面的两个python module之后,再启动模型,会报错log如下。 我之后加入了 --enforce-eager,强制使用 Eager 模式,跳过所有 CUDA Graph 捕获步骤,这个就能起。 请问下有没有对应的升级python module包的list。
DeepSeek-V4-Flash-FlexSMQ-AWQ-W8A8 这个模型在原生的dockers 环境里面是可以起的,但是工具解析的时候还是会有xgrammar的问题。 我升级了下面的两个python module之后,再启动模型,会报错log如下。 我之后加入了 --enforce-eager,强制使用 Eager 模式,跳过所有 CUDA Graph 捕获步骤,这个就能起。 请问下有没有对应的升级python module包的list。
DeepSeek-V4-Flash-FlexSMQ-AWQ-W8A8 这个模型是支持的嘛
环境:MACA 3.8.0.25, mcoplib 0.4.10, vLLM-Metax 0.25.0
模型:DeepSeek-V4-Flash-0731-W8A8
配置:PP=2, TP=8, nnodes=2, 16x C500
崩溃现象:
1. 崩溃发生在 CUDA Graph capture 阶段(capture_model → _dummy_run → self.model(...))
2. 报错:memory violation(0x4) → mcErrorIllegalAddress
3. 崩溃 kernel:
- _ZN7mctlass6KernelINS_4gemm6kernel11MacaGemmMoe...MacaMoeMmaMultistage...
- mhc_fused_post_pre_tilelang (tilelang.py line 345)
- fused_indexer_q_rope_int8_quant (fused_indexer_q.py line 180)
目前有遇到这个问题
pip install xgrammar==0.2.1 --no-deps
pip install apache-tvm-ffi==0.1.9
目前测试完,升级这里两个对应的包可以解决问题
这个是升级完,再起vllm时候的报错
我现在使用的是这个版本的镜像, 不管是dsv4, 还是qwen3.8, 只要是涉及到工具调用解析,例如opencode,或者其他的agent调用,就会报下面的错误。。 这个有什么解法嘛? 这个问题已经困扰我很久了。