deepseek v4 flash sglang启动参数?
deepseek v4 flash sglang启动参数?
尊敬的开发者您好,参考
sglang serve \
--trust-remote-code \
--model-path metax-tech/DeepSeek-V4-Flash-FlexSMQ-AWQ-W8A8 \
--tp 8 \
--speculative-algorithm EAGLE \
--speculative-num-steps 3 \
--speculative-eagle-topk 1 \
--speculative-num-draft-tokens 4 \
--host 0.0.0.0 \
--port 30000
实测sglang 0.5.12 + dsv4部署效果好于vllm;vllm-metax(即使是最新0.26.0)疑似精度或者推理逻辑有问题,会导致长上下文的性能严重退化,tool call和thinking也不太正常
看到sglang 0.5.14镜像以及发布,这个版本是否支持v4 0731部署了?dspark是否可用?如可用命令行参数怎么写?谢谢!
尊敬的开发者您好,sglang 0.5.14支持ds v4 0731部署,dspark可用,命令参考
sglang serve \
--trust-remote-code \
--model-path metax-tech/DeepSeek-V4-Flash-0731-W8A8 \
--tp 8 \
--speculative-algorithm DSPARK \
--mem-fraction-static 0.90 \
--host 0.0.0.0 \
--port 30000
镜像:cr.metax-tech.com/public-ai-release/maca/sglang:0.5.14-maca.ai3.8.2.122-torch2.10-py310-ubuntu22.04-amd64
模型:DeepSeek-V4-Flash-0731-W8A8
硬件:曦云 C500 ×16(单机)
【启动参数】
python3 -m sglang.launch_server \
--model-path "$MODEL" --served-model-name deepseek-v4-flash \
--host 0.0.0.0 --port "$PORT" \
--tp-size 8 --context-length 98304 --chunked-prefill-size 8192 \
--trust-remote-code --kv-cache-dtype bfloat16 \
--speculative-algorithm DSPARK \
--tool-call-parser deepseekv4 --reasoning-parser deepseek-v4
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
【问题 1】这个镜像目前是否只支持切到8张卡?是否支持16张?
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
【问题 2】加DSPARK后第一次前向就报错;按提示回退后性能反而退化4倍。
不加--speculative-algorithm时一切正常。加上DSPARK后第一次前向报:
File ".../sglang/srt/speculative/dspark_components/kernels/commit_kv_proj.py", line 138,
in _dequant_linear_weight
assert weight.dtype == torch.float8_e4m3fn, (
AssertionError: unsupported wkv weight dtype torch.int8 for the fused commit kv proj;
set SGLANG_DSPARK_KERNEL_COMMIT_KV_PROJ=torch
按报错提示把22个SGLANG_DSPARK_KERNEL_*=torch 全部回退后,服务能起来、请求也正常,
但同机同口径压测(1024 输入/强制输出256token/唯一前缀,8 并发):
(1)不投机:单人55.8 tok/s ,TPOT17.92 ms;
(2)DSPARK + 22 个回退:单人13.6 tok/s ,TPOT 73.47 ms。
尊敬的开发者您好,
1.支持16张卡
2.请参考developer.metax-tech.com/forum/t/fa-tie-qian-bi-kan-jing-xiang-shi-yong-wen-ti-ti-wen-mo-ban/267/ 给出详细信息
memfrac大概可以设置0.87,0.9会爆显存;max model len对应的大概能有450K;chunked_prefill_size 8192就行,SGLANG_DSPARK_KERNEL_COMMIT_KV_PROJ需要配置防止走fp8,别的不用全部回退,SGLANG_DSPARK_KERNEL_EXPAND_PREFILL这个必须配置,编译会报错。
docker run -d \
--device=/dev/dri --device=/dev/mxcd --device=/dev/infiniband \
--group-add video --security-opt seccomp=unconfined \
--security-opt apparmor=unconfined --shm-size 100gb --ulimit memlock=-1 \
--privileged=true --network host \
-v /mnt/nvme0n1p1/modelscope:/llm_models \
-e TORCHINDUCTOR_COMPILE_THREADS=1 \
-e PYTORCH_ALLOC_CONF=expandable_segments:True \
-e SGLANG_DEFAULT_THINKING=1 \
-e SGLANG_DSPARK_KERNEL_EXPAND_PREFILL=torch \
-e SGLANG_DSPARK_KERNEL_COMMIT_KV_PROJ=torch \
-e SGLANG_MOE_CONFIG_DIR=/llm_models/moe_configs \
--name sglang-0514-dspark \
cr.metax-tech.com/public-ai-release/maca/sglang:0.5.14-maca.ai3.8.2.122-torch2.10-py312-kylinv11-amd64 \
bash -c 'python3 /llm_models/sglang-0514-thinkfix.py; echo ===PATCH-PREAMBLE-DONE===; grep -q SGLANG-0514-DEFTHINK /opt/conda/lib/python3.12/site-packages/sglang/srt/entrypoints/openai/serving_chat.py || { echo ===THINKFIX-NOT-APPLIED===; exit 9; }; python -m sglang.launch_server --host 0.0.0.0 --port 30000 --model-path /llm_models/metax-tech--DeepSeek-V4-Flash-0731-W8A8/snapshots/master --served-model-name deepseek-v4-flash --trust-remote-code --tp 8 --quantization w8a8_int8 --reasoning-parser deepseek-v4 --tool-call-parser deepseekv4 --mem-fraction-static 0.87 --speculative-algorithm DSPARK --speculative-dspark-block-size 5 --kv-cache-dtype bf16 --mamba-ssm-dtype bfloat16 --enable-cache-report --chunked-prefill-size 8192 --enable-hierarchical-cache --hicache-ratio 1 --hicache-io-backend direct --watchdog-timeout 1800 --context-length 460800'
参考我的运行命令;THINKFIX是为了默认开启thinking,打了个猴子补丁你可以忽略