• Members 26 posts
    2026年9月21日 10:49

    deepseek v4 flash sglang启动参数?

  • arrow_forward

    Thread has been moved from 公共.

  • Members 949 posts
    2026年9月21日 10:54

    尊敬的开发者您好,参考

    sglang serve \
      --trust-remote-code \
      --model-path metax-tech/DeepSeek-V4-Flash-FlexSMQ-AWQ-W8A8 \
      --tp 8 \
      --speculative-algorithm EAGLE \
      --speculative-num-steps 3 \
      --speculative-eagle-topk 1 \
      --speculative-num-draft-tokens 4 \
      --host 0.0.0.0 \
      --port 30000
    
  • Members 26 posts
    2026年9月21日 16:56

    实测sglang 0.5.12 + dsv4部署效果好于vllm;vllm-metax(即使是最新0.26.0)疑似精度或者推理逻辑有问题,会导致长上下文的性能严重退化,tool call和thinking也不太正常

  • Members 26 posts
    2026年9月24日 08:56

    看到sglang 0.5.14镜像以及发布,这个版本是否支持v4 0731部署了?dspark是否可用?如可用命令行参数怎么写?谢谢!

  • Members 949 posts
    2026年9月24日 10:14

    尊敬的开发者您好,sglang 0.5.14支持ds v4 0731部署,dspark可用,命令参考

    sglang serve \
      --trust-remote-code \
      --model-path metax-tech/DeepSeek-V4-Flash-0731-W8A8 \
      --tp 8 \
      --speculative-algorithm DSPARK \
      --mem-fraction-static 0.90 \
      --host 0.0.0.0 \
      --port 30000
    
  • Members 1 post
    2026年9月24日 14:27

    镜像:cr.metax-tech.com/public-ai-release/maca/sglang:0.5.14-maca.ai3.8.2.122-torch2.10-py310-ubuntu22.04-amd64
    模型:DeepSeek-V4-Flash-0731-W8A8
    硬件:曦云 C500 ×16(单机)

    【启动参数】
    python3 -m sglang.launch_server \
    --model-path "$MODEL" --served-model-name deepseek-v4-flash \
    --host 0.0.0.0 --port "$PORT" \
    --tp-size 8 --context-length 98304 --chunked-prefill-size 8192 \
    --trust-remote-code --kv-cache-dtype bfloat16 \
    --speculative-algorithm DSPARK \
    --tool-call-parser deepseekv4 --reasoning-parser deepseek-v4

    ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━

    【问题 1】这个镜像目前是否只支持切到8张卡?是否支持16张?

    ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
    【问题 2】加DSPARK后第一次前向就报错;按提示回退后性能反而退化4倍。

    不加--speculative-algorithm时一切正常。加上DSPARK后第一次前向报:

    File ".../sglang/srt/speculative/dspark_components/kernels/commit_kv_proj.py", line 138,
    in _dequant_linear_weight
    assert weight.dtype == torch.float8_e4m3fn, (
    AssertionError: unsupported wkv weight dtype torch.int8 for the fused commit kv proj;
    set SGLANG_DSPARK_KERNEL_COMMIT_KV_PROJ=torch

    按报错提示把22个SGLANG_DSPARK_KERNEL_*=torch 全部回退后,服务能起来、请求也正常,
    但同机同口径压测(1024 输入/强制输出256token/唯一前缀,8 并发):
    (1)不投机:单人55.8 tok/s ,TPOT17.92 ms;
    (2)DSPARK + 22 个回退:单人13.6 tok/s ,TPOT 73.47 ms。

  • Members 26 posts
    2026年9月24日 14:59

    memfrac大概可以设置0.87,0.9会爆显存;max model len对应的大概能有450K;chunked_prefill_size 8192就行,SGLANG_DSPARK_KERNEL_COMMIT_KV_PROJ需要配置防止走fp8,别的不用全部回退,SGLANG_DSPARK_KERNEL_EXPAND_PREFILL这个必须配置,编译会报错。

    docker run -d \
      --device=/dev/dri --device=/dev/mxcd --device=/dev/infiniband \
      --group-add video --security-opt seccomp=unconfined \
      --security-opt apparmor=unconfined --shm-size 100gb --ulimit memlock=-1 \
      --privileged=true --network host \
      -v /mnt/nvme0n1p1/modelscope:/llm_models \
      -e TORCHINDUCTOR_COMPILE_THREADS=1 \
      -e PYTORCH_ALLOC_CONF=expandable_segments:True \
      -e SGLANG_DEFAULT_THINKING=1 \
      -e SGLANG_DSPARK_KERNEL_EXPAND_PREFILL=torch \
      -e SGLANG_DSPARK_KERNEL_COMMIT_KV_PROJ=torch \
      -e SGLANG_MOE_CONFIG_DIR=/llm_models/moe_configs \
      --name sglang-0514-dspark \
      cr.metax-tech.com/public-ai-release/maca/sglang:0.5.14-maca.ai3.8.2.122-torch2.10-py312-kylinv11-amd64 \
      bash -c 'python3 /llm_models/sglang-0514-thinkfix.py; echo ===PATCH-PREAMBLE-DONE===; grep -q SGLANG-0514-DEFTHINK /opt/conda/lib/python3.12/site-packages/sglang/srt/entrypoints/openai/serving_chat.py || { echo ===THINKFIX-NOT-APPLIED===; exit 9; }; python -m sglang.launch_server --host 0.0.0.0 --port 30000 --model-path /llm_models/metax-tech--DeepSeek-V4-Flash-0731-W8A8/snapshots/master --served-model-name deepseek-v4-flash --trust-remote-code --tp 8 --quantization w8a8_int8 --reasoning-parser deepseek-v4 --tool-call-parser deepseekv4 --mem-fraction-static 0.87 --speculative-algorithm DSPARK --speculative-dspark-block-size 5 --kv-cache-dtype bf16 --mamba-ssm-dtype bfloat16 --enable-cache-report --chunked-prefill-size 8192 --enable-hierarchical-cache --hicache-ratio 1 --hicache-io-backend direct --watchdog-timeout 1800 --context-length 460800'
    

    参考我的运行命令;THINKFIX是为了默认开启thinking,打了个猴子补丁你可以忽略

  • arrow_forward

    Thread has been moved from 解决中.