• Members 7 posts
    2026年8月3日 20:02

    请问sglang-0.5.14-minimax-h3-0801镜像8卡的推荐docker部署参数是?

  • arrow_forward

    Thread has been moved from 公共.

  • Members 794 posts
    2026年8月4日 11:09

    尊敬的开发者您好,参考

    sglang serve \
      --model-path xx \
      --num-gpus 8 \
      --tp-size 4 \
      --ulysses-degree 2 \
      --performance-mode speed \
      --host 0.0.0.0 \
      --port 30010 \
      --model-variant fl2va
    
  • Members 7 posts
    2026年8月4日 14:11

    [08-04 09:29:12] Initializing distributed environment with world_size=8, device=cuda:0, timeout=3600
    [08-04 09:29:22] Found nccl from library libmccl.so ← Metax 的 MCCL(NCCL 兼容实现)
    ...
    [08-04 09:32:31] Rank 0 scheduler is dead. Please check if there are relevant logs.
    [08-04 09:32:31] Exit code: -9 ← worker 被 SIGKILL
    node002:148:1288 [...] MCCL WARN socketProgressOpt:
    Call to recv from 10.1.32.2<32919> failed : Connection reset by peer ← MCCL bootstrap 连 10.1.32.2 被对端 reset
    node002:150:1287 [...] MCCL WARN socketProgressOpt:
    Call to recv from 10.1.32.2<32919> failed : Connection reset by peer
    ...
    [主进程] data = reader.recv() → raise EOFError ← 主进程与 worker 的管道断开,整体退出

    3) 错误逐行解读

    • Initializing distributed environment with world_size=8:8 个 GPU worker 进程开始建组。
    • Found nccl from library libmccl.so:走的是 Metax 的 MCCL 集合通信库。
    • Call to recv from 10.1.32.2<32919> failed: Connection reset by peer:MCCL 做 bootstrap 时,某个 worker 试图连 10.1.32.2:32919(= bond0,这台机的数据网 IP)被对端 reset。说明 8 个 worker 之间没法建立 TCP 通信通道。
    • Rank 0 scheduler is dead. Exit code: -9:worker 0 收到 SIGKILL(-9),崩溃。
    • EOFError:主进程等着从 worker 收消息,管道断了,整个服务退出。
      启动参数是 docker run -d \
      --name minimax-h3-sglang \
      --privileged \
      --network=host \
      --ipc=host --shm-size=32g \
      -v /data4/model/MiniMax-H3:/model \
      -e TORCH_CUDA_ARCH_LIST="8.0;8.6;8.9;9.0" \
      -e PYTORCH_ALLOC_CONF=expandable_segments:True \
      -e SGLANG_NSA_FLASHMLA_BACKEND_DECODE_COMPUTE_FP8=0 \
      -e SGLANG_SAIL_DSV4_USE_FLASH_MLA_SPARSE_FWD=0 \
      -e SGLANG_NSA_DUAL_STREAM=0 \
      -e ENABLE_ACEXT_W4A8_EP=1 \
      -e SGLANG_ENABLE_JIT_DEEPGEMM=1 \
      -e PYTHONUNBUFFERED=1 \
      -e MCCL_IB_DISABLE=1 \
      cr.metax-tech.com/public-init/minimax-h3/sglang-0.5.14-minimax-h3-0801:latest \
      python -m sglang.multimodal_gen.runtime.entrypoints.cli.main serve \
      --model-path /model/FL2VA \
      --num-gpus 8 \
      --ulysses-degree 8 \
      --port 30010 \
      --host 0.0.0.0 \
      --trust-remote-code
  • Members 794 posts
    2026年8月5日 10:08

    尊敬的开发者您好,请使用以下命令

    export MODEL_PATH="$MINIMAX_H3_FL2VA_MODEL_PATH" 
    export PORT=30010 
    export SERVER_OUTPUT_DIR="$MINIMAX_H3_OUTPUT_ROOT/server-$PORT" 
    mkdir -p "$SERVER_OUTPUT_DIR" 
    
    docker run -it  --device=/dev/dri --device=/dev/mxcd \
    --device=/dev/infiniband --privileged=true --group-add video \
    --device=/dev/mem \
    --network=host --security-opt seccomp=unconfined \
    --security-opt apparmor=unconfined --shm-size '100gb' \
    --ulimit memlock=-1 -v /usr/local/:/usr/local/ \
    $image_id /bin/bash
    
    python3 -m sglang.multimodal_gen.runtime.launch_server \
      --model-path "$MODEL_PATH" \
      --num-gpus 8 \
      --sp-degree 8 \
      --ulysses-degree 8 \
      --use-fsdp-inference true \
      --hsdp-replicate-dim 1 \
      --hsdp-shard-dim 8 \
      --dit-cpu-offload true \
      --dit-layerwise-offload false \
      --vae-cpu-offload true \
      --trust-remote-code \
      --warmup-mode off \
      --host 0.0.0.0 \
      --port "$PORT" \
      --strict-ports \
      --output-path "$SERVER_OUTPUT_DIR"
    
  • Members 2 posts
    2026年8月5日 21:28

    请问在8卡C500环境下,有运行更快的参数吗?

    另一个问题是,每次运行一次生成视频后,第二次发送请求sglang进程就会crash,然后就要重启sglang,请问是我的命令有问题吗?
    video_id=$(
    curl -sS -X POST http://127.0.0.1:30000/v1/videos \
    -H "Content-Type: application/json" \
    -d '{
    "model": "MiniMaxAI/MiniMax-H3",
    "prompt": "A young man walks on the street.",
    "seconds": 5,
    "task": "t2va",
    "conditions": [],
    "target": {
    "short_edge": 768, "aspect_ratio": "9:16", "duration_seconds": 5.0
    },
    "num_outputs_per_prompt": 1, "num_inference_steps": 50,
    "flow_shift": 12.0, "audio_flow_shift": 3.0, "seed": 1101
    }' |
    jq -r '.id'
    )
    while true; do
    status=$(curl -sS "http://127.0.0.1:30000/v1/videos/${video_id}" | jq -r '.status')
    [ "$status" = "completed" ] && break
    [ "$status" = "failed" ] && exit 1
    sleep 10
    done
    curl -sS -L "http://127.0.0.1:30000/v1/videos/${video_id}/content" -o minimax-h3-t2va.mp4

  • Members 2 posts
    2026年8月6日 14:03

    启动方式就是参考docker run -it --device=/dev/dri --device=/dev/mxcd \
    --device=/dev/infiniband --privileged=true --group-add video \
    --device=/dev/mem \
    --network=host --security-opt seccomp=unconfined \
    --security-opt apparmor=unconfined --shm-size '100gb' \
    --ulimit memlock=-1 -v /usr/local/:/usr/local/ \
    $image_id /bin/bash

    python3 -m sglang.multimodal_gen.runtime.launch_server \
    --model-path "$MODEL_PATH" \
    --num-gpus 8 \
    --sp-degree 8 \
    --ulysses-degree 8 \
    --use-fsdp-inference true \
    --hsdp-replicate-dim 1 \
    --hsdp-shard-dim 8 \
    --dit-cpu-offload true \
    --dit-layerwise-offload false \
    --vae-cpu-offload true \
    --trust-remote-code \
    --warmup-mode off \
    --host 0.0.0.0 \
    --port "$PORT" \
    --strict-ports \
    --output-path "$SERVER_OUTPUT_DIR"

    环境是8卡C500, 驱动sdk都是最新的3.8.1
    第一次请求正常,但是第二次请求就会出现

    微信图片_20260806114447_3062_174.png

    PNG, 156.5 KB, uploaded by zhangzunhao on 2026年8月6日.

  • Members 794 posts
    2026年8月6日 16:15

    尊敬的开发者您好,等待后续镜像修复此问题。若需加速修复,请通过商务渠道申请。

  • arrow_forward

    Thread has been moved from 解决中.

  • Members 1 post
    2026年8月14日 23:43

    我也是报这个错,环境: 128核 768G内存 8*C500