请问sglang-0.5.14-minimax-h3-0801镜像8卡的推荐docker部署参数是?
请问sglang-0.5.14-minimax-h3-0801镜像8卡的推荐docker部署参数是?
尊敬的开发者您好,参考
sglang serve \
--model-path xx \
--num-gpus 8 \
--tp-size 4 \
--ulysses-degree 2 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30010 \
--model-variant fl2va
[08-04 09:29:12] Initializing distributed environment with world_size=8, device=cuda:0, timeout=3600
[08-04 09:29:22] Found nccl from library libmccl.so ← Metax 的 MCCL(NCCL 兼容实现)
...
[08-04 09:32:31] Rank 0 scheduler is dead. Please check if there are relevant logs.
[08-04 09:32:31] Exit code: -9 ← worker 被 SIGKILL
node002:148:1288 [...] MCCL WARN socketProgressOpt:
Call to recv from 10.1.32.2<32919> failed : Connection reset by peer ← MCCL bootstrap 连 10.1.32.2 被对端 reset
node002:150:1287 [...] MCCL WARN socketProgressOpt:
Call to recv from 10.1.32.2<32919> failed : Connection reset by peer
...
[主进程] data = reader.recv() → raise EOFError ← 主进程与 worker 的管道断开,整体退出
3) 错误逐行解读
尊敬的开发者您好,请使用以下命令
export MODEL_PATH="$MINIMAX_H3_FL2VA_MODEL_PATH"
export PORT=30010
export SERVER_OUTPUT_DIR="$MINIMAX_H3_OUTPUT_ROOT/server-$PORT"
mkdir -p "$SERVER_OUTPUT_DIR"
docker run -it --device=/dev/dri --device=/dev/mxcd \
--device=/dev/infiniband --privileged=true --group-add video \
--device=/dev/mem \
--network=host --security-opt seccomp=unconfined \
--security-opt apparmor=unconfined --shm-size '100gb' \
--ulimit memlock=-1 -v /usr/local/:/usr/local/ \
$image_id /bin/bash
python3 -m sglang.multimodal_gen.runtime.launch_server \
--model-path "$MODEL_PATH" \
--num-gpus 8 \
--sp-degree 8 \
--ulysses-degree 8 \
--use-fsdp-inference true \
--hsdp-replicate-dim 1 \
--hsdp-shard-dim 8 \
--dit-cpu-offload true \
--dit-layerwise-offload false \
--vae-cpu-offload true \
--trust-remote-code \
--warmup-mode off \
--host 0.0.0.0 \
--port "$PORT" \
--strict-ports \
--output-path "$SERVER_OUTPUT_DIR"
请问在8卡C500环境下,有运行更快的参数吗?
另一个问题是,每次运行一次生成视频后,第二次发送请求sglang进程就会crash,然后就要重启sglang,请问是我的命令有问题吗?
video_id=$(
curl -sS -X POST http://127.0.0.1:30000/v1/videos \
-H "Content-Type: application/json" \
-d '{
"model": "MiniMaxAI/MiniMax-H3",
"prompt": "A young man walks on the street.",
"seconds": 5,
"task": "t2va",
"conditions": [],
"target": {
"short_edge": 768, "aspect_ratio": "9:16", "duration_seconds": 5.0
},
"num_outputs_per_prompt": 1, "num_inference_steps": 50,
"flow_shift": 12.0, "audio_flow_shift": 3.0, "seed": 1101
}' |
jq -r '.id'
)
while true; do
status=$(curl -sS "http://127.0.0.1:30000/v1/videos/${video_id}" | jq -r '.status')
[ "$status" = "completed" ] && break
[ "$status" = "failed" ] && exit 1
sleep 10
done
curl -sS -L "http://127.0.0.1:30000/v1/videos/${video_id}/content" -o minimax-h3-t2va.mp4
启动方式就是参考docker run -it --device=/dev/dri --device=/dev/mxcd \
--device=/dev/infiniband --privileged=true --group-add video \
--device=/dev/mem \
--network=host --security-opt seccomp=unconfined \
--security-opt apparmor=unconfined --shm-size '100gb' \
--ulimit memlock=-1 -v /usr/local/:/usr/local/ \
$image_id /bin/bash
python3 -m sglang.multimodal_gen.runtime.launch_server \
--model-path "$MODEL_PATH" \
--num-gpus 8 \
--sp-degree 8 \
--ulysses-degree 8 \
--use-fsdp-inference true \
--hsdp-replicate-dim 1 \
--hsdp-shard-dim 8 \
--dit-cpu-offload true \
--dit-layerwise-offload false \
--vae-cpu-offload true \
--trust-remote-code \
--warmup-mode off \
--host 0.0.0.0 \
--port "$PORT" \
--strict-ports \
--output-path "$SERVER_OUTPUT_DIR"
环境是8卡C500, 驱动sdk都是最新的3.8.1
第一次请求正常,但是第二次请求就会出现
尊敬的开发者您好,等待后续镜像修复此问题。若需加速修复,请通过商务渠道申请。
我也是报这个错,环境: 128核 768G内存 8*C500