[08-04 09:29:12] Initializing distributed environment with world_size=8, device=cuda:0, timeout=3600
[08-04 09:29:22] Found nccl from library libmccl.so ← Metax 的 MCCL(NCCL 兼容实现)
...
[08-04 09:32:31] Rank 0 scheduler is dead. Please check if there are relevant logs.
[08-04 09:32:31] Exit code: -9 ← worker 被 SIGKILL
node002:148:1288 [...] MCCL WARN socketProgressOpt:
Call to recv from 10.1.32.2<32919> failed : Connection reset by peer ← MCCL bootstrap 连 10.1.32.2 被对端 reset
node002:150:1287 [...] MCCL WARN socketProgressOpt:
Call to recv from 10.1.32.2<32919> failed : Connection reset by peer
...
[主进程] data = reader.recv() → raise EOFError ← 主进程与 worker 的管道断开,整体退出
3) 错误逐行解读
- Initializing distributed environment with world_size=8:8 个 GPU worker 进程开始建组。
- Found nccl from library libmccl.so:走的是 Metax 的 MCCL 集合通信库。
- Call to recv from 10.1.32.2<32919> failed: Connection reset by peer:MCCL 做 bootstrap 时,某个 worker 试图连 10.1.32.2:32919(= bond0,这台机的数据网 IP)被对端 reset。说明 8 个 worker 之间没法建立 TCP 通信通道。
- Rank 0 scheduler is dead. Exit code: -9:worker 0 收到 SIGKILL(-9),崩溃。
- EOFError:主进程等着从 worker 收消息,管道断了,整个服务退出。
启动参数是 docker run -d \
--name minimax-h3-sglang \
--privileged \
--network=host \
--ipc=host --shm-size=32g \
-v /data4/model/MiniMax-H3:/model \
-e TORCH_CUDA_ARCH_LIST="8.0;8.6;8.9;9.0" \
-e PYTORCH_ALLOC_CONF=expandable_segments:True \
-e SGLANG_NSA_FLASHMLA_BACKEND_DECODE_COMPUTE_FP8=0 \
-e SGLANG_SAIL_DSV4_USE_FLASH_MLA_SPARSE_FWD=0 \
-e SGLANG_NSA_DUAL_STREAM=0 \
-e ENABLE_ACEXT_W4A8_EP=1 \
-e SGLANG_ENABLE_JIT_DEEPGEMM=1 \
-e PYTHONUNBUFFERED=1 \
-e MCCL_IB_DISABLE=1 \
cr.metax-tech.com/public-init/minimax-h3/sglang-0.5.14-minimax-h3-0801:latest \
python -m sglang.multimodal_gen.runtime.entrypoints.cli.main serve \
--model-path /model/FL2VA \
--num-gpus 8 \
--ulysses-degree 8 \
--port 30010 \
--host 0.0.0.0 \
--trust-remote-code