MetaX-Tech Developer Forum 论坛首页
  • 沐曦开发者
search
Sign in

habibi

  • Members
  • Joined 2026年6月11日
  • message 帖子
  • forum 主题
  • favorite 关注者
  • favorite_border Follows
  • person_outline 详细信息

habibi has posted 7 messages.

  • See post chevron_right
    habibi
    Members
    sglang-0.5.14-minimax-h3-0801 推荐部署参数是? 已解决 2026年8月4日 14:11

    [08-04 09:29:12] Initializing distributed environment with world_size=8, device=cuda:0, timeout=3600
    [08-04 09:29:22] Found nccl from library libmccl.so ← Metax 的 MCCL(NCCL 兼容实现)
    ...
    [08-04 09:32:31] Rank 0 scheduler is dead. Please check if there are relevant logs.
    [08-04 09:32:31] Exit code: -9 ← worker 被 SIGKILL
    node002:148:1288 [...] MCCL WARN socketProgressOpt:
    Call to recv from 10.1.32.2<32919> failed : Connection reset by peer ← MCCL bootstrap 连 10.1.32.2 被对端 reset
    node002:150:1287 [...] MCCL WARN socketProgressOpt:
    Call to recv from 10.1.32.2<32919> failed : Connection reset by peer
    ...
    [主进程] data = reader.recv() → raise EOFError ← 主进程与 worker 的管道断开,整体退出

    3) 错误逐行解读

    • Initializing distributed environment with world_size=8:8 个 GPU worker 进程开始建组。
    • Found nccl from library libmccl.so:走的是 Metax 的 MCCL 集合通信库。
    • Call to recv from 10.1.32.2<32919> failed: Connection reset by peer:MCCL 做 bootstrap 时,某个 worker 试图连 10.1.32.2:32919(= bond0,这台机的数据网 IP)被对端 reset。说明 8 个 worker 之间没法建立 TCP 通信通道。
    • Rank 0 scheduler is dead. Exit code: -9:worker 0 收到 SIGKILL(-9),崩溃。
    • EOFError:主进程等着从 worker 收消息,管道断了,整个服务退出。
      启动参数是 docker run -d \
      --name minimax-h3-sglang \
      --privileged \
      --network=host \
      --ipc=host --shm-size=32g \
      -v /data4/model/MiniMax-H3:/model \
      -e TORCH_CUDA_ARCH_LIST="8.0;8.6;8.9;9.0" \
      -e PYTORCH_ALLOC_CONF=expandable_segments:True \
      -e SGLANG_NSA_FLASHMLA_BACKEND_DECODE_COMPUTE_FP8=0 \
      -e SGLANG_SAIL_DSV4_USE_FLASH_MLA_SPARSE_FWD=0 \
      -e SGLANG_NSA_DUAL_STREAM=0 \
      -e ENABLE_ACEXT_W4A8_EP=1 \
      -e SGLANG_ENABLE_JIT_DEEPGEMM=1 \
      -e PYTHONUNBUFFERED=1 \
      -e MCCL_IB_DISABLE=1 \
      cr.metax-tech.com/public-init/minimax-h3/sglang-0.5.14-minimax-h3-0801:latest \
      python -m sglang.multimodal_gen.runtime.entrypoints.cli.main serve \
      --model-path /model/FL2VA \
      --num-gpus 8 \
      --ulysses-degree 8 \
      --port 30010 \
      --host 0.0.0.0 \
      --trust-remote-code
  • See post chevron_right
    habibi
    Members
    sglang-0.5.14-minimax-h3-0801 推荐部署参数是? 已解决 2026年8月3日 20:02

    请问sglang-0.5.14-minimax-h3-0801镜像8卡的推荐docker部署参数是?

  • See post chevron_right
    habibi
    Members
    HiCache JIT kernel 编译失败 已解决 2026年7月3日 15:28

    用sglang镜像没法开HiCache

    error: invalid input constraint 'l' in asm
    asm volatile("ld.global.L1::no_allocate.b32 %0,[%1];" : "=r"(tmp) : "l"(src));

    register(page-lock) too much memory, it will degrade system performance
    mcHostRegister: Returned mcErrorInvalidValue

  • See post chevron_right
    habibi
    Members
    DP=4 TP=2 + LMCache 启动时 mxkwCreateQueueBlock timeout × 21,driver queue pool 上限是否可调 已解决 2026年6月23日 18:11

    一、软硬件信息

    1. 服务器厂家:新华三(H3C)R5500 G6
    2. 沐曦GPU型号:METAX C500 64G × 8卡(单机)
    3. 操作系统内核版本:Linux metax-host-042 5.15.0-119-generic #129-Ubuntu SMP x86_64
    4. 是否开启CPU虚拟化:否
    5. mx-smi回显:(贴 mx-smi 输出)
    6. docker info回显:(贴 docker info 输出)
    7. 镜像版本:mx-devops-acr-cn-shanghai.cr.volces.com/pub-registry1/ai-opentest/release/maca/vllm-metax:0.21.0-maca.ai3.7.1.2-dsv4-torch2.8-py310-ubuntu22.04-amd64
    8. 启动容器命令:(贴你们的 docker run 命令)
    9. vLLM 启动命令:
    vllm serve <model> \
      --tensor-parallel-size 2 \
      -dp 4 \
      --enable-prefix-caching \
      --max-model-len 33536 \
      --kv-transfer-config '{"kv_connector":"LMCacheMetaXConnectorV1","kv_role":"kv_both"}'
    

    二、问题现象

    在 DP=4 TP=2(8 worker)配置下启动 vLLM + LMCache,服务卡死无法完成初始化,日志中出现大量 mxkwCreateQueueBlock timeout:

    [MXKW][E]queues.c:844 : [mxkwCreateQueueBlock][Hint]ioctl create queue block timeout, gpu_id:X type:21. Retrying.
    

    共出现 21 次,进程在 graph capture 阶段卡死。不加 LMCache、相同拓扑下正常启动(177s)。


    三、已做实验汇总

    | 实验 | 改动 | 结果 |
    |---|---|---|
    | baseline DP4 TP2 | 无 LMCache | ✅ 正常启动 177s |
    | LMCache DP4 TP2 | 原始配置 | ❌ mxkwCreateQueueBlock × 21 |
    | + --enforce-eager | 关闭 graph capture | ❌ mxkwCreateQueueBlock × 21 |
    | + 关 pinned pool | max_local_cpu_size=0 | ❌ mxkwCreateQueueBlock × 21 |
    | + 关 GPU stream | stream 改 no-op | ❌ mxkwCreateQueueBlock × 21 |
    | MACA_MPS_MODE=1 | 开启 MPS 共享队列 | ❌ MCCL 通信失败,连接中止 |
    | TP=8 DP=1 + LMCache | 改拓扑 | ✅ 正常启动,功能验证通过 |


    四、根因分析

    MetaX driver 的 GPU hardware queue pool 有固定上限。DP=4 下每个 GPU 需要为 4 个独立 DP 通信组各自初始化,底座 queue 消耗是 DP=1 的 4 倍。LMCache 初始化在此基础上额外消耗 queue,导致总量超限,后续申请全部阻塞超时。

    TP=8 DP=1 无问题,是因为只有 1 个 DP 通信组,给 LMCache 留了足够余量。


    五、咨询问题

    1. MetaX driver queue pool 的上限是多少?有没有环境变量或驱动参数可以调大?(类似 CUDA 的 CUDA_DEVICE_MAX_CONNECTIONS)
    2. MACA_MPS_MODE=1 在 DP=4 多进程场景下导致 MCCL 通信建立失败:socketStartConnect: Connect to 10.1.36.2:XXXXX failed: Software caused connection abort,约 300s 后退出。请问 MPS 模式在 DP 多进程场景下是否支持?有无正确配置方式?
  • See post chevron_right
    habibi
    Members
    LMCache 0.4.4+maca 版本是否支持 P2P 多节点 KV Cache 共享?NIXL 已就绪但 lmcache.experimental 模块缺失 已解决 2026年6月11日 16:52

    请问哪个镜像可以支持lmcache.experimental.p2p 这个功能?

  • See post chevron_right
    habibi
    Members
    LMCache 0.4.4+maca 版本是否支持 P2P 多节点 KV Cache 共享?NIXL 已就绪但 lmcache.experimental 模块缺失 已解决 2026年6月11日 16:15

    mx-devops-acr-cn-shanghai.cr.volces.com/pub-registry1/ai-opentest/release/maca/vllm-metax:0.21.0-maca.ai3.7.1.2-dsv4-torch2.8-py310-ubuntu22.04-amd64

  • See post chevron_right
    habibi
    Members
    LMCache 0.4.4+maca 版本是否支持 P2P 多节点 KV Cache 共享?NIXL 已就绪但 lmcache.experimental 模块缺失 已解决 2026年6月11日 10:40

    一、软硬件信息

    1. 服务器厂家:新华三(H3C)R5500 G6
    2. 沐曦GPU型号:METAX C500 64G × 8卡 × 4台机器(共32卡)
    3. 操作系统内核版本:Linux metax-host-041 5.15.0-119-generic #129-Ubuntu SMP x86_64
    4. 是否开启CPU虚拟化:否
    5. mx-smi回显:(贴一下 mx-smi 输出)
    6. docker info回显:(贴一下 docker info 输出)
    7. 镜像版本:lmcache 0.4.4+maca3.7.1.2.dsv4
    8. 启动容器命令:(贴你们的启动命令)
    9. 容器内执行命令:
    python3 -c "from lmcache.experimental.p2p import P2PBackend; print('P2P supported')"
    

    二、问题现象

    我们正在部署 4 机 32 卡的多节点推理集群,希望使用 LMCache 的 P2P 多节点 KV Cache 共享功能,将各节点 CPU 内存组成统一缓存池以提升跨实例缓存命中率。

    环境已满足 P2P 所需的全部硬件条件:

    • RDMA 网卡:Broadcom BCM957608,4 张 RoCE v2 网卡均为 PORT_ACTIVE 状态
    • 节点间 RDMA 带宽实测:单 QP 约 21 GB/s,4 QP 约 42 GB/s,物理链路 400 Gbps
    • NIXL 已安装:import nixl 正常,nixl_agent 等核心接口可用

    但执行以下命令时报错:

    python3 -c "from lmcache.experimental.p2p import P2PBackend; print('P2P supported')"
    

    报错信息:

    ModuleNotFoundError: No module named 'lmcache.experimental'
    

    当前 lmcache 可用模块如下(pkgutil.iter_modules 输出):

    c_ops, cli, connections, integration, lmcache_fs,
    lmcache_redis, logging, native_storage_ops,
    non_cuda_equivalents, observability, tools,
    usage_context, utils, v1
    

    可以看到 experimental 模块完全缺失。

    咨询问题:

    1. lmcache 0.4.4+maca 版本是否计划支持 lmcache.experimental.p2p P2P 多节点 CPU 共享功能?
    2. 如有支持计划,预计什么版本/时间可用?是否有内测版本可以提前试用?
    3. 当前 NIXL 已安装但无版本号(import nixl 正常,nixl.__version__ 报 AttributeError),该版本是否与 P2P 功能兼容?
    4. 在 P2P 功能就绪前,官方是否推荐使用 Redis 后端(lmcache_redis)作为跨节点共享缓存的替代方案?有无针对沐曦平台的最佳实践文档?
  • 沐曦开发者论坛
powered by misago