请问sglang-0.5.14-minimax-h3-0801镜像8卡的推荐docker部署参数是?
请问sglang-0.5.14-minimax-h3-0801镜像8卡的推荐docker部署参数是?
用sglang镜像没法开HiCache
error: invalid input constraint 'l' in asm
asm volatile("ld.global.L1::no_allocate.b32 %0,[%1];" : "=r"(tmp) : "l"(src));
register(page-lock) too much memory, it will degrade system performance
mcHostRegister: Returned mcErrorInvalidValue
一、软硬件信息
mx-smi 输出)docker info 输出)mx-devops-acr-cn-shanghai.cr.volces.com/pub-registry1/ai-opentest/release/maca/vllm-metax:0.21.0-maca.ai3.7.1.2-dsv4-torch2.8-py310-ubuntu22.04-amd64vllm serve <model> \
--tensor-parallel-size 2 \
-dp 4 \
--enable-prefix-caching \
--max-model-len 33536 \
--kv-transfer-config '{"kv_connector":"LMCacheMetaXConnectorV1","kv_role":"kv_both"}'
二、问题现象
在 DP=4 TP=2(8 worker)配置下启动 vLLM + LMCache,服务卡死无法完成初始化,日志中出现大量 mxkwCreateQueueBlock timeout:
[MXKW][E]queues.c:844 : [mxkwCreateQueueBlock][Hint]ioctl create queue block timeout, gpu_id:X type:21. Retrying.
共出现 21 次,进程在 graph capture 阶段卡死。不加 LMCache、相同拓扑下正常启动(177s)。
三、已做实验汇总
| 实验 | 改动 | 结果 |
|---|---|---|
| baseline DP4 TP2 | 无 LMCache | ✅ 正常启动 177s |
| LMCache DP4 TP2 | 原始配置 | ❌ mxkwCreateQueueBlock × 21 |
| + --enforce-eager | 关闭 graph capture | ❌ mxkwCreateQueueBlock × 21 |
| + 关 pinned pool | max_local_cpu_size=0 | ❌ mxkwCreateQueueBlock × 21 |
| + 关 GPU stream | stream 改 no-op | ❌ mxkwCreateQueueBlock × 21 |
| MACA_MPS_MODE=1 | 开启 MPS 共享队列 | ❌ MCCL 通信失败,连接中止 |
| TP=8 DP=1 + LMCache | 改拓扑 | ✅ 正常启动,功能验证通过 |
四、根因分析
MetaX driver 的 GPU hardware queue pool 有固定上限。DP=4 下每个 GPU 需要为 4 个独立 DP 通信组各自初始化,底座 queue 消耗是 DP=1 的 4 倍。LMCache 初始化在此基础上额外消耗 queue,导致总量超限,后续申请全部阻塞超时。
TP=8 DP=1 无问题,是因为只有 1 个 DP 通信组,给 LMCache 留了足够余量。
五、咨询问题
CUDA_DEVICE_MAX_CONNECTIONS)MACA_MPS_MODE=1 在 DP=4 多进程场景下导致 MCCL 通信建立失败:socketStartConnect: Connect to 10.1.36.2:XXXXX failed: Software caused connection abort,约 300s 后退出。请问 MPS 模式在 DP 多进程场景下是否支持?有无正确配置方式?一、软硬件信息
mx-smi 输出)docker info 输出)python3 -c "from lmcache.experimental.p2p import P2PBackend; print('P2P supported')"
二、问题现象
我们正在部署 4 机 32 卡的多节点推理集群,希望使用 LMCache 的 P2P 多节点 KV Cache 共享功能,将各节点 CPU 内存组成统一缓存池以提升跨实例缓存命中率。
环境已满足 P2P 所需的全部硬件条件:
import nixl 正常,nixl_agent 等核心接口可用但执行以下命令时报错:
python3 -c "from lmcache.experimental.p2p import P2PBackend; print('P2P supported')"
报错信息:
ModuleNotFoundError: No module named 'lmcache.experimental'
当前 lmcache 可用模块如下(pkgutil.iter_modules 输出):
c_ops, cli, connections, integration, lmcache_fs,
lmcache_redis, logging, native_storage_ops,
non_cuda_equivalents, observability, tools,
usage_context, utils, v1
可以看到 experimental 模块完全缺失。
咨询问题:
lmcache 0.4.4+maca 版本是否计划支持 lmcache.experimental.p2p P2P 多节点 CPU 共享功能?import nixl 正常,nixl.__version__ 报 AttributeError),该版本是否与 P2P 功能兼容?lmcache_redis)作为跨节点共享缓存的替代方案?有无针对沐曦平台的最佳实践文档?