4. 已知问题和使用限制

模块

问题和限制说明

MXMACA软件栈

多程序长时间并行执行,有概率会出现程序执行无响应问题

Flash Attention C++接口有优化,使用Flash Attention C++接口的应用需要继承新的接口,对2.23.0.x及以前版本不兼容

某些主板不支持atomic访问的部分功能

mx C/C++程序不支持在Ubuntu18.04系统编译运行

C550 OAM上部分算子需要设置 MCCL_PCIE_BUFFER_MODE=1 规避性能回退问题

flash_attn特殊场景下有hang的现象

MC3-14011 UMD Perf Metrics kernel launch某些case会有一定性能下降

mcFftXt接口暂未支持,请使用非Xt的接口替代

TORCH_ALLOW_TF32_CUBLAS_OVERRIDE 变量在host和容器里默认值不同,个别算子在不同环境测试会出现精度/性能差异

在一些特殊场景下可以设置 MACA_SMALL_PAGESIZE_ENABLE=1 提升性能

Geqrf某些case会有一定性能下降

Series.str.like 函数在处理某些特殊字符串(如%_等)时会失败

C588 平台进行AI测试需配置sudo命令 sudo cpupower idle-set -D 0 用来提升性能

使用SGLang出现问题时可尝试添加 MCCL_ENABLE_FC=0

C550平台 HSTU_attn 计算正确,但是部分随机数输入下精度略降

在线安装Metax Driver 3.7.1.1 时,需要预先在线安装metax-linux=3.8.1

在线安装Metax Driver 3.8.1.6 时,需要指定版本进行安装,如apt install metax-linux=3.9.6 mxfw=3.8.1 mxsmt=3.8.1.6 metax-driver=3.8.1.6

内核版本6.6.0及以上时多机使用需要联系技术支持工程师获取详细信息

模型推理和训练

在开启mxmaca graph的时候抓取torch profile会造成系统异常,需要配置如下环境变量规避该问题: MCPTI_ENABLED=ON 和 MACA_GRAPH_LAUNCH_MODE=1

Pytorch训练centernet_R18和Retinanet模型时,存在amp精度loss为NaN的情况

Pytorch训练多VF场景下偶发hang

Pytorch训练学习率策略,推荐使用 --auto-scale-lr 自适应学习率

GPU占用率低时受到其他硬件因素影响较大,在不同机器测试时易出现性能波动

Pytorch个别模型对CPU资源敏感易出现性能波动现象

Pytorch ssd模型多卡训练偶发loss为NaN

Pytorch ARM环境下执行某些模型时,性能有一定概率出现一定波动

Pytorch Deeplabv3模型FP32精度单卡训练时,需要设置新的环境变量以避免loss为NaN

对于LLM.PPL,不建议开启ACS,因为开启ACS可能会导致性能下降。如果必须开启ACS,需要关闭通信库PCIe复用功能,环境变量是 export MCCL_PCIE_BUFFER_MODE=0

通讯库性能优化使用了更多显存,特殊情况下,可能导致显存不足

MC3-13800 VeRL部分模型训练提示flash_attn_3 backward pass is not yet implemented,解决办法: 在容器内卸载pip包flash_attn_3

MC3-13801 Megatron-LM部分模型训练提示flash_attn_3 backward pass is not yet implemented,解决办法: 在容器内卸载pip包flash_attn_3

VPU

C500-21118 MCJPEG解码暂不支持444、422、gray、411、440格式jpeg文件

MC3-14080 C600U个别case编码和转码性能可能偏低

mx-smi

个别机型执行 warm reset 会引发异常

CXL及相关子命令暂不支持

虚拟化

虚拟机透传GPU或VF,只支持虚拟机启动前设置透传GPU或VF

/etc/mvgvm_config 文件默认权限为0,如需要修改此文件,需要将文件权限改为0644

不支持 mx-smi –vfflr 操作

划分 VF 时,有极小概率偶发出现不影响功能的 dmesg 报错(PROTOCOL_STATE_RESPONSE_TIMEOUT 2),该报错不影响划分VF,功能可以正常使用

GPU透传虚拟机,如遇虚拟机内GPU加载驱动不在线,且demsg 查找 “no space”有GPU BDF 相关报错,虚拟机xml可配<pcihole64 unit=’GiB’>64</pcihole64>

MXC600 系列 mx-smi –set-queue-priority 为 high 后无法恢复成 normal

MC3-12294 开启1VF后测试小模型Modelzoo1_classification_ox_resnet50和Modelzoo1_NLP_Transformer_ox_bert推理性能不达标,低于整卡的90%

[MXC600系列] MC3-14528 全部GPU卡和CX7网卡透传到虚拟机内测试deepep low lantency不达标

[MXC600系列] MC3-14801 开启sgpu和透传PF卡到虚拟机的场景下测试vllm单die模型Qwen3.5-27B-FP8,对比宿主机整卡性能不达标

mx-report

Debian10、Alinux3、KeyrachOS5.8系统使用mx-report时会提示 get kmd log failed ,实际不影响log收集

mxvs

sGPU开启后,mxvs ops在burst策略下不符合算力分配原则,fixed策略下设置1-2%的算力不符合算力分配原则

ETH

MXC600系列opmi的smmaca模块对MCCL perf有一些影响

IREE

MC3-13789部分示例运行会报错

TileLang

在线安装tilelang 0.1.9时需要指定版本安装,如 pip install tilelang==0.1.9 apache-tvm-ffi==0.1.3.dev11

通讯库

DeepEP internode 算法多机通信支持最大专家数为512

通过环境变量MCCL_IB_QPS_PER_CONNECTION设置不同QP数量时,MCCL多机通信每个连接使用32个QP存在局部性能异常

osu_alltoall双机case在中兴网卡运行时间较长

C588 OAM osu_alltoall 和 osu_gather 在部分设备上存在稳定性问题

C588 OAM 上不指定卡序运行 mccl perf 会偶现掉卡,可以通过指定特定卡序 MACA_VISIBLE_DEVICES=0,1,2,3,6,5,4,7,10,9,8,11,14,15,12,13 规避

alltoall 和 gather perf 多次测试结果可能会有 15% 以内的波动

ACL

[MXC600系列] MC3-14696测试triton性能,torch2.10版本有大部分case出现性能回退

[MXC600系列] MC3-14525 N300测试pytorch的功能,执行bash run_pytest.sh daily脚本,torch2.6和torch2.8场景出现OOM异常

[MXC600系列] MC3-14417 N300测试triton的功能,torch2.6和torch2.8场景出现OOM异常

[MXC500系列] MC3-14166 测试股blas_gemm性能,部分性能相对于3.8.0.x有回退

MC3-14162 torch2.4-py38场景下,triton功能测试报错,代码写法不兼容python38

MC3-14144 flash_attn性能测试报错,尚未支持benchmark脚本里的kv cache API的功能

MC3-14091 测试pytorch功能,执行bash run_ytest.sh daily,../test/inductor/test_compile_worker.py测试脚本报错,文件中的阈值设置不合理

MC3-14079 测试pytorch功能,执行bash run_ytest.sh checkin,./test_mpi_mpirun_cpu_allreduce.py测试脚本报错

MC3-13980 测试triton_mctriton36功能时,测试文件找不到,放错了路径

mx_tools

MC3-15228 mx-diagease 多于8卡环境,diagease监控模式显示小部分出界,缩放可显示全部内容