4. 已知问题和使用限制

模块

问题和限制说明

MXMACA软件栈

多程序长时间并行执行,有概率会出现程序执行无响应问题

Flash Attention C++接口有优化,使用Flash Attention C++接口的应用需要继承新的接口,对2.23.0.x及以前版本不兼容

某些主板不支持atomic访问的部分功能

mx C/C++程序不支持在Ubuntu18.04系统编译运行

C550 OAM上部分算子需要设置 MCCL_PCIE_BUFFER_MODE=1 规避性能回退问题

flash_attn特殊场景下有hang的现象

C588平台执行 simpleIPC case执行输出会有变化

mcFftXt接口暂未支持,请使用非Xt的接口替代

TORCH_ALLOW_TF32_CUBLAS_OVERRIDE 变量在host和容器里默认值不同,个别算子在不同环境测试会出现精度/性能差异

在一些特殊场景下可以设置 MACA_SMALL_PAGESIZE_ENABLE=1 提升性能

Geqrf某些case会有一定性能下降

Series.str.like 函数在处理某些特殊字符串(如%_等)时会失败

C588 平台进行AI测试需配置sudo命令 sudo cpupower idle-set -D 0 用来提升性能

使用SGLang出现问题时可尝试添加 MCCL_ENABLE_FC=0

C550平台 HSTU_attn 计算正确,但是部分随机数输入下精度略降

在线安装Metax Driver 3.7.1.1 时,需要预先在线安装metax-linux=3.8.1

在线安装Metax Driver 3.8.1.6 时,需要指定版本进行安装,如apt install metax-linux=3.9.6 mxfw=3.8.1 mxsmt=3.8.1.6 metax-driver=3.8.1.6

内核版本6.6.0及以上时多机使用需要联系技术支持工程师获取详细信息

模型推理和训练

在开启mxmaca graph的时候抓取torch profile会造成系统异常,需要配置如下环境变量规避该问题: MCPTI_ENABLED=ONMACA_GRAPH_LAUNCH_MODE=1

Pytorch训练centernet_R18和Retinanet模型时,存在amp精度loss为NaN的情况

Pytorch训练多VF场景下偶发hang

Pytorch训练学习率策略,推荐使用 --auto-scale-lr 自适应学习率

GPU占用率低时受到其他硬件因素影响较大,在不同机器测试时易出现性能波动

Pytorch个别模型对CPU资源敏感易出现性能波动现象

Pytorch ssd模型多卡训练偶发loss为NaN

Pytorch ARM环境下执行某些模型时,性能有一定概率出现一定波动

Pytorch Deeplabv3模型FP32精度单卡训练时,需要设置新的环境变量以避免loss为NaN

对于LLM.PPL,不建议开启ACS,因为开启ACS可能会导致性能下降。如果必须开启ACS,需要关闭通信库PCIe复用功能,环境变量是 export MCCL_PCIE_BUFFER_MODE=0

通讯库性能优化使用了更多显存,特殊情况下,可能导致显存不足

VPU

MCJPEG解码暂不支持444、422、gray、411、440格式jpeg文件

开启虚拟化多于1VF情形下,编码相关功能不可用

mx-smi

个别机型执行 warm reset 会引发异常

CXL及相关子命令暂不支持

虚拟化

虚拟机透传GPU或VF,只支持虚拟机启动前设置透传GPU或VF

/etc/mvgvm_config 文件默认权限为0,如需要修改此文件,需要将文件权限改为0644

不支持 mx-smi –vfflr 操作

划分 VF 时,有极小概率偶发出现不影响功能的 dmesg 报错(PROTOCOL_STATE_RESPONSE_TIMEOUT 2),该报错不影响划分VF,功能可以正常使用

HygonC86-4G(OPN:7490) CPU测试ATS全部卡透传的P2P PCIe带宽时,虚拟机xml需配置 qemu commandline:-pci-testdev.id=testdec,membar=1099511627776

MXC600 系列 mx-smi –set-queue-priority 为 high 后无法恢复成 normal

mx-report

Debian10、Alinux3、KeyrachOS5.8系统使用mx-report时会提示 get kmd log failed,实际不影响log收集

mxvs

sGPU开启后,mxvs ops在burst策略下不符合算力分配原则,fixed策略下设置1-2%的算力不符合算力分配原则

ETH

MXC600系列opmi的smmaca模块对MCCL perf有一些影响

IREE

部分示例运行会报错

TileLang

部分示例运行会报错

在线安装tilelang 0.1.9时需要指定版本安装,如 pip install tilelang==0.1.9 apache-tvm-ffi==0.1.3.dev11

通讯库

DeepEP internode 算法多机通信支持最大专家数为512

通过环境变量MCCL_IB_QPS_PER_CONNECTION设置不同QP数量时,MCCL多机通信每个连接使用32个QP存在局部性能异常

osu_alltoall双机case在中兴网卡运行时间较长

C588 OAM osu_alltoall 和 osu_gather 在部分设备上存在稳定性问题

C588 OAM 上不指定卡序运行 mccl perf 会偶现掉卡,可以通过指定特定卡序 MACA_VISIBLE_DEVICES=0,1,2,3,6,5,4,7,10,9,8,11,14,15,12,13 规避

alltoall 和 gather perf 多次测试结果可能会有 15% 以内的波动