4. 已知问题和使用限制
模块 |
问题和限制说明 |
|---|---|
MXMACA软件栈 |
多程序长时间并行执行,有概率会出现程序执行无响应问题 |
Flash Attention C++接口有优化,使用Flash Attention C++接口的应用需要继承新的接口,对2.23.0.x及以前版本不兼容 |
|
某些主板不支持atomic访问的部分功能 |
|
mx C/C++程序不支持在Ubuntu18.04系统编译运行 |
|
C550 OAM上部分算子需要设置 |
|
flash_attn特殊场景下有hang的现象 |
|
MC3-14011 UMD Perf Metrics kernel launch某些case会有一定性能下降 |
|
mcFftXt接口暂未支持,请使用非Xt的接口替代 |
|
|
|
在一些特殊场景下可以设置 |
|
Geqrf某些case会有一定性能下降 |
|
|
|
C588 平台进行AI测试需配置sudo命令 |
|
使用SGLang出现问题时可尝试添加 |
|
C550平台 HSTU_attn 计算正确,但是部分随机数输入下精度略降 |
|
在线安装Metax Driver 3.7.1.1 时,需要预先在线安装metax-linux=3.8.1 |
|
在线安装Metax Driver 3.8.1.6 时,需要指定版本进行安装,如apt install metax-linux=3.9.6 mxfw=3.8.1 mxsmt=3.8.1.6 metax-driver=3.8.1.6 |
|
内核版本6.6.0及以上时多机使用需要联系技术支持工程师获取详细信息 |
|
模型推理和训练 |
在开启mxmaca graph的时候抓取torch profile会造成系统异常,需要配置如下环境变量规避该问题: |
Pytorch训练centernet_R18和Retinanet模型时,存在amp精度loss为NaN的情况 |
|
Pytorch训练多VF场景下偶发hang |
|
Pytorch训练学习率策略,推荐使用 |
|
GPU占用率低时受到其他硬件因素影响较大,在不同机器测试时易出现性能波动 |
|
Pytorch个别模型对CPU资源敏感易出现性能波动现象 |
|
Pytorch ssd模型多卡训练偶发loss为NaN |
|
Pytorch ARM环境下执行某些模型时,性能有一定概率出现一定波动 |
|
Pytorch Deeplabv3模型FP32精度单卡训练时,需要设置新的环境变量以避免loss为NaN |
|
对于LLM.PPL,不建议开启ACS,因为开启ACS可能会导致性能下降。如果必须开启ACS,需要关闭通信库PCIe复用功能,环境变量是 |
|
通讯库性能优化使用了更多显存,特殊情况下,可能导致显存不足 |
|
MC3-13800 VeRL部分模型训练提示flash_attn_3 backward pass is not yet implemented,解决办法: 在容器内卸载pip包flash_attn_3 |
|
MC3-13801 Megatron-LM部分模型训练提示flash_attn_3 backward pass is not yet implemented,解决办法: 在容器内卸载pip包flash_attn_3 |
|
VPU |
C500-21118 MCJPEG解码暂不支持444、422、gray、411、440格式jpeg文件 |
MC3-14080 C600U个别case编码和转码性能可能偏低 |
|
mx-smi |
个别机型执行 warm reset 会引发异常 |
CXL及相关子命令暂不支持 |
|
虚拟化 |
虚拟机透传GPU或VF,只支持虚拟机启动前设置透传GPU或VF |
/etc/mvgvm_config 文件默认权限为0,如需要修改此文件,需要将文件权限改为0644 |
|
不支持 mx-smi –vfflr 操作 |
|
划分 VF 时,有极小概率偶发出现不影响功能的 dmesg 报错(PROTOCOL_STATE_RESPONSE_TIMEOUT 2),该报错不影响划分VF,功能可以正常使用 |
|
GPU透传虚拟机,如遇虚拟机内GPU加载驱动不在线,且demsg 查找 “no space”有GPU BDF 相关报错,虚拟机xml可配<pcihole64 unit=’GiB’>64</pcihole64> |
|
MXC600 系列 mx-smi –set-queue-priority 为 high 后无法恢复成 normal |
|
MC3-12294 开启1VF后测试小模型Modelzoo1_classification_ox_resnet50和Modelzoo1_NLP_Transformer_ox_bert推理性能不达标,低于整卡的90% |
|
[MXC600系列] MC3-14528 全部GPU卡和CX7网卡透传到虚拟机内测试deepep low lantency不达标 |
|
[MXC600系列] MC3-14801 开启sgpu和透传PF卡到虚拟机的场景下测试vllm单die模型Qwen3.5-27B-FP8,对比宿主机整卡性能不达标 |
|
mx-report |
Debian10、Alinux3、KeyrachOS5.8系统使用mx-report时会提示 |
mxvs |
sGPU开启后,mxvs ops在burst策略下不符合算力分配原则,fixed策略下设置1-2%的算力不符合算力分配原则 |
ETH |
MXC600系列opmi的smmaca模块对MCCL perf有一些影响 |
IREE |
MC3-13789部分示例运行会报错 |
TileLang |
在线安装tilelang 0.1.9时需要指定版本安装,如 pip install tilelang==0.1.9 apache-tvm-ffi==0.1.3.dev11 |
通讯库 |
DeepEP internode 算法多机通信支持最大专家数为512 |
通过环境变量MCCL_IB_QPS_PER_CONNECTION设置不同QP数量时,MCCL多机通信每个连接使用32个QP存在局部性能异常 |
|
osu_alltoall双机case在中兴网卡运行时间较长 |
|
C588 OAM osu_alltoall 和 osu_gather 在部分设备上存在稳定性问题 |
|
C588 OAM 上不指定卡序运行 mccl perf 会偶现掉卡,可以通过指定特定卡序 MACA_VISIBLE_DEVICES=0,1,2,3,6,5,4,7,10,9,8,11,14,15,12,13 规避 |
|
alltoall 和 gather perf 多次测试结果可能会有 15% 以内的波动 |
|
ACL |
[MXC600系列] MC3-14696测试triton性能,torch2.10版本有大部分case出现性能回退 |
[MXC600系列] MC3-14525 N300测试pytorch的功能,执行bash run_pytest.sh daily脚本,torch2.6和torch2.8场景出现OOM异常 |
|
[MXC600系列] MC3-14417 N300测试triton的功能,torch2.6和torch2.8场景出现OOM异常 |
|
[MXC500系列] MC3-14166 测试股blas_gemm性能,部分性能相对于3.8.0.x有回退 |
|
MC3-14162 torch2.4-py38场景下,triton功能测试报错,代码写法不兼容python38 |
|
MC3-14144 flash_attn性能测试报错,尚未支持benchmark脚本里的kv cache API的功能 |
|
MC3-14091 测试pytorch功能,执行bash run_ytest.sh daily,../test/inductor/test_compile_worker.py测试脚本报错,文件中的阈值设置不合理 |
|
MC3-14079 测试pytorch功能,执行bash run_ytest.sh checkin,./test_mpi_mpirun_cpu_allreduce.py测试脚本报错 |
|
MC3-13980 测试triton_mctriton36功能时,测试文件找不到,放错了路径 |
|
mx_tools |
MC3-15228 mx-diagease 多于8卡环境,diagease监控模式显示小部分出界,缩放可显示全部内容 |