MetaX-Tech Developer Forum 论坛首页
  • 沐曦开发者
search
Sign in

huanglu2518

  • Members
  • Joined 2026年4月24日
  • message 帖子
  • forum 主题
  • favorite 关注者
  • favorite_border Follows
  • person_outline 详细信息

huanglu2518 has posted 10 messages.

  • See post chevron_right
    huanglu2518
    Members
    新发布的vllm-metax:0.26.0镜像是否支持Deepseek-V4-Flash-W8A8? 已解决 2026年9月17日 17:40

    您好,使用vllm-metax:0.26.0镜像部署Deepseek-V4-Flash-W8A8,任务未完成时,会偶发性输出终止,出现终止end符,这个怎么解决?

  • See post chevron_right
    huanglu2518
    Members
    新发布的vllm-metax:0.26.0镜像是否支持Deepseek-V4-Flash-W8A8? 已解决 2026年9月16日 14:57

    新发布的vllm-metax:0.26.0镜像是否支持Deepseek-V4-Flash-W8A8的工具调用?之前的0.25.0版本不支持。

  • See post chevron_right
    huanglu2518
    Members
    modelzoo.llm.vllm:1.0.3-maca.ai3.8.2.105-torch2.10-py312-ubuntu22.04-amd64 已解决 2026年9月11日 12:00

    按照您给的命令升级完了,启动报错了信息类似下面的:由于内网不能拍照和下载下来,因此找了一个报错信息基本一样的
    ERROR 02-25 14:51:52 [multiproc_executor.py:772] WorkerProc failed to start.
    ERROR 02-25 14:51:52 [multiproc_executor.py:772] Traceback (most recent call last):
    ERROR 02-25 14:51:52 [multiproc_executor.py:772] File "/home/amax/miniconda/envs/llama_factory/lib/python3.11/site-packages/vllm/v1/executor/multiproc_executor.py", line 743, in worker_main
    ERROR 02-25 14:51:52 [multiproc_executor.py:772] worker = WorkerProc(args, *kwargs)
    ERROR 02-25 14:51:52 [multiproc_executor.py:772] ^^^^^^^^^^^^^^^^^^^^^^^^^^^
    ERROR 02-25 14:51:52 [multiproc_executor.py:772] File "/home/amax/miniconda/envs/llama_factory/lib/python3.11/site-packages/vllm/v1/executor/multiproc_executor.py", line 569, in init
    ERROR 02-25 14:51:52 [multiproc_executor.py:772] self.worker.init_device()
    ERROR 02-25 14:51:52 [multiproc_executor.py:772] File "/home/amax/miniconda/envs/llama_factory/lib/python3.11/site-packages/vllm/v1/worker/worker_base.py", line 326, in init_device
    ERROR 02-25 14:51:52 [multiproc_executor.py:772] self.worker.init_device() # type: ignore
    ERROR 02-25 14:51:52 [multiproc_executor.py:772] ^^^^^^^^^^^^^^^^^^^^^^^^^
    ERROR 02-25 14:51:52 [multiproc_executor.py:772] File "/home/amax/miniconda/envs/llama_factory/lib/python3.11/site-packages/vllm/v1/worker/gpu_worker.py", line 210, in init_device
    ERROR 02-25 14:51:52 [multiproc_executor.py:772] current_platform.set_device(self.device)
    ERROR 02-25 14:51:52 [multiproc_executor.py:772] File "/home/amax/miniconda/envs/llama_factory/lib/python3.11/site-packages/vllm/platforms/cuda.py", line 123, in set_device
    ERROR 02-25 14:51:52 [multiproc_executor.py:772] torch.cuda.set_device(device)
    ERROR 02-25 14:51:52 [multiproc_executor.py:772] File "/home/amax/miniconda/envs/llama_factory/lib/python3.11/site-packages/torch/cuda/init.py", line 567, in set_device
    ERROR 02-25 14:51:52 [multiproc_executor.py:772] torch._C._cuda_setDevice(device)
    ERROR 02-25 14:51:52 [multiproc_executor.py:772] torch.AcceleratorError: CUDA error: CUDA-capable device(s) is/are busy or unavailable
    ERROR 02-25 14:51:52 [multiproc_executor.py:772] Search for cudaErrorDevicesUnavailable' in https://docs.nvidia.com/cuda/cuda-runtime-api/group__CUDART__TYPES.html for more information. ERROR 02-25 14:51:52 [multiproc_executor.py:772] CUDA kernel errors might be asynchronously reported at some other API call, so the stacktrace below might be incorrect. ERROR 02-25 14:51:52 [multiproc_executor.py:772] For debugging consider passing CUDA_LAUNCH_BLOCKING=1 ERROR 02-25 14:51:52 [multiproc_executor.py:772] Compile withTORCH_USE_CUDA_DSA` to enable device-side assertions.
    ERROR 02-25 14:51:52 [multiproc_executor.py:772]
    INFO 02-25 14:51:52 [multiproc_executor.py:730] Parent process exited, terminating worker
    INFO 02-25 14:51:52 [multiproc_executor.py:730] Parent process exited, terminating worker
    INFO 02-25 14:51:53 [parallel_state.py:1212] world_size=2 rank=1 local_rank=1 distributed_init_method=tcp://127.0.0.1:38723 backend=nccl
    [W225 14:51:56.592294033 TCPStore.cpp:340] [c10d] TCP client failed to connect/validate to host 127.0.0.1:38723 - retrying (try=0, timeout=600000ms, delay=2716ms): Interrupted system call
    Exception raised from delay at /pytorch/torch/csrc/distributed/c10d/socket.cpp:115 (most recent call first):
    frame #0: c10::Error::Error(c10::SourceLocation, std::__cxx11::basic_string<char, std::char_traits<char>, std::allocator<char> >) + 0x80 (0x7f401375fb80 in /home/amax/miniconda/envs/llama_factory/lib/python3.11/site-packages/torch/lib/libc10.so)
    frame #1: <unknown function> + 0x5ffc5d1 (0x7f4070afd5d1 in /home/amax/miniconda/envs/llama_factory/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
    frame #2: <unknown function> + 0x14a15e8 (0x7f406bfa25e8 in /home/amax/miniconda/envs/llama_factory/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
    frame #3: <unknown function> + 0x607828b (0x7f4070b7928b in /home/amax/miniconda/envs/llama_factory/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
    frame #4: <unknown function> + 0x6078624 (0x7f4070b79624 in /home/amax/miniconda/envs/llama_factory/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
    frame #5: <unknown function> + 0x5ff4ea3 (0x7f4070af5ea3 in /home/amax/miniconda/envs/llama_factory/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
    frame #6: c10d::TCPStore::TCPStore(std::__cxx11::basic_string<char, std::char_traits<char>, std::allocator<char> >, c10d::TCPStoreOptions const&) + 0x41d (0x7f4070afc8cd in /home/amax/miniconda/envs/llama_factory/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
    frame #7: <unknown function> + 0xd71465 (0x7f40801c8465 in /home/amax/miniconda/envs/llama_factory/lib/python3.11/site-packages/torch/lib/libtorch_python.so)
    frame #8: <unknown function> + 0xdadda6 (0x7f4080204da6 in /home/amax/miniconda/envs/llama_factory/lib/python3.11/site-packages/torch/lib/libtorch_python.so)
    frame #9: <unknown function> + 0x3cc7ad (0x7f407f8237ad in /home/amax/miniconda/envs/llama_factory/lib/python3.11/site-packages/torch/lib/libtorch_python.so)
    frame #10: <unknown function> + 0x1fd496 (0x55ba06b99496 in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #11: _PyObject_MakeTpCall + 0x24b (0x55ba06b7584b in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #12: <unknown function> + 0x22d1de (0x55ba06bc91de in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #13: _PyObject_Call + 0x12b (0x55ba06bb3dab in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #14: <unknown function> + 0x2155df (0x55ba06bb15df in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #15: <unknown function> + 0x1d9b63 (0x55ba06b75b63 in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #16: <unknown function> + 0x4c9bb (0x7f40969ff9bb in /home/amax/miniconda/envs/llama_factory/lib/python3.11/site-packages/scipy/spatial/_distance_pybind.cpython-311-x86_64-linux-gnu.so)
    frame #17: _PyObject_MakeTpCall + 0x24b (0x55ba06b7584b in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #18: _PyEval_EvalFrameDefault + 0x665 (0x55ba06b83b75 in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #19: <unknown function> + 0x27b5c0 (0x55ba06c175c0 in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #20: <unknown function> + 0x204083 (0x55ba06ba0083 in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #21: PyObject_Vectorcall + 0x2c (0x55ba06b8facc in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #22: _PyEval_EvalFrameDefault + 0x665 (0x55ba06b83b75 in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #23: _PyFunction_Vectorcall + 0x165 (0x55ba06ba97e5 in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #24: PyObject_Call + 0x136 (0x55ba06bb3b46 in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #25: _PyEval_EvalFrameDefault + 0x43bb (0x55ba06b878cb in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #26: _PyFunction_Vectorcall + 0x165 (0x55ba06ba97e5 in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #27: PyObject_Call + 0x136 (0x55ba06bb3b46 in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #28: _PyEval_EvalFrameDefault + 0x43bb (0x55ba06b878cb in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #29: _PyFunction_Vectorcall + 0x165 (0x55ba06ba97e5 in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #30: <unknown function> + 0x2152b3 (0x55ba06bb12b3 in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #31: <unknown function> + 0x1d9b63 (0x55ba06b75b63 in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #32: PyObject_Call + 0xbe (0x55ba06bb3ace in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #33: _PyEval_EvalFrameDefault + 0x43bb (0x55ba06b878cb in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #34: _PyFunction_Vectorcall + 0x165 (0x55ba06ba97e5 in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #35: PyObject_Call + 0x136 (0x55ba06bb3b46 in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #36: _PyEval_EvalFrameDefault + 0x43bb (0x55ba06b878cb in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #37: <unknown function> + 0x2a4435 (0x55ba06c40435 in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #38: PyEval_EvalCode + 0x9d (0x55ba06c3fb7d in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #39: <unknown function> + 0x2c164a (0x55ba06c5d64a in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #40: <unknown function> + 0x2bd343 (0x55ba06c59343 in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #41: PyRun_StringFlags + 0x62 (0x55ba06c4ebb2 in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #42: PyRun_SimpleStringFlags + 0x3c (0x55ba06c4e96c in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #43: Py_RunMain + 0x30f (0x55ba06c6873f in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #44: Py_BytesMain + 0x37 (0x55ba06c2fa67 in /home/amax/miniconda/envs/llama_factory/bin/python)
    frame #45: __libc_start_main + 0xf3 (0x7f40f929d083 in /lib/x86_64-linux-gnu/libc.so.6)
    frame #46: <unknown function> + 0x2938d9 (0x55ba06c2f8d9 in /home/amax/miniconda/envs/llama_factory/bin/python)

    (EngineCore_DP0 pid=4097130) ERROR 02-25 14:52:00 [core.py:946] EngineCore failed to start.

  • See post chevron_right
    huanglu2518
    Members
    vllm-metax:0.19.0-maca.ai3.5.3.502-torch2.8-py310-ubuntu22.04镜像部署qwen3.5-35b-a3b-w8a8报错 已解决 2026年8月18日 21:38

    在沐曦C500单卡使用vllm-metax:0.19.0-maca.ai3.5.3.502-torch2.8-py310-ubuntu22.04-amd64镜像部署qwen3.5-35b-a3b-w8a8报错,显示错误信息为ValueError: Tokenizer class TokenizersBackend does not exist or is not currently imported.在modelscope上查看到阿里发布的qwen3.5-35b-a3b的"tokenizer_class": "Qwen2Tokenizer",沐曦量化过后的显示为 "tokenizer_class": "TokenizersBackend",应该选择哪个版本的镜像进行部署?

  • See post chevron_right
    huanglu2518
    Members
    C500麒麟V10国防版驱动升级问题 已解决 2026年8月10日 11:27

    应该下载哪个版本的驱动?KylinV10SP2还是KylinV11?

  • See post chevron_right
    huanglu2518
    Members
    C500麒麟V10国防版驱动升级问题 已解决 2026年8月10日 11:27

    应该下载哪个版本的驱动?KylinV10SP2还是KylinV11?

  • See post chevron_right
    huanglu2518
    Members
    C500麒麟V10国防版驱动升级问题 已解决 2026年8月7日 12:01

    目前操作系统使用的是麒麟v10国防版,CPU使用的是海光7490,驱动版本为3.5.x.x,目前为了适配最新的DSV4模型,怎么升级驱动来适配最新的VLLM以及SGLang推理框架?

  • See post chevron_right
    huanglu2518
    Members
    GPUSatck v2.1.2手动分配C500显卡失败 已解决 2026年4月24日 18:19

    这个个人主题在哪里开通,能否私信您。

  • See post chevron_right
    huanglu2518
    Members
    GPUSatck v2.1.2手动分配C500显卡失败 已解决 2026年4月24日 18:12

    这个跟咱们的技术支持沟通后,让发在这里找下问题解决办法。这个是属于C500和海光7490的适配问题,不属于GPUStack的问题。

  • See post chevron_right
    huanglu2518
    Members
    GPUSatck v2.1.2手动分配C500显卡失败 已解决 2026年4月24日 18:04

    部署环境为:沐曦C500 8卡服务器*2、CPU-海光7490
    运行环境:GPUStack V2.1.2 docker
    模型为:Qwen3.5-235B-a8w8
    模型运行镜像为:gpustack/runner:maca3.5-vllm0.14.0
    在使用gpustack控制台手动设置运行节点的显卡为第2张卡时,报错了。
    信息为如图所示,怀疑是在获取GPU Index时报错了。

  • 沐曦开发者论坛
powered by misago