• Members 11 posts
    2026年8月30日 18:24

    使用的是cr.metax-tech.com/public-ai-release/maca/sglang:0.5.12-maca.ai3.8.2.7-torch2.10-py312-ubuntu22.04-amd64 镜像

    导致服务崩溃的直接原因是 SGLang 的模型加载器无法识别 Draft 模型的架构名称 DFlash2DraftModel
    官方镜像啥时候能支持?
    错误日志:
    Capturing batches (bs=1 avail_mem=11.82 GB): 100%|█| 3/3 [00:20<00:00, 6.76s/i
    [2026-08-30 18:23:41] Capture cuda graph end. Time elapsed: 20.78 s. mem usage=0.26 GB. avail mem=11.80 GB.
    [2026-08-30 18:23:41] Disable piecewise CUDA graph because --disable-piecewise-cuda-graph is set
    [2026-08-30 18:23:42] Init torch distributed begin.
    [2026-08-30 18:23:42] Init torch distributed ends. elapsed=0.00 s, mem usage=0.00 GB
    [2026-08-30 18:23:42] Load weight begin. avail mem=11.80 GB
    [2026-08-30 18:23:42] Scheduler hit an exception: Traceback (most recent call last):
    File "/opt/conda/lib/python3.12/site-packages/sglang/srt/managers/scheduler.py", line 4050, in run_scheduler_process
    scheduler = Scheduler(
    ^^^^^^^^^^
    File "/opt/conda/lib/python3.12/site-packages/sglang/srt/managers/scheduler.py", line 444, in init
    self.init_model_worker()
    File "/opt/conda/lib/python3.12/site-packages/sglang/srt/managers/scheduler.py", line 740, in init_model_worker
    self.maybe_init_draft_worker()
    File "/opt/conda/lib/python3.12/site-packages/sglang/srt/managers/scheduler.py", line 724, in maybe_init_draft_worker
    self.draft_worker = DraftWorkerClass(**draft_worker_kwargs)
    ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
    File "/opt/conda/lib/python3.12/site-packages/sglang/srt/speculative/dflash_worker.py", line 143, in init
    self.draft_worker = TpModelWorker(
    ^^^^^^^^^^^^^^
    File "/opt/conda/lib/python3.12/site-packages/sglang/srt/managers/tp_worker.py", line 262, in init
    self._init_model_runner()
    File "/opt/conda/lib/python3.12/site-packages/sglang/srt/managers/tp_worker.py", line 347, in _init_model_runner
    self._model_runner = ModelRunner(
    ^^^^^^^^^^^^
    File "/opt/conda/lib/python3.12/site-packages/sglang/srt/model_executor/model_runner.py", line 539, in init
    self.initialize(pre_model_load_memory)
    File "/opt/conda/lib/python3.12/site-packages/sglang/srt/model_executor/model_runner.py", line 659, in initialize
    self.load_model()
    File "/opt/conda/lib/python3.12/site-packages/sglang/srt/model_executor/model_runner.py", line 1491, in load_model
    self.model = self.loader.load_model(
    ^^^^^^^^^^^^^^^^^^^^^^^
    File "/opt/conda/lib/python3.12/site-packages/sglang/srt/model_loader/loader.py", line 715, in load_model
    quant_config = _get_quantization_config(model_config, self.load_config)
    ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
    File "/opt/conda/lib/python3.12/site-packages/sglang/srt/model_loader/loader.py", line 198, in _get_quantization_config
    model_class, _ = get_model_architecture(model_config)
    ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
    File "/opt/conda/lib/python3.12/site-packages/sglang/srt/model_loader/utils.py", line 222, in get_model_architecture
    architectures = resolve_transformers_arch(model_config, architectures)
    ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
    File "/opt/conda/lib/python3.12/site-packages/sglang/srt/model_loader/utils.py", line 152, in resolve_transformers_arch
    raise ValueError(
    ValueError: Cannot find model module. 'DFlash2DraftModel' is not a registered model in the Transformers library (only relevant if the model is meant to be in Transformers) and 'AutoModel' is not present in the model config's 'auto_map' (relevant if the model is custom).

    [2026-08-30 18:23:42] Received sigquit from a child process. It usually means the child failed.
    start_sglang_server.sh: line 38: 35 Killed /opt/conda/bin/python3 -m sglang.launch_server --model-path /models/Qwen3.8-27B-W8A8-INT8 --served-model-name "Qwen3.8-27B" --host 0.0.0.0 --port 23600 --tp 1 --trust-remote-code --attention-backend flashinfer --mem-fraction-static 0.80 --context-length 131072 --chunked-prefill-size 16384 --max-running-requests 3 --schedule-policy fcfs --schedule-conservativeness 1.0 --mamba-scheduler-strategy extra_buffer --speculative-algorithm DFLASH --speculative-draft-model-path /models/Qwen3.8-27B-DFlash2 --speculative-num-draft-tokens 8 --tool-call-parser qwen3_coder --reasoning-parser qwen3

  • arrow_forward

    Thread has been moved from 公共.

  • Members 949 posts
    2026年8月31日 10:22

    尊敬的开发者您好,此镜像不支持dflash2

  • Members 949 posts
    2026年9月1日 15:12

    尊敬的开发者您好,等待后续镜像更新支持

  • arrow_forward

    Thread has been moved from 解决中.