使用的是cr.metax-tech.com/public-ai-release/maca/sglang:0.5.12-maca.ai3.8.2.7-torch2.10-py312-ubuntu22.04-amd64 镜像
导致服务崩溃的直接原因是 SGLang 的模型加载器无法识别 Draft 模型的架构名称 DFlash2DraftModel
官方镜像啥时候能支持?
错误日志:
Capturing batches (bs=1 avail_mem=11.82 GB): 100%|█| 3/3 [00:20<00:00, 6.76s/i
[2026-08-30 18:23:41] Capture cuda graph end. Time elapsed: 20.78 s. mem usage=0.26 GB. avail mem=11.80 GB.
[2026-08-30 18:23:41] Disable piecewise CUDA graph because --disable-piecewise-cuda-graph is set
[2026-08-30 18:23:42] Init torch distributed begin.
[2026-08-30 18:23:42] Init torch distributed ends. elapsed=0.00 s, mem usage=0.00 GB
[2026-08-30 18:23:42] Load weight begin. avail mem=11.80 GB
[2026-08-30 18:23:42] Scheduler hit an exception: Traceback (most recent call last):
File "/opt/conda/lib/python3.12/site-packages/sglang/srt/managers/scheduler.py", line 4050, in run_scheduler_process
scheduler = Scheduler(
^^^^^^^^^^
File "/opt/conda/lib/python3.12/site-packages/sglang/srt/managers/scheduler.py", line 444, in init
self.init_model_worker()
File "/opt/conda/lib/python3.12/site-packages/sglang/srt/managers/scheduler.py", line 740, in init_model_worker
self.maybe_init_draft_worker()
File "/opt/conda/lib/python3.12/site-packages/sglang/srt/managers/scheduler.py", line 724, in maybe_init_draft_worker
self.draft_worker = DraftWorkerClass(**draft_worker_kwargs)
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/opt/conda/lib/python3.12/site-packages/sglang/srt/speculative/dflash_worker.py", line 143, in init
self.draft_worker = TpModelWorker(
^^^^^^^^^^^^^^
File "/opt/conda/lib/python3.12/site-packages/sglang/srt/managers/tp_worker.py", line 262, in init
self._init_model_runner()
File "/opt/conda/lib/python3.12/site-packages/sglang/srt/managers/tp_worker.py", line 347, in _init_model_runner
self._model_runner = ModelRunner(
^^^^^^^^^^^^
File "/opt/conda/lib/python3.12/site-packages/sglang/srt/model_executor/model_runner.py", line 539, in init
self.initialize(pre_model_load_memory)
File "/opt/conda/lib/python3.12/site-packages/sglang/srt/model_executor/model_runner.py", line 659, in initialize
self.load_model()
File "/opt/conda/lib/python3.12/site-packages/sglang/srt/model_executor/model_runner.py", line 1491, in load_model
self.model = self.loader.load_model(
^^^^^^^^^^^^^^^^^^^^^^^
File "/opt/conda/lib/python3.12/site-packages/sglang/srt/model_loader/loader.py", line 715, in load_model
quant_config = _get_quantization_config(model_config, self.load_config)
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/opt/conda/lib/python3.12/site-packages/sglang/srt/model_loader/loader.py", line 198, in _get_quantization_config
model_class, _ = get_model_architecture(model_config)
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/opt/conda/lib/python3.12/site-packages/sglang/srt/model_loader/utils.py", line 222, in get_model_architecture
architectures = resolve_transformers_arch(model_config, architectures)
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/opt/conda/lib/python3.12/site-packages/sglang/srt/model_loader/utils.py", line 152, in resolve_transformers_arch
raise ValueError(
ValueError: Cannot find model module. 'DFlash2DraftModel' is not a registered model in the Transformers library (only relevant if the model is meant to be in Transformers) and 'AutoModel' is not present in the model config's 'auto_map' (relevant if the model is custom).
[2026-08-30 18:23:42] Received sigquit from a child process. It usually means the child failed.
start_sglang_server.sh: line 38: 35 Killed /opt/conda/bin/python3 -m sglang.launch_server --model-path /models/Qwen3.8-27B-W8A8-INT8 --served-model-name "Qwen3.8-27B" --host 0.0.0.0 --port 23600 --tp 1 --trust-remote-code --attention-backend flashinfer --mem-fraction-static 0.80 --context-length 131072 --chunked-prefill-size 16384 --max-running-requests 3 --schedule-policy fcfs --schedule-conservativeness 1.0 --mamba-scheduler-strategy extra_buffer --speculative-algorithm DFLASH --speculative-draft-model-path /models/Qwen3.8-27B-DFlash2 --speculative-num-draft-tokens 8 --tool-call-parser qwen3_coder --reasoning-parser qwen3