diff --git a/tests/models/registry.py b/tests/models/registry.py index 86641c9b155..ac3282e3680 100644 --- a/tests/models/registry.py +++ b/tests/models/registry.py @@ -1425,6 +1425,14 @@ _SPECULATIVE_DECODING_EXAMPLE_MODELS = { max_model_len=8192, # Reduce max len to ensure test runs in low-VRAM CI env max_num_seqs=32, ), + "DFlashQwen3NextDraftModel": _HfExamplesInfo( + "Qwen/Qwen3-Coder-Next", + speculative_model="z-lab/Qwen3-Coder-Next-DFlash", + use_original_num_layers=True, # DFlash requires all layers + max_model_len=8192, # Reduce for CI + max_num_seqs=32, + min_transformers_version="4.56.3", # Required for Qwen3Next + ), # [Eagle] "EagleCohereForCausalLM": _HfExamplesInfo( "/host/engines/cohere-moe", diff --git a/vllm/model_executor/models/qwen3_next.py b/vllm/model_executor/models/qwen3_next.py index 165a2d94cfc..2ab08290fb5 100644 --- a/vllm/model_executor/models/qwen3_next.py +++ b/vllm/model_executor/models/qwen3_next.py @@ -68,6 +68,7 @@ from .interfaces import ( HasInnerState, IsHybrid, MixtureOfExperts, + SupportsEagle3, SupportsLoRA, SupportsPP, ) @@ -758,6 +759,7 @@ class Qwen3NextForCausalLM( SupportsPP, QwenNextMixtureOfExperts, IsHybrid, + SupportsEagle3, ): packed_modules_mapping = { "qkv_proj": [