[Model][Dflash] Enable Dflash support for Qwen3NextForCausalLM targets (#45319)

Signed-off-by: Jonas I. Liechti <j-i-l@t4d.ch>
This commit is contained in:
Jonas I. Liechti
2026-06-12 10:30:09 -07:00
committed by GitHub
parent 272c16953e
commit d6fd7ce8da
2 changed files with 10 additions and 0 deletions
+8
View File
@@ -1425,6 +1425,14 @@ _SPECULATIVE_DECODING_EXAMPLE_MODELS = {
max_model_len=8192, # Reduce max len to ensure test runs in low-VRAM CI env
max_num_seqs=32,
),
"DFlashQwen3NextDraftModel": _HfExamplesInfo(
"Qwen/Qwen3-Coder-Next",
speculative_model="z-lab/Qwen3-Coder-Next-DFlash",
use_original_num_layers=True, # DFlash requires all layers
max_model_len=8192, # Reduce for CI
max_num_seqs=32,
min_transformers_version="4.56.3", # Required for Qwen3Next
),
# [Eagle]
"EagleCohereForCausalLM": _HfExamplesInfo(
"/host/engines/cohere-moe",
+2
View File
@@ -68,6 +68,7 @@ from .interfaces import (
HasInnerState,
IsHybrid,
MixtureOfExperts,
SupportsEagle3,
SupportsLoRA,
SupportsPP,
)
@@ -758,6 +759,7 @@ class Qwen3NextForCausalLM(
SupportsPP,
QwenNextMixtureOfExperts,
IsHybrid,
SupportsEagle3,
):
packed_modules_mapping = {
"qkv_proj": [