forked from Karylab-cklius/vllm
[Model][Dflash] Enable Dflash support for Qwen3NextForCausalLM targets (#45319)
Signed-off-by: Jonas I. Liechti <j-i-l@t4d.ch>
This commit is contained in:
@@ -1425,6 +1425,14 @@ _SPECULATIVE_DECODING_EXAMPLE_MODELS = {
|
||||
max_model_len=8192, # Reduce max len to ensure test runs in low-VRAM CI env
|
||||
max_num_seqs=32,
|
||||
),
|
||||
"DFlashQwen3NextDraftModel": _HfExamplesInfo(
|
||||
"Qwen/Qwen3-Coder-Next",
|
||||
speculative_model="z-lab/Qwen3-Coder-Next-DFlash",
|
||||
use_original_num_layers=True, # DFlash requires all layers
|
||||
max_model_len=8192, # Reduce for CI
|
||||
max_num_seqs=32,
|
||||
min_transformers_version="4.56.3", # Required for Qwen3Next
|
||||
),
|
||||
# [Eagle]
|
||||
"EagleCohereForCausalLM": _HfExamplesInfo(
|
||||
"/host/engines/cohere-moe",
|
||||
|
||||
@@ -68,6 +68,7 @@ from .interfaces import (
|
||||
HasInnerState,
|
||||
IsHybrid,
|
||||
MixtureOfExperts,
|
||||
SupportsEagle3,
|
||||
SupportsLoRA,
|
||||
SupportsPP,
|
||||
)
|
||||
@@ -758,6 +759,7 @@ class Qwen3NextForCausalLM(
|
||||
SupportsPP,
|
||||
QwenNextMixtureOfExperts,
|
||||
IsHybrid,
|
||||
SupportsEagle3,
|
||||
):
|
||||
packed_modules_mapping = {
|
||||
"qkv_proj": [
|
||||
|
||||
Reference in New Issue
Block a user