From 9dabdfb88c36c0243fec2d9ebf2d6d72ac7fe00a Mon Sep 17 00:00:00 2001 From: Nick Hill Date: Thu, 2 Jul 2026 18:17:55 +0100 Subject: [PATCH] also use MambaHybridModelState for attention-free models Signed-off-by: Nick Hill --- vllm/v1/worker/gpu/model_states/__init__.py | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/vllm/v1/worker/gpu/model_states/__init__.py b/vllm/v1/worker/gpu/model_states/__init__.py index dc52dc4ee57..de69ed15eae 100644 --- a/vllm/v1/worker/gpu/model_states/__init__.py +++ b/vllm/v1/worker/gpu/model_states/__init__.py @@ -27,7 +27,7 @@ def init_model_state( return EncoderDecoderModelState(vllm_config, model, encoder_cache, device) - if vllm_config.model_config.is_hybrid: + if vllm_config.model_config.is_hybrid or vllm_config.model_config.is_attention_free: from vllm.v1.worker.gpu.model_states.mamba_hybrid import MambaHybridModelState return MambaHybridModelState(vllm_config, model, encoder_cache, device)