diff --git a/vllm/v1/worker/gpu/model_states/__init__.py b/vllm/v1/worker/gpu/model_states/__init__.py index dc52dc4ee57..de69ed15eae 100644 --- a/vllm/v1/worker/gpu/model_states/__init__.py +++ b/vllm/v1/worker/gpu/model_states/__init__.py @@ -27,7 +27,7 @@ def init_model_state( return EncoderDecoderModelState(vllm_config, model, encoder_cache, device) - if vllm_config.model_config.is_hybrid: + if vllm_config.model_config.is_hybrid or vllm_config.model_config.is_attention_free: from vllm.v1.worker.gpu.model_states.mamba_hybrid import MambaHybridModelState return MambaHybridModelState(vllm_config, model, encoder_cache, device)