also use MambaHybridModelState for attention-free models

Signed-off-by: Nick Hill <nickhill123@gmail.com>
This commit is contained in:
Nick Hill
2026-07-02 18:17:55 +01:00
parent 064cd5aefe
commit 9dabdfb88c
+1 -1
View File
@@ -27,7 +27,7 @@ def init_model_state(
return EncoderDecoderModelState(vllm_config, model, encoder_cache, device)
if vllm_config.model_config.is_hybrid:
if vllm_config.model_config.is_hybrid or vllm_config.model_config.is_attention_free:
from vllm.v1.worker.gpu.model_states.mamba_hybrid import MambaHybridModelState
return MambaHybridModelState(vllm_config, model, encoder_cache, device)