forked from Karylab-cklius/vllm
also use MambaHybridModelState for attention-free models
Signed-off-by: Nick Hill <nickhill123@gmail.com>
This commit is contained in:
@@ -27,7 +27,7 @@ def init_model_state(
|
||||
|
||||
return EncoderDecoderModelState(vllm_config, model, encoder_cache, device)
|
||||
|
||||
if vllm_config.model_config.is_hybrid:
|
||||
if vllm_config.model_config.is_hybrid or vllm_config.model_config.is_attention_free:
|
||||
from vllm.v1.worker.gpu.model_states.mamba_hybrid import MambaHybridModelState
|
||||
|
||||
return MambaHybridModelState(vllm_config, model, encoder_cache, device)
|
||||
|
||||
Reference in New Issue
Block a user