From 1d41009e81eb6493f2c19e9d2a0d472564764e62 Mon Sep 17 00:00:00 2001 From: Nick Hill Date: Fri, 26 Jun 2026 16:34:21 -0700 Subject: [PATCH] [ModelRunner V2] Fix cross-attention block table sizing (#46753) Signed-off-by: Nick Hill --- vllm/v1/worker/gpu/model_runner.py | 5 +++-- 1 file changed, 3 insertions(+), 2 deletions(-) diff --git a/vllm/v1/worker/gpu/model_runner.py b/vllm/v1/worker/gpu/model_runner.py index de8cd476cd4..cb46ffc3dc0 100644 --- a/vllm/v1/worker/gpu/model_runner.py +++ b/vllm/v1/worker/gpu/model_runner.py @@ -409,10 +409,11 @@ class GPUModelRunner(LoRAModelRunnerMixin): block_table_max_model_len = self.max_model_len if self.is_encoder_decoder: - # Cross-attention block tables need to index encoder tokens - # (e.g., Whisper ~1500), which can exceed decoder max_model_len. + # Cross-attention block tables need to index encoder tokens, which + # can exceed the decoder's max_model_len. block_table_max_model_len = max( block_table_max_model_len, + self.scheduler_config.max_num_encoder_input_tokens, getattr(self.model_config.hf_config, "max_source_positions", 0), )