From e24a1df5708bd7bef41f6f7fc67100855442a769 Mon Sep 17 00:00:00 2001 From: Wentao Ye <44945378+yewentao256@users.noreply.github.com> Date: Wed, 4 Mar 2026 13:57:18 -0500 Subject: [PATCH] Update vllm/v1/worker/gpu/model_states/default.py Co-authored-by: Nick Hill Signed-off-by: Wentao Ye <44945378+yewentao256@users.noreply.github.com> --- vllm/v1/worker/gpu/model_states/default.py | 11 +++-------- 1 file changed, 3 insertions(+), 8 deletions(-) diff --git a/vllm/v1/worker/gpu/model_states/default.py b/vllm/v1/worker/gpu/model_states/default.py index 957bea17959..00d86d7db48 100644 --- a/vllm/v1/worker/gpu/model_states/default.py +++ b/vllm/v1/worker/gpu/model_states/default.py @@ -195,15 +195,10 @@ class DefaultModelState(ModelState): and num_reqs > 0 and bool((query_lens_np == self.uniform_decode_query_len).all()) ) + attn_num_reqs = input_batch.num_tokens_after_padding if is_uniform_full_decode: - attn_num_reqs = min( - cdiv( - input_batch.num_tokens_after_padding, self.uniform_decode_query_len - ), - self.max_num_reqs, - ) - else: - attn_num_reqs = min(input_batch.num_tokens_after_padding, self.max_num_reqs) + attn_num_reqs = cdiv(attn_num_reqs, self.uniform_decode_query_len) + attn_num_reqs = min(attn_num_reqs, self.max_num_reqs) attn_num_tokens = input_batch.num_tokens_after_padding attn_query_start_loc_cpu = torch.empty(attn_num_reqs + 1, dtype=torch.int32)