From 28ee7f57df0bcfed68042f06b86df1bb454b9ea4 Mon Sep 17 00:00:00 2001 From: Yongye Zhu Date: Wed, 17 Jun 2026 04:57:34 +0000 Subject: [PATCH] [Model] M3 MSA indexer: align decode path with rebased index API The MSA builder/impl were written against the pre-#45743 indexer decode API. After rebasing onto main, MiniMaxM3IndexerDecodeMetadata gained a required max_decode_query_len field and minimax_m3_index_decode dropped its sm_scale parameter, so the MSA path crashed at engine init during cudagraph profiling (missing max_decode_query_len). - Pass max_decode_query_len when building decode metadata. - Drop the stale sm_scale arg and pass max_decode_query_len in the decode kernel call, matching the Triton builder/impl. Co-Authored-By: Claude Opus 4.8 (1M context) Signed-off-by: Yongye Zhu (cherry picked from commit 0b70ba38a17f03a369c572addf5ea3ab39a32758) --- vllm/models/minimax_m3/nvidia/indexer_msa.py | 3 ++- 1 file changed, 2 insertions(+), 1 deletion(-) diff --git a/vllm/models/minimax_m3/nvidia/indexer_msa.py b/vllm/models/minimax_m3/nvidia/indexer_msa.py index 9eed33f69e9..432c8bb790d 100644 --- a/vllm/models/minimax_m3/nvidia/indexer_msa.py +++ b/vllm/models/minimax_m3/nvidia/indexer_msa.py @@ -121,6 +121,7 @@ class MiniMaxM3IndexerMSAMetadataBuilder(MiniMaxM3IndexerMetadataBuilder): block_table=block_table[:num_decodes], max_seq_len=common_attn_metadata.max_seq_len, decode_query_len=decode_query_len, + max_decode_query_len=self.max_decode_query_len, ) prefill: MiniMaxM3IndexerMSAPrefillMetadata | None = None @@ -211,8 +212,8 @@ class MiniMaxM3IndexerMSAImpl(MiniMaxM3IndexerImpl): self.init_blocks, self.local_blocks, self.num_kv_heads, - self.scale, d.decode_query_len, + d.max_decode_query_len, out=buf, )