From 0d2f4e7c9c88d27fdfbb46dc4e2458d615102cb5 Mon Sep 17 00:00:00 2001 From: Thien Tran Date: Thu, 9 Jul 2026 05:58:39 +0800 Subject: [PATCH] Allow FlashInfer A2A backends for TRTLLM FP8 MoE Modular (#46661) Signed-off-by: Thien Tran --- vllm/model_executor/layers/fused_moe/experts/trtllm_fp8_moe.py | 2 ++ 1 file changed, 2 insertions(+) diff --git a/vllm/model_executor/layers/fused_moe/experts/trtllm_fp8_moe.py b/vllm/model_executor/layers/fused_moe/experts/trtllm_fp8_moe.py index a4cce79741e..2fb72059183 100644 --- a/vllm/model_executor/layers/fused_moe/experts/trtllm_fp8_moe.py +++ b/vllm/model_executor/layers/fused_moe/experts/trtllm_fp8_moe.py @@ -136,6 +136,8 @@ class TrtLlmFp8ExpertsModular(TrtLlmFp8ExpertsBase, mk.FusedMoEExpertsModular): not moe_parallel_config.use_all2all_kernels or moe_parallel_config.use_ag_rs_all2all_kernels or moe_parallel_config.use_deepep_v2_kernels + or moe_parallel_config.use_fi_nvl_one_sided_kernels + or moe_parallel_config.use_fi_nvl_two_sided_kernels ) and not moe_parallel_config.enable_eplb @staticmethod