From c8d2f3cb1485fcca725653fb92a445b6cc10ade7 Mon Sep 17 00:00:00 2001 From: Joe Rowell Date: Tue, 30 Jun 2026 21:50:46 +0200 Subject: [PATCH] [Bugfix] compressed-tensors: allow int8 grouped WNA16 MoE on Marlin (#47154) Signed-off-by: Joe Rowell Co-authored-by: Robert Shaw <114415538+robertgshaw2-redhat@users.noreply.github.com> --- .../compressed_tensors_moe_wna16_marlin.py | 1 - 1 file changed, 1 deletion(-) diff --git a/vllm/model_executor/layers/quantization/compressed_tensors/compressed_tensors_moe/compressed_tensors_moe_wna16_marlin.py b/vllm/model_executor/layers/quantization/compressed_tensors/compressed_tensors_moe/compressed_tensors_moe_wna16_marlin.py index 0401a5b6e73..46fa36180d9 100644 --- a/vllm/model_executor/layers/quantization/compressed_tensors/compressed_tensors_moe/compressed_tensors_moe_wna16_marlin.py +++ b/vllm/model_executor/layers/quantization/compressed_tensors/compressed_tensors_moe/compressed_tensors_moe_wna16_marlin.py @@ -80,7 +80,6 @@ class CompressedTensorsWNA16MarlinMoEMethod(CompressedTensorsMoEMethod): else: scale = kInt4StaticGroupScale elif self.num_bits == 8: - assert self.group_size == -1 scale = kInt8StaticGroupScale else: raise ValueError(