diff --git a/vllm/model_executor/kernels/linear/scaled_mm/xpu.py b/vllm/model_executor/kernels/linear/scaled_mm/xpu.py index 7e44fb943fd..0e4ead39219 100644 --- a/vllm/model_executor/kernels/linear/scaled_mm/xpu.py +++ b/vllm/model_executor/kernels/linear/scaled_mm/xpu.py @@ -59,6 +59,9 @@ class XPUFP8ScaledMMLinearKernel(FP8ScaledMMLinearKernel): replace_parameter(layer, "weight", weight.data.t()) # else: already in [in, out] layout — no-op + weight_scale = layer.weight_scale.t().contiguous() + replace_parameter(layer, "weight_scale", weight_scale.data) + def apply_weights( self, layer: torch.nn.Module,