From 850295881041754184717804104fcaadd2b2129e Mon Sep 17 00:00:00 2001 From: liuzhenwei Date: Fri, 17 Jul 2026 18:54:34 +0800 Subject: [PATCH] [XPU] support HND layout (#47975) Signed-off-by: zhenwei-intel --- vllm/platforms/xpu.py | 8 -------- 1 file changed, 8 deletions(-) diff --git a/vllm/platforms/xpu.py b/vllm/platforms/xpu.py index cd57fb04bd2..80f99acc5ac 100644 --- a/vllm/platforms/xpu.py +++ b/vllm/platforms/xpu.py @@ -124,14 +124,6 @@ class XPUPlatform(Platform): attn_selector_config: "AttentionSelectorConfig", num_heads: int | None = None, ) -> str: - from vllm.v1.attention.backends.utils import set_kv_cache_layout - - set_kv_cache_layout("NHD") - logger.info_once( - "Setting VLLM_KV_CACHE_LAYOUT to 'NHD' for XPU; " - "only NHD layout is supported by XPU attention kernels." - ) - # TurboQuant KV cache: route directly to TQ backend kv_cache_dtype = attn_selector_config.kv_cache_dtype if kv_cache_dtype is not None and kv_cache_dtype.startswith("turboquant_"):