diff --git a/vllm/model_executor/models/AXK1.py b/vllm/model_executor/models/AXK1.py index 701ec67c855..d526f57d3d9 100644 --- a/vllm/model_executor/models/AXK1.py +++ b/vllm/model_executor/models/AXK1.py @@ -649,7 +649,7 @@ class AXK1DecoderLayer(nn.Module): ) -> tuple[torch.Tensor, torch.Tensor]: # Self Attention if residual is None: - residual = hidden_states.clone() + residual = hidden_states hidden_states = self.input_layernorm(hidden_states) else: hidden_states, residual = self.input_layernorm(hidden_states, residual) diff --git a/vllm/model_executor/models/deepseek_v2.py b/vllm/model_executor/models/deepseek_v2.py index 2f6a472fe35..8d20e0b5c68 100644 --- a/vllm/model_executor/models/deepseek_v2.py +++ b/vllm/model_executor/models/deepseek_v2.py @@ -1186,7 +1186,7 @@ class DeepseekV2DecoderLayer(nn.Module): ) -> torch.Tensor: # Self Attention if residual is None: - residual = hidden_states.clone() + residual = hidden_states hidden_states = self.input_layernorm(hidden_states) else: hidden_states, residual = self.input_layernorm(hidden_states, residual) diff --git a/vllm/model_executor/models/glm4_moe_lite.py b/vllm/model_executor/models/glm4_moe_lite.py index 77aaa179aa5..b4d0fe96680 100644 --- a/vllm/model_executor/models/glm4_moe_lite.py +++ b/vllm/model_executor/models/glm4_moe_lite.py @@ -184,7 +184,7 @@ class Glm4MoeLiteDecoderLayer(nn.Module): ) -> torch.Tensor: # Self Attention if residual is None: - residual = hidden_states.clone() + residual = hidden_states hidden_states = self.input_layernorm(hidden_states) else: hidden_states, residual = self.input_layernorm(hidden_states, residual) diff --git a/vllm/model_executor/models/openpangu.py b/vllm/model_executor/models/openpangu.py index a517c52e690..8432566a150 100644 --- a/vllm/model_executor/models/openpangu.py +++ b/vllm/model_executor/models/openpangu.py @@ -935,7 +935,7 @@ class OpenPanguDecoderLayer(nn.Module): residual: torch.Tensor | None, ) -> torch.Tensor: if residual is None: - residual = hidden_states.clone() + residual = hidden_states hidden_states = self.input_layernorm(hidden_states) else: hidden_states, residual = self.input_layernorm(hidden_states, residual)