[Model] Fix missing maybe_prefix (#42280)

Signed-off-by: DarkLight1337 <tlleungac@connect.ust.hk>
This commit is contained in:
Cyrus Leung
2026-05-11 09:04:06 +00:00
committed by GitHub
parent b1b59720b2
commit 9efdddca28
25 changed files with 49 additions and 29 deletions
+6 -2
View File
@@ -45,6 +45,7 @@ from .utils import (
is_pp_missing_parameter,
make_empty_intermediate_tensors_factory,
make_layers,
maybe_prefix,
)
@@ -367,7 +368,10 @@ class ArceeForCausalLM(
self.config = config
# Initialize the inner Transformer model (ArceeModel)
self.model = ArceeModel(vllm_config=vllm_config, prefix=f"{prefix}.model")
self.model = ArceeModel(
vllm_config=vllm_config,
prefix=maybe_prefix(prefix, "model"),
)
# On the last pipeline stage, set up the LM head and logits processor
if get_pp_group().is_last_rank:
# Determine vocabulary size (including any LoRA extra tokens
@@ -378,7 +382,7 @@ class ArceeForCausalLM(
config.hidden_size,
quant_config=vllm_config.quant_config,
bias=getattr(config, "lm_head_bias", False),
prefix=f"{prefix}.lm_head",
prefix=maybe_prefix(prefix, "lm_head"),
)
if config.tie_word_embeddings:
# Tie output weights with input embedding matrix
+1 -1
View File
@@ -540,7 +540,7 @@ class AriaForConditionalGeneration(nn.Module, SupportsMultiModal):
self.vision_tower = AriaVisionTransformer(
config.vision_config,
quant_config=quant_config,
prefix=f"{prefix}.vision_tower",
prefix=maybe_prefix(prefix, "vision_tower"),
)
self.multi_modal_projector = AriaProjector(
config, prefix=maybe_prefix(prefix, "multi_modal_projector")
+1 -1
View File
@@ -561,7 +561,7 @@ class Blip2ForConditionalGeneration(
config.qformer_config,
cache_config=cache_config,
quant_config=quant_config,
prefix=f"{prefix}.qformer",
prefix=maybe_prefix(prefix, "qformer"),
)
self.language_projection = nn.Linear(
config.qformer_config.hidden_size,
+1 -1
View File
@@ -777,7 +777,7 @@ class CLIPVisionModel(nn.Module):
quant_config=quant_config,
num_hidden_layers_override=num_hidden_layers_override,
require_post_norm=require_post_norm,
prefix=f"{prefix}.vision_model",
prefix=maybe_prefix(prefix, "vision_model"),
)
def forward(
+3 -2
View File
@@ -64,7 +64,7 @@ from .interfaces import (
SupportsMultiModal,
SupportsTranscription,
)
from .utils import AutoWeightsLoader, WeightsMapper, make_layers
from .utils import AutoWeightsLoader, WeightsMapper, make_layers, maybe_prefix
logger = init_logger(__name__)
@@ -1717,7 +1717,8 @@ class CohereASRModel(nn.Module):
self.encoder = ConformerEncoder(vllm_config=vllm_config)
self.decoder = CohereASRDecoder(
vllm_config=vllm_config, prefix=f"{prefix}.decoder"
vllm_config=vllm_config,
prefix=maybe_prefix(prefix, "decoder"),
)
if self.encoder.d_model != self.decoder.hidden_size:
+3 -1
View File
@@ -198,7 +198,9 @@ class EagleDeepseekV3ForCausalLM(DeepseekV3ForCausalLM):
vllm_config.parallel_config
)
self.model = DeepseekV2Model(
vllm_config=vllm_config, prefix="model", start_layer_id=target_layer_num
vllm_config=vllm_config,
prefix=maybe_prefix(prefix, "model"),
start_layer_id=target_layer_num,
)
self.lm_head = ParallelLMHead(
@@ -318,7 +318,9 @@ class Eagle3DeepseekV2ForCausalLM(DeepseekV2ForCausalLM):
self.config.target_layer_count = target_layer_num
self.model = DeepseekV2Eagle3Model(
vllm_config=vllm_config, prefix="model", start_layer_id=target_layer_num
vllm_config=vllm_config,
prefix=maybe_prefix(prefix, "model"),
start_layer_id=target_layer_num,
)
logit_scale = getattr(self.config, "logit_scale", 1.0)
@@ -149,7 +149,7 @@ class WindowQFormerDownsampler(nn.Module):
qformer_config,
quant_config=quant_config,
cache_config=cache_config,
prefix=f"{prefix}.qformer",
prefix=maybe_prefix(prefix, "qformer"),
)
self.image_side = (
+2 -2
View File
@@ -620,7 +620,7 @@ class GraniteSpeechForConditionalGeneration(
self.encoder = GraniteSpeechCTCEncoder(
config=config.encoder_config,
quant_config=quant_config,
prefix=f"{prefix}.encoder",
prefix=maybe_prefix(prefix, "encoder"),
)
# Blip2 QFormer
@@ -628,7 +628,7 @@ class GraniteSpeechForConditionalGeneration(
config=config,
quant_config=quant_config,
cache_config=cache_config,
prefix=f"{prefix}.projector",
prefix=maybe_prefix(prefix, "projector"),
)
self.make_empty_intermediate_tensors = (
+4 -1
View File
@@ -930,7 +930,10 @@ class HunyuanV1ModelBase(
self.config = config
self.quant_config = quant_config
self.model = HunYuanModel(vllm_config=vllm_config, prefix="model")
self.model = HunYuanModel(
vllm_config=vllm_config,
prefix=maybe_prefix(prefix, "model"),
)
if get_pp_group().is_last_rank:
self.lm_head = ParallelLMHead(
config.vocab_size,
+1 -1
View File
@@ -729,7 +729,7 @@ class KeyeSiglipVisionModel(nn.Module):
self.vision_model = KeyeSiglipVisionTransformer(
config,
quant_config=quant_config,
prefix=f"{prefix}.vision_model",
prefix=maybe_prefix(prefix, "vision_model"),
)
self.quant_config = quant_config
+2 -1
View File
@@ -25,6 +25,7 @@ from vllm.model_executor.layers.linear import (
from vllm.model_executor.layers.quantization import QuantizationConfig
from vllm.model_executor.model_loader.weight_utils import default_weight_loader
from .utils import maybe_prefix
from .vision import (
is_vit_use_data_parallel,
resolve_visual_encoder_outputs,
@@ -472,7 +473,7 @@ class Siglip2Model(torch.nn.Module):
quant_config=quant_config,
num_hidden_layers_override=num_hidden_layers_override,
require_post_norm=require_post_norm,
prefix=f"{prefix}.vision_model",
prefix=maybe_prefix(prefix, "vision_model"),
)
def forward(
+1 -1
View File
@@ -176,7 +176,7 @@ class EagleLlama4ForCausalLM(Llama4ForCausalLM):
)
self.model = LlamaModel(
vllm_config=vllm_config,
prefix="model",
prefix=maybe_prefix(prefix, "model"),
start_layer_id=target_layer_num,
quant_config=quant_config,
)
+3 -1
View File
@@ -174,7 +174,9 @@ class EagleLlamaForCausalLM(LlamaForCausalLM):
vllm_config.parallel_config
)
self.model = LlamaModel(
vllm_config=vllm_config, prefix="model", start_layer_id=target_layer_num
vllm_config=vllm_config,
prefix=maybe_prefix(prefix, "model"),
start_layer_id=target_layer_num,
)
logit_scale = getattr(self.config, "logit_scale", 1.0)
+3 -1
View File
@@ -287,7 +287,9 @@ class Eagle3LlamaForCausalLM(LlamaForCausalLM):
# proper layer_types indexing in draft models
self.config.target_layer_count = target_layer_num
self.model = LlamaModel(
vllm_config=vllm_config, prefix="model", start_layer_id=target_layer_num
vllm_config=vllm_config,
prefix=maybe_prefix(prefix, "model"),
start_layer_id=target_layer_num,
)
logit_scale = getattr(self.config, "logit_scale", 1.0)
+3 -1
View File
@@ -128,7 +128,9 @@ class EagleMistralForCausalLM(MistralForCausalLM):
vllm_config.parallel_config
)
self.model = EagleMistralModel(
vllm_config=vllm_config, prefix="model", start_layer_id=target_layer_num
vllm_config=vllm_config,
prefix=maybe_prefix(prefix, "model"),
start_layer_id=target_layer_num,
)
logit_scale = getattr(self.config, "logit_scale", 1.0)
+1 -1
View File
@@ -489,7 +489,7 @@ class Molmo2VisionTransformer(nn.Module):
self.transformer = Molmo2VisionBlockCollection(
config,
quant_config,
prefix=f"{prefix}.transformer",
prefix=maybe_prefix(prefix, "transformer"),
)
def add_pos_emb(self, x: torch.Tensor, patch_num: int) -> torch.Tensor:
+1 -1
View File
@@ -857,7 +857,7 @@ class OpenPanguVLForConditionalGeneration(
with self._mark_language_model(vllm_config):
self.language_model = init_vllm_registered_model(
vllm_config=vllm_config,
prefix=maybe_prefix("openpangu", "language_model"),
prefix=maybe_prefix(prefix, "openpangu.language_model"),
architectures=["PanguEmbeddedForCausalLM"],
)
+2 -2
View File
@@ -96,7 +96,7 @@ class VisualTokenizer(torch.nn.Module):
self.backbone = self._init_backbone(
config=config,
quant_config=quant_config,
prefix=f"{prefix}.backbone",
prefix=maybe_prefix(prefix, "backbone"),
)
# reserved tokens for IMAGE_INDICATORS
head_dim = config.vocab_size - len(IMAGE_INDICATOR_IDS)
@@ -442,7 +442,7 @@ class Ovis(nn.Module, SupportsMultiModal, SupportsPP):
self.visual_tokenizer = VisualTokenizer(
config=config.visual_tokenizer_config,
quant_config=quant_config,
prefix=f"{prefix}.visual_tokenizer",
prefix=maybe_prefix(prefix, "visual_tokenizer"),
)
self.vte = VisualEmbedding(
self.config.visual_tokenizer_config.vocab_size, self.config.hidden_size
+1 -1
View File
@@ -465,7 +465,7 @@ class Ovis2_5(nn.Module, SupportsMultiModal, SupportsPP):
config=config.vit_config,
visual_vocab_size=config.visual_vocab_size,
quant_config=quant_config,
prefix=f"{prefix}.visual_tokenizer",
prefix=maybe_prefix(prefix, "visual_tokenizer"),
)
self.vte = VisualEmbedding(config.visual_vocab_size, config.hidden_size)
+1 -1
View File
@@ -895,7 +895,7 @@ class SiglipVisionModel(nn.Module):
self.vision_model = SiglipVisionTransformer(
config,
quant_config=quant_config,
prefix=f"{prefix}.vision_model",
prefix=maybe_prefix(prefix, "vision_model"),
)
self.quant_config = quant_config
+1 -1
View File
@@ -1034,7 +1034,7 @@ class Phi4MMForCausalLM(nn.Module, SupportsLoRA, SupportsMultiModal):
self.vision_encoder = Phi4MMImageEncoder(
config,
quant_config,
prefix="model.vision_embed_tokens",
prefix=maybe_prefix(prefix, "model.vision_embed_tokens"),
model_dir=config._name_or_path,
)
+1 -1
View File
@@ -510,7 +510,7 @@ class DFlashQwen3ForCausalLM(Qwen3ForCausalLM):
self.config.target_layer_count = target_layer_num
self.model = DFlashQwen3Model(
vllm_config=vllm_config,
prefix="model",
prefix=maybe_prefix(prefix, "model"),
start_layer_id=target_layer_num,
)
+1 -1
View File
@@ -867,7 +867,7 @@ class SiglipVisionModel(nn.Module):
quant_config=quant_config,
num_hidden_layers_override=num_hidden_layers_override,
require_post_norm=require_post_norm,
prefix=f"{prefix}.vision_model",
prefix=maybe_prefix(prefix, "vision_model"),
use_head=use_head,
)
+2 -1
View File
@@ -29,6 +29,7 @@ from vllm.model_executor.layers.rotary_embedding.common import (
from vllm.model_executor.model_loader.weight_utils import default_weight_loader
from vllm.platforms import current_platform
from .utils import maybe_prefix
from .vision import is_vit_use_data_parallel
@@ -598,7 +599,7 @@ class Siglip2NavitModel(torch.nn.Module):
self.vision_model = Siglip2VisionTransformer(
config,
quant_config=quant_config,
prefix=f"{prefix}.vision_model",
prefix=maybe_prefix(prefix, "vision_model"),
)
def forward(