diff --git a/vllm/entrypoints/scale_out/token_in_token_out/protocol.py b/vllm/entrypoints/scale_out/token_in_token_out/protocol.py index 723c2792491..48a1c4722dd 100644 --- a/vllm/entrypoints/scale_out/token_in_token_out/protocol.py +++ b/vllm/entrypoints/scale_out/token_in_token_out/protocol.py @@ -221,8 +221,10 @@ class GenerateResponse(BaseModel): "through out the inference process and return in response." ), ) + model: str | None = None + created: int | None = None choices: list[GenerateResponseChoice] - + usage: UsageInfo | None = Field(default=None) prompt_logprobs: list[dict[int, Logprob] | None] | None = None kv_transfer_params: dict[str, Any] | None = Field( diff --git a/vllm/entrypoints/scale_out/token_in_token_out/serving.py b/vllm/entrypoints/scale_out/token_in_token_out/serving.py index 70185a85b30..3562530a144 100644 --- a/vllm/entrypoints/scale_out/token_in_token_out/serving.py +++ b/vllm/entrypoints/scale_out/token_in_token_out/serving.py @@ -320,7 +320,7 @@ class ServingTokens(OpenAIServing): request_metadata.final_usage_info = usage response = GenerateResponse( - id=request_id, + request_id=request_id, created=created_time, model=model_name, choices=choices,