From 024b06b0dc0c0a6e5ec45bcdea21d35e43fcc23f Mon Sep 17 00:00:00 2001 From: Aleksei Ivashov <67375340+AIvashov@users.noreply.github.com> Date: Wed, 1 Jul 2026 13:00:19 +0300 Subject: [PATCH] [Bugfix] Expose usage field in GenerateResponse for disaggregated serving (#42748) Signed-off-by: AIvashov Signed-off-by: NickLucche Co-authored-by: NickLucche --- vllm/entrypoints/scale_out/token_in_token_out/protocol.py | 4 +++- vllm/entrypoints/scale_out/token_in_token_out/serving.py | 2 +- 2 files changed, 4 insertions(+), 2 deletions(-) diff --git a/vllm/entrypoints/scale_out/token_in_token_out/protocol.py b/vllm/entrypoints/scale_out/token_in_token_out/protocol.py index 723c2792491..48a1c4722dd 100644 --- a/vllm/entrypoints/scale_out/token_in_token_out/protocol.py +++ b/vllm/entrypoints/scale_out/token_in_token_out/protocol.py @@ -221,8 +221,10 @@ class GenerateResponse(BaseModel): "through out the inference process and return in response." ), ) + model: str | None = None + created: int | None = None choices: list[GenerateResponseChoice] - + usage: UsageInfo | None = Field(default=None) prompt_logprobs: list[dict[int, Logprob] | None] | None = None kv_transfer_params: dict[str, Any] | None = Field( diff --git a/vllm/entrypoints/scale_out/token_in_token_out/serving.py b/vllm/entrypoints/scale_out/token_in_token_out/serving.py index 70185a85b30..3562530a144 100644 --- a/vllm/entrypoints/scale_out/token_in_token_out/serving.py +++ b/vllm/entrypoints/scale_out/token_in_token_out/serving.py @@ -320,7 +320,7 @@ class ServingTokens(OpenAIServing): request_metadata.final_usage_info = usage response = GenerateResponse( - id=request_id, + request_id=request_id, created=created_time, model=model_name, choices=choices,