diff --git a/.buildkite/test_areas/attention.yaml b/.buildkite/test_areas/attention.yaml index 01e43b50149..9c662fec1af 100644 --- a/.buildkite/test_areas/attention.yaml +++ b/.buildkite/test_areas/attention.yaml @@ -4,7 +4,7 @@ depends_on: steps: - label: V1 attention (H100-MI300) key: v1-attention-h100-mi300 - timeout_in_minutes: 30 + timeout_in_minutes: 85 device: h100 source_file_dependencies: - vllm/config/attention.py @@ -16,7 +16,7 @@ steps: mirror: amd: device: mi325_1 - timeout_in_minutes: 70 + timeout_in_minutes: 95 depends_on: - image-build-amd source_file_dependencies: @@ -30,7 +30,7 @@ steps: - label: V1 attention (B200) key: v1-attention-b200 - timeout_in_minutes: 30 + timeout_in_minutes: 80 device: b200-k8s source_file_dependencies: - vllm/config/attention.py diff --git a/.buildkite/test_areas/basic_correctness.yaml b/.buildkite/test_areas/basic_correctness.yaml index d7173b6438d..1b92babb3ce 100644 --- a/.buildkite/test_areas/basic_correctness.yaml +++ b/.buildkite/test_areas/basic_correctness.yaml @@ -4,7 +4,7 @@ depends_on: steps: - label: Basic Correctness key: basic-correctness - timeout_in_minutes: 30 + timeout_in_minutes: 45 device: h200_18gb source_file_dependencies: - vllm/ @@ -19,6 +19,6 @@ steps: mirror: amd: device: mi325_1 - timeout_in_minutes: 50 + timeout_in_minutes: 70 depends_on: - image-build-amd diff --git a/.buildkite/test_areas/benchmarks.yaml b/.buildkite/test_areas/benchmarks.yaml index 622ebd44f40..7c26a8d6e98 100644 --- a/.buildkite/test_areas/benchmarks.yaml +++ b/.buildkite/test_areas/benchmarks.yaml @@ -4,7 +4,7 @@ depends_on: steps: - label: Benchmarks CLI Test key: benchmarks-cli-test - timeout_in_minutes: 20 + timeout_in_minutes: 30 device: h200_18gb source_file_dependencies: - vllm/ @@ -23,7 +23,7 @@ steps: num_gpus: 2 optional: true working_dir: "/vllm-workspace/" - timeout_in_minutes: 10 + timeout_in_minutes: 20 source_file_dependencies: - benchmarks/attention_benchmarks/ - vllm/v1/attention/ diff --git a/.buildkite/test_areas/compile.yaml b/.buildkite/test_areas/compile.yaml index 01248738d51..eba37f657d9 100644 --- a/.buildkite/test_areas/compile.yaml +++ b/.buildkite/test_areas/compile.yaml @@ -4,7 +4,7 @@ depends_on: steps: - label: Sequence Parallel Correctness Tests (2 GPUs) key: sequence-parallel-correctness-tests-2-gpus - timeout_in_minutes: 50 + timeout_in_minutes: 80 working_dir: "/vllm-workspace/" num_devices: 2 source_file_dependencies: @@ -19,7 +19,7 @@ steps: - label: Sequence Parallel Correctness Tests (2xH100) key: sequence-parallel-correctness-tests-2xh100 - timeout_in_minutes: 50 + timeout_in_minutes: 75 working_dir: "/vllm-workspace/" device: h100 optional: true @@ -30,7 +30,7 @@ steps: - label: AsyncTP Correctness Tests (2xH100) key: asynctp-correctness-tests-2xh100 - timeout_in_minutes: 50 + timeout_in_minutes: 30 working_dir: "/vllm-workspace/" device: h100 optional: true @@ -41,7 +41,7 @@ steps: - label: AsyncTP Correctness Tests (B200) key: asynctp-correctness-tests-b200 - timeout_in_minutes: 50 + timeout_in_minutes: 30 working_dir: "/vllm-workspace/" device: b200-k8s optional: true @@ -52,7 +52,7 @@ steps: - label: Distributed Compile Unit Tests (2xH100) key: distributed-compile-unit-tests-2xh100 - timeout_in_minutes: 20 + timeout_in_minutes: 45 working_dir: "/vllm-workspace/" device: h100 num_devices: 2 @@ -66,7 +66,7 @@ steps: - label: Fusion and Compile Unit Tests (2xB200) key: fusion-and-compile-unit-tests-2xb200 - timeout_in_minutes: 20 + timeout_in_minutes: 30 working_dir: "/vllm-workspace/" device: b200-k8s source_file_dependencies: @@ -96,7 +96,7 @@ steps: - label: Fusion E2E Quick (H100) key: fusion-e2e-quick-h100 - timeout_in_minutes: 15 + timeout_in_minutes: 25 working_dir: "/vllm-workspace/" device: h100 num_devices: 1 @@ -115,7 +115,7 @@ steps: - label: Fusion E2E Config Sweep (H100) key: fusion-e2e-config-sweep-h100 - timeout_in_minutes: 30 + timeout_in_minutes: 25 working_dir: "/vllm-workspace/" device: h100 num_devices: 1 @@ -149,7 +149,7 @@ steps: - label: Fusion E2E TP2 Quick (H100) key: fusion-e2e-tp2-quick-h100 - timeout_in_minutes: 20 + timeout_in_minutes: 35 working_dir: "/vllm-workspace/" device: h100 num_devices: 2 @@ -167,7 +167,7 @@ steps: - label: Fusion E2E TP2 AR-RMS Config Sweep (H100) key: fusion-e2e-tp2-ar-rms-config-sweep-h100 - timeout_in_minutes: 40 + timeout_in_minutes: 30 working_dir: "/vllm-workspace/" device: h100 num_devices: 2 @@ -207,7 +207,7 @@ steps: - label: Fusion E2E TP2 (B200) key: fusion-e2e-tp2-b200 - timeout_in_minutes: 20 + timeout_in_minutes: 45 working_dir: "/vllm-workspace/" device: b200-k8s num_devices: 2 diff --git a/.buildkite/test_areas/cuda.yaml b/.buildkite/test_areas/cuda.yaml index 956c76cf05f..99e1949fef7 100644 --- a/.buildkite/test_areas/cuda.yaml +++ b/.buildkite/test_areas/cuda.yaml @@ -4,7 +4,7 @@ depends_on: steps: - label: Platform Tests key: platform-tests - timeout_in_minutes: 15 + timeout_in_minutes: 20 device: h200_18gb source_file_dependencies: - vllm/envs.py @@ -19,7 +19,7 @@ steps: - label: Cudagraph key: cudagraph - timeout_in_minutes: 20 + timeout_in_minutes: 30 source_file_dependencies: - tests/v1/cudagraph - vllm/v1/cudagraph_dispatcher.py diff --git a/.buildkite/test_areas/disaggregated.yaml b/.buildkite/test_areas/disaggregated.yaml index 4cab698f322..38020d91ad0 100644 --- a/.buildkite/test_areas/disaggregated.yaml +++ b/.buildkite/test_areas/disaggregated.yaml @@ -4,7 +4,7 @@ depends_on: steps: - label: Distributed NixlConnector PD accuracy (4 GPUs) key: distributed-nixlconnector-pd-accuracy-4-gpus - timeout_in_minutes: 30 + timeout_in_minutes: 55 working_dir: "/vllm-workspace/tests" num_devices: 4 source_file_dependencies: @@ -16,7 +16,7 @@ steps: mirror: amd: device: mi300_4 - timeout_in_minutes: 110 + timeout_in_minutes: 85 depends_on: - image-build-amd source_file_dependencies: @@ -29,7 +29,7 @@ steps: - label: Distributed FlashInfer NixlConnector PD accuracy (4 GPUs) key: distributed-flashinfer-nixlconnector-pd-accuracy-4-gpus - timeout_in_minutes: 30 + timeout_in_minutes: 55 working_dir: "/vllm-workspace/tests" num_devices: 4 source_file_dependencies: @@ -66,7 +66,7 @@ steps: mirror: amd: device: mi300_4 - timeout_in_minutes: 50 + timeout_in_minutes: 60 depends_on: - image-build-amd source_file_dependencies: @@ -79,7 +79,7 @@ steps: - label: CrossLayer KV layout Distributed NixlConnector PD accuracy tests (4 GPUs) key: crosslayer-kv-layout-distributed-nixlconnector-pd-accuracy-tests-4-gpus - timeout_in_minutes: 30 + timeout_in_minutes: 55 working_dir: "/vllm-workspace/tests" num_devices: 4 source_file_dependencies: @@ -91,7 +91,7 @@ steps: mirror: amd: device: mi300_4 - timeout_in_minutes: 110 + timeout_in_minutes: 85 depends_on: - image-build-amd source_file_dependencies: @@ -104,7 +104,7 @@ steps: - label: Hybrid SSM NixlConnector PD accuracy tests (4 GPUs) key: hybrid-ssm-nixlconnector-pd-accuracy-tests-4-gpus - timeout_in_minutes: 25 + timeout_in_minutes: 60 working_dir: "/vllm-workspace/tests" num_devices: 4 source_file_dependencies: @@ -116,7 +116,7 @@ steps: mirror: amd: device: mi300_4 - timeout_in_minutes: 60 + timeout_in_minutes: 80 depends_on: - image-build-amd source_file_dependencies: @@ -143,7 +143,7 @@ steps: - label: MultiConnector (Nixl+Offloading) PD accuracy (2 GPUs) key: multiconnector-nixl-offloading-pd-accuracy-2-gpus - timeout_in_minutes: 30 + timeout_in_minutes: 40 working_dir: "/vllm-workspace/tests" num_devices: 2 source_file_dependencies: @@ -158,7 +158,7 @@ steps: - label: NixlConnector PD + Spec Decode acceptance (2 GPUs) key: nixlconnector-pd-spec-decode-acceptance-2-gpus - timeout_in_minutes: 30 + timeout_in_minutes: 45 device: a100 working_dir: "/vllm-workspace/tests" num_devices: 2 @@ -172,7 +172,7 @@ steps: mirror: amd: device: mi300_2 - timeout_in_minutes: 60 + timeout_in_minutes: 70 depends_on: - image-build-amd source_file_dependencies: @@ -186,7 +186,7 @@ steps: - label: MultiConnector (Nixl+Offloading) PD edge cases (2 GPUs) key: multiconnector-nixl-offloading-pd-edge-cases-2-gpus - timeout_in_minutes: 30 + timeout_in_minutes: 25 working_dir: "/vllm-workspace/tests" num_devices: 2 source_file_dependencies: diff --git a/.buildkite/test_areas/distributed.yaml b/.buildkite/test_areas/distributed.yaml index 0b81cdb9d11..b519132c6f1 100644 --- a/.buildkite/test_areas/distributed.yaml +++ b/.buildkite/test_areas/distributed.yaml @@ -4,7 +4,7 @@ depends_on: steps: - label: Distributed Comm Ops key: distributed-comm-ops - timeout_in_minutes: 20 + timeout_in_minutes: 25 working_dir: "/vllm-workspace/tests" num_devices: 2 source_file_dependencies: @@ -18,7 +18,7 @@ steps: - label: Distributed DP Tests (2 GPUs) key: distributed-dp-tests-2-gpus - timeout_in_minutes: 20 + timeout_in_minutes: 35 working_dir: "/vllm-workspace/tests" num_devices: 2 source_file_dependencies: @@ -55,7 +55,7 @@ steps: - label: Distributed Compile + RPC Tests (2 GPUs) key: distributed-compile-rpc-tests-2-gpus - timeout_in_minutes: 20 + timeout_in_minutes: 65 working_dir: "/vllm-workspace/tests" num_devices: 2 source_file_dependencies: @@ -78,7 +78,7 @@ steps: - label: Distributed Torchrun + Shutdown Tests (2 GPUs) key: distributed-torchrun-shutdown-tests-2-gpus - timeout_in_minutes: 20 + timeout_in_minutes: 30 working_dir: "/vllm-workspace/tests" num_devices: 2 source_file_dependencies: @@ -133,7 +133,7 @@ steps: - label: Distributed DP Tests (4 GPUs) key: distributed-dp-tests-4-gpus - timeout_in_minutes: 30 + timeout_in_minutes: 45 working_dir: "/vllm-workspace/tests" num_devices: 4 source_file_dependencies: @@ -154,7 +154,7 @@ steps: - label: Distributed Compile + Comm (4 GPUs) key: distributed-compile-comm-4-gpus - timeout_in_minutes: 30 + timeout_in_minutes: 70 working_dir: "/vllm-workspace/tests" num_devices: 4 source_file_dependencies: @@ -176,7 +176,7 @@ steps: - label: Distributed Tests (8xH100) key: distributed-tests-8xh100 - timeout_in_minutes: 10 + timeout_in_minutes: 20 device: h100 num_devices: 8 working_dir: "/vllm-workspace/tests" @@ -212,7 +212,7 @@ steps: - label: Distributed Tests (2xH100-2xMI300) key: distributed-tests-2xh100-2xmi300 - timeout_in_minutes: 15 + timeout_in_minutes: 30 device: h100 optional: true working_dir: "/vllm-workspace/" @@ -259,7 +259,7 @@ steps: - label: Pipeline + Context Parallelism (4 GPUs) key: pipeline-context-parallelism-4-gpus - timeout_in_minutes: 60 + timeout_in_minutes: 55 working_dir: "/vllm-workspace/tests" num_devices: 4 source_file_dependencies: @@ -274,7 +274,7 @@ steps: - label: RayExecutorV2 (4 GPUs) key: rayexecutorv2-4-gpus - timeout_in_minutes: 60 + timeout_in_minutes: 45 working_dir: "/vllm-workspace/tests" num_devices: 4 source_file_dependencies: diff --git a/.buildkite/test_areas/docker.yaml b/.buildkite/test_areas/docker.yaml index 9bf96221abe..9f0562ca3bc 100644 --- a/.buildkite/test_areas/docker.yaml +++ b/.buildkite/test_areas/docker.yaml @@ -3,7 +3,7 @@ depends_on: - image-build-cpu steps: - label: Docker Build Metadata - timeout_in_minutes: 10 + timeout_in_minutes: 20 device: cpu-small source_file_dependencies: - .buildkite/release-pipeline.yaml diff --git a/.buildkite/test_areas/e2e_integration.yaml b/.buildkite/test_areas/e2e_integration.yaml index 3f87e3958d0..6655ae781e8 100644 --- a/.buildkite/test_areas/e2e_integration.yaml +++ b/.buildkite/test_areas/e2e_integration.yaml @@ -4,7 +4,7 @@ depends_on: steps: - label: DeepSeek V2-Lite Sync EPLB Accuracy (4xH100) key: deepseek-v2-lite-sync-eplb-accuracy-4xh100 - timeout_in_minutes: 60 + timeout_in_minutes: 25 device: h100 optional: true num_devices: 4 @@ -14,7 +14,7 @@ steps: - label: Qwen3-30B-A3B-FP8-block Sync EPLB Accuracy (4xH100) key: qwen3-30b-a3b-fp8-block-sync-eplb-accuracy-4xh100 - timeout_in_minutes: 60 + timeout_in_minutes: 25 device: h100 optional: true num_devices: 4 @@ -24,7 +24,7 @@ steps: - label: Qwen3-30B-A3B-FP8-block Sync EPLB Accuracy (2xB200) key: qwen3-30b-a3b-fp8-block-sync-eplb-accuracy-2xb200 - timeout_in_minutes: 60 + timeout_in_minutes: 20 device: b200-k8s optional: true num_devices: 2 @@ -34,7 +34,7 @@ steps: - label: Qwen3-30B-A3B-FP8 DP4 Async EPLB Accuracy key: qwen3-30b-a3b-fp8-dp4-async-eplb-accuracy - timeout_in_minutes: 60 + timeout_in_minutes: 25 device: h100 optional: true num_devices: 4 @@ -44,7 +44,7 @@ steps: - label: DeepSeek V2-Lite Prefetch Offload Accuracy (H100) key: deepseek-v2-lite-prefetch-offload-accuracy-h100 - timeout_in_minutes: 60 + timeout_in_minutes: 20 device: h100 optional: true num_devices: 1 diff --git a/.buildkite/test_areas/engine.yaml b/.buildkite/test_areas/engine.yaml index 7bb60546572..1c50ab7a113 100644 --- a/.buildkite/test_areas/engine.yaml +++ b/.buildkite/test_areas/engine.yaml @@ -4,7 +4,7 @@ depends_on: steps: - label: Engine key: engine - timeout_in_minutes: 15 + timeout_in_minutes: 30 device: h200_18gb source_file_dependencies: - vllm/compilation/ @@ -29,13 +29,13 @@ steps: mirror: amd: device: mi325_1 - timeout_in_minutes: 60 + timeout_in_minutes: 50 depends_on: - image-build-amd - label: Engine (1 GPU) key: engine-1-gpu - timeout_in_minutes: 30 + timeout_in_minutes: 45 source_file_dependencies: - vllm/v1/engine/ - tests/v1/engine/ @@ -45,13 +45,13 @@ steps: mirror: amd: device: mi325_1 - timeout_in_minutes: 40 + timeout_in_minutes: 55 depends_on: - image-build-amd - label: e2e Scheduling (1 GPU) key: e2e-scheduling-1-gpu - timeout_in_minutes: 30 + timeout_in_minutes: 35 device: h200_18gb source_file_dependencies: - vllm/v1/ @@ -61,14 +61,14 @@ steps: mirror: amd: device: mi325_1 - timeout_in_minutes: 60 + timeout_in_minutes: 70 depends_on: - image-build-amd - label: e2e Core (1 GPU) device: h200_35gb key: e2e-core-1-gpu - timeout_in_minutes: 30 + timeout_in_minutes: 40 source_file_dependencies: - vllm/v1/ - tests/v1/e2e/general/ @@ -77,7 +77,7 @@ steps: mirror: amd: device: mi325_1 - timeout_in_minutes: 35 + timeout_in_minutes: 60 depends_on: - image-build-amd source_file_dependencies: @@ -87,7 +87,7 @@ steps: - label: V1 e2e (2 GPUs) key: v1-e2e-2-gpus - timeout_in_minutes: 60 # TODO: Fix timeout after we have more confidence in the test stability + timeout_in_minutes: 25 # TODO: Fix timeout after we have more confidence in the test stability optional: true num_devices: 2 source_file_dependencies: @@ -120,7 +120,7 @@ steps: - label: V1 e2e (4 GPUs) key: v1-e2e-4-gpus - timeout_in_minutes: 60 # TODO: Fix timeout after we have more confidence in the test stability + timeout_in_minutes: 20 # TODO: Fix timeout after we have more confidence in the test stability optional: true num_devices: 4 source_file_dependencies: @@ -148,7 +148,7 @@ steps: - label: V1 e2e (4xH100) key: v1-e2e-4xh100 - timeout_in_minutes: 60 + timeout_in_minutes: 35 device: h100 num_devices: 4 optional: true diff --git a/.buildkite/test_areas/entrypoints.yaml b/.buildkite/test_areas/entrypoints.yaml index 5ef88d4b97b..2db4c5ad5a2 100644 --- a/.buildkite/test_areas/entrypoints.yaml +++ b/.buildkite/test_areas/entrypoints.yaml @@ -4,7 +4,7 @@ depends_on: steps: - label: Entrypoints Unit Tests key: entrypoints-unit-tests - timeout_in_minutes: 10 + timeout_in_minutes: 25 working_dir: "/vllm-workspace/tests" source_file_dependencies: - vllm/entrypoints @@ -16,7 +16,7 @@ steps: - label: Entrypoints Integration (LLM) key: entrypoints-integration-llm - timeout_in_minutes: 40 + timeout_in_minutes: 60 working_dir: "/vllm-workspace/tests" source_file_dependencies: - vllm/ @@ -37,7 +37,7 @@ steps: - label: Entrypoints Integration (API Server) key: entrypoints-integration-api-server device: h200_35gb - timeout_in_minutes: 130 + timeout_in_minutes: 50 working_dir: "/vllm-workspace/tests" source_file_dependencies: - vllm/ @@ -56,7 +56,7 @@ steps: - label: Entrypoints Integration (API Server OpenAI - Part 1) key: entrypoints-integration-api-server-openai-part-1 - timeout_in_minutes: 50 + timeout_in_minutes: 45 working_dir: "/vllm-workspace/tests" source_file_dependencies: - vllm/ @@ -68,13 +68,13 @@ steps: mirror: amd: device: mi325_1 - timeout_in_minutes: 80 + timeout_in_minutes: 65 depends_on: - image-build-amd - label: Entrypoints Integration (API Server OpenAI - Part 2) key: entrypoints-integration-api-server-openai-part-2 - timeout_in_minutes: 50 + timeout_in_minutes: 45 working_dir: "/vllm-workspace/tests" source_file_dependencies: - vllm/ @@ -109,7 +109,7 @@ steps: mirror: amd: device: mi325_1 - timeout_in_minutes: 60 + timeout_in_minutes: 65 depends_on: - image-build-amd @@ -126,7 +126,7 @@ steps: - label: Entrypoints Integration (Speech to Text) device: h200_35gb key: entrypoints-integration-speech_to_text - timeout_in_minutes: 50 + timeout_in_minutes: 45 working_dir: "/vllm-workspace/tests" source_file_dependencies: - vllm/ @@ -138,7 +138,7 @@ steps: - label: Entrypoints Integration (Multimodal) device: h200_35gb key: entrypoints-integration-multimodal - timeout_in_minutes: 50 + timeout_in_minutes: 45 working_dir: "/vllm-workspace/tests" source_file_dependencies: - vllm/ @@ -160,7 +160,7 @@ steps: - label: OpenAI API Correctness key: openai-api-correctness - timeout_in_minutes: 30 + timeout_in_minutes: 20 device: h200_18gb source_file_dependencies: - csrc/ diff --git a/.buildkite/test_areas/expert_parallelism.yaml b/.buildkite/test_areas/expert_parallelism.yaml index ccb3054f2e9..d02ffeb7748 100644 --- a/.buildkite/test_areas/expert_parallelism.yaml +++ b/.buildkite/test_areas/expert_parallelism.yaml @@ -4,7 +4,7 @@ depends_on: steps: - label: EPLB Algorithm key: eplb-algorithm - timeout_in_minutes: 15 + timeout_in_minutes: 20 device: h200_18gb working_dir: "/vllm-workspace/tests" source_file_dependencies: @@ -27,7 +27,7 @@ steps: - label: EPLB Execution # 17min key: eplb-execution - timeout_in_minutes: 27 + timeout_in_minutes: 25 working_dir: "/vllm-workspace/tests" num_devices: 4 source_file_dependencies: @@ -39,7 +39,7 @@ steps: - label: Elastic EP Scaling Test key: elastic-ep-scaling-test - timeout_in_minutes: 20 + timeout_in_minutes: 30 device: h100 working_dir: "/vllm-workspace/tests" num_devices: 4 diff --git a/.buildkite/test_areas/kernels.yaml b/.buildkite/test_areas/kernels.yaml index 10c132da095..d9e350f5093 100644 --- a/.buildkite/test_areas/kernels.yaml +++ b/.buildkite/test_areas/kernels.yaml @@ -4,7 +4,7 @@ depends_on: steps: - label: vLLM IR Tests key: vllm-ir-tests - timeout_in_minutes: 10 + timeout_in_minutes: 35 device: h200_18gb working_dir: "/vllm-workspace/" source_file_dependencies: @@ -16,7 +16,7 @@ steps: - label: Kernels Core Operation Test key: kernels-core-operation-test - timeout_in_minutes: 75 + timeout_in_minutes: 120 source_file_dependencies: - csrc/ - tests/kernels/core @@ -27,7 +27,7 @@ steps: - label: Kernels MiniMax Reduce RMS Test (2 GPUs) key: kernels-minimax-reduce-rms-test-2-gpus - timeout_in_minutes: 15 + timeout_in_minutes: 20 num_devices: 2 device: h100 source_file_dependencies: @@ -41,7 +41,7 @@ steps: - label: Deepseek V4 Kernel Test (H100) key: deepseek-v4-kernel-test-h100 - timeout_in_minutes: 15 + timeout_in_minutes: 30 device: h100 source_file_dependencies: - csrc/fused_deepseek_v4_qnorm_rope_kv_insert_kernel.cu @@ -54,7 +54,7 @@ steps: - label: Deepseek V4 Kernel Test (B200) key: deepseek-v4-kernel-test-b200 - timeout_in_minutes: 15 + timeout_in_minutes: 20 device: b200-k8s source_file_dependencies: - csrc/fused_deepseek_v4_qnorm_rope_kv_insert_kernel.cu @@ -65,7 +65,7 @@ steps: - label: Kernels Attention Test %N key: kernels-attention-test - timeout_in_minutes: 35 + timeout_in_minutes: 65 source_file_dependencies: - csrc/attention/ - vllm/v1/attention @@ -79,7 +79,7 @@ steps: mirror: amd: device: mi325_1 - timeout_in_minutes: 55 + timeout_in_minutes: 90 depends_on: - image-build-amd source_file_dependencies: @@ -106,7 +106,7 @@ steps: - label: Kernels Quantization Test %N key: kernels-quantization-test - timeout_in_minutes: 90 + timeout_in_minutes: 60 source_file_dependencies: - csrc/quantization/ - vllm/model_executor/layers/quantization @@ -131,7 +131,7 @@ steps: - label: Kernels MoE Test %N key: kernels-moe-test - timeout_in_minutes: 25 + timeout_in_minutes: 50 source_file_dependencies: - csrc/quantization/cutlass_w8a8/moe/ - csrc/moe/ @@ -147,7 +147,7 @@ steps: mirror: amd: device: mi325_1 - timeout_in_minutes: 50 + timeout_in_minutes: 65 source_file_dependencies: - csrc/quantization/cutlass_w8a8/moe/ - csrc/moe/ @@ -163,7 +163,7 @@ steps: - label: Kernels Mamba Test key: kernels-mamba-test - timeout_in_minutes: 45 + timeout_in_minutes: 40 source_file_dependencies: - csrc/mamba/ - tests/kernels/mamba @@ -172,7 +172,7 @@ steps: - pytest -v -s kernels/mamba - label: Kernels KDA Test - timeout_in_minutes: 20 + timeout_in_minutes: 25 device: h200_18gb source_file_dependencies: - vllm/model_executor/layers/fla/ops/kda.py @@ -184,7 +184,7 @@ steps: - label: Kernels DeepGEMM Test (H100) key: kernels-deepgemm-test-h100 - timeout_in_minutes: 45 + timeout_in_minutes: 35 device: h100 num_devices: 1 source_file_dependencies: @@ -211,7 +211,7 @@ steps: - label: Kernels (B200) key: kernels-b200 - timeout_in_minutes: 30 + timeout_in_minutes: 80 working_dir: "/vllm-workspace/" device: b200-k8s # optional: true @@ -264,7 +264,7 @@ steps: - label: Kernels Helion Test key: kernels-helion-test - timeout_in_minutes: 30 + timeout_in_minutes: 115 device: h100 source_file_dependencies: - vllm/utils/import_utils.py @@ -276,7 +276,7 @@ steps: - label: Kernels FP8 MoE Test (1xH100) key: kernels-fp8-moe-test-1xh100 - timeout_in_minutes: 90 + timeout_in_minutes: 40 device: h100 num_devices: 1 optional: true @@ -293,7 +293,7 @@ steps: - label: Kernels FP8 MoE Test (2xH100) key: kernels-fp8-moe-test-2xh100 - timeout_in_minutes: 90 + timeout_in_minutes: 45 device: h100 num_devices: 2 optional: true @@ -303,7 +303,7 @@ steps: - label: Kernels Fp4 MoE Test (B200) key: kernels-fp4-moe-test-b200 - timeout_in_minutes: 60 + timeout_in_minutes: 25 device: b200-k8s num_devices: 1 optional: true @@ -316,7 +316,7 @@ steps: - label: Kernels FusedMoE Layer Test (2 H100s) key: kernels-fusedmoe-layer-test-2-h100s - timeout_in_minutes: 90 + timeout_in_minutes: 30 device: h100 num_devices: 2 source_file_dependencies: diff --git a/.buildkite/test_areas/lm_eval.yaml b/.buildkite/test_areas/lm_eval.yaml index feba8f26eb3..1f7d2787536 100644 --- a/.buildkite/test_areas/lm_eval.yaml +++ b/.buildkite/test_areas/lm_eval.yaml @@ -5,7 +5,7 @@ steps: - label: LM Eval Small Models device: h200_35gb key: lm-eval-small-models - timeout_in_minutes: 75 + timeout_in_minutes: 45 source_file_dependencies: - csrc/ - vllm/model_executor/layers/quantization @@ -56,7 +56,7 @@ steps: - label: LM Eval Small Models (1xB200) key: lm-eval-small-models-1xb200 - timeout_in_minutes: 120 + timeout_in_minutes: 50 device: b200-k8s optional: true source_file_dependencies: @@ -80,7 +80,7 @@ steps: - label: LM Eval Large Models EP (2xB200) key: lm-eval-large-models-ep-2xb200 - timeout_in_minutes: 120 + timeout_in_minutes: 60 device: b200-k8s optional: true num_devices: 2 @@ -92,7 +92,7 @@ steps: - label: LM Eval Qwen3.5 Models (2xB200) key: lm-eval-qwen3-5-models-2xb200 - timeout_in_minutes: 120 + timeout_in_minutes: 45 device: b200-k8s optional: true num_devices: 2 @@ -109,7 +109,7 @@ steps: - label: LM Eval Large Models (8xH200) key: lm-eval-large-models-8xh200 - timeout_in_minutes: 60 + timeout_in_minutes: 50 device: h200 optional: true num_devices: 8 @@ -118,7 +118,7 @@ steps: mirror: amd: device: mi300_8 - timeout_in_minutes: 180 + timeout_in_minutes: 60 depends_on: - image-build-amd commands: @@ -152,7 +152,7 @@ steps: - label: LM Eval Humming f16 (A100 - TEMPORARY) key: lm-eval-humming-f16-a100 - timeout_in_minutes: 120 + timeout_in_minutes: 75 device: a100 optional: true num_devices: 1 @@ -167,7 +167,7 @@ steps: - label: LM Eval Humming Act int8 (A100 - TEMPORARY) key: lm-eval-humming-act-a100 - timeout_in_minutes: 120 + timeout_in_minutes: 45 device: a100 optional: true num_devices: 1 @@ -182,7 +182,7 @@ steps: - label: LM Eval Humming f16 (H100 - TEMPORARY) key: lm-eval-humming-f16-h100 - timeout_in_minutes: 120 + timeout_in_minutes: 70 device: h100 optional: true num_devices: 1 @@ -197,7 +197,7 @@ steps: - label: LM Eval Humming Act fp8/int8 (H100 - TEMPORARY) key: lm-eval-humming-act-h100 - timeout_in_minutes: 120 + timeout_in_minutes: 70 device: h100 optional: true num_devices: 1 @@ -213,7 +213,7 @@ steps: - label: LM Eval Humming f16 (B200 - TEMPORARY) key: lm-eval-humming-f16-b200 - timeout_in_minutes: 120 + timeout_in_minutes: 50 device: b200-k8s optional: true num_devices: 1 @@ -228,7 +228,7 @@ steps: - label: LM Eval Humming Act fp8/int8 (B200 - TEMPORARY) key: lm-eval-humming-act-b200 - timeout_in_minutes: 120 + timeout_in_minutes: 50 device: b200-k8s optional: true num_devices: 1 @@ -244,7 +244,7 @@ steps: - label: LM Eval TurboQuant KV Cache key: lm-eval-turboquant-kv-cache - timeout_in_minutes: 75 + timeout_in_minutes: 55 device: h200_18gb source_file_dependencies: - vllm/model_executor/layers/quantization/turboquant/ @@ -256,7 +256,7 @@ steps: - label: GPQA Eval (GPT-OSS) (2xH100) key: gpqa-eval-gpt-oss-2xh100 - timeout_in_minutes: 120 + timeout_in_minutes: 35 device: h100 optional: true num_devices: 2 @@ -270,7 +270,7 @@ steps: - label: GPQA Eval (GPT-OSS) (2xB200) key: gpqa-eval-gpt-oss-2xb200 - timeout_in_minutes: 120 + timeout_in_minutes: 30 device: b200-k8s optional: true num_devices: 2 @@ -284,7 +284,7 @@ steps: - label: GPQA Eval (GPT-OSS) (DGX Spark) key: gpqa-eval-gpt-oss-spark - timeout_in_minutes: 120 + timeout_in_minutes: 35 device: dgx-spark optional: true num_devices: 1 @@ -313,7 +313,7 @@ steps: - label: LM Eval KV-Offload (2xH100) key: kv-offload-medium - timeout_in_minutes: 60 + timeout_in_minutes: 30 device: h100 num_devices: 2 source_file_dependencies: @@ -327,7 +327,7 @@ steps: - label: LM Eval KV-Offload (4xH100) key: kv-offload-large - timeout_in_minutes: 60 + timeout_in_minutes: 40 device: h100 num_devices: 4 source_file_dependencies: @@ -341,7 +341,7 @@ steps: - label: MRCR Eval Small Models device: h200_35gb - timeout_in_minutes: 30 + timeout_in_minutes: 25 source_file_dependencies: - tests/evals/mrcr/ commands: diff --git a/.buildkite/test_areas/lora.yaml b/.buildkite/test_areas/lora.yaml index bd437c52265..46a3710ea80 100644 --- a/.buildkite/test_areas/lora.yaml +++ b/.buildkite/test_areas/lora.yaml @@ -5,7 +5,7 @@ steps: - label: LoRA %N device: h200_35gb key: lora - timeout_in_minutes: 30 + timeout_in_minutes: 40 source_file_dependencies: - vllm/lora - tests/lora @@ -16,7 +16,7 @@ steps: amd: device: mi325_1 working_dir: "/vllm-workspace/tests" - timeout_in_minutes: 60 + timeout_in_minutes: 65 source_file_dependencies: - vllm/lora - tests/lora @@ -27,7 +27,7 @@ steps: - label: LoRA TP (Distributed) key: lora-tp-distributed - timeout_in_minutes: 30 + timeout_in_minutes: 60 num_devices: 4 source_file_dependencies: - vllm/lora diff --git a/.buildkite/test_areas/misc.yaml b/.buildkite/test_areas/misc.yaml index fd6ef2e61ba..13840c8db2f 100644 --- a/.buildkite/test_areas/misc.yaml +++ b/.buildkite/test_areas/misc.yaml @@ -5,7 +5,7 @@ steps: - label: V1 Spec Decode device: h200_35gb key: v1-spec-decode - timeout_in_minutes: 30 + timeout_in_minutes: 40 source_file_dependencies: - vllm/config/ - vllm/distributed/ @@ -24,13 +24,13 @@ steps: mirror: amd: device: mi300_1 - timeout_in_minutes: 65 + timeout_in_minutes: 75 depends_on: - image-build-amd - label: V1 Sample + Logits key: v1-sample-logits - timeout_in_minutes: 30 + timeout_in_minutes: 45 device: h200_18gb source_file_dependencies: - vllm/config/ @@ -64,7 +64,7 @@ steps: - label: V1 Core + KV + Metrics key: v1-core-kv-metrics - timeout_in_minutes: 30 + timeout_in_minutes: 60 source_file_dependencies: - vllm/config/ - vllm/distributed/ @@ -108,7 +108,7 @@ steps: mirror: amd: device: mi325_1 - timeout_in_minutes: 60 + timeout_in_minutes: 75 depends_on: - image-build-amd @@ -172,7 +172,7 @@ steps: - label: Regression key: regression - timeout_in_minutes: 20 + timeout_in_minutes: 30 device: h200_18gb source_file_dependencies: - vllm/config/ @@ -195,7 +195,7 @@ steps: - label: Examples device: h200_35gb key: examples - timeout_in_minutes: 45 + timeout_in_minutes: 40 working_dir: "/vllm-workspace/examples" source_file_dependencies: - vllm/entrypoints @@ -237,7 +237,7 @@ steps: - label: Metrics, Tracing (2 GPUs) key: metrics-tracing-2-gpus - timeout_in_minutes: 20 + timeout_in_minutes: 25 num_devices: 2 source_file_dependencies: - vllm/config/ @@ -281,7 +281,7 @@ steps: mirror: amd: device: mi325_1 - timeout_in_minutes: 20 + timeout_in_minutes: 45 depends_on: - image-build-amd source_file_dependencies: @@ -292,7 +292,7 @@ steps: - label: Async Engine, Inputs, Utils, Worker device: h200_35gb key: async-engine-inputs-utils-worker - timeout_in_minutes: 50 + timeout_in_minutes: 25 source_file_dependencies: - vllm/assets/ - vllm/config/ @@ -319,7 +319,7 @@ steps: key: async-engine-inputs-utils-worker-config-cpu depends_on: - image-build-cpu - timeout_in_minutes: 30 + timeout_in_minutes: 65 source_file_dependencies: - vllm/assets/ - vllm/config/ @@ -381,7 +381,7 @@ steps: - label: Batch Invariance (A100) key: batch-invariance-a100 - timeout_in_minutes: 30 + timeout_in_minutes: 40 device: a100 source_file_dependencies: - vllm/v1/attention @@ -395,7 +395,7 @@ steps: - label: Batch Invariance (H100) key: batch-invariance-h100 - timeout_in_minutes: 30 + timeout_in_minutes: 40 device: h100 source_file_dependencies: - vllm/v1/attention @@ -411,7 +411,7 @@ steps: - label: Batch Invariance (B200) key: batch-invariance-b200 - timeout_in_minutes: 30 + timeout_in_minutes: 35 device: b200-k8s source_file_dependencies: - vllm/v1/attention @@ -430,7 +430,7 @@ steps: - label: Acceptance Length Test (Large Models) # optional device: h200_35gb key: acceptance-length-test-large-models - timeout_in_minutes: 25 + timeout_in_minutes: 20 gpu: h100 optional: true num_gpus: 1 diff --git a/.buildkite/test_areas/model_executor.yaml b/.buildkite/test_areas/model_executor.yaml index aaf85b4f275..4280e600df4 100644 --- a/.buildkite/test_areas/model_executor.yaml +++ b/.buildkite/test_areas/model_executor.yaml @@ -4,7 +4,7 @@ depends_on: steps: - label: Model Executor key: model-executor - timeout_in_minutes: 35 + timeout_in_minutes: 45 source_file_dependencies: - vllm/engine/arg_utils.py - vllm/config/model.py diff --git a/.buildkite/test_areas/model_runner_v2.yaml b/.buildkite/test_areas/model_runner_v2.yaml index dbb35df80be..3601aeee117 100644 --- a/.buildkite/test_areas/model_runner_v2.yaml +++ b/.buildkite/test_areas/model_runner_v2.yaml @@ -5,7 +5,7 @@ steps: - label: Model Runner V2 Core Tests device: h200_35gb key: model-runner-v2-core-tests - timeout_in_minutes: 45 + timeout_in_minutes: 35 source_file_dependencies: - vllm/v1/worker/gpu/ - vllm/v1/worker/gpu_worker.py @@ -27,7 +27,7 @@ steps: - label: Model Runner V2 Examples device: h200_35gb key: model-runner-v2-examples - timeout_in_minutes: 45 + timeout_in_minutes: 35 working_dir: "/vllm-workspace/examples" source_file_dependencies: - vllm/v1/worker/gpu/ @@ -63,7 +63,7 @@ steps: - label: Model Runner V2 Distributed (2 GPUs) key: model-runner-v2-distributed-2-gpus - timeout_in_minutes: 45 + timeout_in_minutes: 30 working_dir: "/vllm-workspace/tests" num_devices: 2 source_file_dependencies: @@ -84,7 +84,7 @@ steps: - label: Model Runner V2 Pipeline Parallelism (4 GPUs) key: model-runner-v2-pipeline-parallelism-4-gpus - timeout_in_minutes: 60 + timeout_in_minutes: 50 working_dir: "/vllm-workspace/tests" num_devices: 4 source_file_dependencies: diff --git a/.buildkite/test_areas/models_basic.yaml b/.buildkite/test_areas/models_basic.yaml index 3a113f1982a..0fcd4f41048 100644 --- a/.buildkite/test_areas/models_basic.yaml +++ b/.buildkite/test_areas/models_basic.yaml @@ -4,7 +4,7 @@ depends_on: steps: - label: Basic Models Tests (Initialization) key: basic-models-tests-initialization - timeout_in_minutes: 45 + timeout_in_minutes: 25 device: h200_18gb source_file_dependencies: - vllm/ @@ -17,7 +17,7 @@ steps: - label: Basic Models Tests (Extra Initialization) %N device: h200_35gb key: basic-models-tests-extra-initialization - timeout_in_minutes: 45 + timeout_in_minutes: 100 source_file_dependencies: - vllm/model_executor/models/ - tests/models/test_initialization.py @@ -32,7 +32,7 @@ steps: - label: Basic Models Tests (Other) device: h200_35gb key: basic-models-tests-other - timeout_in_minutes: 45 + timeout_in_minutes: 35 source_file_dependencies: - vllm/ - tests/models/test_terratorch.py @@ -50,7 +50,7 @@ steps: key: basic-models-test-other-cpu depends_on: - image-build-cpu - timeout_in_minutes: 10 + timeout_in_minutes: 20 source_file_dependencies: - vllm/ - tests/models/test_utils.py diff --git a/.buildkite/test_areas/models_distributed.yaml b/.buildkite/test_areas/models_distributed.yaml index a3ee7666ed0..c1ec5eb00ae 100644 --- a/.buildkite/test_areas/models_distributed.yaml +++ b/.buildkite/test_areas/models_distributed.yaml @@ -4,7 +4,7 @@ depends_on: steps: - label: Distributed Model Tests (2 GPUs) key: distributed-model-tests-2-gpus - timeout_in_minutes: 50 + timeout_in_minutes: 60 working_dir: "/vllm-workspace/tests" num_devices: 2 source_file_dependencies: diff --git a/.buildkite/test_areas/models_language.yaml b/.buildkite/test_areas/models_language.yaml index 2c163bc8049..d89d3fabaec 100644 --- a/.buildkite/test_areas/models_language.yaml +++ b/.buildkite/test_areas/models_language.yaml @@ -4,7 +4,7 @@ depends_on: steps: - label: Language Models Tests (Standard) key: language-models-tests-standard - timeout_in_minutes: 25 + timeout_in_minutes: 30 device: h200_18gb source_file_dependencies: - vllm/ @@ -21,7 +21,7 @@ steps: - label: Language Models Tests (Extra Standard) %N key: language-models-tests-extra-standard - timeout_in_minutes: 45 + timeout_in_minutes: 40 source_file_dependencies: - vllm/model_executor/models/ - tests/models/language/pooling/test_embedding.py @@ -52,7 +52,7 @@ steps: - label: Language Models Tests (Hybrid) %N key: language-models-tests-hybrid - timeout_in_minutes: 75 + timeout_in_minutes: 65 source_file_dependencies: - vllm/ - tests/models/language/generation @@ -67,7 +67,7 @@ steps: mirror: amd: device: mi325_1 - timeout_in_minutes: 90 + timeout_in_minutes: 70 depends_on: - image-build-amd commands: @@ -78,7 +78,7 @@ steps: - label: Language Models Test (Extended Generation) # 80min device: h200_35gb key: language-models-test-extended-generation - timeout_in_minutes: 110 + timeout_in_minutes: 65 optional: true source_file_dependencies: - vllm/ @@ -92,7 +92,7 @@ steps: - label: Language Models Test (PPL) key: language-models-test-ppl - timeout_in_minutes: 110 + timeout_in_minutes: 30 device: h200_18gb optional: true source_file_dependencies: @@ -104,7 +104,7 @@ steps: - label: Language Models Test (Extended Pooling) # 36min device: h200_35gb key: language-models-test-extended-pooling - timeout_in_minutes: 50 + timeout_in_minutes: 70 optional: true source_file_dependencies: - vllm/ @@ -120,7 +120,7 @@ steps: - label: Language Models Test (MTEB) key: language-models-test-mteb - timeout_in_minutes: 110 + timeout_in_minutes: 45 device: h200_18gb optional: true source_file_dependencies: diff --git a/.buildkite/test_areas/models_multimodal.yaml b/.buildkite/test_areas/models_multimodal.yaml index a721efa6067..6720483c25f 100644 --- a/.buildkite/test_areas/models_multimodal.yaml +++ b/.buildkite/test_areas/models_multimodal.yaml @@ -20,7 +20,7 @@ steps: - label: "Multi-Modal Models (Standard) 2: qwen3 + gemma" key: multi-modal-models-standard-2-qwen3-gemma - timeout_in_minutes: 45 + timeout_in_minutes: 50 device: h200_18gb source_file_dependencies: - vllm/ @@ -38,7 +38,7 @@ steps: - label: "Multi-Modal Models (Standard) 3: llava + qwen2_vl" device: h200_35gb key: multi-modal-models-standard-3-llava-qwen2-vl - timeout_in_minutes: 45 + timeout_in_minutes: 40 source_file_dependencies: - vllm/ - tests/models/multimodal @@ -54,7 +54,7 @@ steps: - label: "Multi-Modal Models (Standard) 4: other + whisper" device: h200_35gb key: multi-modal-models-standard-4-other-whisper - timeout_in_minutes: 45 + timeout_in_minutes: 50 source_file_dependencies: - vllm/ - tests/models/multimodal @@ -73,7 +73,7 @@ steps: key: multi-modal-processor-cpu depends_on: - image-build-cpu - timeout_in_minutes: 60 + timeout_in_minutes: 125 source_file_dependencies: - vllm/ - tests/models/multimodal @@ -84,7 +84,7 @@ steps: - label: Multi-Modal Processor # 44min key: multi-modal-processor - timeout_in_minutes: 60 + timeout_in_minutes: 65 device: h200_18gb source_file_dependencies: - vllm/ @@ -96,7 +96,7 @@ steps: - label: Multi-Modal Accuracy Eval (Small Models) # 50min device: h200_35gb key: multi-modal-accuracy-eval-small-models - timeout_in_minutes: 70 + timeout_in_minutes: 30 working_dir: "/vllm-workspace/.buildkite/lm-eval-harness" source_file_dependencies: - vllm/multimodal/ @@ -164,7 +164,7 @@ steps: mirror: amd: device: mi325_1 - timeout_in_minutes: 60 + timeout_in_minutes: 75 depends_on: - image-build-amd source_file_dependencies: diff --git a/.buildkite/test_areas/plugins.yaml b/.buildkite/test_areas/plugins.yaml index 5effe17513d..e0bb67b1bb4 100644 --- a/.buildkite/test_areas/plugins.yaml +++ b/.buildkite/test_areas/plugins.yaml @@ -4,7 +4,7 @@ depends_on: steps: - label: Plugin Tests (2 GPUs) key: plugin-tests-2-gpus - timeout_in_minutes: 60 + timeout_in_minutes: 35 working_dir: "/vllm-workspace/tests" num_devices: 2 source_file_dependencies: diff --git a/.buildkite/test_areas/pytorch.yaml b/.buildkite/test_areas/pytorch.yaml index 5c3060582aa..72cb0069664 100644 --- a/.buildkite/test_areas/pytorch.yaml +++ b/.buildkite/test_areas/pytorch.yaml @@ -5,7 +5,7 @@ steps: - label: PyTorch Compilation Unit Tests device: h200_35gb key: pytorch-compilation-unit-tests - timeout_in_minutes: 10 + timeout_in_minutes: 90 source_file_dependencies: - vllm/__init__.py - vllm/_aiter_ops.py @@ -78,7 +78,7 @@ steps: - label: PyTorch Compilation Passes Unit Tests key: pytorch-compilation-passes-unit-tests - timeout_in_minutes: 20 + timeout_in_minutes: 45 source_file_dependencies: - vllm/__init__.py - vllm/_aiter_ops.py @@ -110,13 +110,13 @@ steps: mirror: amd: device: mi300_1 - timeout_in_minutes: 180 + timeout_in_minutes: 65 depends_on: - image-build-amd - label: PyTorch Fullgraph Smoke Test key: pytorch-fullgraph-smoke-test - timeout_in_minutes: 35 + timeout_in_minutes: 60 source_file_dependencies: - vllm/__init__.py - vllm/_aiter_ops.py @@ -152,7 +152,7 @@ steps: - label: PyTorch Fullgraph key: pytorch-fullgraph - timeout_in_minutes: 30 + timeout_in_minutes: 40 device: h200_18gb source_file_dependencies: - vllm/__init__.py diff --git a/.buildkite/test_areas/quantization.yaml b/.buildkite/test_areas/quantization.yaml index a92ee24f4aa..ce3e58e501b 100644 --- a/.buildkite/test_areas/quantization.yaml +++ b/.buildkite/test_areas/quantization.yaml @@ -4,7 +4,7 @@ depends_on: steps: - label: Quantization key: quantization - timeout_in_minutes: 90 + timeout_in_minutes: 60 source_file_dependencies: - csrc/ - vllm/model_executor/layers/quantization @@ -23,7 +23,7 @@ steps: - label: Quantized Fusions key: quantized-fusions - timeout_in_minutes: 30 + timeout_in_minutes: 20 source_file_dependencies: - tests/fusion - vllm/model_executor/layers/fusion @@ -35,7 +35,7 @@ steps: - label: Quantized MoE Test (B200) key: quantized-moe-test-b200 - timeout_in_minutes: 60 + timeout_in_minutes: 120 working_dir: "/vllm-workspace/" device: b200-k8s source_file_dependencies: @@ -53,7 +53,7 @@ steps: - label: Quantized Models Test key: quantized-models-test - timeout_in_minutes: 60 + timeout_in_minutes: 50 source_file_dependencies: - vllm/model_executor/layers/quantization - tests/models/quantization diff --git a/.buildkite/test_areas/rust_frontend.yaml b/.buildkite/test_areas/rust_frontend.yaml index 1dfe912aa89..9e5e09c3ec3 100644 --- a/.buildkite/test_areas/rust_frontend.yaml +++ b/.buildkite/test_areas/rust_frontend.yaml @@ -3,7 +3,7 @@ depends_on: - image-build steps: - label: Rust Frontend OpenAI Coverage - timeout_in_minutes: 90 + timeout_in_minutes: 30 device: h200_18gb working_dir: "/vllm-workspace/tests" source_file_dependencies: @@ -38,7 +38,7 @@ steps: - pytest -v -s v1/sample/test_logprobs_e2e.py -k "test_prompt_logprobs_e2e_server" - label: Rust Frontend Serve/Admin Coverage - timeout_in_minutes: 60 + timeout_in_minutes: 25 device: h200_18gb working_dir: "/vllm-workspace/tests" source_file_dependencies: @@ -67,7 +67,7 @@ steps: - pytest -v -s entrypoints/serve/tokenize/test_tokenization.py -k "not tokenizer_info" - label: Rust Frontend Core Correctness - timeout_in_minutes: 30 + timeout_in_minutes: 20 device: h200_18gb working_dir: "/vllm-workspace/tests" source_file_dependencies: @@ -81,7 +81,7 @@ steps: - pytest -s entrypoints/openai/correctness/test_lmeval.py::test_lm_eval_accuracy_v1_engine - label: Rust Frontend Tool Use - timeout_in_minutes: 60 + timeout_in_minutes: 25 working_dir: "/vllm-workspace/tests" source_file_dependencies: - rust/ @@ -95,7 +95,7 @@ steps: - pytest -v -s tool_use --ignore=tool_use/mistral --models llama3.2 -k "not test_response_format_with_tool_choice_required and not test_parallel_tool_calls_false and not test_tool_call_and_choice" - label: Rust Frontend Distributed - timeout_in_minutes: 30 + timeout_in_minutes: 25 num_devices: 4 working_dir: "/vllm-workspace/tests" source_file_dependencies: diff --git a/.buildkite/test_areas/rust_frontend_cargo.yaml b/.buildkite/test_areas/rust_frontend_cargo.yaml index 06f9eb9c245..21d4c2ac219 100644 --- a/.buildkite/test_areas/rust_frontend_cargo.yaml +++ b/.buildkite/test_areas/rust_frontend_cargo.yaml @@ -4,7 +4,7 @@ steps: - label: Rust Frontend Cargo Style + Clippy key: rust-frontend-cargo-style-clippy depends_on: [] - timeout_in_minutes: 30 + timeout_in_minutes: 20 device: cpu-medium no_plugin: true source_file_dependencies: @@ -18,7 +18,7 @@ steps: - label: Rust Frontend Cargo Tests key: rust-frontend-cargo-tests depends_on: [] - timeout_in_minutes: 30 + timeout_in_minutes: 20 device: cpu-medium no_plugin: true source_file_dependencies: diff --git a/.buildkite/test_areas/samplers.yaml b/.buildkite/test_areas/samplers.yaml index 5abc1688943..2e7cd4a623e 100644 --- a/.buildkite/test_areas/samplers.yaml +++ b/.buildkite/test_areas/samplers.yaml @@ -5,7 +5,7 @@ steps: - label: Samplers Test device: h200_35gb key: samplers-test - timeout_in_minutes: 75 + timeout_in_minutes: 40 source_file_dependencies: - vllm/model_executor/layers - vllm/sampling_metadata.py diff --git a/.buildkite/test_areas/spec_decode.yaml b/.buildkite/test_areas/spec_decode.yaml index 671638f6f64..096c324bb8e 100644 --- a/.buildkite/test_areas/spec_decode.yaml +++ b/.buildkite/test_areas/spec_decode.yaml @@ -4,7 +4,7 @@ depends_on: steps: - label: Spec Decode Eagle key: spec-decode-eagle - timeout_in_minutes: 30 + timeout_in_minutes: 25 device: h200_18gb source_file_dependencies: - vllm/v1/spec_decode/ @@ -15,7 +15,7 @@ steps: mirror: amd: device: mi325_1 - timeout_in_minutes: 45 + timeout_in_minutes: 60 depends_on: - image-build-amd source_file_dependencies: @@ -29,7 +29,7 @@ steps: - label: Spec Decode Eagle Nightly B200 key: spec-decode-eagle-nightly-b200 - timeout_in_minutes: 30 + timeout_in_minutes: 25 device: b200-k8s optional: true source_file_dependencies: @@ -41,7 +41,7 @@ steps: - label: Spec Decode Speculators + MTP key: spec-decode-speculators-mtp - timeout_in_minutes: 30 + timeout_in_minutes: 20 device: h200_18gb source_file_dependencies: - vllm/v1/spec_decode/ @@ -82,7 +82,7 @@ steps: - label: Spec Decode Ngram + Suffix key: spec-decode-ngram-suffix - timeout_in_minutes: 30 + timeout_in_minutes: 20 device: h200_18gb source_file_dependencies: - vllm/v1/spec_decode/ @@ -93,7 +93,7 @@ steps: mirror: amd: device: mi325_1 - timeout_in_minutes: 65 + timeout_in_minutes: 55 # TODO(akaratza): Test after Torch >= 2.12 bump soft_fail: true depends_on: @@ -109,7 +109,7 @@ steps: - label: Spec Decode Draft Model key: spec-decode-draft-model - timeout_in_minutes: 30 + timeout_in_minutes: 45 device: h200_18gb source_file_dependencies: - vllm/v1/spec_decode/ @@ -120,7 +120,7 @@ steps: mirror: amd: device: mi325_1 - timeout_in_minutes: 50 + timeout_in_minutes: 55 depends_on: - image-build-amd source_file_dependencies: @@ -134,7 +134,7 @@ steps: - label: Spec Decode Draft Model Nightly B200 key: spec-decode-draft-model-nightly-b200 - timeout_in_minutes: 30 + timeout_in_minutes: 40 device: b200-k8s optional: true source_file_dependencies: @@ -146,7 +146,7 @@ steps: - label: Speculators Correctness key: speculators-correctness - timeout_in_minutes: 60 + timeout_in_minutes: 30 device: h100 optional: true num_devices: 1 @@ -159,7 +159,7 @@ steps: - pytest -v -s v1/spec_decode/test_speculators_correctness.py -m slow_test - label: Spec Decode MTP hybrid (B200) - timeout_in_minutes: 30 + timeout_in_minutes: 20 device: b200-k8s optional: true source_file_dependencies: diff --git a/.buildkite/test_areas/weight_loading.yaml b/.buildkite/test_areas/weight_loading.yaml index 9d7bd0bce91..eeb24a49d8d 100644 --- a/.buildkite/test_areas/weight_loading.yaml +++ b/.buildkite/test_areas/weight_loading.yaml @@ -4,7 +4,7 @@ depends_on: steps: - label: Weight Loading Multiple GPU # 33min key: weight-loading-multiple-gpu - timeout_in_minutes: 45 + timeout_in_minutes: 50 working_dir: "/vllm-workspace/tests" num_devices: 2 optional: true