Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
7 changes: 5 additions & 2 deletions docker/Dockerfile.torch280.vllm.AMD
Original file line number Diff line number Diff line change
Expand Up @@ -26,5 +26,8 @@ WORKDIR /app/ROLL
RUN pip3 install ./mcore_adapter \
&& export PYTHONPATH=/app/ROLL:$PYTHONPATH

RUN sed -i 's/_flash_attn_max_version = PkgVersion("2\.7\.3")/_flash_attn_max_version = PkgVersion("3.0.0.post1")/' /opt/conda/envs/py_3.10/lib/python3.10/site-packages/transformer_engine/pytorch/attention.py

RUN sed -i 's/_flash_attn_max_version = PkgVersion("2\.7\.3")/_flash_attn_max_version = PkgVersion("3.0.0.post1")/' /opt/conda/envs/py_3.10/lib/python3.10/site-packages/transformer_engine/pytorch/attention.py \
&& sed -i -e '/^[[:space:]]*if envs.VLLM_USE_STANDALONE_COMPILE and is_torch_equal_or_newer(/ {' -e 'N' -e 's/^\([[:space:]]*\).*\n.*/\1if False:/' -e '}' /opt/conda/envs/py_3.10/lib/python3.10/site-packages/vllm/compilation/backends.py \
&& sed -i \
-e '/^[[:space:]]*if cuda_val := os.environ.get(CUDA_VISIBLE_DEVICES_ENV_VAR, None) is not None:/ s/^\([[:space:]]*if \)cuda_val := os.environ.get(CUDA_VISIBLE_DEVICES_ENV_VAR, None) is not None:/\1(cuda_val := os.environ.get(CUDA_VISIBLE_DEVICES_ENV_VAR, None)) is not None:/' \
-e '/^[[:space:]]*if hip_val := os.environ.get(HIP_VISIBLE_DEVICES_ENV_VAR, None) is None:/ s/^\([[:space:]]*if \)hip_val:= os.environ.get(HIP_VISIBLE_DEVICES_ENV_VAR, None) is None:/\1(hip_val := os.environ.get(HIP_VISIBLE_DEVICES_ENV_VAR, None)) is None:/' /opt/conda/envs/py_3.10/lib/python3.10/site-packages/ray/_private/accelerators/amd_gpu.py
1 change: 0 additions & 1 deletion roll/third_party/vllm/vllm_0_10_0/llm.py
Original file line number Diff line number Diff line change
Expand Up @@ -168,7 +168,6 @@ def add_requests(
preprocessed_inputs = input_preprocessor.preprocess(
prompt={"prompt_token_ids": token_ids, "multi_modal_data": multi_modal_data[i]},
lora_request=lora_request,
prompt_adapter_request=None,
)
# in v1, engine does not use a input_processor
processed_inputs = (
Expand Down
6 changes: 0 additions & 6 deletions roll/third_party/vllm/vllm_0_10_0/v1/llm_engine.py
Original file line number Diff line number Diff line change
Expand Up @@ -17,7 +17,6 @@
from vllm.multimodal.inputs import PlaceholderRange
from vllm.multimodal.utils import merge_and_sort_multimodal_metadata
from vllm.pooling_params import PoolingParams
from vllm.prompt_adapter.request import PromptAdapterRequest
from vllm.sampling_params import SamplingParams, RequestOutputKind
from vllm.v1.engine import EngineCoreRequest
from vllm.v1.engine import EngineCoreOutputs
Expand All @@ -37,7 +36,6 @@ def custom_process_inputs(
arrival_time: Optional[float] = None,
lora_request: Optional[LoRARequest] = None,
trace_headers: Optional[Mapping[str, str]] = None,
prompt_adapter_request: Optional[PromptAdapterRequest] = None,
priority: int = 0,
) -> EngineCoreRequest:

Expand All @@ -47,8 +45,6 @@ def custom_process_inputs(
raise ValueError("V1 does not support priority yet.")
if trace_headers is not None:
raise ValueError("V1 does not support tracing yet.")
if prompt_adapter_request is not None:
raise ValueError("V1 does not support prompt_adapter_request.")

assert arrival_time is not None

Expand Down Expand Up @@ -195,7 +191,6 @@ def _add_processed_request(
params: Union[SamplingParams, PoolingParams],
arrival_time: float,
lora_request: Optional[LoRARequest],
prompt_adapter_request: Optional[PromptAdapterRequest],
trace_headers: Optional[Mapping[str, str]] = None,
priority: int = 0,
) -> None:
Expand All @@ -205,7 +200,6 @@ def _add_processed_request(
prompt_str, request = self.processor.custom_process_inputs(request_id, processed_inputs, params,
arrival_time, lora_request,
trace_headers,
prompt_adapter_request,
priority)

n = params.n if isinstance(params, SamplingParams) else 1
Expand Down