|
| 1 | +#!/bin/bash |
| 2 | +# slot_mapping ON + mm_ar_rmsnorm ON (35B-A3B, gpu4-7) |
| 3 | +# mm fusion threshold: M > 512 (VLLM_FL_MM_AR_RMSNORM_MIN_TOKENS). |
| 4 | +# Rationale: decode steps have M <= concurrency (64) and must NOT fuse |
| 5 | +# (the extra add_out all-gather cancels the win at small M); prefill chunks |
| 6 | +# (up to 2048) fuse only above 512, same as the tuned npugraph_ex pass. |
| 7 | + |
| 8 | +export VLLM_FL_USE_ACLNN_CHUNK_GDN=1 |
| 9 | +# features: slot_mapping ON, conv1d_prepack OFF, mm_ar_rmsnorm ON |
| 10 | +export VLLM_FL_DISABLE_CONV1D_PREPACK=1 |
| 11 | +export VLLM_FL_ENABLE_MM_AR_RMSNORM=1 |
| 12 | +export VLLM_FL_DISABLE_NPU_SLOT_MAPPING=0 |
| 13 | +export VLLM_FL_MM_AR_RMSNORM_MIN_TOKENS=512 |
| 14 | + |
| 15 | +echo "==========================================" |
| 16 | +echo " slot_mapping ON + mm_ar_rmsnorm ON (35B-A3B)" |
| 17 | +echo "==========================================" |
| 18 | +echo "VLLM_FL_DISABLE_CONV1D_PREPACK=${VLLM_FL_DISABLE_CONV1D_PREPACK}" |
| 19 | +echo "VLLM_FL_ENABLE_MM_AR_RMSNORM=${VLLM_FL_ENABLE_MM_AR_RMSNORM}" |
| 20 | +echo "VLLM_FL_DISABLE_NPU_SLOT_MAPPING=${VLLM_FL_DISABLE_NPU_SLOT_MAPPING}" |
| 21 | +echo "VLLM_FL_MM_AR_RMSNORM_MIN_TOKENS=${VLLM_FL_MM_AR_RMSNORM_MIN_TOKENS}" |
| 22 | +echo "" |
| 23 | + |
| 24 | +/workspace/scripts/run_vllm_fl_profile_unified.sh \ |
| 25 | + --model-path /models/Qwen3.6-35B-A3B \ |
| 26 | + --model-name qwen3.6 \ |
| 27 | + --model-tag qwen3.6-35b-a3b \ |
| 28 | + --mode graph \ |
| 29 | + --cudagraph-mode FULL \ |
| 30 | + --cases "1024,1024,256;4096,1024,256;16384,1024,256;65536,1024,256" \ |
| 31 | + --concurrency 64 \ |
| 32 | + --max-num-seqs 64 \ |
| 33 | + --max-model-len 131072 \ |
| 34 | + --tp 4 \ |
| 35 | + --gmem 0.9 \ |
| 36 | + --devices 4,5,6,7 \ |
| 37 | + --port 8123 \ |
| 38 | + --no-bench-profile \ |
| 39 | + --skip-analyse \ |
| 40 | + --package none \ |
| 41 | + --run-label slot_mmar_on_c64_4case_i1k_4k_16k_64k_graph_noprof |
0 commit comments