CLI commands for LLM Track evaluation.
python scripts/generate_kernel_and_verify.py \
--op-name aten::add \
--single-test \
--server-type openai \
--model-name gpt-4o \
--max-rounds 3python scripts/generate_kernel_and_verify.py \
--server-type openai \
--model-name gpt-4o \
--max-rounds 10python scripts/generate_kernel_and_verify.py \
--dataset KernelGenBench \
--server-type openai \
--model-name gpt-4opython scripts/generate_kernel_and_verify.py \
--dataset KernelGenBench-aten \
--server-type openai \
--model-name gpt-4o# vLLM operators only
python scripts/generate_kernel_and_verify.py \
--dataset KernelGenBench-vllm \
--server-type openai
# cuBLAS operators only
python scripts/generate_kernel_and_verify.py \
--dataset KernelGenBench-cublas \
--server-type openaipython scripts/generate_kernel_and_verify.py \
--api-format openai \
--model-name gpt-4opython scripts/generate_kernel_and_verify.py \
--api-format anthropic \
--model-name claude-opus-4-6No provider registration is required. Select the endpoint's wire protocol and pass its URL, key, and model directly:
python scripts/generate_kernel_and_verify.py \
--api-format <openai|anthropic> \
--model-name <model-name> \
--base-url <api-endpoint> \
--api-key <your-api-key>The same values can be provided with OPENAI_BASE_URL /
OPENAI_API_KEY or ANTHROPIC_BASE_URL / ANTHROPIC_API_KEY.
Enable feedback from previous rounds:
python scripts/generate_kernel_and_verify.py \
--server-type openai \
--model-name gpt-4o \
--reflectionpython scripts/generate_kernel_and_verify.py \
--resume-from output/pass_at_k/previous_run/Test with only 8 operators:
python scripts/generate_kernel_and_verify.py \
--debug \
--server-type openai