|
| 1 | +benchmark: |
| 2 | + name: "logos_test" |
| 3 | + version: "1.0.0" |
| 4 | + runs: 1 |
| 5 | + |
| 6 | +evaluators: |
| 7 | + qwen38_27b: |
| 8 | + provider: "openai_compatible" |
| 9 | + model: "Qwen/Qwen3.8-27B" |
| 10 | + base_url: "https://logos.aet.cit.tum.de/v1" |
| 11 | + temperature: 1.0 |
| 12 | + max_tokens: 2000 |
| 13 | + qwen36_35b: |
| 14 | + provider: "openai_compatible" |
| 15 | + model: "Qwen/Qwen3.6-35B-A3B" |
| 16 | + base_url: "https://logos.aet.cit.tum.de/v1" |
| 17 | + temperature: 1.0 |
| 18 | + max_tokens: 2000 |
| 19 | + llama33_70b: |
| 20 | + provider: "openai_compatible" |
| 21 | + model: "RedHatAI/Llama-3.3-70B-Instruct-quantized.w4a16" |
| 22 | + base_url: "https://logos.aet.cit.tum.de/v1" |
| 23 | + temperature: 1.0 |
| 24 | + max_tokens: 2000 |
| 25 | + gptoss120b: |
| 26 | + provider: "openai_compatible" |
| 27 | + model: "openai/gpt-oss-120b" |
| 28 | + base_url: "https://logos.aet.cit.tum.de/v1" |
| 29 | + temperature: 1.0 |
| 30 | + max_tokens: 8000 |
| 31 | + gemma3_12b: |
| 32 | + provider: "openai_compatible" |
| 33 | + model: "google/gemma-3-12b-it" |
| 34 | + base_url: "https://logos.aet.cit.tum.de/v1" |
| 35 | + temperature: 1.0 |
| 36 | + max_tokens: 2000 |
| 37 | + gemma3_4b: |
| 38 | + provider: "openai_compatible" |
| 39 | + model: "google/gemma-3-4b-it" |
| 40 | + base_url: "https://logos.aet.cit.tum.de/v1" |
| 41 | + temperature: 1.0 |
| 42 | + max_tokens: 2000 |
| 43 | + llama31_8b: |
| 44 | + provider: "openai_compatible" |
| 45 | + model: "meta-llama/Llama-3.1-8B-Instruct" |
| 46 | + base_url: "https://logos.aet.cit.tum.de/v1" |
| 47 | + temperature: 1.0 |
| 48 | + max_tokens: 2000 |
| 49 | + phi4reason: |
| 50 | + provider: "openai_compatible" |
| 51 | + model: "microsoft/Phi-4-reasoning" |
| 52 | + base_url: "https://logos.aet.cit.tum.de/v1" |
| 53 | + temperature: 1.0 |
| 54 | + max_tokens: 8000 |
| 55 | + |
| 56 | +metrics: |
| 57 | + - name: "accuracy" |
| 58 | + version: "1.1" |
| 59 | + evaluators: ["qwen38_27b", "qwen36_35b", "llama33_70b", "gptoss120b", "gemma3_12b", "gemma3_4b", "llama31_8b", "phi4reason"] |
| 60 | + enabled: true |
| 61 | + - name: "answer_key_correctness" |
| 62 | + version: "1.0" |
| 63 | + evaluators: ["qwen38_27b", "qwen36_35b", "llama33_70b", "gptoss120b", "gemma3_12b", "gemma3_4b", "llama31_8b", "phi4reason"] |
| 64 | + enabled: true |
| 65 | + - name: "objective_alignment" |
| 66 | + version: "1.0" |
| 67 | + evaluators: ["qwen38_27b", "qwen36_35b", "llama33_70b", "gptoss120b", "gemma3_12b", "gemma3_4b", "llama31_8b", "phi4reason"] |
| 68 | + enabled: true |
| 69 | + - name: "cognitive_level" |
| 70 | + version: "1.0" |
| 71 | + evaluators: ["qwen38_27b", "qwen36_35b", "llama33_70b", "gptoss120b", "gemma3_12b", "gemma3_4b", "llama31_8b", "phi4reason"] |
| 72 | + enabled: true |
| 73 | + - name: "clarity" |
| 74 | + version: "2.0" |
| 75 | + evaluators: ["qwen38_27b", "qwen36_35b", "llama33_70b", "gptoss120b", "gemma3_12b", "gemma3_4b", "llama31_8b", "phi4reason"] |
| 76 | + enabled: true |
| 77 | + - name: "distractor_quality" |
| 78 | + version: "2.0" |
| 79 | + evaluators: ["qwen38_27b", "qwen36_35b", "llama33_70b", "gptoss120b", "gemma3_12b", "gemma3_4b", "llama31_8b", "phi4reason"] |
| 80 | + enabled: true |
| 81 | + - name: "homogeneous_options" |
| 82 | + version: "2.0" |
| 83 | + evaluators: ["qwen38_27b", "qwen36_35b", "llama33_70b", "gptoss120b", "gemma3_12b", "gemma3_4b", "llama31_8b", "phi4reason"] |
| 84 | + enabled: true |
| 85 | + - name: "absence_of_cueing" |
| 86 | + version: "1.0" |
| 87 | + evaluators: ["qwen38_27b", "qwen36_35b", "llama33_70b", "gptoss120b", "gemma3_12b", "gemma3_4b", "llama31_8b", "phi4reason"] |
| 88 | + enabled: true |
| 89 | + - name: "grammatical_correctness" |
| 90 | + version: "2.0" |
| 91 | + evaluators: ["qwen38_27b", "qwen36_35b", "llama33_70b", "gptoss120b", "gemma3_12b", "gemma3_4b", "llama31_8b", "phi4reason"] |
| 92 | + enabled: true |
| 93 | + |
| 94 | +inputs: |
| 95 | + quiz_directory: "data/quizzes/example_quiz.json" |
| 96 | + source_directory: "data/inputs" |
| 97 | + instructions_directory: "data/instructions" |
| 98 | + |
| 99 | +outputs: |
| 100 | + results_directory: "data/results/logos_test" |
| 101 | + aggregate: true |
0 commit comments