|
1 | 1 | { |
2 | 2 | "schemaVersion": 2, |
3 | 3 | "formula": "agi-readiness-v2", |
4 | | - "updatedAt": "2026-07-16T05:14:47.391Z", |
5 | | - "agiReadiness": 75.6, |
6 | | - "agiDistance": 24.4, |
| 4 | + "updatedAt": "2026-07-17T05:17:41.505Z", |
| 5 | + "agiReadiness": 76.1, |
| 6 | + "agiDistance": 23.9, |
7 | 7 | "bottleneckDimension": { |
8 | 8 | "id": "agentsAutonomy", |
9 | 9 | "name": "Agents + Autonomy", |
10 | | - "score": 59.1, |
11 | | - "distance": 40.9 |
| 10 | + "score": 59.8, |
| 11 | + "distance": 40.2 |
12 | 12 | }, |
13 | 13 | "eta": { |
14 | 14 | "status": "collecting_baseline", |
|
40 | 40 | "name": "Agents + Autonomy", |
41 | 41 | "weight": 0.3, |
42 | 42 | "description": "Computer use, long-horizon professional workflows, planning, and applied office/finance tasks.", |
43 | | - "score": 59.1, |
44 | | - "distance": 40.9, |
| 43 | + "score": 59.8, |
| 44 | + "distance": 40.2, |
45 | 45 | "benchmarkCount": 6 |
46 | 46 | }, |
47 | 47 | { |
48 | 48 | "id": "toolSearchReliability", |
49 | 49 | "name": "Tool Use + Search Reliability", |
50 | 50 | "weight": 0.15, |
51 | 51 | "description": "Tool calling, web/search persistence, user-policy following, and repeated agent reliability proxies.", |
52 | | - "score": 81.6, |
53 | | - "distance": 18.4, |
| 52 | + "score": 83.6, |
| 53 | + "distance": 16.4, |
54 | 54 | "benchmarkCount": 8 |
55 | 55 | } |
56 | 56 | ], |
|
80 | 80 | "scoreRaw": 0.647, |
81 | 81 | "modelName": "Claude Mythos Preview", |
82 | 82 | "modelId": "claude-mythos-preview", |
83 | | - "totalModels": 88, |
| 83 | + "totalModels": 89, |
84 | 84 | "trend": "flat", |
85 | 85 | "source": "llm-stats:humanity's-last-exam", |
86 | 86 | "description": "2,500 expert-vetted multimodal questions across math, science, humanities, and vision." |
|
95 | 95 | "scoreRaw": 0.946, |
96 | 96 | "modelName": "GPT-5.6 Sol", |
97 | 97 | "modelId": "gpt-5.6-sol", |
98 | | - "totalModels": 231, |
| 98 | + "totalModels": 232, |
99 | 99 | "trend": "flat", |
100 | 100 | "source": "llm-stats:gpqa", |
101 | 101 | "description": "PhD-level questions in biology, chemistry, and physics." |
|
126 | 126 | "modelName": "GPT-5.6 Sol", |
127 | 127 | "modelId": "gpt-5.6-sol", |
128 | 128 | "totalModels": 17, |
129 | | - "trend": "up", |
| 129 | + "trend": "flat", |
130 | 130 | "source": "llm-stats:frontiermath", |
131 | 131 | "description": "Advanced unpublished mathematical problems authored and reviewed by expert mathematicians." |
132 | 132 | }, |
|
200 | 200 | "scoreRaw": 0.888, |
201 | 201 | "modelName": "GPT-5.6 Sol", |
202 | 202 | "modelId": "gpt-5.6-sol", |
203 | | - "totalModels": 11, |
| 203 | + "totalModels": 12, |
204 | 204 | "trend": "flat", |
205 | 205 | "source": "llm-stats:terminal-bench-2.1", |
206 | 206 | "description": "Updated terminal-agent benchmark for autonomous command-line execution." |
|
226 | 226 | "name": "APEX-Agents", |
227 | 227 | "category": "Long-Horizon Agents", |
228 | 228 | "dimension": "agentsAutonomy", |
229 | | - "score": 33.8, |
230 | | - "scoreRaw": 0.338, |
231 | | - "modelName": "Seed 2.1 Pro", |
232 | | - "modelId": "seed-2.1-pro", |
233 | | - "totalModels": 6, |
234 | | - "trend": "flat", |
| 229 | + "score": 37.6, |
| 230 | + "scoreRaw": 0.376, |
| 231 | + "modelName": "Kimi K3", |
| 232 | + "modelId": "kimi-k3", |
| 233 | + "totalModels": 7, |
| 234 | + "trend": "up", |
235 | 235 | "source": "llm-stats:apex-agents", |
236 | 236 | "description": "Long-horizon professional tasks requiring sustained planning and execution." |
237 | 237 | }, |
|
275 | 275 | "scoreRaw": 0.722, |
276 | 276 | "modelName": "Seed 2.1 Pro", |
277 | 277 | "modelId": "seed-2.1-pro", |
278 | | - "totalModels": 6, |
| 278 | + "totalModels": 7, |
279 | 279 | "trend": "flat", |
280 | 280 | "source": "llm-stats:officeqa-pro", |
281 | 281 | "description": "Professional knowledge-work tasks involving documents, spreadsheets, and office workflows." |
|
346 | 346 | "name": "MCP Atlas", |
347 | 347 | "category": "Tool Use", |
348 | 348 | "dimension": "toolSearchReliability", |
349 | | - "score": 83.8, |
350 | | - "scoreRaw": 0.838, |
351 | | - "modelName": "Seed 2.1 Pro", |
352 | | - "modelId": "seed-2.1-pro", |
353 | | - "totalModels": 28, |
354 | | - "trend": "flat", |
| 349 | + "score": 84.2, |
| 350 | + "scoreRaw": 0.842, |
| 351 | + "modelName": "Kimi K3", |
| 352 | + "modelId": "kimi-k3", |
| 353 | + "totalModels": 29, |
| 354 | + "trend": "up", |
355 | 355 | "source": "llm-stats:mcp-atlas", |
356 | 356 | "description": "Scaled tool coordination across complex multi-step tool-use tasks." |
357 | 357 | }, |
|
361 | 361 | "name": "Toolathlon", |
362 | 362 | "category": "Tool Use", |
363 | 363 | "dimension": "toolSearchReliability", |
364 | | - "score": 59.9, |
365 | | - "scoreRaw": 0.599, |
366 | | - "modelName": "Claude Opus 4.8", |
367 | | - "modelId": "claude-opus-4-8", |
368 | | - "totalModels": 28, |
369 | | - "trend": "flat", |
| 364 | + "score": 73.2, |
| 365 | + "scoreRaw": 0.732, |
| 366 | + "modelName": "Kimi K3", |
| 367 | + "modelId": "kimi-k3", |
| 368 | + "totalModels": 29, |
| 369 | + "trend": "up", |
370 | 370 | "source": "llm-stats:toolathlon", |
371 | 371 | "description": "Multi-tool proficiency across diverse tool-use categories." |
372 | 372 | }, |
|
376 | 376 | "name": "BrowseComp", |
377 | 377 | "category": "Search", |
378 | 378 | "dimension": "toolSearchReliability", |
379 | | - "score": 90.4, |
380 | | - "scoreRaw": 0.904, |
381 | | - "modelName": "GPT-5.6 Sol", |
382 | | - "modelId": "gpt-5.6-sol", |
383 | | - "totalModels": 56, |
384 | | - "trend": "flat", |
| 379 | + "score": 91.2, |
| 380 | + "scoreRaw": 0.912, |
| 381 | + "modelName": "Kimi K3", |
| 382 | + "modelId": "kimi-k3", |
| 383 | + "totalModels": 57, |
| 384 | + "trend": "up", |
385 | 385 | "source": "llm-stats:browsecomp", |
386 | 386 | "description": "Persistent web browsing and hard-to-find information retrieval." |
387 | 387 | }, |
|
406 | 406 | "name": "DeepSearchQA", |
407 | 407 | "category": "Search", |
408 | 408 | "dimension": "toolSearchReliability", |
409 | | - "score": 93.1, |
410 | | - "scoreRaw": 0.931, |
411 | | - "modelName": "Claude Opus 4.8", |
412 | | - "modelId": "claude-opus-4-8", |
413 | | - "totalModels": 7, |
414 | | - "trend": "flat", |
| 409 | + "score": 95, |
| 410 | + "scoreRaw": 0.95, |
| 411 | + "modelName": "Kimi K3", |
| 412 | + "modelId": "kimi-k3", |
| 413 | + "totalModels": 8, |
| 414 | + "trend": "up", |
415 | 415 | "source": "llm-stats:deepsearchqa", |
416 | 416 | "description": "Multi-hop deep search and answer retrieval." |
417 | 417 | } |
|
566 | 566 | "bottleneckDimension": "agentsAutonomy", |
567 | 567 | "updatedAt": "2026-07-16T05:14:47.391Z", |
568 | 568 | "formula": "agi-readiness-v2" |
| 569 | + }, |
| 570 | + { |
| 571 | + "date": "Jul 17, 2026", |
| 572 | + "agiReadiness": 76.1, |
| 573 | + "agiDistance": 23.9, |
| 574 | + "bottleneckDimension": "agentsAutonomy", |
| 575 | + "updatedAt": "2026-07-17T05:17:41.505Z", |
| 576 | + "formula": "agi-readiness-v2" |
569 | 577 | } |
570 | 578 | ], |
571 | 579 | "legacyHistory": [ |
|
0 commit comments