BenchmarksModelsComparisongetEvals SmithApp ReportsAbout
Powered by PumaAI

Model Catalog

Every model we evaluate

Release dates, index scores, cost per test, and latency on the getEvals Index. Filter by lab or search by name.

#ModelIndexCost / testLatencyReleased
1Claude Opus 5
Anthropic
67.21%$19.2855m 49s2026-07-22
2Claude Fable 5
Anthropic
66.04%$28.8037m 51s2026-06-09
3GPT-5.6 Sol
OpenAI
63.71%$13.7932m 24s2026-07-09
4Claude Opus 4.8
Anthropic
60.91%$12.6736m 22s2026-05-28
5GPT-5.6 Luna
OpenAI
59.88%$0.6223m 16s2026-07-09
6Claude Sonnet 5
Anthropic
59.61%$17.7045m 46s2026-06-30
7Grok 4.6
SpaceXAI
59.17%$4.3438m 4s2026-08-12
8Kimi K3
Moonshot · Open weights
57.81%$6.4769m 34s2026-07-16
9GPT 5.5
OpenAI
57.41%$6.1420m 51s2026-05-15
10Muse Spark 1.2
Meta
57.05%$1.6616m 49s2026-08-05
11GPT-5.6 Terra
OpenAI
56.53%$1.8011m 40s2026-07-09
12Claude Opus 4.7
Anthropic
56.11%$12.7728m 26s2026-05-01
13Gemini 3.6 Flash
Google
55.35%$3.0322m 8s2026-07-21
14Muse Spark 1.1
Meta
54.75%$1.2513m 48s2026-06-15
15DeepSeek V4 Flash 0731
DeepSeek · Open weights
53.57%$0.2234m 55s2026-07-31
16GLM 5.2
zAI · Open weights
53.12%$4.2942m 7s2026-06-13
17Gemini 3.5 Flash
Google
53.08%$2.9111m 1s2026-05-22
18DeepSeek V4 Pro 0813
DeepSeek · Open weights
52.37%$0.8458m 18s2026-08-13
19Qwen 3.8 Max
Alibaba
51.84%$4.0090m 46s2026-08-03
20Grok 4.5
SpaceXAI
51.53%$1.9613m 58s2026-07-16
21Claude Sonnet 4.6
Anthropic
50.59%$8.4934m 46s2026-04-20
22Inkling
Thinking · Open weights
49.28%$0.4130m 0s2026-07-15
23Qwen 3.7 Max
Alibaba
44.77%$2.8529m 42s2026-05-20
24Nemotron 3 Ultra
NVIDIA · Open weights
43.99%$1.1026m 40s2026-06-04
25Kimi K2.6
Moonshot · Open weights
43.47%$1.8539m 52s2026-04-28
26DeepSeek V4
DeepSeek · Open weights
42.89%$0.9323m 47s2026-06-01
27MiniMax-M3
MiniMax · Open weights
42.72%$2.5035m 15s2026-05-31
28Gemma 4 31B IT
Google · Open weights
38.94%$0.355m 23s2026-04-10
29Mistral Medium 3.5
Mistral · Open weights
17.95%$8.0157m 26s2026-03-20