The Public Standard for Real World AI Performance

Generic benchmarks only go so far.
Vals AI evaluates models on the real tasks each industry relies on.

Vals Index
Vals Index
Finance
Healthcare
Math
AIME

Challenging national math exam given to top high-school students

View Details
MATH 500

Academic math benchmark on probability, algebra, and trigonometry

View Details
MGSM

A multilingual benchmark for mathematical questions.

View Details
Academic
Education
Coding
Proprietary

Updated 7/31/2026

Code Migration

33

models tested

Can language models reimplement working programs in another language?

Top Models

1
Claude Opus 5

Claude Opus 5

57.5%
2
Claude Fable 5

Claude Fable 5

55.1%
3
GPT-5.6 Sol

GPT-5.6 Sol

52.9%
View Details
Academic

Updated 7/31/2026

IOI

60

models tested

International Olympiad in Informatics

Top Models

1
Claude Opus 5

Claude Opus 5

91.7%
2
GPT-5.6 Sol

GPT-5.6 Sol

86.7%
3
GPT-5.6 Luna

GPT-5.6 Luna

72.9%
View Details
Academic

Updated 8/1/2026

LiveCodeBench

132

models tested

Our Implementation of the LiveCodeBench benchmark

Top Models

1
Claude Fable 5

Claude Fable 5

89.8%
2
Claude Opus 5

Claude Opus 5

89.0%
3
Gemini 3.1 Pro Preview (02/26)

Gemini 3.1 Pro Preview (02/26)

88.5%
View Details
Academic

Updated 7/31/2026

ProgramBench

35

models tested

Can language models rebuild programs from scratch?

Top Models

1
Claude Opus 5

Claude Opus 5

3.0%
2
Claude Fable 5

Claude Fable 5

2.0%
3
Kimi K3

Kimi K3

2.0%
View Details
Academic

Updated 7/31/2026

SkillsBench

20

models tested

How important are skills for agents?

Top Models

1
Grok 4.5

Grok 4.5

66.0%
2
GPT 5.5

GPT 5.5

62.6%
3
GPT 5.5

GPT 5.5

62.2%
View Details
Academic

Updated 7/31/2026

SWE-bench Verified

75

models tested

Solving production software engineering tasks

Top Models

1
Claude Opus 5

Claude Opus 5

97.0%
2
GPT-5.6 Sol

GPT-5.6 Sol

96.2%
3
Claude Fable 5

Claude Fable 5

95.0%
View Details
Academic

Updated 8/1/2026

Terminal-Bench 2.1

47

models tested

State-of-the-art set of difficult terminal-based tasks

Top Models

1
GPT-5.6 Sol

GPT-5.6 Sol

85.8%
2
Claude Opus 5

Claude Opus 5

84.6%
3
Kimi K3

Kimi K3

80.9%
View Details
Proprietary

Updated 7/31/2026

Vibe Code Bench v1.1

76

models tested

Can models build web applications from scratch?

Top Models

1
Claude Fable 5

Claude Fable 5

90.4%
2
Claude Opus 5

Claude Opus 5

88.4%
3
Kimi K3

Kimi K3

85.0%
View Details
Terminal-Bench 2.0

State-of-the-art set of difficult terminal-based tasks

View Details
Beta
Games
Social Mobility