Compare Models

Select models (max 5)
Gemini 4 ArgonClaude Sonnet 5.5Claude Opus 5.5Claude Fable 5.1Claude Opus 5
Benchmarks

Vals Index *

Gemini 4 Argon
0.00%± 0.97
(41/41)
Claude Sonnet 5.5
0.00%± 0.92
(41/41)
Claude Opus 5.5
0.00%± 0.89
(41/41)
Claude Fable 5.1
0.00%± 1.11
(41/41)
Claude Opus 5
0.00%± 0.96
(41/41)

Legal Research Bench *

Gemini 4 Argon
0.00%± 3.46
(72/72)
Claude Sonnet 5.5
0.00%± 3.47
(72/72)
Claude Opus 5.5
0.00%± 3.48
(72/72)
Claude Fable 5.1
0.00%± 3.46
(72/72)
Claude Opus 5
0.00%± 3.46
(72/72)

Finance Agent (v2) *

Gemini 4 Argon
0.00%± 0.32
(73/73)
Claude Sonnet 5.5
0.00%± 0.67
(73/73)
Claude Opus 5.5
0.00%± 0.17
(73/73)
Claude Fable 5.1
0.00%± 2.06
(73/73)
Claude Opus 5
0.00%± 0.08
(73/73)

Tax Agent Bench *

Gemini 4 Argon
0.00%± 2.87
(64/64)
Claude Sonnet 5.5
0.00%± 2.98
(64/64)
Claude Opus 5.5
0.00%± 3.15
(64/64)
Claude Fable 5.1
0.00%± 2.83
(64/64)
Claude Opus 5
0.00%± 2.96
(64/64)

MedCode *

Gemini 4 Argon
0.00%± 2.10
(104/104)
Claude Sonnet 5.5
0.00%± 2.12
(104/104)
Claude Opus 5.5
0.00%± 2.27
(104/104)
Claude Fable 5.1
0.00%± 2.17
(104/104)
Claude Opus 5
0.00%± 1.99
(104/104)

Terminal-Bench Science

Gemini 4 Argon
0.00%± 5.98
(34/34)
Claude Sonnet 5.5
0.00%± 5.86
(34/34)
Claude Opus 5.5
0.00%± 6.01
(34/34)
Claude Fable 5.1
0.00%± 5.90
(34/34)
Claude Opus 5
0.00%± 5.35
(34/34)

Code Migration *

Gemini 4 Argon
0.00%± 4.35
(71/71)
Claude Sonnet 5.5
0.00%± 4.26
(71/71)
Claude Opus 5.5
0.00%± 4.33
(71/71)
Claude Fable 5.1
0.00%± 4.81
(71/71)
Claude Opus 5
0.00%± 4.37
(71/71)

Terminal-Bench 4.0

Gemini 4 Argon
0.00%± 2.31
(42/42)
Claude Sonnet 5.5
0.00%± 1.01
(42/42)
Claude Opus 5.5
0.00%± 0.00
(42/42)
Claude Fable 5.1
0.00%± 3.31
(42/42)
Claude Opus 5
0.00%± 1.34
(42/42)

Vibe Code Bench v1.1 *

Gemini 4 Argon
0.00%± 1.90
(106/106)
Claude Sonnet 5.5
0.00%± 1.26
(106/106)
Claude Opus 5.5
0.00%± 1.53
(106/106)
Claude Fable 5.1
0.00%± 1.57
(106/106)
Claude Opus 5
0.00%± 3.00
(106/106)

Overall performance

Performance on the Vals Index, a GDP-weighted aggregation of tasks across finance, coding, and law

2026-09-30

Comparison by Industry

Model performance on different sections of the economy.

Legal
54.23%
25.50%
27.12%
50.16%
49.64%
Finance
72.29%
69.07%
68.34%
71.99%
70.89%
Healthcare
73.11%
72.01%
70.61%
72.40%
77.28%
Math
99.00%
100.00%
100.00%
100.00%
99.00%
Science
55.36%
56.26%
58.65%
43.87%
47.93%
Academic
N/A
N/A
N/A
92.15%
91.64%
Education
53.65%
51.77%
45.83%
48.53%
49.43%
Coding
64.03%
77.35%
61.00%
60.10%
62.42%
Cyber
61.07%
44.87%
44.47%
46.66%
38.79%
Social Mobility
69.76%
67.19%
70.64%
74.90%
76.93%

Cost Analysis

Per task and per token model pricing.

Vals Index · USD
$15.68
$21.34
$32.14
$28.71
$19.31
Cost / TestVals Index
$15.68
$21.34
$32.14
$28.71
$19.31
Input Cost/ 1M Tokens
$4.00
$2.00
$4.00
$10.00
$5.00
Input Cache Write/ 1M Tokens
N/A
$2.50
$5.00
$12.50
$6.25
Input Cache Read/ 1M Tokens
$0.20
$0.20
$0.40
$0.25
$0.50
Output Cost/ 1M Tokens
$20.00
$10.00
$20.00
$50.00
$25.00

Model Metadata

Basic information about each model.

Model provider
GoogleGoogle
AnthropicAnthropic
AnthropicAnthropic
AnthropicAnthropic
AnthropicAnthropic
Latency2792.77s4684.30s4740.12s4608.95s3461.38s
Cost (In/Out)$4 / $20$2 / $10$4 / $20$10 / $50$5 / $25
Context Window1M1M1M1M1M
Max Output Token262k128k128k128k128k
Input Modality