NeurionForgeEval
LeaderboardModelsRun Eval →
REGISTRY

Evaluated Models

All models with empirical Measured test runs and correlation data.

Claude 3.5 Sonnet

Frontier
100.0%Avg Score
10 runs recordedInspect Evidence →

Claude 3.7 Sonnet

Anthropic
Pending
0 runs recordedInspect Evidence →

Claude 3.7 Sonnet (Hybrid)

Frontier
100.0%Avg Score
10 runs recordedInspect Evidence →

DeepSeek R1

DeepSeek
Pending
0 runs recordedInspect Evidence →

DeepSeek V3

DeepSeek
Pending
0 runs recordedInspect Evidence →

Gemini 2.5 Pro

Frontier
100.0%Avg Score
10 runs recordedInspect Evidence →

Gemini 2.5 Pro

Google
Pending
0 runs recordedInspect Evidence →

gemini-2.0-flash

Gemini
Pending
0 runs recordedInspect Evidence →

gemini-2.5-flash

Gemini
Pending
0 runs recordedInspect Evidence →

GPT-4o

Frontier
100.0%Avg Score
10 runs recordedInspect Evidence →

GPT-5

OpenAI
100.0%Avg Score
10 runs recordedInspect Evidence →

Llama 3.1 8B Instruct

Meta
Pending
0 runs recordedInspect Evidence →

Llama 3.3 70B Instruct

Meta
Pending
0 runs recordedInspect Evidence →

Mistral NeMo 12B

Mistral
Pending
0 runs recordedInspect Evidence →

o3-mini

Frontier
100.0%Avg Score
10 runs recordedInspect Evidence →

Phi-4 14B

Microsoft
Pending
0 runs recordedInspect Evidence →

Qwen2.5 32B Instruct

Alibaba
Pending
0 runs recordedInspect Evidence →

Qwen2.5 72B Instruct

Alibaba
Pending
0 runs recordedInspect Evidence →

Qwen2.5 7B Instruct

Alibaba
Pending
0 runs recordedInspect Evidence →