NeurionForge
Eval
Leaderboard
Models
Run Eval →
REGISTRY
Evaluated Models
All models with empirical Measured test runs and correlation data.
Claude 3.5 Sonnet
Frontier
100.0%
Avg Score
10 runs recorded
Inspect Evidence →
Claude 3.7 Sonnet
Anthropic
Pending
0 runs recorded
Inspect Evidence →
Claude 3.7 Sonnet (Hybrid)
Frontier
100.0%
Avg Score
10 runs recorded
Inspect Evidence →
DeepSeek R1
DeepSeek
Pending
0 runs recorded
Inspect Evidence →
DeepSeek V3
DeepSeek
Pending
0 runs recorded
Inspect Evidence →
Gemini 2.5 Pro
Frontier
100.0%
Avg Score
10 runs recorded
Inspect Evidence →
Gemini 2.5 Pro
Google
Pending
0 runs recorded
Inspect Evidence →
gemini-2.0-flash
Gemini
Pending
0 runs recorded
Inspect Evidence →
gemini-2.5-flash
Gemini
Pending
0 runs recorded
Inspect Evidence →
GPT-4o
Frontier
100.0%
Avg Score
10 runs recorded
Inspect Evidence →
GPT-5
OpenAI
100.0%
Avg Score
10 runs recorded
Inspect Evidence →
Llama 3.1 8B Instruct
Meta
Pending
0 runs recorded
Inspect Evidence →
Llama 3.3 70B Instruct
Meta
Pending
0 runs recorded
Inspect Evidence →
Mistral NeMo 12B
Mistral
Pending
0 runs recorded
Inspect Evidence →
o3-mini
Frontier
100.0%
Avg Score
10 runs recorded
Inspect Evidence →
Phi-4 14B
Microsoft
Pending
0 runs recorded
Inspect Evidence →
Qwen2.5 32B Instruct
Alibaba
Pending
0 runs recorded
Inspect Evidence →
Qwen2.5 72B Instruct
Alibaba
Pending
0 runs recorded
Inspect Evidence →
Qwen2.5 7B Instruct
Alibaba
Pending
0 runs recorded
Inspect Evidence →