Independent first
Third-party evaluator results are separated from provider launch claims.
EVALUATION INTELLIGENCE
Benchmark scores are evidence, not universal truth. SXF stores who ran the evaluation, which version, which model configuration and which results are actually comparable.
COMPARABILITY RULE
SXF only treats results as numerically comparable when benchmark identity, version, evaluator methodology and comparable group line up. Tool use, fallback behavior and reasoning effort remain part of the observation.
Third-party evaluator results are separated from provider launch claims.
Live leaderboards can change methodology. Every snapshot stores its observed date and benchmark version.
Reasoning effort, tools and fallback behavior stay attached to the score.
Different benchmarks are not collapsed into a homemade universal intelligence score.
BENCHMARK REGISTRY
composite intelligence · score · higher-is-better
6 observations Open benchmark evidence ↗agentic knowledge work · elo · higher-is-better
3 observations Open benchmark evidence ↗professional knowledge work · elo · higher-is-better
3 observations Open benchmark evidence ↗business automation · task-success · higher-is-better
3 observations Open benchmark evidence ↗agentic coding · task-success · higher-is-better
3 observations Open benchmark evidence ↗scientific coding · score · higher-is-better
3 observations Open benchmark evidence ↗multidisciplinary reasoning · accuracy · higher-is-better
3 observations Open benchmark evidence ↗frontier science reasoning · score · higher-is-better
3 observations Open benchmark evidence ↗long context reasoning · score · higher-is-better
3 observations Open benchmark evidence ↗professional workflows · task-success · higher-is-better
1 observations Open benchmark evidence ↗agentic coding · task-success · higher-is-better
1 observations Open benchmark evidence ↗multidisciplinary reasoning · accuracy · higher-is-better
2 observations Open benchmark evidence ↗MODEL COVERAGE