{
  "derived_at": "2026-08-19T22:29:39.099Z",
  "source": [
    "nova_rubric_score_results.json",
    "nova_full_judge_6way_results.json"
  ],
  "method": {
    "rubric": "mean of Nova Pro 0-100 correctness scores, 20 shared tasks per model",
    "preference": "share of pairwise comparisons won, TIE counted as 0.5 for each side and kept in the denominator"
  },
  "n_tasks": 20,
  "n_rubric_gradings": 120,
  "n_pairwise": 300,
  "models": [
    {
      "model": "Claude Opus 5 (medium)",
      "rubric_mean": 97.9,
      "rubric_n": 20,
      "preference_pct": 77.5,
      "preference_n": 100
    },
    {
      "model": "Claude Sonnet 5 (medium)",
      "rubric_mean": 92.5,
      "rubric_n": 20,
      "preference_pct": 66.5,
      "preference_n": 100
    },
    {
      "model": "GPT-5.6 Sol (medium)",
      "rubric_mean": 97.4,
      "rubric_n": 20,
      "preference_pct": 45.5,
      "preference_n": 100
    },
    {
      "model": "GPT-5.6 Terra (medium)",
      "rubric_mean": 91.25,
      "rubric_n": 20,
      "preference_pct": 31,
      "preference_n": 100
    },
    {
      "model": "DeepSeek V4 Flash 0731 (high)",
      "rubric_mean": 95.75,
      "rubric_n": 20,
      "preference_pct": 35,
      "preference_n": 100
    },
    {
      "model": "Quorum Plus",
      "rubric_mean": 97.5,
      "rubric_n": 20,
      "preference_pct": 44.5,
      "preference_n": 100
    }
  ]
}