IA & tech · English

Will the highest Humanity's Last Exam (HLE) accuracy score in Epoch AI's benchmark data reach at least 58.5 % for a model released on or before 2026-12-06?

échéance 2026-12-06 confiance moyenne preuve niveau 4
36 %estimation PolySignal

Critère de résolution

Resolves YES if, in a snapshot of Epoch AI's benchmark data (https://epoch.ai/data/benchmark_data.zip, file "hle_external.csv", column "Accuracy") taken on or after 2026-12-20, at least one model with a release date on or before 2026-12-06 has a value >= 58.5 %. Reference at creation: 54.8 % (gpt-6-astra_unknown, 2026-09-03). Voided if Epoch AI revises the methodology so that values are no longer comparable, or retires the file. Data: Epoch AI, CC BY 4.0.

État de départ vérifié

Computed base rate: 36% of past 60-day windows in Epoch AI's benchmark data saw the running record rise by at least the required amount (threshold 0.585, current record 0.5479999999999999). Data: Epoch AI, CC BY 4.0, epoch.ai/benchmarks. Overlapping windows: small effective sample.
Les arguments ci-dessous ont été produits par le modèle en anglais. Ils sont affichés tels quels plutôt que traduits automatiquement, pour que rien sur cette page ne soit un texte que PolySignal n'a pas réellement écrit.

Ce qui fait monter

Ce qui fait descendre

Ce qui ferait le plus bouger ce chiffre

Whether a major frontier AI lab releases a new flagship reasoning model or update between October 8 and December 6, 2026, that Epoch AI evaluates on HLE.

Comment ce chiffre est fabriqué

Échéance2026-12-06
Taux de base36%
Meilleure preuveniveau 4 · 1 article(s) utilisé(s)
Estimations35 · 36 (écart 1 pts)
Confiancemoyenne
Plafond de preuvenon déclenché
Révisée le2026-10-08 19:50
Modèlegemini-3.7-flash

Sources consultées

Modern AI Benchmarks: What Practitioners Actually Need to Knowniveau 4 · Medium · 2026-05-29