Подписаться в Telegram
← Ко всей ленте

Все самые трудные задачи бенчмарка FrontierMath решены ИИ: за 14 месяцев результат вырос с 5% до 98%

ИИ перерос экзамен, который год назад казался почти непроходимым: теперь мерить его придётся на задачах, которые ещё не решил никто из людей.

Epoch AI объявила, что уровень Tier 4 бенчмарка FrontierMath — задачи исследовательского уровня от профессиональных математиков — «насыщен»: каждую из 43 задач хотя бы раз решил ИИ. Последнюю, составленную Джеем Пантоном, взяла GPT-6 Astra, причём без «непредусмотренных обходных путей», которые авторы замечали в других решениях. Когда уровень запустили в июле 2025 года, лучший результат был около 5%; сейчас у Astra 97,6%, у Claude Fable 5 — 90,2%. Epoch переключается на нерешённые задачи и формальную проверку доказательств.

Источники 2

Все самые трудные задачи бенчмарка FrontierMath решены ИИ: за 14 месяцев результат вырос с 5% до 98% | Sintelligent