Anthropic выпустила Claude Fable 5.1 и Mythos 5.1: вдвое лучше в научных задачах и дешевле в работе
Самая сильная публичная модель стала заметно умнее в научной работе и одновременно дешевле — длинные автономные задачи, которые ИИ делает часами, становятся доступнее для всех.
Fable 5.1 набирает 52,6% на Terminal-Bench-Science (у Fable 5 было 24,7%), 55,8% на Terminal-Bench 4.0 и 60,9% на Humanity's Last Exam без инструментов. Чтение из кэша подешевело на 75% (до $0,25 за млн токенов), что снижает счёт примерно на 25% на типичных задачах и до 45% на агентных; базовые цены $10/$50 за млн токенов не изменились. Mythos 5.1 — та же модель с другими защитами, доступная только проверенным специалистам по кибербезопасности и наукам о жизни в США. Защиты стали реже срабатывать зря: на 60% меньше ложных блокировок в кибербезопасности и на 85% — в безобидных биологических запросах. ARC Prize подтвердил 97,5% на ARC-AGI-1 и 90% на ARC-AGI-2.