Подписаться в Telegram
← Ко всей ленте

Исследование: прогресс языковых моделей за 2019–2025 годы в основном дали данные, а не новые архитектуры

Главным двигателем ИИ оказались не хитрые схемы нейросетей, а то, на чём их учат, — значит, следующий рывок зависит от того, научится ли ИИ сам создавать для себя хорошие данные.

Дваркеш Патель и Джерри Хан обучили рецепты моделей от GPT-2 до OLMo-2 на корпусах от OpenWebText до UltraFineWeb и разделили вклад факторов: при бюджете 1e19 FLOP улучшения данных дали 12-кратный выигрыш в эффективности, а улучшения моделей — 3,7-кратный, то есть в 3,24 раза меньше. Авторы оговаривают, что архитектурные новшества ценны прежде всего тем, что позволили масштабировать обучение, и что главный открытый вопрос — сможет ли синтетика расширить исчерпывающиеся интернет-данные.

Источники 1