Минцифры и бизнес обсуждают гранты на сбор русскоязычных данных для обучения больших моделей
Государство поняло, что главный дефицит для своего ИИ — не видеокарты, а хорошие данные на родном языке.
Идея — софинансировать не сами модели, а подготовку качественных русскоязычных и отраслевых наборов данных, которыми смогут пользоваться несколько исследовательских команд: сейчас компании тратят на сбор и разметку десятки миллионов рублей каждая. Обсуждение шло на рабочей группе 10 сентября, договориться о мерах поддержки нужно до 30 сентября; всего господдержка развития ИИ запланирована примерно на 71,7 млрд рублей. Эксперты предупреждают, что без требований к использованию деньги могут уйти крупным корпорациям, а датасеты — пылиться.
Источники 1