Китайская Z.ai: её модель GLM сама построила систему, которая её же обслуживает на 100 тысячах китайских чипов
ИИ сам настраивает железо, на котором работает, да ещё на чипах без Nvidia — и санкции, и нехватка инженеров перестают быть непреодолимым барьером.
В техническом отчёте компания описала, как с нуля развернула инференс GLM-5.3-Flash (320 млрд параметров, 18 млрд активных, контекст 1 млн токенов) на кластере из более чем 100 тысяч ускорителей китайского производства — по её словам, такого масштаба на местных чипах ещё никто не запускал. Значительную часть работы сделал инфраструктурный агент на GLM-5.3: от первой адаптации до продакшена ушло меньше двух недель, пропускная способность выросла втрое, а стоимость токена сравнялась с решениями на GPU Nvidia. Z.ai называет это ранним примером рекурсивного самоулучшения.
Источники 3