Z.ai опубликовала инженерный отчет о том, как модель GLM-5.3 участвовала в создании production-инференса для GLM-5.3-Flash Они описывают этот процесс как первый шаг в сторону recursive self-improvement и говорят, что подобная практика «полностью меняет то, как создаются следующие поколения моделей». Короче, перед инженерами стояла задача: нужно было развернуть кластер на 100 000+ китайских ускорителей (не Nvidia). Это, кстати, первое развертывание их отечественных чипов такого масштаба. GLM-5.3 использовали для оптимизации производительности и скорости. В итоге всего за две недели инженеры с помощью модели вырастили throughput в три раза! Агент сам формулировал гипотезы, где теряется скорость, и писал код фиксов, люди только ставили цели, смотрели за безопасностью и принимали конечные решения. Три конкретных фикса, которые агент сделал автономно: – Убрал Python GIL bottleneck, который ел ~20% производительности – Ускорил decode-кернел в 1.71 раза – Починил числовую точность в KDA-кернеле для длинного контекста (фикс впоследствии влили в проект Flash Linear Attention) https://z.ai/blog/glm-built-its-inference-infrastructure P.S. В конце их блогпоста не хватает только фразы «а американцы пусть и дальше замедляются»