Z.ai опубликовала инженерный отчет о том, как модель GLM-5.3 участвовала в создании production-инференса для GLM-5.3-Flash Они описывают этот процесс как первый шаг в сторону recursive self-improvement и говорят, что подобная практика «полностью меняет то, как создаются следующие поколения моделей». Короче, перед инженерами стояла задача: нужно было развернуть кластер на 100 000+ китайских ускорителей (не Nvidia). Это, кстати, первое развертывание их отечественных чипов такого масштаба. GLM-5.3 использовали для оптимизации производительности и скорости. В итоге всего за две недели инженеры с помощью модели вырастили throughput в три раза! Агент сам формулировал гипотезы, где теряется скорость, и писал код фиксов, люди только ставили цели, смотрели за безопасностью и принимали конечные решения. Три конкретных фикса, которые агент сделал автономно: – Убрал Python GIL bottleneck, который ел ~20% производительности – Ускорил decode-кернел в 1.71 раза – Починил числовую точность в KDA-кернеле для длинного контекста (фикс впоследствии влили в проект Flash Linear Attention) https://z.ai/blog/glm-built-its-inference-infrastructure P.S. В конце их блогпоста не хватает только фразы «а американцы пусть и дальше замедляются»
Z.ai опубликовала инженерный отчет о том, как модель GLM-5.3 участвовала в…
Из этого канала
- #9943За AI-навыки в вакансиях платят на 62% больше PwC - одна из компаний «большой…
За AI-навыки в вакансиях платят на 62% больше PwC - одна из компаний «большой четвёрки» - подсчитала среднюю надбавку к зарплате разработчиков за AI-навыки…
- #9942"Neuralink показали процесс восстановления речи из мыслей Кеннету Шоку –…
"Neuralink показали процесс восстановления речи из мыслей Кеннету Шоку – пациенту с БАС – в январе 2026 имплантировали чип N1.
- #9941Побывали с командой на deep tech night в офисе Яндекса Слушали доклады,…
Побывали с командой на deep tech night в офисе Яндекса Слушали доклады, общались с экспертами и нетворкали.