Прикольный результат. Не все чекпойнты одинаково полезны. Очередная лотерея. Generalization Dynamics of LM Pre-Training __Jiaxin Wen, Zhengxuan Wu, Dawn Song, Lijie Chen__ Paper: https://arxiv.org/abs/2609.33150 Review: https://arxiviq.substack.com/p/generalization-dynamics-of-lm-pre Code: N/A Model: N/A ЧТО сделали: Авторы проверили, как языковые модели переходят от простых поверхностных эвристик к способности обобщать. Для этого они отслеживали частые промежуточные чекпоинты открытых моделей в процессе предобучения с помощью легковесного набора поведенческих тестов. ЧТО получили: Модели нестабильно удерживают способность к рассуждению на масштабах от 9x до 90x оптимума по Чинчилле. В задаче последовательной арифметики точность OLMo3-32B достигает 81% на 2.17T токенов, падает до 0% на 2.19T токенов и снова подскакивает до 81.7% на 2.21T токенов. Выбор промежуточного чекпоинта на 4.5T токенов вместо 4.9T даёт 36.3% против 29.8% точности на GPQA после математического файнтюнинга, а также повышает устойчивость к атакам через prefilling с 21% до 53%. ПОЧЕМУ это важно: Взяв финальный чекпоинт долгого предобучения, можно получить ухудшенные представления для рассуждений и безопасности. При этом диагностические сигналы сильно различаются в разных доменах. Искать правильный чекпойнт здесь: https://t.me/gonzo_ML_podcasts/4823