Не уверен всё же, что буду продолжать с форматом статей в телеге. Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning __Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora__ Paper: https://arxiv.org/abs/2608.05139v1 Code: https://github.com/Gen-Verse/Skill-Entropy-RL Dataset: https://huggingface.co/datasets/Gen-Verse/Skill2-Bench # TL;DR ЧТО сделали: Авторы предложили метрику Skill Entropy (энтропия навыков), которая количественно оценивает сложности, возникающие у языковых моделей при переключении между различными когнитивными навыками в длинных цепочках рассуждений. С её помощью создан бенчмарк Skill²-Bench (558 навыков в 9 доменах) и разработан метод подкрепляющего обучения Skill-Entropy RL, штрафующий модель за ошибки при смене контекста и вознаграждающий точность ответов. ПОЧЕМУ это важно: Современные языковые модели отлично справляются с изолированными задачами, но их точность резко падает, когда в рамках одного контекста приходится переключаться между разными типами мышления (например, от математических вычислений к творческому письму). Модели страдают «когнитивной инерцией» и пытаются применять прежний шаблон решения к новым шагам. Для практиков: Метод Skill-Entropy RL позволяет относительно небольшим открытым моделям (например, Qwen3-4B-Instruct) превзойти стандартные методы RL по итоговым результатам, такие как GRPO, и улучшить генерализацию на сторонних датасетах вроде OpenR1-Math. Подробнее тут: https://t.me/gonzo_ML_podcasts/4783