Замена LLM-as-a-Judge. Там где судья схлопывает свои представления в токены и выдаёт текстовый ответ, близкие (но несовпадающие) решения часто неразличимы. Авторы предлагают перейти на этап раньше и сравнивать распределение логитов, через матожидание. На этом уровне уже есть обнаруживаемая разница. Похоже в чём-то на историю с переходом к distributional RL. А также предлагают алгоритм голосования без квадратичной сложности. LLM-as-a-Verifier: A General-Purpose Verification Framework __Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini__ Paper: https://arxiv.org/abs/2607.05391 Review: https://arxiviq.substack.com/p/llm-as-a-verifier-a-general-purpose Code: https://github.com/llm-as-a-verifier/llm-as-a-verifier Site: https://llm-as-a-verifier.com/ Model: N/A # TL;DR ЧТО сделали: Авторы представили LLM-as-a-Verifier — универсальный фреймворк верификации, работающий без дополнительного обучения. Он вычисляет непрерывные оценки награды (reward scores) через математическое ожидание по распределению логитов упорядоченных токенов оценки. ПОЧЕМУ это важно: Этот подход решает проблему частых «ничьих» (высокий tie-rate) у стандартных дискретных LLM-судей. Предоставляя хорошо откалиброванную непрерывную обратную связь, метод позволяет масштабировать верификацию по детализации оценок, числу повторений и критериям. Он также работает как плотный сигнал награды для обучения с подкреплением (RL) и инструмент отслеживания прогресса для автономных агентов. Для практиков: Фреймворк легко внедрить как plug-and-play функцию ценности (value function) для масштабирования вычислений на этапе инференса (test-time compute scaling). Верифицировать тут: https://t.me/gonzo_ML_podcasts/4558
Замена LLM-as-a-Judge. Там где судья схлопывает свои представления в токены и…
Из этого канала
- #5772Шмидхубер и ко написали 97-страничный обзор про самоулучшающихся агентов.…
Шмидхубер и ко написали 97-страничный обзор про самоулучшающихся агентов. Построено на идее, что агент — это параметры модели + харнесс, At = (θt, Σt).
- #5767Снова про зацикленные трансформеры, но на этот раз в контексте сжатия для edge…
Снова про зацикленные трансформеры, но на этот раз в контексте сжатия для edge устройств.
- #5761Улучшенный зацикленный трансформер с латентным ризонингом, который теперь…
Улучшенный зацикленный трансформер с латентным ризонингом, который теперь работает для языковой модели размером 3B и не теряет в качестве по сравнению с…