На неделе MoonshotAI представили Kimi-K2, огромную модель на 1 триллион параметров, оптимизированную на агентские задачи. По архитектуре модель фактически повторяет DeepSeek V3 со слегка изменёнными некоторыми параметрами в конфигурации. Модель как бы не обучена рассуждать, поэтому авторы сравнивают её с non-thinking вариантами других моделей, но как по мне это лукавство. K2 была дообучена с RLVR и с инструментами во время ответа. Но числа на бенчмарках всё равно впечатляют. Чуть больше можно почитать, например, в соседнем канале. (тут не могу не вспомнить, что META всё ещё не выпустила рассуждающую модель 😀😀😀 и агентскую тоже. Ну ща, исследователи купят домики на бонусы и начнут работать, ждём LLAMA-5) Так вот, почему пишу пост. Из технического блога хотел поделиться тремя вещами: 1. Узнал про ACEBench, духовного наследника крутого τ -Bench. В обоих бенчмарках есть симулируемый пользователь, который ведёт диалог с LLM, которую оценивают. Этакое прокси к real world usage, позволяющее проводить не статическую оценку. Статью почитаю, разбор не обещаю. 2. Авторы кратко рассказывают, как делают Agentic Capabilities в K2 — они как раз, вдохновились ACEBench. Пайплайн изображён на картинке, почитать подробнее тут. Важно, что вся оценка перформанса основана на рубриках. Рубрики — это инструкции, описывающие, как нужно оценить ответ с разных сторон. Оценка проводится самой LLM по этой инструкции. OpenAI, да и другие игроки, почти наверняка идут таким же путём. Думаю, что у кого качественнее и дайверснее рубрики — тот и будет делать круче модели, прокачивая рассуждения во всё большем и большем количестве доменов. 3. Демки агентских способностей на сайте! Обязательно зайдите и потыкайте, выглядит очень прикольно, как из одного простого промпта собирается целая игра или сайт, которые выглядят неплохо. Попробую сам потыкать (используя API, конечно — где мне 1T модель развернуть?). Дракон удар 🇨🇳