На неделе MoonshotAI представили Kimi-K2, огромную модель на 1 триллион параметров, оптимизированную на агентские задачи. По архитектуре модель фактически повторяет DeepSeek V3 со слегка изменёнными некоторыми параметрами в конфигурации. Модель как бы не обучена рассуждать, поэтому авторы сравнивают её с non-thinking вариантами других моделей, но как по мне это лукавство. K2 была дообучена с RLVR и с инструментами во время ответа. Но числа на бенчмарках всё равно впечатляют. Чуть больше можно почитать, например, в соседнем канале. (тут не могу не вспомнить, что META всё ещё не выпустила рассуждающую модель 😀😀😀 и агентскую тоже. Ну ща, исследователи купят домики на бонусы и начнут работать, ждём LLAMA-5) Так вот, почему пишу пост. Из технического блога хотел поделиться тремя вещами: 1. Узнал про ACEBench, духовного наследника крутого τ -Bench. В обоих бенчмарках есть симулируемый пользователь, который ведёт диалог с LLM, которую оценивают. Этакое прокси к real world usage, позволяющее проводить не статическую оценку. Статью почитаю, разбор не обещаю. 2. Авторы кратко рассказывают, как делают Agentic Capabilities в K2 — они как раз, вдохновились ACEBench. Пайплайн изображён на картинке, почитать подробнее тут. Важно, что вся оценка перформанса основана на рубриках. Рубрики — это инструкции, описывающие, как нужно оценить ответ с разных сторон. Оценка проводится самой LLM по этой инструкции. OpenAI, да и другие игроки, почти наверняка идут таким же путём. Думаю, что у кого качественнее и дайверснее рубрики — тот и будет делать круче модели, прокачивая рассуждения во всё большем и большем количестве доменов. 3. Демки агентских способностей на сайте! Обязательно зайдите и потыкайте, выглядит очень прикольно, как из одного простого промпта собирается целая игра или сайт, которые выглядят неплохо. Попробую сам потыкать (используя API, конечно — где мне 1T модель развернуть?). Дракон удар 🇨🇳
На неделе MoonshotAI представили Kimi-K2, огромную модель на 1 триллион…
Из этого канала
- #2652Kimi-VL
Kimi-VL
- #2653Три картинки из свежего блога Semianalysis: 1. Самые крупные датацентры для…
Три картинки из свежего блога Semianalysis: 1. Самые крупные датацентры для тренировки моделей на конец 2026-го года. По плану, META запустит Prometheus.
- #2656Впервые за 2 с копейкой года использования макбука на M2 Max услышал, как…
Впервые за 2 с копейкой года использования макбука на M2 Max услышал, как работает система охлаждения.
- #2650В фильмах/играх/сериалах про зомби мне нравится смотреть на описание того, как…
В фильмах/играх/сериалах про зомби мне нравится смотреть на описание того, как мир спотыкается и валится в пропасть .
- #2649Нашёл интересный график. Есть такой бенчмарк, GPQA, в нём достаточно сложные…
Нашёл интересный график. Есть такой бенчмарк, GPQA, в нём достаточно сложные вопросы (...были) и 4 варианта ответа, из которых надо выбрать. По сути, тест.