"Топовые опенсорсные модели достигли запредельного уровня, в куче бенчмарков сравнимы с коммерческими фронтир моделями. Сейчас узкое место для взрывного роста доступного интеллекта — это домашние девайсы для инференса таких моделей, чтобы у каждого был свой ""бесплатный"" аналог Claude Code и не было бы финансово страшно жечь кучу токенов на OpenClaw-подобные эксперименты. Kimi K3: Open Frontier Intelligence __Kimi Team__ Статья: https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf Блог: https://www.kimi.com/blog/kimi-k3 Ревью: https://arxiviq.substack.com/p/kimi-k3-open-frontier-intelligence Код: https://github.com/MoonshotAI/Kimi-K3 Модель: https://huggingface.co/moonshotai/Kimi-K3 # TL;DR ЧТО сделали: Команда Kimi представила Kimi K3 — открытую мультимодальную модель типа Mixture-of-Experts (MoE) на 2.8 триллиона общих параметров и 104 миллиарда активируемых параметров на токен, поддерживающую контекстное окно в 1 миллион токенов. Модель сочетает гибридное внимание Kimi Delta Attention и Gated Multi-Head Latent Attention в пропорции 3:1, межуровневые связи Block Attention Residuals по глубине, а также Stable LatentMoE с 896 роутируемыми экспертами. Кроме того, Kimi K3 содержит энкодер изображений, обученный с нуля через предсказание следующего токена, и использует мульти-уровневое обучение с подкреплением (RL), дистиллированное из общего, агентного и кодерского доменов. ПОЧЕМУ это важно: Пока опенсорс-сообщество активно развивало масштабирование рассуждений на инференсе, размер открытых базовых моделей застрял в районе 1 триллиона параметров, увеличивая отставание от закрытых SOTA-систем. Kimi K3 доказывает, что одновременное масштабирование параметров до 3T-класса и агентного RL на контексте в 1M токенов даёт прирост эффективности предобучения в 2.5 раза по сравнению с Kimi K2 (https://arxiv.org/abs/2507.20534), создавая полноценную открытую альтернативу закрытым флагманам вроде Claude Fable 5 и GPT-5.6 Sol. Для практиков: Kimi K3 совершает сильный рывок в возможностях открытых моделей за счёт параллельного масштабирования архитектуры и RL. Инженерам и техническим лидерам это даёт готовое к продакшену решение передового уровня с рекордной экономичностью на задачах разработки ПО, сложной работы с инструментами и мультимодальных пайплайнах. Выложив веса на 2.8T и сопутствующие библиотеки, авторы снабдили сообщество инфраструктурой для развёртки сверхбольших архитектур без вспомогательных функций потерь (auxiliary loss) и с микро-ВМ средами для оценки агентов. Подробности и картинки тут: https://t.me/gonzo_ML_podcasts/4643"