"Полная Kimi K3 на Mac: запустить можно, а работать - ну такое 982 ГБ на накопителе и меньше одного токена в секунду. Эти две цифры лучше заголовка объясняют, что именно показал проект WASTE Авторы нашли способ запустить полную по числу параметров, но квантованную Kimi K3 на MacBook Pro, не пытаясь постоянно держать всю модель в оперативной памяти. Общая часть остаётся в памяти, а нужные в конкретный момент экспертные блоки считываются с быстрого накопителя. Технически большая модель помещается на потребительском устройстве, хотя эксплуатационный профиль получается очень специфическим По измерениям самих авторов на указанной конфигурации, контейнер занимает 982 ГБ, практический минимум составляет 64 ГБ памяти, а скорость находится в диапазоне 0,45-0,62 токена в секунду. Это не независимый тест и не универсальная характеристика Kimi K3 Есть ещё одна полезная деталь. Попытка увеличить кэш сверх безопасного запаса памяти привела к подкачке на накопитель и снизила скорость примерно в восемь раз. Больше кэша в таком режиме дало не ускорение, а тормоза между памятью и диском Перед локальным запуском большой модели я бы разделил четыре вопроса: 1. Память. Что должно постоянно находиться в ней и какой запас останется системе 2. Накопитель. Сколько места потребуется и выдержит ли он постоянное чтение блоков 3. Скорость. Сколько времени займёт первый полезный ответ, а не один красивый запуск 4. Класс задачи. Нужен ли человеку диалог в реальном времени или допустима долгая фоновая обработка Отдельно стоит проверить стабильность на длинной серии запросов, энергопотребление и восстановление после сбоя. Репозиторий WASTE хорош тем, что сохраняет неудачные гипотезы и привязывает измерения к оборудованию, конфигурации и версии кода Фраза ""модель запускается локально"" отвечает только на вопрос о технической возможности. Рабочее решение начинается позже, когда скорость, хранение и устойчивость совпадают с ценностью конкретной задачи"