Я сделал open-source инференс движок для Gemma 4 26B-A4B 4-bit. Движок использует всего 2gb ram при размере модели 14gb. Проект написан на Swift/Metal и запускается на любом MacBook с M-процессором, даже на M1 Air. Для того чтобы это работало, я использую стриминг весов с SSD и разные оптимизации. Кастомные fused kernels на Metal, репак весов в более подходящий формат, кеширование экспертов и I/O and compute overlap при работе с ними. Всего было более 100 разных экспериментов, все самое интересное описано в репе. Сейчас движок выдает 4-5 tok/s на M1 Air, 5-6 на M2 Air, 26-29 tok/s на M4 MacBook Pro и 31-35 tok/s на M5 MacBook Pro. Есть отдельное приложение на Mac, которое запускается буквально в одну команду. Надо только будет скачать веса с Hugging Face. Все абсолютно рабочее. На GitHub есть красиво оформленная страничка и больше 110 звездочек https://github.com/drumih/turbo-fieldfare
Я сделал open-source инференс движок для Gemma 4 26B-A4B 4-bit. Движок…
Из этого канала
- #7554И в чём искусственный интеллект Google не прав?
И в чём искусственный интеллект Google не прав?
- #7555Смотрите, какой-то умелец запустил языковую модель на ардуиноподобной плате за…
Смотрите, какой-то умелец запустил языковую модель на ардуиноподобной плате за восемь баксов (ESP32-S3) Внутрь удалось утрамбовать модельку на 28,9 миллиона…
- #7556"Как выжать максимум из ИИ в бизнесе и как считать эффект? Разберемся на…
"Как выжать максимум из ИИ в бизнесе и как считать эффект? Разберемся на бесплатном курсе Selectel подготовил прикладной курс «Искусственный интеллект в…
- #7552Когда нечего почитать перед сном
Когда нечего почитать перед сном
- #7550"Тут ШАД (Школа анализа данных Яндекса) подкатили годную движуху для тех, кто…
"Тут ШАД (Школа анализа данных Яндекса) подкатили годную движуху для тех, кто уже наигрался с обычными чат-ботами и начал пилить автономных агентов, которые…