"О локальном инференсе LLM Регулярно встречаю блогпосты и призывы инференсить LLM на локальном железе. Но это всегда имеет ограничения. Одни предлагают квантизировать модели в 1b, другие хитро стримить, третьи советуют брать модели поменьне. Но квантизация заметно ухудшает качество. Мелкие модели тоже похуже А ""хитрый стриминг""... Вот увидел я пост на медиуме: ""Unbelievable! Run Kimi K3–2.8 Trillion Parameters — on a Single 4GB GPU"". Думаю - не верю. Открываю... ""This is not fast. Roughly five minutes per token."" - не юзабельно #llm #ai"
"О локальном инференсе LLM Регулярно встречаю блогпосты и призывы инференсить…
Из этого канала
- #3854На неделе было много новостей, тезисно о них: — Белый дом должен был закончить…
На неделе было много новостей, тезисно о них: — Белый дом должен был закончить формирование фреймворка по оценке и релизу фронтир-моделей, а также разобраться,…
- #3856Дания нашла самый адекватный способ бороться с домашними заданиями сделанными в…
Дания нашла самый адекватный способ бороться с домашними заданиями сделанными в ChatGPT – перестать угадывать писал ли текст АИ и просто попросить ученика…
- #3857В конце недели появилась запись выступления двух сотрудников OpenAI с деталями…
В конце недели появилась запись выступления двух сотрудников OpenAI с деталями взлома их агентами компании HuggingFace — некотоыре вещи оттуда уже были…
- #3852Я когда увидел — подумал, что шутка: третий (расширенный) трейлер GTA VI выйдет…
Я когда увидел — подумал, что шутка: третий (расширенный) трейлер GTA VI выйдет 27-го августа...
- #3851В статье Reuters про первый инцидент OpenAI со взломом HuggingFace было…
В статье Reuters про первый инцидент OpenAI со взломом HuggingFace было расплывчато написано, что «агент оставил заметки, предположительно предназначенные для…