"О локальном инференсе LLM Регулярно встречаю блогпосты и призывы инференсить LLM на локальном железе. Но это всегда имеет ограничения. Одни предлагают квантизировать модели в 1b, другие хитро стримить, третьи советуют брать модели поменьне. Но квантизация заметно ухудшает качество. Мелкие модели тоже похуже А ""хитрый стриминг""... Вот увидел я пост на медиуме: ""Unbelievable! Run Kimi K3–2.8 Trillion Parameters — on a Single 4GB GPU"". Думаю - не верю. Открываю... ""This is not fast. Roughly five minutes per token."" - не юзабельно #llm #ai"
"О локальном инференсе LLM Регулярно встречаю блогпосты и призывы инференсить…
Из этого канала
- #3852Я когда увидел — подумал, что шутка: третий (расширенный) трейлер GTA VI выйдет…
Я когда увидел — подумал, что шутка: третий (расширенный) трейлер GTA VI выйдет 27-го августа...
- #3851В статье Reuters про первый инцидент OpenAI со взломом HuggingFace было…
В статье Reuters про первый инцидент OpenAI со взломом HuggingFace было расплывчато написано, что «агент оставил заметки, предположительно предназначенные для…
- #3850Число сообщений о серьезных киберуязвимостях продолжает расти. В июле 21…
Число сообщений о серьезных киберуязвимостях продолжает расти. В июле 21 крупная технологическая организация опубликовала около 2500 CVE высокой и критической…