"О локальном инференсе LLM Регулярно встречаю блогпосты и призывы инференсить LLM на локальном железе. Но это всегда имеет ограничения. Одни предлагают квантизировать модели в 1b, другие хитро стримить, третьи советуют брать модели поменьне. Но квантизация заметно ухудшает качество. Мелкие модели тоже похуже А ""хитрый стриминг""... Вот увидел я пост на медиуме: ""Unbelievable! Run Kimi K3–2.8 Trillion Parameters — on a Single 4GB GPU"". Думаю - не верю. Открываю... ""This is not fast. Roughly five minutes per token."" - не юзабельно #llm #ai"