Всю последнюю неделю DeepSeek проводили «дни открытых дверей» — каждый день публиковали репозиторий с кодом, который так или иначе используется ими для создания и применения передовых LLM. Каждый мини-релиз достаточно технический, про разные инженерные оптимизации, но вот сегодняшний более верхнеуровневый, и он рассказывает про tokenomics — экономику токенов (сколько тратят, сколько зарабатывают, итд). Но сначала пара тех. деталей: — в процессе генерации ответа на ваш запрос есть 2 части: предподсчёт векторов для вашего конкретного промпта (можно распараллелить и прогнать все слова за раз) и генерация ответа (по одному за раз) — эти части физически запускаются на разных серверах: первая на 4 нодах (мини-коробка с 8 GPU), вторая на 18 — и там, и там суммарно на всех GPU лежит на 32 больше эксперта (части каждого слоя модели), чем их есть: они избыточны, но помогают в ситуациях, когда какие-то GPU перегружены (на одного эксперта прилетело больше вычислений, чем на другие -> он будет медленнее -> тормозит весь процесс). Сходу не смог найти, но мне кажется я где-то читал, что они на лету считают статистики использования экспертов и держат самые «горячие», то есть эти 32 постоянно меняются (удаляются, вместо них загружаются другие) Теперь про экономику: — суммарно у DeepSeek позавчера (да, они прям за конкретный день сделали полный расчёт) работало ~275 нод, то есть ~2200 GPU для инференса. Все они работают в пиковые часы (~16 часов в сутки), но когда запросов мало, то их число снижается до ~60 нод. Теперь понятно, почему компания на этой неделе начала проводить акции со скидками по 50-75% в определённое время — за сутки при цене в два доллара за одну карту (это нормальная рыночная цена) получилось бы расходов на $87,072. За это же время сервера получили на вход 608 миллиардов токенов и сгенерировали 168 миллиардов — средняя скорость генерации 20-22 токена в секунду, что сильно меньше чем у конкурентов, но не пугайтесь: это не потому что они сделали неэффективно, а потому что во всей системе за раз обрабатываются ОГРОМНЫЕ батчи (наборы запросов) — только так удаётся достичь а) высокой эффективности использования GPU б) низких цен — то есть скорость обработки суммарная очень высокая, но скорость генерации ответа на каждый запрос низкая, потому что запросов набивается до краёв. Это определённо ухудшает некоторые юзкейсы, но а) ахахха 20 токенов в секунду это всё ещё быстрее чем у GPT-4.5 (~13) б) преступно низкая цена покрывает это с запасом — если брать цену использования R1 (она сильно выше, чем DeepSeek V3, обычная чат-модель без рассуждений), то за сутки компания бы получила выручку в $562,027. Несложный подсчёт покажет, что в год выйдет примерно $205M с наценкой $562k/$87k = 545% — ...и это та цифра, которую разносят в СМИ и Твиттере. Цифра, конечно же, неправильная, и сами DeepSeek об этом пишут, но кто читает? Она завышена, потому что: 1) цена на чат-модель v3 существенно ниже 2) модель в браузере и в приложении на телефоне БЕС ПЛАТ НА 3) не учитываются новые ночные скидки — реальная цифра сильно ниже, но её сложно оценить без понимания соотношения чат/не чат и платное/бесплатное использование. Думаю, DeepSeek а) довольны б) зарабатывают, а не терпят убытки — 🙂по информации Semianalysis, Gross Margin у OpenAI на инференс 65-75% (но я по контексту не понял, это с учётом субсидий бесплатным пользователям или нет). На GPT-4.5 и o1, наверное, сильно выше. — конкуруренция будет продолжать играть нам на руку