NVFP4, deepgemm, DSpark, P/D disaggr, CUDA 13.0 Это все для привлечения внимания, потому что: Снова ищу инженеров в команду AI платформы Битрикс24 В прошлый раз из канала пришло много сильных ребят, так что заходим на второй круг. Сейчас нанимаем LLM Ops - тех, кто будет отвечать за то, как модели живут внутри платформы. Что за платформа? Это основа, на которой строятся все AI фичи компании: от простых сценариев до агентов, управляющих Б24.По факту - мы внутренний провайдер моделей, а наши заказчики - продуктовые и внутренние команды, которые генерируют больше 20 млн запросов в месяц (и это только llm). Мы отвечаем за модельки под капотом (для этого у нас больше 200 серверов с GPU от t4 до 8хH200 и B200), за их качество, доступность, производительность и эффективное использование. Плюс вот эти ваши лайтллмы, роутеры, кэши, эвалы, guardrails и прочие интересные штуки. Команда кросс-функциональная: разработчики, ML и *Ops инженеры. Что за LLM Ops? Всё, что связано с моделями, vLLM и инференсом: поднять, настроить, разогнать, обновить и отвечать за то, что оно держит нагрузку и не сжигает деньги впустую. Чем предстоит заниматься: - выжимать максимум из того железа и фреймворка, что уже есть; - поднимать модели и готовить среду под тесты и прод - llm, stt, эмбеддинги и тд; - следить за релизами vLLM и обновляться, потому что каждый релиз приносит фичи, которые нам реально нужны (ну или баги, которые чинить тоже иногда приходится нам); - отвечать за производительность конкретных инстансов: смотреть метрики, ловить узкие места, реагировать; - считать ёмкость и стоимость: 200 машин сами себя эффективно по моделям не разложат. Что ждём от кандидата: - практический опыт именно с vLLM(SGLang тоже котируется); - продовый опыт эксплуатации LLM-сервисов; - понимание, как устроены современные LLM: трансформеры, токенизация, контекстное окно, как и что влияет на latency и throughput; - уметь работать и без кубернетисов; Сильно в плюс: - опыт с различными вариантами роутинга кэша (vllm-r, dynamo, LMCache. и тд); Куда писать и что присылать? Пишите мне в личку: @Ser_no В сообщении лучше сразу прислать: - CV / LinkedIn / GitHub; - пару слов, в чём вы сильны или крутые кейсы которые решали в последнее время; - любые артефакты, если есть: код, конфиги, бенчмарки, дашборды, отчёты, посты; Про платформу рассказываю тут и про команду тут. Перешлите тому самому, верю в силу телеграма)
NVFP4, deepgemm, DSpark, P/D disaggr, CUDA 13.0 Это все для привлечения…
Из этого канала
- #1242⚪️ DeepSeek v4 pro уже легаси … становится с запуском DS 4.1 Flash. Все запросы…
⚪️ DeepSeek v4 pro уже легаси … становится с запуском DS 4.1 Flash. Все запросы на pro модель будут перенаправляться на новый флеш.
- #1243⚪️ AA сделала удобные графики Artificial Analysis, которую вы точно знаете по…
⚪️ AA сделала удобные графики Artificial Analysis, которую вы точно знаете по её Artificial Analysis Index - сделала на сайте удобные графики разного вида.
- #1244⚪️ OpenDesign хвалит DeepSeek 4.1 Flash По мне так, чрезмерно даже хвалят, но…
⚪️ OpenDesign хвалит DeepSeek 4.1 Flash По мне так, чрезмерно даже хвалят, но по их тестам он очень здорово умеет в дизайн на их бенчмарке.
- #1240⚪️ ZSP - Зайки ищут региональных партнёров Какая интересная программа! Комания…
⚪️ ZSP - Зайки ищут региональных партнёров Какая интересная программа! Комания ищет партенров, которые будут отвечать за развитие и внедрение GLM в своих…
- #1239⚪️ Muse Цук достраивает ИИ экосистему - представлен агент Muse Это некий аналог…
⚪️ Muse Цук достраивает ИИ экосистему - представлен агент Muse Это некий аналог Grok Bot / Cowork / ChatGPT Work, тоже со своим компом в облаке.