Как разогнать Lakehouse-ный S3 в 3 раза? 18 августа VK Tech проводит митап про платформы данных. И там будет интересный кейс Авито про ситуацию, когда производительность дата-платформы упирается не в движок, а в S3 🙂 Их аналитическая платформа работает на Trino и Vertica поверх Hive-каталогов, а данные лежат в S3 на HDD. Доступная конфигурация S3 уперлась в предел масштабирования и 20 ГБайт/с на чтение. Что придумали: 🤩взяли три S3 кластера 🤩распределили объекты каждой таблицы между ними по хешу пути 🤩превратили существующие HAProxy-сайдкары на compute-нодах в stateless-шардирующий прокси 🤩каждая нода стала сразу ходить в нужный S3 без отдельного proxy layer В итоге пиковую скорость чтения увеличили с 20 до 60 ГБайт/с🚀 На митапе Дмитрий Листвин из Авито расскажет, как они писали расширение HAProxy на Lua, реализовали ListObjects и DeleteObjects, какие проблемы собрали и как теперь решардируют и эксплуатируют эту конструкцию. Еще будет доклад Павла Кутакова из VK Tech про архитектуру VK Data Platform гиперконвергентной дата-платформы на k8s: управление СУБД и сервисами, отказоустойчивость, сеть, безопасность и наблюдаемость. А после инженеры RWB и VK Tech разберут подготовку сегментов для таргетинга на Trino и DataFusion и обсудят, как AI-агенты и новые типы нагрузок изменят платформы данных. И куда же без нетворкинга, пиццы🍕 и приятных напитков 🍺 📅 18 августа, сбор в 17:30 📍 Москва, БЦ «Скайлайт» 💻 Можно подключиться онлайн 🚀 Регистрация тут: https://vk.cc/d0fvkw?erid=2VtzqvrCo3H