В Lakehouse можно сколько угодно ускорять compute, но если S3 не успевает отдавать данные, вся платформа упрётся в storage. 18 августа на Data Meetup VK Tech будет хороший практический кейс Авито именно про это. Их аналитическая платформа работает на Trino и Vertica поверх Hive-каталогов, данные хранятся в S3 на HDD. Один S3 кластер упёрся в предел масштабирования и 20 ГБайт/с на чтение. Тогда команда взяла три кластера S3, стала распределять объекты каждой таблицы по хешу пути и использовала уже существующие HAProxy-сайдкары на compute-нодах как stateless-шардирующий прокси. В результате пиковую скорость чтения увеличили с 20 до 60 ГБайт/с без отдельного proxy layer. Дмитрий Листвин из Авито расскажет, как они писали расширение HAProxy на Lua, реализовали ListObjects и DeleteObjects, какие проблемы получили при решардинге и как теперь эксплуатируют это решение. Ещё будет доклад Павла Кутакова из VK Tech про архитектуру VK Data Platform гиперконвергентной дата-платформы на Kubernetes: управление СУБД и сервисами, отказоустойчивость, сеть, безопасность и наблюдаемость. После докладов инженеры RWB и VK Tech разберут кейс подготовки сегментов для таргетинга на Trino и DataFusion. Затем обсудят Kubernetes, self-service-аналитику, подготовку платформ под AI-агентов и то, как AI меняет разработку дата-платформ. После технической части — приятные напитки, пицца и можно будет обсудить всё это уже без слайдов. 18 августа, сбор в 17:30 Москва, БЦ «Скайлайт» Онлайн тоже будет. Регистрация 👉 https://vk.cc/d0fvdV?erid=2VtzqxS4LDR