Яндекс открыл код YTsaurus Flow — с ним алгоритмы быстрее замечают, что интересы пользователей изменились Технология обрабатывает клики, лайки и другие события сразу по мере их появления. Немножко контекста. Чтобы рекомендации и реклама попадали в интересы человека, алгоритмам нужны свежие данные о его действиях: что он покупал, какую музыку слушал, о чем спрашивал. Обычно эти данные обрабатывают не сразу, их сначала накапливают, примерно как посылки для отправки поездом. Из-за этого информация поступает в систему с задержкой, которая может составлять часы. Flow сводит ее практически к нулю. Что по технике: — Каждое событие обрабатывается ровно один раз, без потерь и дублей. — При сбоях технология продолжает работать, перераспределяя нагрузку между доступными серверами. — Flow работает в рамках YTsaurus, поэтому накопленную и свежую информацию можно учитывать в одной системе. В Яндексе Flow уже используют Маркет, антифрод и Реклама. В Рекламе он каждую секунду обрабатывает более 100 ГБ данных и миллионы событий. Подготовка данных для дообучения некоторых моделей раньше занимала больше 10 часов, а теперь эту задержку удалось почти полностью устранить. Подойдет и за пределами рекламы: для подготовки данных для обучения ML-моделей, обновления информации на сайтах и в приложениях, подсчета просмотров, кликов и заказов. Выложили под Apache 2.0, а значит, использовать технологию можно и в коммерческих продуктах. github.com/ytsaurus/ytsaurus/tree/main/yt/yt/flow То есть Яндекс открыл не экспериментальную разработку, а технологию, которая уже успешно работает в его сервисах 💡