"Дайджест статей 📰 How We Refresh Razorpay's Data Warehouse 10x Faster with Graphs and Indexes 🔗 https://engineering.razorpay.com/how-we-refresh-razorpays-data-warehouse-10x-faster-with-graphs-and-indexes-538abc244703 💡 Вывод: при полном пересчёте витрин на больших джойнах (30+ таблиц) выигрыш даёт не оптимизация самого джойна, а смена модели: описать витрину как граф зависимостей и обновлять только затронутые ветки через вторичные индексы на озере - так Razorpay убрала зависимость от TiDB для исторических данных и сократила компьют на порядок. 📰 How Cerebras Built Its Enterprise Knowledge Base 🔗 https://www.cerebras.ai/blog/how-we-built-our-knowledge-base 💡 Вывод: рабочая база знаний строится не на единой ""истине"", а на прямой выгрузке из мест, где данные и так живут (Slack, код, доки), с дистилляцией сырых тредов в LLM-нормализованные документы перед эмбеддингом - сырой транскрипт для поиска хуже, чем его выжимка. 📰 DATA MANAGEMENT IN THE AGE OF AI 🔗 https://williaminmon.substack.com/p/data-management-in-the-age-of-ai 💡 Вывод: в мире генеративного ИИ управление данными теряет прямой контроль (правки в базе) и переходит к косвенному - фильтрации того, что вообще попадает в LLM; ключевая задача смещается с моделирования структурированных схем на постоянную актуализацию онтологии/таксономии для неструктурированного текста. 📰 Scaling Grab's Data Lake: Our journey to Apache Iceberg adoption 🔗 https://engineering.grab.com/our-journey-to-apache-iceberg-adoption 💡 Вывод: миграция на Iceberg окупается не сама по себе, а через конкретные узкие места (Z-ordering сократил запрос с 70 до 6 секунд, API-costs на одной таблице упали на 95%); при этом мигрировать нужно точечно - по частоте сканирования и стоимости API, а не всё озеро разом. 📰 Why We Moved from Hive-Style Data Lakes to Apache Iceberg? 🔗 https://medium.com/@rongalinaidu/why-we-moved-from-hive-style-data-lakes-to-apache-iceberg-f9f23e7a64d3 💡 Вывод: сила Iceberg не в замене Parquet, а в отвязке метаданных от файловой структуры (S3 LIST на 50k файлов = 50 запросов только на discovery) и в column ID вместо имени/позиции колонки - это единственное, что делает эволюцию схемы безопасной без переписывания истории."