Дайджест статей 📰 Честный RAG eval set: как собрать первые 100-300 кейсов и не обмануть себя цифрой 🔗 https://habr.com/ru/articles/1070534/ 💡 Вывод: Разделяйте три набора (smoke 20-50, ручной eval 100-300, обучающие данные) и меряйте retrieval отдельно от генерации, иначе причины поломок смешиваются. Практический момент, который автор подтверждает цифрами: на 120 кейсах разница Recall@5 0.808 против 0.792 — это два запроса, а не победа конфигурации; 95% интервал при p=0.78 и n=120 около ±7.4 пункта. Решение принимайте по срезам (exact entity, версии, «нет ответа»), а не по среднему. 📰 Предиктивное обслуживание в промышленности: три системных условия, без которых технологии не работают 🔗 https://habr.com/ru/companies/severstal/articles/1070560/ 💡 Вывод: Технологический успех при операционном провале — стандартный сценарий: модели прогнозируют верно, а ремонтируют по факту. Автор из «Северстали» приводит свои цифры: до 40% временных рядов с датчиками содержат пропуски, только 45% интерфейсов работают в реальном времени, 35% критического оборудования имеет достаточную историю отказов. Проектируйте не платформу, а замкнутый цикл «данные → культура → знания», где каждый элемент питает остальные, иначе получаете дашборды, которые никто не смотрит. Оговорка по источнику: часть статьи — витрина решений «Северстали», сравнительная таблица Industry 4.0 vs 5.0 подана со ссылкой на Deloitte Manufacturing Industry Outlook 2024, но методика замера в тексте не раскрыта. 📰 DataJunction as Netflix's answer to the missing piece of the modern data stack 🔗 https://netflixtechblog.medium.com/datajunction-as-netflixs-answer-to-the-missing-piece-of-the-modern-data-stack-92af926b40a5 💡 Вывод: Netflix выбрал DataJunction не за фичи, а за движок парсинга и генерации SQL плюс хранение определений в связном графе — на момент POC этого не давали ни Minerva, ни внутренний Mando. Строя семантический слой, режьте scope до ядра: API и граф сначала, UI, кэширование и интеграции потом, иначе ядро придётся переписывать. Отдельный аргумент для тех, кто строит LLM поверх аналитики: внутренние модели Netflix могут отвечать по бизнес-метрикам подотчётно только потому, что определения лежат в одном месте. 📰 GenRec: Towards LLM-Native Recommendation at Netflix 🔗 https://netflixtechblog.com/genrec-towards-llm-native-recommendation-at-netflix-f20be6f643e3 💡 Вывод: Сдвиг от feature engineering к context engineering перестал быть слоганом: GenRec обошёл зрелый продакшн-ранкер, используя в 10-40 раз меньше размеченных примеров второй фазы, а окно контекста стало новым бюджетом на фичи — сжатие вербализации до трети токенов почти не тронуло офлайн-метрики и во столько же уронило стоимость инференса. Prefill-only режим на vLLM (один проход по промпту, скоринг всего каталога без авторегрессии) — тот приём, который вообще делает экономику возможной. Инфраструктура рекомендаций начинает выглядеть как LLM-инфраструктура, а не как классический RecSys-стек. 📰 Опыт миграции аналитики для ритейла Retail Analytics с MS SSAS на Alpha OLAP 🔗 https://habr.com/ru/companies/barsgroup/articles/1070016/ 💡 Вывод: Планируя уход с SSAS, закладывайте инженерную работу на 10-20% показателей: 80% (маржа, средний чек, оборачиваемость) переезжают предсказуемо, а ежедневные остатки на 150 млн строк, out-of-stock, прогнозирование и cross-selling требуют переноса логики в СУБД и переработки витрин. Архитектурная ловушка, которую стоит знать заранее: в Alpha OLAP каждый атрибут измерения — отдельная иерархия, что ломает формулы со ссылками на периоды. Заявленный срок миграции всего контура — около 3,5 человеко-месяцев. Оговорка по источнику: текст написан маркетологом продукта Alpha BI, все цифры производительности — от вендора и партнёра, независимых замеров нет.