Дайджет статей 📰 От «грязных» справочников к золотым записям: как AI/ML спасает НСИ от хаоса 🔗 https://habr.com/ru/companies/sofros/articles/1063104/ 💡 Вывод: дедупликация НСИ через метрики похожести строк — тупик (по оценке авторов, приемлемое качество лишь в 30–40% случаев), рабочая схема — атрибутивная нормализация: классификация, извлечение характеристик, эталонные наименования и только потом дедупликация. Осторожно: материал вендорский, SOFROS продаёт описываемый сервис, цифры не независимые. 📰 Дашборд без правильного вопроса опаснее его отсутствия 🔗 https://habr.com/ru/articles/1060014/ 💡 Вывод: каждый отчёт обязан проходить тест «какое управленческое решение я приму, посмотрев на него», иначе он существует ради себя. Показательный кейс: SLA-отчёт считал нарушения без причин, и 400 задач, ждущих бизнес, выглядели как провал ИТ. Шесть узких отчётов под конкретные решения работают лучше одного «красивого» экрана. 📰 Зрелость управления данными: предлагаю простую методику оценки 🔗 https://habr.com/ru/articles/1063316/ 💡 Вывод: цель не максимальный уровень зрелости, а соразмерный масштабу и рискам. Практичный механизм — блокирующие критерии: направление с медианой 3,5 считается заблокированным, если бэкапы ни разу не восстанавливались или у ключевых показателей нет владельца. Часто дешевле договориться об определении выручки, чем строить DWH. 📰 Дата-контракты 2.0: как мы автоматизировали обмен данными между продуктами (МТС) 🔗 https://habr.com/ru/companies/ru_mts/articles/1061814/ 💡 Вывод: контракт живёт, только если встроен в процесс разработки и занимает 3–5 минут, иначе откладывается из спринта в спринт. Неожиданный факт из практики: половину контрактов инициируют потребители данных, а не поставщики. Реестр контрактов постепенно превращается в каталог дата-продуктов и сокращает дубли витрин. 📰 Почему LLM нельзя просто подключить к базе данных и получить GenBI? 🔗 https://habr.com/ru/articles/1062782/ 💡 Вывод: надёжный GenBI строится поверх исполняемого семантического слоя (готовые меры SSAS/metrics layer), а не поверх физических таблиц: LLM должна выбирать проверенную меру, а не пересобирать бизнес-логику на каждый вопрос. Прямое подключение к OLTP даёт худший класс ошибок — правдоподобно неверные цифры. 📰 RAG — это про замеры, а не про код 🔗 https://habr.com/ru/articles/1063026/ 💡 Вывод: индустриальные дефолты — гипотезы, а не факты: на реальных данных BM25 уронил hit@3 с 74% до 55%, реранкер до 64%, а единственным работающим улучшением оказалась бесплатная калибровка порога под роль продукта. Сначала честный eval-харнесс и разделение recall/ranking, потом любые компоненты.
Дайджет статей 📰 От «грязных» справочников к золотым записям: как AI/ML спасает…
Из этого канала
- #2968Коллеги, редакция тут в свободное время провела небольшое исследование на тему…
Коллеги, редакция тут в свободное время провела небольшое исследование на тему того, как финансовые организации выводят генеративный ИИ в чат-боты, ассистенты…
- #2967Коллеги, обратите внимание на книгу…
Коллеги, обратите внимание на книгу…
- #2965Что то редакция сильно подозревает что хитрые OpenAI не просто так были…
Что то редакция сильно подозревает что хитрые OpenAI не просто так были побеждены собственной хитрой моделью.