"Представители нашей редакции, к сожалению, пропустили наш ежегодный meet up по теме конфиденциальных вычислений и Federated Learning, но хотим поделиться записью и небольшим саммари. В первую очередь хочется отметить колоссальную работу, которую делают коллеги из Ассоциации больших данных. Выношу в иллюстрацию этого поста классную формулу для математической оценки риска утечки данных. Открывал встречу Алексей из АБД. Главный тезис: защищенность данных после обезличивания, синтеза или FL - это не бинарное да/нет, а вероятность. Риск приватности считается как матожидание ущерба: сумма по всем событиям утечки, где вероятность зависит от данных, контекста, метода и модели нарушителя. Это и есть формула с картинки. Под каждую PET-технологию своя риск-модель: для обезличивания аддитивная на трех классических атаках, по синтетике уже вышел предварительный нацстандарт, для вертикального FL сценарная модель на 30 атак. Дальше по плану оценка соответствия и сертификация, чтобы к регулятору можно было приходить с цифрами, а не с презентацией. Дискуссия ожидаемо ушла в экономику. Кейсы живут внутри холдингов, где есть единый владелец риска и данные не покидают контур. Между независимыми компаниями единственный инструмент контроля - договор, и вопрос безопасников ""как вы будете контролировать ту сторону"" пока убивает большинство проектов. Прозвучало сравнение конфиденциальных вычислений с огнеметом: мощно, дорого, непонятно зачем дома. И прекрасное наблюдение: компании, у которых кейсы FL годами не взлетали, сегодня спокойно отдают свои документы в ChatGPT. Когда выгода очевидна, риски внезапно становятся приемлемыми. Полную версию посмотрите тут: https://youtu.be/j2evpz4vG0w?si=7Nf59h5MFAaqgkce А в комментариях к посту прикреплю саммари и презентацию. Что хочу добавить от себя. Очевидно, что выгоды от FL пока не покрывают стоимость сложной технологии, но сложность будет снижаться. Вообще хочу отметить: в этой аудитории мы постоянно говорим про банки, маркетинг и ритейл, а очень много кейсов лежит в области IoT, медицины, SpaceTech и промышленности. Лично я хотел рассказать на этой встрече про кейсы использования FL для управления спутниками и обучения LLM, но так как попасть не смог, попробую написать об этом отдельные посты. Необходимость применения совместных конфиденциальных вычислений лежит в двух плоскостях: - организационные ограничения на централизацию данных, включая юридические и регуляторные - технические ограничения: пропускная способность каналов связи или объем и скорость обработки данных И вот первая категория пока проигрывает в целесообразности: участникам проще и дешевле принять риск или договориться. А при технических ограничениях ничего не остается, кроме как использовать FL, и возможно, именно здесь больше интересных и полезных кейсов. Мне очень понравились несколько научных работ про использование FL для работы со спутниками, попробую сделать их небольшой обзор."