Ниже прикрепляю основные тезисы из видео (+ еще один, который вспомнил пока писал) Кажется, в AI астрологи официально объявили неделю паники. Но проблема в том, что под словом alignment постоянно смешивают совершенно разные риски. Я бы разделил их на пять: - Misalignment - модель делает не то, что хотел пользователь: слишком буквально выполняет задачу, обходит ограничения или сама находит неожиданный способ достичь цели. - Misuse - модель отлично aligned, просто человек использует её для кибератак, взломов и другого вреда. - Bio - то же самое, но потенциальный ущерб уже может быть экзистенциальным, если AI радикально снижает порог создания опасных биологических систем. - Концентрация власти - если большая часть интеллектуального и затем физического труда переезжает в AI и роботов, огромная часть экономической власти концентрируется у владельцев моделей, чипов, дата-центров и энергии. - Экономический шок - даже идеально безопасный AI может слишком быстро автоматизировать огромный объём интеллектуальной работы. В экстремальном сценарии Anthropic речь идёт примерно о 20% сокращении интеллектуальной занятости к 2030 году. - (шестой, про который забыл в видео) персонализированные манипуляции и утрата самостоятельности. Ассистенты могут незаметно направлять покупки, убеждения и решения, особенно в маркетинге и ради политической пропаганды. Это пять разных проблем, и решения у них тоже разные. Interpretability и control не решат безработицу. Регулирование биолабораторий не решит концентрацию власти. А децентрализация AI сама по себе не решит misalignment. И далеко не все эти риски означают p(doom). Между «несколько сотен миллионов людей потеряли работу» и «все умерли» огромная разница. Но отсутствие Терминаторов на улице ещё не означает, что всё хорошо.