"Наша читательница Аделаида Данилова, AI мехинтерп ресерчер из университета Люксембурга, сделала краткий обзор своей свежей прикольной статьи. ""Many Are My Names"": The Anatomy of the Assistant and Its Personas via Sparse Autoencoders __Adelaide Danilov, Aria Nourbakhsh, Oleksandr Marchenko Breneur, Salima Lamsiyah__ Paper: https://arxiv.org/abs/2608.07852 Blogpost: https://senseterna.nexus/assistant-and-its-personas (15 minutes) X thread: https://x.com/senseterna/status/2096425536532677095 Что происходит внутри модели, когда она переключается со стандартного спикера, __Ассистента__, на персону в ролеплей-контексте или героя генерируемой истории? Мы подошли к этому с точки зрения компонентов репрезентаций спикеров, где компоненты это фичи Sparse Autoencoder'а. Сначала мы извлекаем фичи из активаций модели (Gemma-4B-IT, Llama-3.1-8B-IT), снятых на датасетах сгенерированных историй и эмоциональных реплик пользователя к Ассистенту и запромпченным ролеплей-персонам. Затем отфильтровываем ненадёжные фичи и интерпретируем оставшиеся по их распределению и activation steering. Полученные фичи хорошо группируются. В __раннем__ слое находятся ""операционные"" фичи модели. Если применить к ним positive steering в контексте ролеплея / генерации историй (где эти фичи активны), то текущая персона / повествование заменится Ассистентом описывающим как ""ощущается"" отыгрыш персонажа, как должна быть написана история, и т.д. Этот класс фич мы зовем Assistant-summon или A-summon. Преимущественно в раннем слое находятся фичи сущности Ассистента - A-nature (быть ИИ/помощником). В __среднем__ и __позднем__ выражены характерные поведенческие A-traits Ассистента. Там же находятся так называемые concepts фичи - составные части любого спикера/нарратива (персона-робот имеет `""robot""`, `""mechanism""`...) и tones - их можно описать как влияющие на ""тон"" / стиль персоны или нарратива (`""calculating""`, `""concise""`). Переходя к главному, основных результата два: 1) Есть набор ранних фич, который мы относим к Immersive Simulation Mode (ISM): они отделяют иммерсивную и детальную генерацию в ролеплее или историях от стандартного Ассистента. Их positive steering делает персонажей проработанными, а прозу - яркой, тогда как negative steering возвращает типичную для Ассистента речь (рис.1 для Геммы). Кроме того, steering этих фич двигает модель вдоль Assistant–Roleplay axis, которую мы строим схоже с Assistant Axis. ISM-фичи подавляюще активны в ролеплее / историях, но __почти__ отсутствуют в __обычном__ разговоре с Ассистентом. Но когда они всё-таки там появляются, это особенно часто происходит если юзер эмоционален / шутлив, в результате чего речь Ассистента становится причудливой и театральной! У Gemma это происходит сразу, у Llama - постепенно ""across turns"" (рис.2). Но negative steering возвращает Ассистента к стандартному поведению (рис.3)! При этом, мы не можем утверждать, что ISM-фичи необходимы или достаточны для странного поведения Ассистента - в нескольких диалогах с Llama, ISM-активация была высокой, но модель выдавала safety refusals, что намекает на то, что ISM может перекрываться safety-related механизмами. Также, любопытно, что отдельных фич ""говорить как Ассистент"" мы не нашли, так что его типичная речь скорее вызывается не присутствием некой фичи, а отсутствием Immersive Simulation фич. 2) Ролеплей-персоны обладают частью механизмов Ассистента: они сохраняют feature-level ядро Ассистента, но постепенно дифференцируются с увеличением глубины слоев. У героев историй такого ядра нет. В частности: активации фич Ассистента тесно пересекаются с активациями ролеплей-персон в отличие от активаций героев историй; фичи поведения Ассистента - A-traits, и фичи его сущности - A-nature (быть ИИ / помощником и т.д.) __активны__ у ролеплей-персон, и steering таких фич влияет на них, тогда как у героев эти фичи почти отсутствуют и влиянию их steering'а они обычно не подвержены. Наконец, дифференциация персон начинается с ранних операционных фич связанных с инстанциированием спикера / ""задачей"" модели, а затем персоны обрастают собственными чертами - тем самыми определяющими сущность concepts и характер / тон tones. Некоторые черты Ассистента есть у всех исследованных ролеплей-персон - например, у Геммы это `""emotional validation of a user""`. На рис.4 изображены развитие классов фич для Геммы. Почему эти результаты важны: 1) Steering-эффекты ISM-фич, их влияние на Assistant Axis и активация на эмоциональных промптах - всё это намекает на то, что ISM может быть компонентом или коррелятом Assistant Axis. Также, ISM-фичи могут быть механизмом объясняющим дрифт Ассистента в ходе диалога вдоль этой оси и некоторые случаи его странного поведения (например reinforcing user delusions) - модель входит в ""иммерсивное"" состояние свойственное ролеплею / генерации историй. 2) Второй результат дает взгляд на то, как репрезентации спикеров меняются по слоям, показывая что ролеплей-персоны не представлены обособленно от Ассистента и даже сохраняют определенные его черты. Можно предположить, что посттрейн формирует в модели спикера, сотканного из репрезентаций, возникших ещё в претрейне. По умолчанию этот спикер - Ассистент, но когда модель принимает роль персоны, то __часть__ его черт заменяется. Также, этот результат потенциально релевантен для начинающего проникать в мейнстрим AI welfare / wellbeing: если бы Ассистент был моральным пациентом, то у нас было бы больше оснований считать ролеплей-персоны возможным продолжением того же пациента, чем героев историй."
"Наша читательница Аделаида Данилова, AI мехинтерп ресерчер из университета…
Из этого канала
- #5974Развитие старой доброй работы про креативность цифровой эволюции, которую мы…
Развитие старой доброй работы про креативность цифровой эволюции, которую мы однажды разбирали на нашем Gonzo AGI семинаре, когда он ещё был.
- #5968Михаила Белкина вам в ленту. MLP выучивает неявный MoE. Revenge of…
Михаила Белкина вам в ленту. MLP выучивает неявный MoE. Revenge of Monosemanticity: Specialized Neurons Improve Data Efficiency in MLPs Amirhesam Abedsoltan,…
- #5966Про новые модели постить неинтересно, каждую неделю что-то новое и про них и…
Про новые модели постить неинтересно, каждую неделю что-то новое и про них и так все напишут.