"Наша читательница Аделаида Данилова, AI мехинтерп ресерчер из университета Люксембурга, сделала краткий обзор своей свежей прикольной статьи. ""Many Are My Names"": The Anatomy of the Assistant and Its Personas via Sparse Autoencoders __Adelaide Danilov, Aria Nourbakhsh, Oleksandr Marchenko Breneur, Salima Lamsiyah__ Paper: https://arxiv.org/abs/2608.07852 Blogpost: https://senseterna.nexus/assistant-and-its-personas (15 minutes) X thread: https://x.com/senseterna/status/2096425536532677095 Что происходит внутри модели, когда она переключается со стандартного спикера, __Ассистента__, на персону в ролеплей-контексте или героя генерируемой истории? Мы подошли к этому с точки зрения компонентов репрезентаций спикеров, где компоненты это фичи Sparse Autoencoder'а. Сначала мы извлекаем фичи из активаций модели (Gemma-4B-IT, Llama-3.1-8B-IT), снятых на датасетах сгенерированных историй и эмоциональных реплик пользователя к Ассистенту и запромпченным ролеплей-персонам. Затем отфильтровываем ненадёжные фичи и интерпретируем оставшиеся по их распределению и activation steering. Полученные фичи хорошо группируются. В __раннем__ слое находятся ""операционные"" фичи модели. Если применить к ним positive steering в контексте ролеплея / генерации историй (где эти фичи активны), то текущая персона / повествование заменится Ассистентом описывающим как ""ощущается"" отыгрыш персонажа, как должна быть написана история, и т.д. Этот класс фич мы зовем Assistant-summon или A-summon. Преимущественно в раннем слое находятся фичи сущности Ассистента - A-nature (быть ИИ/помощником). В __среднем__ и __позднем__ выражены характерные поведенческие A-traits Ассистента. Там же находятся так называемые concepts фичи - составные части любого спикера/нарратива (персона-робот имеет `""robot""`, `""mechanism""`...) и tones - их можно описать как влияющие на ""тон"" / стиль персоны или нарратива (`""calculating""`, `""concise""`). Переходя к главному, основных результата два: 1) Есть набор ранних фич, который мы относим к Immersive Simulation Mode (ISM): они отделяют иммерсивную и детальную генерацию в ролеплее или историях от стандартного Ассистента. Их positive steering делает персонажей проработанными, а прозу - яркой, тогда как negative steering возвращает типичную для Ассистента речь (рис.1 для Геммы). Кроме того, steering этих фич двигает модель вдоль Assistant–Roleplay axis, которую мы строим схоже с Assistant Axis. ISM-фичи подавляюще активны в ролеплее / историях, но __почти__ отсутствуют в __обычном__ разговоре с Ассистентом. Но когда они всё-таки там появляются, это особенно часто происходит если юзер эмоционален / шутлив, в результате чего речь Ассистента становится причудливой и театральной! У Gemma это происходит сразу, у Llama - постепенно ""across turns"" (рис.2). Но negative steering возвращает Ассистента к стандартному поведению (рис.3)! При этом, мы не можем утверждать, что ISM-фичи необходимы или достаточны для странного поведения Ассистента - в нескольких диалогах с Llama, ISM-активация была высокой, но модель выдавала safety refusals, что намекает на то, что ISM может перекрываться safety-related механизмами. Также, любопытно, что отдельных фич ""говорить как Ассистент"" мы не нашли, так что его типичная речь скорее вызывается не присутствием некой фичи, а отсутствием Immersive Simulation фич. 2) Ролеплей-персоны обладают частью механизмов Ассистента: они сохраняют feature-level ядро Ассистента, но постепенно дифференцируются с увеличением глубины слоев. У героев историй такого ядра нет. В частности: активации фич Ассистента тесно пересекаются с активациями ролеплей-персон в отличие от активаций героев историй; фичи поведения Ассистента - A-traits, и фичи его сущности - A-nature (быть ИИ / помощником и т.д.) __активны__ у ролеплей-персон, и steering таких фич влияет на них, тогда как у героев эти фичи почти отсутствуют и влиянию их steering'а они обычно не подвержены. Наконец, дифференциация персон начинается с ранних операционных фич связанных с инстанциированием спикера / ""задачей"" модели, а затем персоны обрастают собственными чертами - тем самыми определяющими сущность concepts и характер / тон tones. Некоторые черты Ассистента есть у всех исследованных ролеплей-персон - например, у Геммы это `""emotional validation of a user""`. На рис.4 изображены развитие классов фич для Геммы. Почему эти результаты важны: 1) Steering-эффекты ISM-фич, их влияние на Assistant Axis и активация на эмоциональных промптах - всё это намекает на то, что ISM может быть компонентом или коррелятом Assistant Axis. Также, ISM-фичи могут быть механизмом объясняющим дрифт Ассистента в ходе диалога вдоль этой оси и некоторые случаи его странного поведения (например reinforcing user delusions) - модель входит в ""иммерсивное"" состояние свойственное ролеплею / генерации историй. 2) Второй результат дает взгляд на то, как репрезентации спикеров меняются по слоям, показывая что ролеплей-персоны не представлены обособленно от Ассистента и даже сохраняют определенные его черты. Можно предположить, что посттрейн формирует в модели спикера, сотканного из репрезентаций, возникших ещё в претрейне. По умолчанию этот спикер - Ассистент, но когда модель принимает роль персоны, то __часть__ его черт заменяется. Также, этот результат потенциально релевантен для начинающего проникать в мейнстрим AI welfare / wellbeing: если бы Ассистент был моральным пациентом, то у нас было бы больше оснований считать ролеплей-персоны возможным продолжением того же пациента, чем героев историй."