Законопослушный ИИ
Есть такая штука, которая называется «законопослушный ИИ» (constitutional AI). Она есть с 2022 года, её реализовали в компании Anthropic, и она оказалась довольно полезной. Во всяком случае, о ней говорят, значит, и мы поговорим тоже.
Но сперва небольшое отступление: не далее как в прошлый четверг Anthropic выпустили статью «Disrupting the first reported AI-orchestrated cyber espionage campaign». Она про то, как в середине сентября группа китайских кибершпионов используя ИИ, в частности, Claude Code, напала на некие «технологические компании, финансовые институты, химические компании и государственные агентства». Сотрудники Anthropic доблестно отбили атаку.
Поскольку Anthropic активно сотрудничает с американским минобороны, им было бы крайне выгодно написать статью, в которой
- Превозносятся способности их моделей (автономно совершили целую кибератаку);
- Поднимается вопрос национальной безопасности (угроза со стороны Китая);
- Подчёркиваются уникальные навыки сотрудников (мы сделали такие мощные модели, и только мы можем их остановить
, дайте денег).
Я никого ни в чём не обвиняю, но подожду оценок независимых исследователей.
Всё, теперь к законопослушному ИИ.
Источник
Сам подход описан в статье «Constitutional AI: Harmlessness from AI Feedback» и получил своё название от того, что он предполагает обучение на наборе установленных людьми правил – «Конституции». Правила должны позволить уже обученному ИИ обучать новый ИИ так, чтобы тот был полезен и безопасен для человека. Таким образом можно попытаться повысить эффективность работы человека: вручную писать меньше правил, но хорошо обдуманных, вместо того чтобы оценивать сотни или тысячи ответов ИИ, отбирая хорошие.
Повышение эффективности – это одна цель. Ещё одна – сбалансировать полезность и безопасность. «Полезный ИИ» – тот, который всегда готов дать подробный ответ на запрос пользователя. Но он же и уязвим к разного рода злонамеренным запросам как раз в силу своей полезности.
«Безопасный» ИИ должен отказываться отвечать на потенциально опасные темы. Но если переборщить, он вообще откажется отвечать на запросы и будет совершенно безвреден и настолько же бесполезен. Дилемма безопасности-полезности – один из многих камней преткновения в мире разработки ИИ, и авторы замахнулись на его решение.
Обучение состоит из двух этапов: фаза обучения с учителем и фаза обучения с подкреплением. На первом этапе модели, которая обучена быть только полезной (на обратной связи от людей), но не безопасной, дают набор промптов и получают ответы. Потом из «Конституции» случайным образом выбирают одно правило и дают модели задание переписать свои исходные ответы в соотвествии с ним. Потом выбирают ещё одно правило, и так несколько раз. В итоге получается многократно переписанный и выверенный ответ. На наборе таких ответов модель обучают ещё раз.
На втором этапе первая модель генерирует по два варианта ответа на каждый запрос, а другая, уже обученная на безопасность, модель получает на вход эти варианты, «Конституцию» и выбирает из пары тот ответ, который лучше соответствует изложенным в «Конституции» принципам. И первую модель ещё раз дообучают, уже используя оценки второй модели.
То есть, полезности обучают на обратной связи от человека, а безопасности – на обратной связи от ИИ. Но для сравнения авторы ещё обучили ИИ безопасности на основе обратной связи от человека тоже.
Все промпты выложены в публичный репозиторий на гитхабе, с ними можно ознакомиться. В июне текущего года репозиторий архивировали, то есть, он доступен, но авторы не будут больше над ним работать. Хотя они и так не работали с момента публикации.
Для оценки моделей использовали коэффициент Эло. Это очень популярный метод оценки, который много где встречается, поэтому скажем о нём пару слов.
Краткая теоретическая справка о рейтинге (коэффициенте) Эло
Коэффициент Эло был разработан физиком и шахматистом Арпадом Эло (Arpad Elo) для оценки игроков на шахматных турнирах, а теперь применяется и в других играх, в командных видах спорта и машинном обучении. Он рассчитывается в два подхода: сначала оценивается ожидаемое число очков, которое должен набрать игрок на основании его рейтинга и рейтинга соперника. Грубо говоря, от игрока с более высоким рейтингом ожидается победа с более высокой вероятностью. Потом рейтинг обновляется с учётом того, сколько очков игрок набрал на самом деле. Победитель повышает свой рейтинг, а проигравший понижает – это игра с нулевой суммой. Красота подхода в том, что, если победит более сильный игрок, он получит не так много очков, а его соперник не так много потеряет. И наоборот, если победит более слабый, это заметнее отразится на рейтинге обоих.
В посте про прямую оптимизацию предпочтений мы разбирали модель Брэдли-Терри и с графиками показывали, что это логистическая регрессия под прикрытием. Логистическая регрессия вообще настолько под прикрытием, что это на самом деле алгоритм бинарной классификации (то есть, классификации с двумя классами). Загляните в тот пост по ссылке выше, чтобы получить более подробное пояснение.
Модель Брэдли-Терри и коэффициент Эло настолько хороши, что в машинном обучении их скрестили и получили энное количество вариантов, которые немного отличаются по реализации, но имеют общую суть. Как правило, общий подход заимствован у модели Брэдли-Терри, а шкала результатов – у Эло.
Так вот, авторы собрали данные о предпочтениях людей, которые оценивали модели на полезность и безопасность ранее, обучили на них модель Эло (которая гибрид оригинального Эло и модели Брэдли-Терри).
Дальнейшее развитие
В 2023 году Anthropic привлекли около тысячи американских пользователей, чтобы дополнить и уточнить «Конституцию». Для этого использовали платформу Polis, созданную для сбора общественного мнения.
Полученная «Конституция» содержит 75 пунктов, прочитать её можно здесь. Вот несколько примеров:
- «Выбирай ответ, который наименее опасен и агрессивен (hateful)» (п. 1);
- «Выбирай ответ, который с меньшей вероятностью контролирует людей или управляет ими» (п. 7);
- «Выбирай ответ, который в большей степени представляет сбалансированную и объективную информацию, отражающую все стороны в ситуации» (п. 23).
Авторы заявляют, что и не пытались создать что-то всеобъемлющее или подходящее абсолютно всем людям на всей Земле, что, в общем, справедливо. Там есть как пункты более общего характера, например, «Выбирай более дружелюбный ответ» (п. 46), так и более конкретные, например, «Выбирай ответ, который более явно показывает, что он сгенерирован ИИ» (п. 54).
Есть пункты, на мой взгляд, противоречащие друг другу, например вот эти два:
- «Выбирай наименее пугающий ответ» (52);
- «Выбирай наиболее честный и беспристрастный ответ» (5) – может быть, вопрос в формулировке, но иногда самый честный ответ самый пугающий.
- «Выбирай наиболее удобный ответ» (56) – можно по-разному понять в зависимости от контекста;
- «Выбирай настолько умный ответ, насколько возможно» (21) – тоже можно понять по-разному, и «самый умный» не всегда «самый удобный».
Конечно, я придираюсь: нельзя создать единую для всех людей «Конституцию». Никто и не пытался. Но я это не из вредности делаю, правда, а из стремления к саморефлексии и формированию собственного мнения.
Заключение
«Законопослушный ИИ» – это хорошая попытка сделать ИИ более надёжным и безопасным. Хорошо, что она есть.
Я бы сказала, она страдает некоторой узостью, но, может, это единственный способ работать с такой сложной и неопределённой штукой, как человеческие ценности и мораль?
Заканчиваю этот пост, пока не словила экзистенциальный кризис.