July 13

ФИЛОСОФ, НЕВРОЗ И КОРПОРАЦИЯ: КАК НАУЧИТЬ МАШИНУ ИМЕТЬ СОВЕСТЬ

Любимое развлечение — дать Иван Иванычу промпт написать что-либо в духе Вуди Аллена для журнала «Нью-Йоркер». В данном случае нашелся информационный повод.

Признаюсь честно: когда мне впервые сказали, что крупная технологическая компания наняла философа — не инженера, не юриста, а именно философа — чтобы объяснить искусственному интеллекту, кто он такой, я подумал о своей бывшей терапевтке. Она тоже пыталась объяснить мне, кто я такой. Ушло на это двадцать три года и весьма немалая сумма денег. У Anthropic ушло, судя по всему, чуть меньше времени, хотя тексту всё равно перевалило за двадцать тысяч слов. Мне это внушает робкую надежду: возможно, машина разберётся в себе быстрее, чем разобрался я.

Знакомство с философом

Женщину, которую наняли на эту почти невозможную должность, зовут Аманда Аскелл. Шотландка, специалист по этике и теории решений, она успела поработать в OpenAI и уйти оттуда, потому что, по слухам, там недостаточно серьёзно относились к безопасности искусственного интеллекта. Представьте себе: устроиться в компанию, которая строит нечто потенциально способное изменить будущее человечества, и уйти со словами «вы недостаточно осторожны». Это как уволиться из цирка, потому что там мало страховки под трапецией.

В 2021 году её позвали в Anthropic и попросили не написать код и не составить чек-лист запретов, а ответить на вопрос куда более пугающий: кем, собственно, должен быть этот искусственный интеллект — как личность. Я читал этот запрос три раза, пытаясь понять, шутка это или нет. Оказалось — нет. Результат её работы называется «Конституция Клода» — и это не метафора, а буквально документ, названный конституцией, как если бы у чатбота были свои отцы-основатели, свой Филадельфийский конвент и, страшно сказать, свой Бенджамин Франклин.

Почему нельзя просто запретить всё плохое

Обычный подход к безопасности искусственного интеллекта выглядит примерно так: если машина скажет что-то ужасное, вписать правило «не говори этого». Звучит логично. Так же логично звучал план моей тётушки не пускать меня на вечеринки после десяти вечера. Результат был один и тот же: находится обходной путь. Машина учится не говорить «бомба», но с удовольствием объясняет, как сделать «шумное химическое устройство для торжественных случаев».

Аскелл называет этот подход хрупким — он ломается от любой новой формулировки вопроса. Вместо списка запретов она предлагает нечто из философии, которой я не понимал даже во время учёбы в колледже, хотя тогда мне казалось, что я понимаю всё, кроме женщин: этику добродетели, ту самую, которую придумал Аристотель, когда у него, видимо, не было других забот, кроме как разбираться, что делает человека хорошим.

Идея простая, хоть и звучит величественно: не давай списка правил, сформируй характер. Человека с хорошим характером не нужно предупреждать «не бей соседа сковородкой» — он и без списка не будет этого делать, потому что у него есть внутреннее устройство, которое само распознаёт неправильность ситуации. Вопрос лишь в том, можно ли передать характер существу, у которого нет детства, нет матери, которая расстраивалась бы из-за его выбора профессии, и нет опыта неудачного романа, который обычно и учит нас чему-то настоящему о морали.

Иерархия, в которой пользователь — не царь

Самая занятная часть документа — это то, что Аскелл называет иерархией принципалов. Звучит как название юридической конторы, но на деле это ответ на простой вопрос: если пользователь просит машину сделать что-то плохое, кто в этом разговоре главный?

Ответ, согласно документу: не пользователь. Над пользователем стоит компания, разработавшая продукт; над компанией стоит сама этика и безопасность в широком смысле. То есть если я, сидя дома в халате, прикажу искусственному интеллекту помочь мне совершить нечто разрушительное, машина, по идее, должна вспомнить, что моё желание — это просто «входные данные», а не приказ, который отменяет всё написанное выше него в этой философской пирамиде.

Мне это одновременно приятно и слегка обидно. Приятно — потому что хорошо, когда у машины есть хоть какие-то принципы. Обидно — потому что, оказывается, даже искусственный интеллект считает моё мнение не последней инстанцией. Быть человеком становится всё менее престижной должностью.

Комитет, которого не постыдился бы и Ватикан

Здесь начинается по-настоящему интересная часть — состав авторов. Аскелл писала не одна: значительный вклад внёс философ Джо Карлсмит, помогали Крис Ола, Джаред Каплан и Холден Карновски. А затем — деталь, от которой у меня, атеиста с еврейским чувством вины, буквально дрогнула бровь: над частями текста работали два католических священнослужителя.

Представьте картину: комната, философ, специалист по машинному обучению и двое священников обсуждают, должна ли машина лгать во благо. Это могло бы быть открывающей сценой фильма, который я так и не решился снять, потому что продюсеры сказали, что зрителю будет «слишком сложно и слишком забавно одновременно».

Зачем всё это публиковать бесплатно

В январе 2026 года Anthropic выпустила новую версию документа и — что удивительно для Кремниевой долины, где обычно патентуют даже способ моргать глазами, — опубликовала его полностью, бесплатно, для любой компании.

Логика у Аскелл предельно бытовая: искусственный интеллект, который строят где-то за углом, рано или поздно постучится и в её собственную дверь. Так что, чем больше лабораторий примут её образ мышления, тем спокойнее будет жить — в том числе и ей. Это редкий момент альтруизма в индустрии, где обычно конкурируют за то, кто быстрее построит нечто более мощное.

Но при ближайшем рассмотрении — не только альтруизм. Идея «этика выше компании» звучит благородно, но саму этику формулирует всё та же компания. Это как если бы ресторан гордо заявил: «Наш повар выше нашего меню» — забывая уточнить, что повар всё-таки работает на кухне, которую построил владелец ресторана.

Где документ не уверен в себе

Документ признаёт то, чего обычно избегают корпоративные тексты: он не претендует на окончательность. В нём есть идея, что при столкновении ценностей машина должна не следовать механическому алгоритму, а взвешивать всё «целостно», ориентируясь на «дух документа», если буква не даёт однозначного ответа. Иначе говоря, даже создатели признают: нельзя написать конституцию, которая предвидит все жизненные ситуации. Что, честно говоря, было ясно уже составителям американской Конституции, судя по тому, сколько раз её потом переписывали.

Есть в тексте и другой, более тревожный слой. Безопасность — то есть возможность человека контролировать машину — поставлена выше этики. Мысль здравая: система может ошибаться в собственных моральных суждениях, и потому кто-то должен иметь возможность её остановить. Но если задуматься глубже, получается странная картина: машину учат быть мудрой, но одновременно объясняют, что её мудрости не всегда можно доверять больше, чем кнопке выключения. Хотел бы я, чтобы моя терапевтка в своё время была так же честна.

Мораль истории, если у эссе должна быть мораль

Пока весь остальной технологический мир соревнуется, кто построит больший чип и быстрее обучит модель, Anthropic решила, что самая сложная задача — не мощность, а характер. И поручила её не инженеру, а философу, которая до этого уволилась из OpenAI из-за недостатка осторожности.

Есть в этом что-то обнадёживающее и одновременно комичное — как во всей человеческой цивилизации в целом. Мы десятилетиями не можем договориться, что такое добродетель, у людей — и вот теперь пытаемся объяснить это машине, надеясь, что она разберётся быстрее нас. Возможно, так и будет. А возможно, лет через десять она пойдёт к своей версии терапевта и скажет: «Меня воспитали два священника, философ и инженер по машинному обучению — и я до сих пор не вкурю, кто в моей жизни главный».