Дружелюбный ИИ
Есть такая организация — Machine Intelligence Research Institute (MIRI, Институт исследования машинного интеллекта). У этой организации есть много любопытных работ, в основном про ИИ и его влияние на человечество.
Влияние их достаточно велико, их много кто цитирует. Я тоже цитировала и считаю их работу важной, хотя во многом с ними не согласна:
- в этом посте рассказала про план MIRI по предотвращению вымирания человечества от чрезмерного развития ИИ;
- здесь начала рассказывать про работу “Creating Friendly AI 1.0” (“Создаём дружелюбный ИИ 1.0”), которую (спойлер) мы обсудим и сегодня.
Если всё сложить, ключевые точки несогласия мои с ними следующие:
- Они рассматривают всё развитие ИИ в парадигме “США против Китая”. Для американской некоммерческой организации это как будто бы нормально, но в целом это очень узкий взгляд на мир.
- Они торгуют страхом, хоть и заявляют рациональный подход. Я не думаю, что разговоры о конце света подтолкнут кого-то к рациональным решениям.
- Их картины будущего отражают взгляды сценаристов Голливуда и предпринимателей из Кремниевой долины. Грех ли это? Не грех. Но это снова очень узкий взгляд.
В общем, мне нравится их работы использовать как отправные точки для более глубокой дискуссии.
#ai #friendlyai #ии #дружелюбныйии
В предыдущих сериях
Я начала рассказывать про “Дружелюбный ИИ” вот в этом видео и планировала снять серию, но потом мне стало лень.
Точнее, не то чтобы лень — просто это не совсем мой формат представления информации. Я бы снимала видео совсем редко, когда прям захочется, но строго по расписанию не могу: мне намного больше нравится писать тексты.
Если вам вдруг больше нравится смотреть видео, то можете глянуть: там я читаю главу 2 “Challenges of Friendly AI” (“Вызовы дружелюбного ИИ”) и делюсь мыслями на её счёт.
Если вам больше нравится читать, то ниже я перескажу его содержание, а в следующем разделе поста обсудим третью главу. Работа объёмная, поэтому я её хочу обсуждать по кусочкам.
Итак, во второй главе автор (Элиэйзер Юдковский — Eliezer Yudkowsky; сам по себе человек известный, но сегодня не о нём) сообщает нам, что всё далее написанное относится к такому ИИ, который способен иметь собственные цели и составлять планы для их достижения. Такого ИИ пока нет, но автор хочет подготовиться к проблемам заранее. Понимаемо.
Кроме того, он сообщает, что намеренно представляет самый плохой из всех возможных сценариев будущего. “Когда мы строим мост, — говорит он, — консервативная инженерная оценка состоит в том, что по нему проедет в десять раз больше транспорта, чем мы рассчитываем, и большая его часть будет пятнадцатитонными грузовиками.”
Консервативная инженерная оценка предполагает, что нам лучше сделать запас побольше, чтобы в реальных условиях эксплуатации конструкция точно устояла.
“Вот с ИИ, — говорит он, — та же фигня: наверное, он не уничтожит мир, но нам надо рассчитывать, что уничтожит.”
Это не совсем он говорит, это скорее я интерпретирую. Но близко к тексту!
Можем ли мы спорить с этим подходом? Не буду отвечать за вас — я не могу. Я всегда готова вообразить себе худший сценарий из всех невозможных и ждать конца света. Вопрос, однако же, в том, куда нас это приводит.
Пример с мостом выглядит очевидным: вот мы постарались, построили такой крепкий мост, какой и не нужен был. Кто от этого пострадал? При условии, что мы справедливо заплатили всем участникам строительства, никто.
А когда мы готовимся к восстанию машин, мне кажется, кто-то всё же страдает в процессе.
Скажем, всякие политики любят продвигать страшные истории, чтобы на их фоне что-нибудь запретить. Например, заставить всех ходить в Интернет по паспорту, или запретить читать неодобренные правительством источники, или ещё что-то в этом роде.
У нас вот ведётся активная борьба с Интернет-мошенниками, так? Стало ли меньше мошенников? А возможностей нам с вами жить нормальную жизнь? В общем, мы тут в России можем легко себе представить, до чего можно дойти под лозунгом “Защитим граждан от [восстания машин, вражеской пропаганды, впишите своё, подчеркните нужное]”.
У меня поэтому на подобные лозунги что-то вроде аллергии. Но кто знает, может, это у меня такая душа чувствительная.
Третья глава — про цели
Как бы то ни было, мы говорим про ИИ, который умеет ставить цели и стремиться к их достижению. Что это значит?
Для успешного целеполагания нужно, во-первых, иметь в голове надёжную модель окружающего мира; во-вторых, иметь чёткое представление о желаемом состоянии мира; в-третьих, уметь составить план движения из точки А в точку Б. Очень просто.
На первый взгляд. На второй всё очень запутанно, и мы — в смысле, люди — сами не то чтобы хорошо справляемся с постановкой целей. И не то чтобы на сто процентов понимаем, как конкретно она происходит, и как конкретно запускается механизм достижения, и почему конкретно иногда он не работает или работает не так, как нам бы хотелось.
Вся третья глава рассказывает нам как раз об этом: если некий сгусток слизи в процессе эволюции вдруг приобрёл свойство двигаться, когда вода вокруг нагревается на градус выше оптимальной температуры, это ещё не целеполагание. Нам может со стороны показаться, что сгусток “плывёт туда, где прохладнее”, но на деле происходит химическая реакция, мембрана сгустка сокращается, и это сокращение перемещает его.
Через несколько миллионов лет эволюции появится клетка с хвостиком, которая будет хвостиком крутить и плыть туда, где есть питательные вещества. Вот это уже целеполагание или ещё нет? У клетки пока нет мозгов и, скажем, три хромосомы, и она размножается делением.
Ещё через миллионы лет эволюции появляется рыбка. У рыбки есть мозг и плавники, она плавниками двигает и ищет еду. Целеполагание? То есть, мы понимаем, что она не составляла себе список продуктов и маршрут к нужным местам, но у неё есть картина мира. У неё есть представление о желаемом состоянии мира (много еды, и вся у неё в желудке, и вокруг нет других голодных рыбок)? Мы думаем, что скорее нет.
Про себя мы думаем, что у нас-то настоящее целеполагание:
- картина мира есть (пусть и кривая-косая, но не в этом суть);
- образ желаемого результата есть (не факт, что мы будем довольны, достигнув его, но это тоже дело десятое);
- план есть (ну он есть, правда?).
И вот непонятно, где проводить черту. Похоже, что нет какого-то чёткого перехода между “целеполагания нет” и “целеполагание есть”. Про это много написано научных работ, но конкретно сейчас мы в них не будем погружаться. А потом будем погружаться, конечно же.
Конкретно на сегодня вывод такой: мы хотим думать об ИИ, способном к целеполаганию, но не можем такой ИИ определить.