Нейросети странные, никто не знает, почему
Статья, о которой я расскажу вам сегодня, называется «The Unreasonable Effectiveness of Deep Learning in Artificial Intelligence», и она прям на нашу с вами любимую тему (это же ваша любимая тема, правда?): про связь мозга и ИИ. Это публикация 2020 года, так что кое-какие новые исследования она не учитывает, но ничего.
Автор рассуждает вот о чём: машинное обучение как область внутри ИИ начало развиваться не с целью достичь уровня человеческого разума, а с целью решить конкретные прикладные задачи. Простые модели не отражают всю сложность мира, в котором мы живём, поэтому понадобилось время, улучшение процессоров и появление гораздо более глубоких и сложных моделей, чтобы начать качественно работать с речью, например. Чтобы решать ещё более сложные задачи и перейти к ИИ более глобального характера, видимо, надо ещё усложнять модели.
Нейросети выросли из живого мозга: оттуда заимствована математическая модель нейрона, которая эволюционировала в перцептрон. Оттуда заимствован сам подход к передаче данных в процессе обучения. У меня (наконец-то) есть полноценная лекция про развитие ИИ, загляните туда, если интересно узнать больше.
Так вот, эти наши современные нейросети, отпочковавшиеся от исследований о мозге – если точнее, от исследований коры больших полушарий, – удивительно эффективны. Удивительно, потому что, как бы странно это ни звучало, мы не всегда понимаем, как они работают и почему работают так неожиданно хорошо.
В видео про градиентный спуск я показывала вот такой очаровательный график:
Это параболоид. Геометрически часть процесса обучения заключается в том, чтобы найти самую глубокую его точку. Но это в безупречной вселенной вводных курсов по машинному обучению – в жизни надо найти самую глубокую точку пространства, которое может выглядеть вот так:
У меня в ChatGPT куча запросов в духе: «Помоги найти инструмент, который я не помню, как называется, но он рисует сложный 3D-план, на котором можно смоделировать градиентный спуск. Я помню, что интерфейс фиолетовый,» – а он не фиолетовый вообще ни разу, но каким-то чудом инструмент нашёлся.
В общем, тут самая глубокая точка в розовой части фигуры, а проблема знаете в чём? В том, что кроме неё тут ещё множество других углублений, из которых не видно, самое оно глубокое или нет.
Геометрически происходит примерно вот что:
- мы начинаем с какой-то случайной точки;
- проводим в этой точке касательную плоскость к тому участку, на который приземлились;
- угол наклона плоскости показывает, где ставить следующую точку: то есть, в какой стороне у нас низ.
Формула такова, что, если поблизости есть локальный минимум (углубление), мы движемся к нему и, попав туда, остаёмся, потому что наверх мы идти не можем. До глобального минимума (самой-самой глубокой точки) можно так вообще не дойти – но мы доходим чаще, чем это теоретически предполагается.
Да, есть разные специальные алгоритмы для повышения шансов успеха, но, когда речь идёт об обучении больших языковых моделей (или других глубоких нейросетей),
- мы не знаем, достигли ли мы глобального или локального минимума;
- мы никак не можем это проверить;
- возможно, мы никогда не сможем этого проверить, потому что вычислительные затраты очень велики;
- возможно, мы на самом деле работаем с примерно плоским пространством, где мало таких минимумов и максимумов, но чёрт его знает вообще.
Так что да, тот факт, что мы вообще получаем хорошие результаты – это удивительно, и мы не знаем, почему оно работает. Просто тыкаем в разные места и смотрим, чо получится. Такие дела.
Это не единственный парадокс глубокого обучения, но остальные я тут не буду перечислять, можете заглянуть в статью.
А с чего мы начали? Ах да, с того, что надо усложнять.
Потому что до сих пор разработки в области ИИ опирались, напомним, на исследования коры больших полушарий, а кроме неё в мозгу есть и другие структуры, которые принципиально важны для ориентирования в пространстве или социальных взаимодействий – того, чего мы хотим достичь в будущем.
Мне нравится, что люди такие: «Мы не до конца понимаем, как работает наш мозг. Но давайте создадим искусственный мозг, который будет работать так же,» – и начинают создавать, и не понимают, как он работает. Так по-человечески.