November 21, 2025

Нейросети странные, никто не знает, почему

Статья, о которой я расскажу вам сегодня, называется «The Unreasonable Effectiveness of Deep Learning in Artificial Intelligence», и она прям на нашу с вами любимую тему (это же ваша любимая тема, правда?): про связь мозга и ИИ. Это публикация 2020 года, так что кое-какие новые исследования она не учитывает, но ничего.

Автор рассуждает вот о чём: машинное обучение как область внутри ИИ начало развиваться не с целью достичь уровня человеческого разума, а с целью решить конкретные прикладные задачи. Простые модели не отражают всю сложность мира, в котором мы живём, поэтому понадобилось время, улучшение процессоров и появление гораздо более глубоких и сложных моделей, чтобы начать качественно работать с речью, например. Чтобы решать ещё более сложные задачи и перейти к ИИ более глобального характера, видимо, надо ещё усложнять модели.

Нейросети выросли из живого мозга: оттуда заимствована математическая модель нейрона, которая эволюционировала в перцептрон. Оттуда заимствован сам подход к передаче данных в процессе обучения. У меня (наконец-то) есть полноценная лекция про развитие ИИ, загляните туда, если интересно узнать больше.

Так вот, эти наши современные нейросети, отпочковавшиеся от исследований о мозге – если точнее, от исследований коры больших полушарий, – удивительно эффективны. Удивительно, потому что, как бы странно это ни звучало, мы не всегда понимаем, как они работают и почему работают так неожиданно хорошо.

В видео про градиентный спуск я показывала вот такой очаровательный график:

График нарисован в geogebra

Это параболоид. Геометрически часть процесса обучения заключается в том, чтобы найти самую глубокую его точку. Но это в безупречной вселенной вводных курсов по машинному обучению – в жизни надо найти самую глубокую точку пространства, которое может выглядеть вот так:

График из приложения Losslandscape

У меня в ChatGPT куча запросов в духе: «Помоги найти инструмент, который я не помню, как называется, но он рисует сложный 3D-план, на котором можно смоделировать градиентный спуск. Я помню, что интерфейс фиолетовый,» – а он не фиолетовый вообще ни разу, но каким-то чудом инструмент нашёлся.

В общем, тут самая глубокая точка в розовой части фигуры, а проблема знаете в чём? В том, что кроме неё тут ещё множество других углублений, из которых не видно, самое оно глубокое или нет.

Геометрически происходит примерно вот что:

  • мы начинаем с какой-то случайной точки;
  • проводим в этой точке касательную плоскость к тому участку, на который приземлились;
  • угол наклона плоскости показывает, где ставить следующую точку: то есть, в какой стороне у нас низ.

Формула такова, что, если поблизости есть локальный минимум (углубление), мы движемся к нему и, попав туда, остаёмся, потому что наверх мы идти не можем. До глобального минимума (самой-самой глубокой точки) можно так вообще не дойти – но мы доходим чаще, чем это теоретически предполагается.

Да, есть разные специальные алгоритмы для повышения шансов успеха, но, когда речь идёт об обучении больших языковых моделей (или других глубоких нейросетей),

  • мы не знаем, достигли ли мы глобального или локального минимума;
  • мы никак не можем это проверить;
  • возможно, мы никогда не сможем этого проверить, потому что вычислительные затраты очень велики;
  • возможно, мы на самом деле работаем с примерно плоским пространством, где мало таких минимумов и максимумов, но чёрт его знает вообще.

Так что да, тот факт, что мы вообще получаем хорошие результаты – это удивительно, и мы не знаем, почему оно работает. Просто тыкаем в разные места и смотрим, чо получится. Такие дела.

Это не единственный парадокс глубокого обучения, но остальные я тут не буду перечислять, можете заглянуть в статью.

А с чего мы начали? Ах да, с того, что надо усложнять.

Потому что до сих пор разработки в области ИИ опирались, напомним, на исследования коры больших полушарий, а кроме неё в мозгу есть и другие структуры, которые принципиально важны для ориентирования в пространстве или социальных взаимодействий – того, чего мы хотим достичь в будущем.

Мне нравится, что люди такие: «Мы не до конца понимаем, как работает наш мозг. Но давайте создадим искусственный мозг, который будет работать так же,» – и начинают создавать, и не понимают, как он работает. Так по-человечески.