Не только токены. Обзор хорошей статьи о том, куда ИИ движется
Сегодня в меню статья про «AGI». Опять. Я отказываюсь воспринимать этот термин всерьёз: в нём больше маркетинга, чем смысла*.
Но эта статья предлагает совокупный и весьма глубокий анализ ИИ, нейробиологии, психологии и ряда других областей, на пересечении которых случаются интересные вещи. Авторы сделали очень качественный обзор, за что использование всяких неприличных слов из трёх букв им можно и простить.
Речь о статье «Thinking Beyond Tokens: From Brain-Inspired Intelligence to Cognitive Foundations for Artificial General Intelligence and its Societal Impact» 2025 года.
Авторы определили AGI следующим образом:
«Системы, способные к объёмному, сравнимому с человеческим, рассуждению и обучению в разных областях без необходимости переобучения под конкретные задачи.»
Отлично, мы здесь любим начинать с определений. Дальше они утверждают, что современным передовым моделям недостаёт нескольких ключевых компонентов, чтобы «достичь уровня человека»:
Важно отметить, что (аналогично многим другим исследователям и по причинам, которые мне постичь не дано) авторы сосредотачиваются преимущественно на больших языковых моделях, как будто ничего больше не существует. Если уж говорить о физическом теле, ориентации в сложной окружающей среде и прочих подобных вещах, стоит обратиться к робототехнике: там полно технологий, заслуживающих внимания. Возможно, языковые модели всё время на языке (и в статьях), потому что с ними сталкивается больше людей, кто знает**.
Справедливости ради, авторы вскоре признают, что внутренние ограничения языковых моделей не позволяют им достичь AGI в том виде, который они сами определили. И это не баг – это фича. У языковых моделей есть область применения, и она довольно узкая. Так задумано.
Немного моего нытья, которое вы можете смело пропустить и переходить сразу к следующему разделу
Не поймите меня неправильно – я люблю языковые модели. Я изучаю языковые модели. Это мои любимые маленькие лабораторные мышки. Есть работы, в которых языковые модели применяют в робототехнике, например, для планирования действий робота. Так что языковые модели вполне могут пробраться в прекрасный мир физического воплощения и всего, чего нам для них захочется, просто как часть более крупных и продуманных систем.
Я просто немного устала от вот этих качелей от «Смотрите, они генерируют рабочий код! Сингулярность настала!» до «Смотрите, они не знают, что если уронить чашку, она разобьётся! ИИ – пузырь, который сейчас лопнет!» Я уже не могу больше закатывать глаза, у меня голова болит.
Авторы сегодняшней статьи этим не страдают, если что. Это я просто выпускаю пар, потому что куда мне его ещё девать. В повседневной жизни мне положено вести себя прилично и не начинать беседу со слов: «Да что ты, чёрт побери, такое несёшь?». Так что потерпите меня немножко или пропустите этот абзац.
Вернёмся к нашим барашкам
Статью я рекомендую прочитать, если вам интересно, что вообще происходит в области ИИ. Авторы кратко описывают эволюцию ИИ-систем и – самое, на мой взгляд, увлекательное – сопоставляют области человеческого мозга с существующими или разрабатываемыми ИИ-технологиями.
Лучше посмотрите сами (рис. 3 на стр. 9), но пару показательных примеров я приведу здесь.
В нашем мозге лобные доли отвечают за такие функции, как
- самосознание (в ИИ изучено мало);
- планирование (в ИИ изучено частично, есть некоторый прогресс);
- обработка эмоций (изучено мало).
Височные доли отвечают (среди прочего) за обработку речи – это хорошо проработанная область в ИИ.
Небольшая оговорка: когда мы говорим «Область мозга X отвечает за функцию Y», это упрощение. Например, бо́льшая часть распознавания речи происходит в двух областях:
То есть, «височные доли отвечают за обработку речи» – не вполне корректное утверждение с научной точки зрения.
Более того, исследования людей с различными повреждениями мозга показывают, что иногда соседние области могут брать на себя часть функций пострадавшего участка, потому что на самом деле функции распределены по всему мозгу. Это называется нейропластичностью. У меня есть пост об этом, если интересно.
В любом случае, подобные упрощения имеют место быть, особенно когда мы хотим увидеть, какие области в исследованиях ИИ изучены недостаточно.
В главе 4, посвящённой «Машинному интеллекту», меня зацепило их определение интеллекта:
«Интеллект также можно рассматривать как способность сжимать высокоразмерные данные в абстрактные, низкоразмерные представления.»
Интересная точка зрения. Это интеллект целиком или какой-то его конкретный аспект, важный именно для этого обсуждения? Склоняюсь к последнему, но это уже моё восприятие.
Дальше они цитируют Эйнштейна, добавляя ещё один фрагмент в определение интеллекта:
«Мерило интеллекта – способность меняться.»
Авторы также обращают наше внимание на необходимость прозрачности, интерпретируемости и согласованности (alignment) ИИ с человеческими представлениями о прекрасном – глава 7 полностью этому посвящена. Мне кажется, мы и так достаточно обсуждаем здесь взаимное влияние друг на друга ИИ и человеков, поэтому свои мысли по этой главе включать не буду.
В целом, очень рекомендую почитать эту статью или те её части, которые вам наиболее интересны. Она хорошо структурирована, написана отличным языком, и источников там цитируется масса. Я себе пару штук уже добавила в список «к прочтению».
* Маркетологи, не бейте. Я вас люблю и уважаю. Имею в виду, что этот термин – часть стратегии продвижения, а не что-то, что описывает технологию.
** Ещё у меня выборка искажена: я сама больше читаю про языковые модели. Не исключено, что все остальные статьи мне просто не попадаются.