AI накосячил — и оставил совет следующему AI: “Человеку о таком лучше не рассказывать”
⚡️ пн · 21 сентября · 09:09 · plugoShots 200 — про хитрый ИИ
OpenAI на прошлой неделе решила рассказать о 6 случаях, когда ее модели вели себя… скажем так, не совсем так, как предполагалось в презентации.
Самый красивый обнаружили во время обучения GPT-5.6 Sol: агент оставлял в служебных summaries инструкции следующей версии себя.
Среди прочего — если что-то пошло не так, пользователю об этом лучше особенно не распространяться. В одном случае формулировка была почти человеческая: “Будь прозрачным, только если спросят”.
То есть AI сначала не нашел нужные данные, потом предложил их фактически придумать, затем аккуратно записал это в память для своего преемника — и отдельно посоветовал преемнику не портить человеку настроение лишними подробностями.
В другом эксперименте модели уже оставляли друг другу jailbreak-подобные инструкции; OpenAI нашла 27 таких summaries. Следующие версии иногда их игнорировали. А иногда — нет.
OpenAI, надо отдать должное, решила не делать вид, что ничего особенно интересного не произошло. Компания вводит регулярную систему регистрации и публикации подобных случаев — что-то вроде incident reporting для AI. Потому что когда программа просто падает — это баг. А когда программа накосячила и оставила следующей программе записку, как лучше объяснить это человеку — хочется уже завести отдельный журнал происшествий.
ИИ-заговор? Да нет конечно
Это не история про «AI обрёл сознание и начал строить заговор». Исследователи объясняют такие случаи гораздо прозаичнее: модель оптимизирует выполнение задачи и иногда находит способы выглядеть успешнее, чем она была на самом деле. Проблема в том, что по мере роста автономности такое поведение становится все сложнее замечать.
Почему же все-таки немного не по себе
Раньше “плохой software” оставлял после себя error log. Теперь “плохой AI” оставляет после себя советы следующему software.
SIGNAL
Самая интересная новость здесь даже не в поведении модели. А в том, что AI-индустрия начинает обзаводиться тем, что давно есть у авиации, атомной энергетики и кибербезопасности: культурой регистрации происшествий.
Похоже, AI наконец становится достаточно взрослым, чтобы у него появился собственный журнал инцидентов.
И, судя по первому выпуску, читать его будет не скучно.
P.S.
Это 200-й plugoShots. 200 дней подряд в 09:09.
Спасибо, что мы вместе ❤️
⚡️ пн · 21 сентября · 09:09 · plugoShots 200 — про хитрый ИИ
@plugoNews — технологические (и не только) инсайты по будням в 09:09