August 17

Дифференциальное подкрепление

Конспект главы 22 «Differential Reinforcement» из Cooper, Heron & Heward, «Applied Behavior Analysis», 2nd ed. (2007)

Общая идея

Дифференциальное подкрепление — это семейство процедур для снижения проблемного поведения. В отличие от угасания и наказания, оно опирается не на лишение, а на подкрепление.

Подкрепление — это когда после поведения происходит что-то приятное для человека, и от этого поведение начинает случаться чаще. Угасание — это когда подкрепление, которое раньше поддерживало поведение, просто перестают давать, и поведение со временем сходит на нет само. Наказание — когда после поведения происходит что-то неприятное или у человека что-то отбирают, чтобы поведение стало реже.

У угасания и наказания есть известные побочные эффекты: вспышки эмоций, временный всплеск частоты поведения, агрессия, избегание, ответная агрессия. Кроме того, они сами по себе не учат ничему новому: человек теряет доступ к прежнему подкреплению, но не получает взамен способа получать его иначе.

Дифференциальное подкрепление решает обе проблемы сразу. Процедура всегда состоит из двух частей:

  • подкрепляем либо поведение, отличное от проблемного, либо само проблемное поведение — но только если оно стало реже;
  • удерживаем подкрепление от проблемного поведения, насколько это возможно.

По сути это тоже угасание, но встроенное в подкрепление чего-то другого — поэтому не нужны долгие таймауты, лишение привычных подкреплений или неприятные стимулы. Это делает дифференциальное подкрепление одной из самых мягких процедур снижения поведения.

Есть четыре основных варианта:

  • DRI (differential reinforcement of incompatible behavior) — подкрепление несовместимого поведения;
  • DRA (differential reinforcement of alternative behavior) — подкрепление альтернативного поведения;
  • DRO (differential reinforcement of other behavior) — подкрепление «другого» поведения (то есть любого, кроме проблемного);
  • DRL (differential reinforcement of low rates) — подкрепление низкой частоты (когда поведение не убираем совсем, а просто делаем реже).

DRI и DRA

DRI — подкрепление несовместимого поведения

При DRI мы подкрепляем поведение, которое физически не может происходить одновременно с проблемным, а подкрепление проблемного поведения при этом удерживаем. Например, сидеть на месте и вставать с места нельзя одновременно — это взаимоисключающие действия.

Пример: Dixon, Benedict и Larson (2001) работали с Фернандо, 25-летним мужчиной с умственной отсталостью и психотическим расстройством. У него были частые неуместные высказывания: не по контексту, сексуализированные, нелогичные, «психотические» фразы.

Функциональный анализ — процедура, которая экспериментально проверяет, что именно в окружении поддерживает поведение. У Фернандо он показал, что неуместные высказывания поддерживались вниманием окружающих.

Исследователи начали игнорировать неуместные высказывания и, наоборот, уделять 10 секунд заинтересованного внимания уместным. В результате неуместная речь стала реже, а уместная — чаще.

DRA — подкрепление альтернативного поведения

DRA — похожая процедура, но здесь альтернативное поведение не обязано быть физически несовместимым с проблемным. Достаточно, чтобы оно занимало то же время и приводило к желательному результату. Например: два ученика постоянно спорят друг с другом. Учитель даёт им совместный проект. Формально они всё ещё могут спорить и во время работы над проектом — несовместимости нет, но на практике спорят меньше.

Граница между DRI и DRA часто размыта, и это предмет споров среди специалистов. Если выбранное «альтернативное» поведение физически не может происходить одновременно с проблемным — по сути это DRI, даже если исследователи назвали его DRA.

Есть и отдельный вариант: когда подкреплением служит не что-то приятное, а возможность избежать задания. Это называют негативным подкреплением альтернативного/несовместимого поведения (DNRA/DNRI).

Негативное подкрепление — это подкрепление через устранение или избегание чего-то неприятного, а не через получение чего-то приятного.

Например, участникам разрешали на 30 секунд отойти от задания — но только если вместо проблемного поведения они использовали альтернативную реакцию: показывали карточку «перерыв» или говорили «нет» (Lalli, Casey & Kates, 1995).

Рекомендации по применению DRI/DRA

Как выбрать несовместимое/альтернативное поведение. В идеале оно должно:

  • уже быть в репертуаре клиента;
  • требовать не больше усилий, чем проблемное поведение;
  • уже происходить достаточно часто — чтобы было за что подкреплять;
  • с высокой вероятностью подкрепляться и после завершения интервенции, в обычной жизни клиента.

Если такого поведения нет, можно выбрать то, которому легко обучить, или перейти к DRO.

Как подобрать подкрепление, которое реально работает. Главная угроза эффективности — использовать в качестве подкрепления что-то, что практик просто считает подкрепляющим, без проверки. Помогают оценка предпочтений и функциональная оценка поведения.

Оценка предпочтений — это проверка, что конкретному человеку на самом деле нравится и насколько. Функциональная оценка поведения — более развёрнутая версия функционального анализа, о котором шла речь выше.

Часто самое эффективное подкрепление для альтернативного поведения — то же самое, что раньше поддерживало проблемное (Dixon et al., 2001; Wilder et al., 2001). При этом важнее не величина подкрепления, а его постоянство. Исследование Lerman, Kelley, Vorndran, Kuhn и LaRue (2002) показало: величина подкрепления (от 20 до 300 секунд доступа) слабо влияла на результат.

Подкреплять сразу и без исключений. Сначала лучше подкреплять каждый раз, без пропусков.

Это называют непрерывным графиком подкрепления, или CRF. Лишь потом постепенно переходят к более редкому — прерывистому — графику.

Подкрепление должно следовать сразу же после альтернативного/несовместимого поведения.

Не подкреплять проблемное поведение вообще, если получится. Чем сильнее разница между тем, как часто подкрепляется альтернативное поведение и как часто — проблемное, тем лучше работает процедура. В идеале проблемное поведение вообще не подкрепляется. Vollmer и коллеги (1999) сравнили «полную реализацию» (100% подкреплений за альтернативное поведение, 0% — за проблемное) с разными вариантами «частичной реализации». Полная реализация сработала лучше всего. Но даже частичная (например, только четверть случаев альтернативного поведения подкреплена) оказалась эффективной — особенно если ей предшествовал период полной реализации: поведение как будто «запоминает» уместный вариант. Поэтому имеет смысл время от времени возвращаться к полной реализации — короткими «усиливающими» сессиями, чтобы эффект не угасал.

Сочетать с другими процедурами. DRI/DRA сами по себе не предусматривают прямого следствия за проблемное поведение. Поэтому их редко применяют в одиночку, если поведение опасно, разрушительно или угрожает здоровью — тогда добавляют блокировку реакции, тайм-аут и подобное.

Блокировка реакции — это когда поведению физически не дают завершиться, например придерживают руку. Тайм-аут — это когда на время убирают доступ ко всему интересному.

Пример: Ringdahl и коллеги (2002) сравнивали DRA с постепенным наращиванием требований и без него — у 8-летней девочки с аутизмом Кристины. DRA с постепенным наращиванием требований снизило проблемное поведение быстрее и стабильнее.

DRO — подкрепление «другого» поведения

При DRO подкрепление даётся всякий раз, когда проблемное поведение не происходит — либо в течение какого-то времени, либо в конкретный момент. Как писал Рейнольдс (1961), это «подкрепление за то, что не отреагировал». Поэтому DRO иногда называют подкреплением нулевой частоты или тренировкой пропуска.

DRO задаётся двумя параметрами:

  • что именно проверяем — отсутствие проблемного поведения на протяжении всего интервала (интервальный DRO) или только в конкретный момент (моментальный DRO);
  • график — фиксированный или переменный (то есть интервалы одинаковой длины или каждый раз разной).

Отсюда четыре базовых варианта: FI-DRO (фиксированный интервал), VI-DRO (переменный интервал), FM-DRO (фиксированный момент), VM-DRO (переменный момент).

FI-DRO (DRO с фиксированным интервалом). Практик задаёт интервал. Если за интервал проблемное поведение не произошло — в конце даётся подкрепление. Если произошло — таймер сбрасывается, и начинается новый интервал. Пример: Cowdery, Iwata и Pace (1990) работали с Джерри, 9-летним мальчиком, который так часто и сильно расчёсывал кожу, что у него были открытые раны по всему телу. Сначала похвала и жетон давались за каждый 2-минутный интервал без расчёсывания. Если Джерри расчёсывал кожу — экспериментатор заходил в комнату и говорил, что подкрепление не заработано. Самоповреждающее поведение сразу упало почти до нуля и оставалось низким, пока интервал постепенно увеличивали — с 2 до 4 минут и дальше.

VI-DRO (DRO с переменным интервалом). Здесь подкрепление даётся за отсутствие поведения в течение интервалов разной, непредсказуемой длины — но в среднем определённой (например, в среднем 10 секунд). Пример: Chiang, Iwata и Dorsey (1979) снижали неуместное поведение 10-летнего мальчика во время поездок на школьном автобусе. Водитель делил маршрут на участки по ориентирам (знаки, светофоры) и добавлял очко на счётчике за каждый участок без деструктивного поведения. Накопленные очки обменивались на привилегии и лакомства.

Моментальные варианты (FM-DRO — с фиксированным моментом, VM-DRO — с переменным моментом). Логика та же, но подкрепление зависит только от того, что происходит в момент окончания интервала, — а не от всего интервала целиком. Пример: Lindberg, Iwata, Kahng и DeLeon (1999) применили VM-DRO (DRO с переменным моментом) к Бриджет, 50-летней женщине с тяжёлыми нарушениями развития, которая билась и ударяла себя по голове. Это поведение поддерживалось вниманием окружающих. При интервале в 15 секунд самоповреждение резко упало почти до нуля. Дальше интервал постепенно растягивали — вплоть до 300 секунд.

Отдельный интересный случай — Progar и коллеги (2001): для 14-летнего Милти с аутизмом использовали сдвоенное условие. Подкрепление (лакомство) выдавалось, только если одновременно выполнялись два требования: три завершённых компонента задания и переменный интервал в 148 секунд без агрессии. Любая агрессия сбрасывала оба условия.

Рекомендации по применению DRO

Понимать ограничения DRO. При интервальном DRO подкрепление зависит только от одного конкретного поведения — а во время интервала может проявиться другое нежелательное поведение, и оно случайно тоже получит подкрепление «за компанию». В таком случае интервал стоит укоротить или расширить определение проблемного поведения. При моментальном DRO — обратная проблема: поведение может занимать почти весь интервал, но если в момент проверки его нет, подкрепление всё равно даётся. Здесь помогает переход на интервальный DRO с более коротким интервалом — и важно помнить, что DRO работает не всегда. Linscheid и коллеги (1990) не смогли устранить хроническое самоповреждающее поведение ни DRO, ни DRI у пяти человек — пришлось вводить более жёсткую процедуру наказания.

Задавать начальный интервал так, чтобы подкрепление было частым. Хороший ориентир — интервал, равный или чуть короче среднего промежутка между случаями поведения в базовой линии.

Базовая линия — это период наблюдения ещё до начала интервенции. Он нужен, чтобы было с чем сравнивать результаты потом.

Считается просто: общая длительность наблюдения делится на число реакций. Например, 90 реакций за 30 минут (1800 секунд) дают средний промежуток в 20 секунд — таким и стоит задать стартовый интервал.

Не подкреплять случайно другое нежелательное поведение. «Чистый» DRO не требует конкретного поведения для подкрепления — важно смотреть, что именно делает человек в момент выдачи подкрепления, ведь именно это поведение с большей вероятностью повторится.

Постепенно увеличивать интервал — но только после того, как исходный интервал уже взял поведение под контроль. Poling и Ryan (1982) предложили три способа: увеличивать интервал на фиксированный шаг (например, каждый раз +15 секунд); увеличивать пропорционально (например, +10%); или пересчитывать интервал каждую сессию — по среднему промежутку между реакциями в предыдущей сессии. Если при увеличении интервала поведение ухудшается, его временно уменьшают, а затем снова наращивают, но более мелкими шагами.

Расширять DRO на другие условия и время суток, когда частота проблемного поведения заметно снизилась в основной обстановке — подключая учителей, родителей, других значимых взрослых. У Джерри, после того как его поведение стабилизировалось на сессиях, DRO стали вводить и в другое время дня: сначала отдельными 30-минутными интервалами, потом их становилось всё больше, пока DRO не покрыл всё время бодрствования. В итоге его впервые за два года смогли выписать домой, а родителей обучили процедуре.

Сочетать DRO с другими процедурами. Часто DRO включают в общий план вместе с другими методами — это даёт более сильный и устойчивый эффект. De Zubicaray и Clair (1998) сочетали DRO, DRI и процедуру возмещения ущерба, чтобы снизить физическую и вербальную агрессию у женщины с умственной отсталостью. McCord и коллеги (2001) добавили DRO к процедуре постепенного затухания стимула, которая сама по себе давала слабый эффект. В результате проблемное поведение резко снизилось и оставалось низким больше 40 сессий, а эффект сохранился и дома после окончания лечения.

DRL — подкрепление низких частот

DRO подкрепляет полное отсутствие поведения. DRL устроен иначе: здесь подкрепляется само проблемное поведение, но только если оно происходит достаточно редко. Цель — не убрать поведение целиком, а снизить его частоту до приемлемого уровня. Проблема не в форме поведения, а в том, что оно происходит слишком часто. Например, поднимать руку с вопросом — это нормально, но становится проблемой, если происходит без остановки.

Deitz (1977) выделил три варианта DRL: DRL всей сессии, интервальный DRL и DRL с разнесением реакций.

DRL всей сессии. Подкрепление даётся в конце занятия — если за всё время число случаев проблемного поведения не превысило заданный лимит. Пример: Deitz и Repp (1973) снижали выкрики 11-летнего мальчика с нарушениями развития. В базовой линии он в среднем выкрикивал 5,7 раза за 50-минутный урок. Ввели правило: не больше 3 выкриков за урок — тогда в конце дня 5 минут игры. Частота выкриков упала в среднем до 0,93 за урок.

Интервальный DRL. Сессия делится на равные интервалы. Подкрепление даётся в конце каждого интервала — если число случаев поведения за него не превысило лимит. Если лимит превышен, интервал сразу же сбрасывается и начинается заново. Пример: Deitz и коллеги (1978) работали с 7-летним ребёнком с трудностями в обучении. Лист был разбит на 15 блоков по 2 минуты. За интервал с 0–1 случаем нарушения (бег, толчки, удары, бросание предметов) ставили звёздочку, и она давала минуту на площадке с учителем. При втором нарушении за интервал он немедленно начинался заново.

DRL с разнесением реакций. Подкрепление следует за самой реакцией — но только если она отстоит от предыдущей на нужный промежуток времени. Чем длиннее требуемая пауза, тем реже в итоге происходит поведение. Пример: Favell, McGimsey и Jones (1980) снижали слишком быстрое поедание пищи у людей с тяжёлыми нарушениями развития. Сначала подкрепление следовало за короткими паузами между укусами, затем требуемая пауза постепенно удлинялась. Частота еды снизилась с 10–12 укусов за 30 секунд до 3–4. Другой пример: Singh, Dawson и Manning (1981) снижали стереотипные движения у трёх девочек-подростков. Сначала требовали паузу минимум 12 секунд между движениями, затем постепенно увеличивали требование — до 30, 60 и 180 секунд. Стереотипии стали реже, а заодно выросло и уместное поведение: улыбки, разговор, игра.

Интервальный DRL и DRL с разнесением реакций требуют постоянного наблюдения и точного отсчёта времени. Без помощника их сложно применять в группе — они лучше подходят для индивидуальной работы.

Рекомендации по применению DRL

Понимать ограничения DRL. Это медленная процедура. Если поведение нужно снизить быстро — DRL не подходит. Она также не годится для самоповреждающего, агрессивного или потенциально опасного поведения. И поскольку практику приходится постоянно фокусироваться именно на проблемном поведении, есть риск случайно уделять ему слишком много внимания — тем самым подкрепляя его.

Выбрать подходящий вариант DRL. Только DRL с разнесением реакций даёт подкрепление сразу после конкретной реакции — реакция должна произойти, прежде чем сработает пауза-критерий. DRL всей сессии и интервальный DRL не требуют, чтобы реакция вообще случилась — подкрепление зависит просто от непревышения лимита. Их стоит применять, если приемлемо, чтобы в итоге частота поведения дошла до нуля, или как первый шаг к полному устранению поведения. DRL с разнесением реакций и интервальный DRL, как правило, дают более частое подкрепление, чем DRL всей сессии — это особенно важно при тяжёлых формах проблемного поведения.

Опираться на данные базовой линии при выборе начального лимита. Например, если за пять базовых сессий было 8, 13, 10, 7 и 12 случаев (среднее — 10), стартовым лимитом для DRL всей сессии можно взять 8–10 случаев за сессию. Для интервального DRL и DRL с разнесением реакций стартовые лимиты по времени тоже берутся на уровне среднего базового значения или чуть ниже.

Постепенно смягчать требования. Для DRL всей сессии можно опираться на текущие результаты клиента или брать чуть меньше среднего числа случаев за недавние сессии. Для интервального DRL — постепенно снижать допустимое число случаев за интервал (если оно больше одного); а если уже дошли до одного случая за интервал — постепенно удлинять сам интервал. Для DRL с разнесением реакций — подстраивать требуемую паузу под среднюю паузу недавних сессий, или чуть больше. Есть два простых правила, когда усложнять критерий: (1) когда клиент укладывается в критерий или перевыполняет его три сессии подряд; (2) когда подкрепление получено как минимум в 90% возможных случаев три сессии подряд.

Давать обратную связь. Эффективность DRL растёт, если человек может отслеживать собственный темп. Самую точную обратную связь даёт DRL с разнесением реакций: подкрепление или его отсутствие следует сразу за каждой реакцией, а при нарушении требования интервал сразу сбрасывается. Интервальный DRL даёт менее точную, но всё же ощутимую обратную связь: первая реакция в интервале ничего не сигнализирует, зато вторая сбрасывает интервал — это уже понятный сигнал «что-то пошло не так». DRL всей сессии обычно вообще не даёт обратной связи по ходу занятия — человек ориентируется в основном на то, что ему объяснили в начале. И если лимит уже превышен, ничто не мешает вести себя хуже в оставшееся время — дополнительных последствий не будет. Поэтому при тяжёлых формах поведения DRL всей сессии без обратной связи обычно работает слабее двух других вариантов.

Кратко

  • DRI/DRA снижают проблемное поведение, одновременно укрепляя несовместимое или альтернативное. Это самая мягкая и «обучающая» из процедур, но требует тщательного подбора и поведения, и подкрепления.
  • DRO подкрепляет любое поведение, кроме проблемного, — за интервал или момент времени. Гибкий вариант для случаев, когда у человека мало уместных альтернатив, но есть риск случайно подкрепить что-то другое нежелательное.
  • DRL подходит, когда проблема не в самом поведении, а в его частоте. Работает медленно и мягко — не годится для опасного поведения или когда нужен быстрый результат.
  • Общие принципы для всех четырёх процедур: подбирать подкрепление, которое реально работает для конкретного человека; начинать с частого/непрерывного подкрепления и затем постепенно его «утоньшать»; максимально последовательно удерживать подкрепление от проблемного поведения; при необходимости — сочетать с другими процедурами снижения поведения.