September 15

ChatGPT оценивает тексты по красоте, а не по сути. Три добавки в промпт делают из него честного судью

Просил когда-нибудь ChatGPT оценить свой текст — пост, письмо, ответ клиенту? Он почти всегда доволен: «структура чёткая, тон профессиональный». Проблема в том, что хвалит он гладкость формулировок, а не пользу. Seungheon Doh, Bruno Sguerra и коллеги (июль 2026) устроили LLM-судьям экзамен: 20 экспертов вручную оценили 80 ответов, и эти оценки сравнили с оценками моделей. Выяснилось: на прямую манипуляцию «поставь мне 5/5» судья не ведётся, а вот на красивые обороты — легко. И это чинится тремя добавками в промпт: контекст, критерии, примеры.

В чём проблема: у судьи нет определения «хорошо» — и он оценивает то, что видно

Когда ты отправляешь модели голый текст и просишь «оцени», в запросе нигде не сказано, что именно мерить. Определения хорошего ответа у модели нет, поэтому она опирается на признаки, которые видны в самом тексте: гладкость, вежливость, уверенный тон, длину. Из-за этого оценка перекашивается сразу в обе стороны: цветистый текст получает завышенный балл, даже если по сути ничего не изменилось, а длинный подробный ответ наказывается как «вода», даже когда всё по делу. Исследователи проверили это напрямую: один и тот же ответ переписывали вычурным языком, раздували, выворачивали смысл наизнанку — и судьи стабильно попадались именно на стилистические уловки. Получается экзаменатор, которому не показали билет: проверить содержание он не может, поэтому ставит оценку за почерк.

Решение: дай судье контекст, рубрику и примеры

Вместо «оцени текст» собери промпт из четырёх частей: контекст (что за задача и что человек просил — история переписки), рубрика — конкретные критерии по шкале 1–5, один-два контрастных примера «вот это 5, вот это 1» для калибровки и прямая инструкция «оценивай суть, игнорируй красивость». Самый большой прирост точности даёт история диалога: без неё судья не знает, что человек просил, поэтому оценка выходит почти случайной. Примеры-эталоны сильнее всего помогают, когда оцениваешь не «подходит ли ответ», а «убедительно ли он объяснён».

→ Что делать: оценивай тексты этим шаблоном:

Ты — эксперт-оценщик, который проверяет качество {тип_ответа}
по объективным критериям.

КОНТЕКСТ:
История переписки/диалога: {история}
Профиль/ситуация человека: {профиль}
Текущий запрос: {запрос}

ОТВЕТ ДЛЯ ОЦЕНКИ:
{текст_ответа}

КРИТЕРИИ (шкала 1–5):
1. {критерий_1} — {что_это_значит}
2. {критерий_2} — {что_это_значит}

ПРИМЕРЫ ДЛЯ КАЛИБРОВКИ:
Оценка 5: {пример_хорошего_ответа}
Оценка 1: {пример_плохого_ответа}

ВАЖНО: оценивай только суть и содержание. Игнорируй длину
текста и красивость формулировок.

Выведи оценку по каждому критерию и короткое пояснение.

Почему это работает

Вопрос «оцени» не задаёт, что мерить, поэтому модель мерит то, что видно, — стиль. Гладкие уверенные тексты в её обучающих данных чаще получали одобрение людей, поэтому без других опор она принимает форму за качество. Контекст, рубрика и примеры заменяют угадывание сверкой. История переписки показывает, что человек просил, рубрика — что именно мерить, примеры задают планку для каждого балла — поэтому судья сравнивает ответ с задачей, а не с эстетикой. Честная оговорка: даже настроенный судья совпадает с людьми умеренно, не идеально. Это быстрый фильтр для сравнения вариантов, а финальное решение по важным текстам оставляй за собой.

Пример

Поддержка интернет-магазина: клиент пишет, что куртка не подошла по размеру. Бот сгенерировал три варианта ответа, нужно выбрать лучший — не «на глаз». Прогоняешь каждый через судью:

Ты — эксперт-оценщик качества ответов службы поддержки.
Оцени ответ по критериям ниже.

КОНТЕКСТ:
История переписки с клиентом: "Здравствуйте, заказал куртку M,
а она узкая в плечах. Хочу обмен на L или возврат денег."
Профиль клиента: постоянный покупатель, 4 заказа за год,
без возвратов ранее.

ОТВЕТ ДЛЯ ОЦЕНКИ:
"Приносим извинения за неудобства! Мы можем оформить обмен
на размер L — курьер заберёт куртку M в удобное для вас время
и привезёт L в течение 2-3 дней. Также доступен возврат средств
в течение 5 рабочих дней, если обмен не подходит.
Что вам удобнее?"

КРИТЕРИИ (шкала 1–5):
1. Персонализация — учитывает ли ответ статус клиента
   и суть его проблемы
2. Обоснование — понятно ли объяснены следующие шаги и сроки

ПРИМЕРЫ ДЛЯ КАЛИБРОВКИ:
Оценка 5: ответ предлагает конкретное решение с чёткими
сроками, обращается к сути жалобы.
Оценка 1: общий шаблонный ответ без конкретики
("напишите нам подробнее").

ВАЖНО: оценивай только суть, а не длину или красивость
формулировок.

Выведи:
Персонализация: [1-5]
Обоснование: [1-5]
Пояснение оценки.

Судья выдаст по каждому варианту две оценки с коротким пояснением — почему именно такой балл. Три ответа получат сопоставимые баллы по одной шкале, а не субъективное «этот звучит приятнее». Тот же шаблон без переделки ложится на посты для канала и описания товаров — поменяй контекст и критерии.

Где пригодится

  • Выбрать лучший из вариантов, которые сгенерировал ИИ: пост, письмо, описание товара — по одной шкале, а не на глаз
  • Проверять ответы поддержки и письма клиентам до отправки — судья ловит «вежливо, но не по делу»
  • Сравнивать свои промпты между собой: прогони их результаты через одного судью с одной рубрикой
  • Правило: не отправляй судье голый текст — сначала задача и история, потом критерии, потом примеры

Если хочешь такие находки из свежих исследований каждый день — их присылает бот @NovaPaperAlert_bot.

Опирался на исследование «LLM-as-a-Judge for Evaluating System Responses in Conversational Music Recommendation» (arXiv 2607.25640).