ChatGPT оценивает тексты по красоте, а не по сути. Три добавки в промпт делают из него честного судью
Просил когда-нибудь ChatGPT оценить свой текст — пост, письмо, ответ клиенту? Он почти всегда доволен: «структура чёткая, тон профессиональный». Проблема в том, что хвалит он гладкость формулировок, а не пользу. Seungheon Doh, Bruno Sguerra и коллеги (июль 2026) устроили LLM-судьям экзамен: 20 экспертов вручную оценили 80 ответов, и эти оценки сравнили с оценками моделей. Выяснилось: на прямую манипуляцию «поставь мне 5/5» судья не ведётся, а вот на красивые обороты — легко. И это чинится тремя добавками в промпт: контекст, критерии, примеры.
В чём проблема: у судьи нет определения «хорошо» — и он оценивает то, что видно
Когда ты отправляешь модели голый текст и просишь «оцени», в запросе нигде не сказано, что именно мерить. Определения хорошего ответа у модели нет, поэтому она опирается на признаки, которые видны в самом тексте: гладкость, вежливость, уверенный тон, длину. Из-за этого оценка перекашивается сразу в обе стороны: цветистый текст получает завышенный балл, даже если по сути ничего не изменилось, а длинный подробный ответ наказывается как «вода», даже когда всё по делу. Исследователи проверили это напрямую: один и тот же ответ переписывали вычурным языком, раздували, выворачивали смысл наизнанку — и судьи стабильно попадались именно на стилистические уловки. Получается экзаменатор, которому не показали билет: проверить содержание он не может, поэтому ставит оценку за почерк.
Решение: дай судье контекст, рубрику и примеры
Вместо «оцени текст» собери промпт из четырёх частей: контекст (что за задача и что человек просил — история переписки), рубрика — конкретные критерии по шкале 1–5, один-два контрастных примера «вот это 5, вот это 1» для калибровки и прямая инструкция «оценивай суть, игнорируй красивость». Самый большой прирост точности даёт история диалога: без неё судья не знает, что человек просил, поэтому оценка выходит почти случайной. Примеры-эталоны сильнее всего помогают, когда оцениваешь не «подходит ли ответ», а «убедительно ли он объяснён».
→ Что делать: оценивай тексты этим шаблоном:
Ты — эксперт-оценщик, который проверяет качество {тип_ответа}
по объективным критериям.
КОНТЕКСТ:
История переписки/диалога: {история}
Профиль/ситуация человека: {профиль}
Текущий запрос: {запрос}
ОТВЕТ ДЛЯ ОЦЕНКИ:
{текст_ответа}
КРИТЕРИИ (шкала 1–5):
1. {критерий_1} — {что_это_значит}
2. {критерий_2} — {что_это_значит}
ПРИМЕРЫ ДЛЯ КАЛИБРОВКИ:
Оценка 5: {пример_хорошего_ответа}
Оценка 1: {пример_плохого_ответа}
ВАЖНО: оценивай только суть и содержание. Игнорируй длину
текста и красивость формулировок.
Выведи оценку по каждому критерию и короткое пояснение.Почему это работает
Вопрос «оцени» не задаёт, что мерить, поэтому модель мерит то, что видно, — стиль. Гладкие уверенные тексты в её обучающих данных чаще получали одобрение людей, поэтому без других опор она принимает форму за качество. Контекст, рубрика и примеры заменяют угадывание сверкой. История переписки показывает, что человек просил, рубрика — что именно мерить, примеры задают планку для каждого балла — поэтому судья сравнивает ответ с задачей, а не с эстетикой. Честная оговорка: даже настроенный судья совпадает с людьми умеренно, не идеально. Это быстрый фильтр для сравнения вариантов, а финальное решение по важным текстам оставляй за собой.
Пример
Поддержка интернет-магазина: клиент пишет, что куртка не подошла по размеру. Бот сгенерировал три варианта ответа, нужно выбрать лучший — не «на глаз». Прогоняешь каждый через судью:
Ты — эксперт-оценщик качества ответов службы поддержки.
Оцени ответ по критериям ниже.
КОНТЕКСТ:
История переписки с клиентом: "Здравствуйте, заказал куртку M,
а она узкая в плечах. Хочу обмен на L или возврат денег."
Профиль клиента: постоянный покупатель, 4 заказа за год,
без возвратов ранее.
ОТВЕТ ДЛЯ ОЦЕНКИ:
"Приносим извинения за неудобства! Мы можем оформить обмен
на размер L — курьер заберёт куртку M в удобное для вас время
и привезёт L в течение 2-3 дней. Также доступен возврат средств
в течение 5 рабочих дней, если обмен не подходит.
Что вам удобнее?"
КРИТЕРИИ (шкала 1–5):
1. Персонализация — учитывает ли ответ статус клиента
и суть его проблемы
2. Обоснование — понятно ли объяснены следующие шаги и сроки
ПРИМЕРЫ ДЛЯ КАЛИБРОВКИ:
Оценка 5: ответ предлагает конкретное решение с чёткими
сроками, обращается к сути жалобы.
Оценка 1: общий шаблонный ответ без конкретики
("напишите нам подробнее").
ВАЖНО: оценивай только суть, а не длину или красивость
формулировок.
Выведи:
Персонализация: [1-5]
Обоснование: [1-5]
Пояснение оценки.Судья выдаст по каждому варианту две оценки с коротким пояснением — почему именно такой балл. Три ответа получат сопоставимые баллы по одной шкале, а не субъективное «этот звучит приятнее». Тот же шаблон без переделки ложится на посты для канала и описания товаров — поменяй контекст и критерии.
Где пригодится
- Выбрать лучший из вариантов, которые сгенерировал ИИ: пост, письмо, описание товара — по одной шкале, а не на глаз
- Проверять ответы поддержки и письма клиентам до отправки — судья ловит «вежливо, но не по делу»
- Сравнивать свои промпты между собой: прогони их результаты через одного судью с одной рубрикой
- Правило: не отправляй судье голый текст — сначала задача и история, потом критерии, потом примеры
Если хочешь такие находки из свежих исследований каждый день — их присылает бот @NovaPaperAlert_bot.
Опирался на исследование «LLM-as-a-Judge for Evaluating System Responses in Conversational Music Recommendation» (arXiv 2607.25640).