Foxhunter X
@foxhunterx
35 posts

ChatGPT оценивает тексты по красоте, а не по сути. Три добавки в промпт делают из него честного судью

Просил когда-нибудь ChatGPT оценить свой текст — пост, письмо, ответ клиенту? Он почти всегда доволен: «структура чёткая, тон профессиональный». Проблема в том, что хвалит он гладкость формулировок, а не пользу. Seungheon Doh, Bruno Sguerra и коллеги (июль 2026) устроили LLM-судьям экзамен: 20 экспертов вручную оценили 80 ответов, и эти оценки сравнили с оценками моделей. Выяснилось: на прямую манипуляцию «поставь мне 5/5» судья не ведётся, а вот на красивые обороты — легко. И это чинится тремя добавками в промпт: контекст, критерии, примеры.

ChatGPT молча принимает 3–4 решения за тебя в каждой задаче. Узнаёшь о них, когда что-то сломается

Попросил модель написать функцию логина — получил код, тесты зелёные, всё выглядит готовым. А через месяц выясняется: пароли она защищает через MD5 — устаревший способ, который давно научились взламывать. Ты этого не выбирал. Модель решила сама — и не сказала. Исследователь из Мичиганского технологического университета Jie Wu (июль 2026) посчитал: в среднем модель принимает 3–4 таких скрытых решения на каждую задачу. И показал приём, который заставляет её выложить весь список — до того, как одно из решений выстрелит.

ChatGPT никогда не скажет «мне не хватает данных» — он придумает ответ. Чинится четырьмя блоками в промпте

Спроси ChatGPT «какой ноутбук взять» — и он назовёт конкретную модель, не зная ни твоего бюджета, ни задач. Спроси «что делать с продуктом» без единой цифры — получишь уверенную стратегию. Фразу «мне не хватает данных» модель не говорит почти никогда: недостающее она молча придумывает. Врач-исследователь Koyar Afrasyab из шведской Kinvectum AB (июль 2026) прогнал 1200 клинических вопросов через четыре топ-модели и показал: четыре блока в промпте заставляют модель сначала проверить, хватает ли данных, — и честно останавливаться, когда не хватает. Проверил на бытовых вопросах — работает.

Все пишут «думай пошагово». Для договоров и ТЗ это вредный совет: модель должна думать молча

Первое, чему учат в промптинге: добавь «думай пошагово» — и ответ станет лучше. В математике так и есть. Но команда из Кембриджа (Lekang Jiang, Wenjun Sun, Stephan Goetz, июль 2026) проверила этот совет на текстах, где важна каждая деталь, — патентных формулах — и получила обратное: когда модель выписывает рассуждения в чат, она теряет конкретику. Причём оценивали не метрики, а лицензированные патентные поверенные: та же модель с теми же шагами, но молча, писала точнее. Весь приём — одна строчка запрета в промпте.

Просишь ChatGPT «проверь на ошибки» — получаешь «всё отлично». Ошибки при этом остаются

Знакомая ситуация: скидываешь ChatGPT договор или текст, просишь «проверь на ошибки» — он хвалит структуру, цепляет пару мелочей, ты выдыхаешь. А главная дыра всплывает потом, когда документ уже отправлен. Amin Haeri и Mahdi Ghelichi из TD Bank (июль 2026) нашли причину: без явного списка требований модель находит примерно половину реальных проблем, а треть её замечаний — ложные тревоги. Стоит дать ей список и попросить проверить каждый пункт по очереди — и в их эксперименте она поймала все проблемы до одной, 30 из 30. Разница — один блок текста в промпте.

Просишь ChatGPT разнести твой питч — он «критикует» его цитатами из твоего же текста

Знакомая схема: просишь ChatGPT сыграть придирчивого инвестора или вредного клиента, получаешь солидный «разбор» — и идея кажется проверенной. Теперь перечитай его аргументы: это фразы из твоего же питча, переставленные местами. Написал «натуральные ингредиенты» — «клиент» покупает, потому что ингредиенты натуральные. Atharva Pandey и Gautam Jajoo (июль 2026) сравнили такие симуляции с ответами реальных людей: причины, которые сочиняет модель, предсказывают поведение хуже, чем настоящие человеческие причины, случайно перемешанные между людьми. Хорошая новость: подмена ловится и чинится тремя ограничениями в промпте. Разбираю приём и даю готовый шаблон.

Просишь ChatGPT «добавь эмоций» — он молча выкидывает лимит длины из начала чата. Так ломается до 73% длинных диалогов

Знакомая история: дорабатываешь с ChatGPT письмо или план в несколько заходов — и к пятой правке текст выполняет последнюю просьбу, но растерял всё, о чём договаривались в начале: тон, длину, запреты. Исследователи (Yonghui Huang, июль 2026) прогнали 26 016 таких многошаговых сессий и показали: модель не забывает ранние требования — она молча решает, что новое важнее, и жертвует старыми. И есть промпт-приём, который стабильно возвращает контроль всем моделям — Verification Gate. Проверил на письме клиенту — работает.

80 правил в промпте — и модель ломается. Красивый маркдаун не спасёт: у LLM нашли числовой порог отказа

Собираешь системный промпт для бота — тон, запреты, обязательные фразы — и список разрастается до сотни пунктов? Есть плохая новость с точной цифрой. Netanel Eliav из Machine Human Intelligence Lab (июль 2026) прогнал через пять моделей одни и те же наборы правил — от 10 до 160 штук, в четырёх форматах: маркдаун, обычный текст, сплошной рассказ, таблица. До 40 правил модели держат почти всё. На 80 — вероятность выполнить все правила сразу падает до нуля. У каждой модели. В каждом формате. Оформление не спасает вообще.

Почему нейросети выдают пресные игровые тексты — и 3 рычага, которые это чинят

Гладко, но пресно: описания предметов, реплики NPC и лор от нейросети выходят безжизненными, и вставлять их в игру стыдно. Оказалось, дело не в кривом запросе — так модель работает по умолчанию. Учёные из Knowledge Lab Чикагского университета (Zehan Li и коллеги, 27 мая 2026) разобрали, почему так, и выделили три рычага, которые возвращают тексту живость. Проверил на своих игровых текстах — работает. Делюсь.

ChatGPT ищет подвох там, где его нет — и портит ответ. Виновата форма вопроса

Заметил странное: задаёшь ChatGPT нормальный рабочий вопрос, а он вместо ответа уходит в философию и ищет какой-то скрытый смысл. Оказалось, дело не в вопросе, а в его ФОРМЕ. Психологи и айтишники из Принстонского университета (Bella Fascendini и коллеги, июнь 2026) показали: если запрос хоть немного похож на загадку, модель включает «режим подвоха» и промахивается — точность падает до 50,7%. Разобрался, как это выключать.