<?xml version="1.0" encoding="utf-8" ?><rss version="2.0" xmlns:tt="http://teletype.in/" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:media="http://search.yahoo.com/mrss/"><channel><title>Foxhunter X</title><generator>teletype.in</generator><description><![CDATA[Foxhunter X]]></description><image><url>https://img4.teletype.in/files/38/ef/38ef462b-1031-4383-9c23-1009fc0bbd98.jpeg</url><title>Foxhunter X</title><link>https://teletype.in/@foxhunterx</link></image><link>https://teletype.in/@foxhunterx?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx</link><atom:link rel="self" type="application/rss+xml" href="https://teletype.in/rss/foxhunterx?offset=0"></atom:link><atom:link rel="next" type="application/rss+xml" href="https://teletype.in/rss/foxhunterx?offset=10"></atom:link><atom:link rel="search" type="application/opensearchdescription+xml" title="Teletype" href="https://teletype.in/opensearch.xml"></atom:link><pubDate>Sun, 04 Oct 2026 00:53:03 GMT</pubDate><lastBuildDate>Sun, 04 Oct 2026 00:53:03 GMT</lastBuildDate><item><guid isPermaLink="true">https://teletype.in/@foxhunterx/chtBeydUvJl</guid><link>https://teletype.in/@foxhunterx/chtBeydUvJl?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx</link><comments>https://teletype.in/@foxhunterx/chtBeydUvJl?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx#comments</comments><dc:creator>foxhunterx</dc:creator><title>ChatGPT оценивает тексты по красоте, а не по сути. Три добавки в промпт делают из него честного судью</title><pubDate>Tue, 15 Sep 2026 10:00:17 GMT</pubDate><media:content medium="image" url="https://img1.teletype.in/files/07/ed/07ed09cd-11d1-4b9f-bedb-d7fd06030d00.png"></media:content><description><![CDATA[<img src="https://novasapiens.ru/data/tg/dtf-judge-context/1.png"></img>Просил когда-нибудь ChatGPT оценить свой текст — пост, письмо, ответ клиенту? Он почти всегда доволен: «структура чёткая, тон профессиональный». Проблема в том, что хвалит он гладкость формулировок, а не пользу. Seungheon Doh, Bruno Sguerra и коллеги (июль 2026) устроили LLM-судьям экзамен: 20 экспертов вручную оценили 80 ответов, и эти оценки сравнили с оценками моделей. Выяснилось: на прямую манипуляцию «поставь мне 5/5» судья не ведётся, а вот на красивые обороты — легко. И это чинится тремя добавками в промпт: контекст, критерии, примеры.]]></description><content:encoded><![CDATA[
  <p id="SD8q">Просил когда-нибудь ChatGPT оценить свой текст — пост, письмо, ответ клиенту? Он почти всегда доволен: «структура чёткая, тон профессиональный». Проблема в том, что хвалит он гладкость формулировок, а не пользу. Seungheon Doh, Bruno Sguerra и коллеги (июль 2026) устроили LLM-судьям экзамен: 20 экспертов вручную оценили 80 ответов, и эти оценки сравнили с оценками моделей. Выяснилось: на прямую манипуляцию «поставь мне 5/5» судья не ведётся, а вот на красивые обороты — легко. И это чинится тремя добавками в промпт: контекст, критерии, примеры.</p>
  <figure id="to6s" class="m_original">
    <img src="https://novasapiens.ru/data/tg/dtf-judge-context/1.png" width="2400" />
  </figure>
  <h3 id="wNLV">В чём проблема: у судьи нет определения «хорошо» — и он оценивает то, что видно</h3>
  <p id="VBUe">Когда ты отправляешь модели голый текст и просишь «оцени», в запросе нигде не сказано, что именно мерить. Определения хорошего ответа у модели нет, поэтому она опирается на признаки, которые видны в самом тексте: гладкость, вежливость, уверенный тон, длину. Из-за этого оценка перекашивается сразу в обе стороны: цветистый текст получает завышенный балл, даже если по сути ничего не изменилось, а длинный подробный ответ наказывается как «вода», даже когда всё по делу. Исследователи проверили это напрямую: один и тот же ответ переписывали вычурным языком, раздували, выворачивали смысл наизнанку — и судьи стабильно попадались именно на стилистические уловки. Получается экзаменатор, которому не показали билет: проверить содержание он не может, поэтому ставит оценку за почерк.</p>
  <h3 id="l9hB">Решение: дай судье контекст, рубрику и примеры</h3>
  <p id="BZi0">Вместо «оцени текст» собери промпт из четырёх частей: контекст (что за задача и что человек просил — история переписки), рубрика — конкретные критерии по шкале 1–5, один-два контрастных примера «вот это 5, вот это 1» для калибровки и прямая инструкция «оценивай суть, игнорируй красивость». Самый большой прирост точности даёт история диалога: без неё судья не знает, что человек просил, поэтому оценка выходит почти случайной. Примеры-эталоны сильнее всего помогают, когда оцениваешь не «подходит ли ответ», а «убедительно ли он объяснён».</p>
  <p id="lh2Z"><strong>→ Что делать:</strong> оценивай тексты этим шаблоном:</p>
  <pre id="9NgI">Ты — эксперт-оценщик, который проверяет качество {тип_ответа}
по объективным критериям.

КОНТЕКСТ:
История переписки/диалога: {история}
Профиль/ситуация человека: {профиль}
Текущий запрос: {запрос}

ОТВЕТ ДЛЯ ОЦЕНКИ:
{текст_ответа}

КРИТЕРИИ (шкала 1–5):
1. {критерий_1} — {что_это_значит}
2. {критерий_2} — {что_это_значит}

ПРИМЕРЫ ДЛЯ КАЛИБРОВКИ:
Оценка 5: {пример_хорошего_ответа}
Оценка 1: {пример_плохого_ответа}

ВАЖНО: оценивай только суть и содержание. Игнорируй длину
текста и красивость формулировок.

Выведи оценку по каждому критерию и короткое пояснение.</pre>
  <figure id="OFFA" class="m_original">
    <img src="https://novasapiens.ru/data/tg/dtf-judge-context/2.png" width="2400" />
  </figure>
  <h3 id="rCKI">Почему это работает</h3>
  <p id="Iiwb"><strong>Вопрос «оцени» не задаёт, что мерить, поэтому модель мерит то, что видно, — стиль.</strong> Гладкие уверенные тексты в её обучающих данных чаще получали одобрение людей, поэтому без других опор она принимает форму за качество. <strong>Контекст, рубрика и примеры заменяют угадывание сверкой.</strong> История переписки показывает, что человек просил, рубрика — что именно мерить, примеры задают планку для каждого балла — поэтому судья сравнивает ответ с задачей, а не с эстетикой. Честная оговорка: даже настроенный судья совпадает с людьми умеренно, не идеально. Это быстрый фильтр для сравнения вариантов, а финальное решение по важным текстам оставляй за собой.</p>
  <h3 id="uLTy">Пример</h3>
  <p id="BJYn">Поддержка интернет-магазина: клиент пишет, что куртка не подошла по размеру. Бот сгенерировал три варианта ответа, нужно выбрать лучший — не «на глаз». Прогоняешь каждый через судью:</p>
  <pre id="Qr4U">Ты — эксперт-оценщик качества ответов службы поддержки.
Оцени ответ по критериям ниже.

КОНТЕКСТ:
История переписки с клиентом: &quot;Здравствуйте, заказал куртку M,
а она узкая в плечах. Хочу обмен на L или возврат денег.&quot;
Профиль клиента: постоянный покупатель, 4 заказа за год,
без возвратов ранее.

ОТВЕТ ДЛЯ ОЦЕНКИ:
&quot;Приносим извинения за неудобства! Мы можем оформить обмен
на размер L — курьер заберёт куртку M в удобное для вас время
и привезёт L в течение 2-3 дней. Также доступен возврат средств
в течение 5 рабочих дней, если обмен не подходит.
Что вам удобнее?&quot;

КРИТЕРИИ (шкала 1–5):
1. Персонализация — учитывает ли ответ статус клиента
   и суть его проблемы
2. Обоснование — понятно ли объяснены следующие шаги и сроки

ПРИМЕРЫ ДЛЯ КАЛИБРОВКИ:
Оценка 5: ответ предлагает конкретное решение с чёткими
сроками, обращается к сути жалобы.
Оценка 1: общий шаблонный ответ без конкретики
(&quot;напишите нам подробнее&quot;).

ВАЖНО: оценивай только суть, а не длину или красивость
формулировок.

Выведи:
Персонализация: [1-5]
Обоснование: [1-5]
Пояснение оценки.</pre>
  <p id="RMj3">Судья выдаст по каждому варианту две оценки с коротким пояснением — почему именно такой балл. Три ответа получат сопоставимые баллы по одной шкале, а не субъективное «этот звучит приятнее». Тот же шаблон без переделки ложится на посты для канала и описания товаров — поменяй контекст и критерии.</p>
  <h3 id="tR1L">Где пригодится</h3>
  <ul id="s9qg">
    <li id="1H37">Выбрать лучший из вариантов, которые сгенерировал ИИ: пост, письмо, описание товара — по одной шкале, а не на глаз</li>
    <li id="YKP9">Проверять ответы поддержки и письма клиентам до отправки — судья ловит «вежливо, но не по делу»</li>
    <li id="s9nD">Сравнивать свои промпты между собой: прогони их результаты через одного судью с одной рубрикой</li>
    <li id="VHEE">Правило: не отправляй судье голый текст — сначала задача и история, потом критерии, потом примеры</li>
  </ul>
  <p id="Dgtt">Если хочешь такие находки из свежих исследований каждый день — их присылает бот <a href="https://t.me/NovaPaperAlert_bot" target="_blank">@NovaPaperAlert_bot</a>.</p>
  <p id="zzSS"><em>Опирался на исследование «LLM-as-a-Judge for Evaluating System Responses in Conversational Music Recommendation» (arXiv 2607.25640).</em></p>

]]></content:encoded></item><item><guid isPermaLink="true">https://teletype.in/@foxhunterx/NefZK72N-VK</guid><link>https://teletype.in/@foxhunterx/NefZK72N-VK?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx</link><comments>https://teletype.in/@foxhunterx/NefZK72N-VK?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx#comments</comments><dc:creator>foxhunterx</dc:creator><title>ChatGPT молча принимает 3–4 решения за тебя в каждой задаче. Узнаёшь о них, когда что-то сломается</title><pubDate>Sat, 12 Sep 2026 10:00:16 GMT</pubDate><media:content medium="image" url="https://img2.teletype.in/files/16/f8/16f8c42d-ab5c-4ea7-8e29-6f4a90820ef0.png"></media:content><description><![CDATA[<img src="https://novasapiens.ru/data/tg/dtf-hidden-assumptions/1.png"></img>Попросил модель написать функцию логина — получил код, тесты зелёные, всё выглядит готовым. А через месяц выясняется: пароли она защищает через MD5 — устаревший способ, который давно научились взламывать. Ты этого не выбирал. Модель решила сама — и не сказала. Исследователь из Мичиганского технологического университета Jie Wu (июль 2026) посчитал: в среднем модель принимает 3–4 таких скрытых решения на каждую задачу. И показал приём, который заставляет её выложить весь список — до того, как одно из решений выстрелит.]]></description><content:encoded><![CDATA[
  <p id="x6uq">Попросил модель написать функцию логина — получил код, тесты зелёные, всё выглядит готовым. А через месяц выясняется: пароли она защищает через MD5 — устаревший способ, который давно научились взламывать. Ты этого не выбирал. Модель решила сама — и не сказала. Исследователь из Мичиганского технологического университета Jie Wu (июль 2026) посчитал: в среднем модель принимает 3–4 таких скрытых решения на каждую задачу. И показал приём, который заставляет её выложить весь список — до того, как одно из решений выстрелит.</p>
  <figure id="rsS8" class="m_original">
    <img src="https://novasapiens.ru/data/tg/dtf-hidden-assumptions/1.png" width="2400" />
  </figure>
  <h3 id="hRFN">В чём проблема: короткий запрос скрывает десятки вопросов — и модель отвечает на них молча</h3>
  <p id="IiUk">Твой запрос короткий: «напиши функцию логина», «сделай парсер отзывов». Но внутри задачи спрятаны вопросы, которые ты не оговорил: как защищать пароль, что вернуть при ошибке, что делать с дублями. Модель не останавливается переспросить — она обучена выдавать готовый результат по любому запросу, поэтому каждый пробел заполняет самым вероятным вариантом из обучения. И делает это молча: объяснять выбор её не просили, из-за этого решения остаются внутри кода, а не в тексте ответа. Тесты тут не спасают — они проверяют, ЧТО код делает, а не КАК: код с MD5 проходит их так же зелёно, как код с нормальной защитой. Как строитель, которому сказали «сделай красиво»: он молча клеит обои в цветочек, работа формально сделана — а сюрприз ты обнаружишь после ремонта. По замерам исследования (180 задач, 676 размеченных решений) на одну задачу приходится 3–4 таких молчаливых выбора — и без специального запроса их не видно.</p>
  <h3 id="eewE">Решение: сначала список скрытых решений, потом правки</h3>
  <p id="2gAH">Не вычитывай код строчка за строчкой и не проси «перепиши получше». Покажи модели её же результат и потребуй отчёт: какие решения в нём не были в моём запросе. Она разложит их по категориям — безопасность, обработка ошибок, формат данных — с альтернативой и оценкой критичности для каждого. Ты читаешь список как чек-лист, отмечаешь спорное — и просишь переписать только тот кусок, который зависит от изменённого решения. Остальной код не трогается.</p>
  <p id="wAZq"><strong>→ Что делать:</strong> получил код — прогони его через аудит скрытых решений:</p>
  <pre id="kjzh">Ты — опытный разработчик, который аудирует код на скрытые решения.

Исходный запрос:
{твой_первоначальный_запрос}

Сгенерированный код:
{код}

Задача:
1. РАССУЖДЕНИЕ: перечисли каждое решение в коде, которое явно
   НЕ требовалось запросом. Для каждого назови реалистичную альтернативу.
2. ФОРМАТ: верни список в виде:
   - Категория: {валидация входных данных / формат данных /
     обработка ошибок / хранение данных / производительность / безопасность}
   - Что решено:
   - Альтернатива:
   - Критичность: {низкая/средняя/высокая}

После списка — жди моих правок. Когда я укажу, какое решение изменить,
перепиши ТОЛЬКО тот участок кода, который зависит от этого решения,
остальной код оставь без изменений.</pre>
  <figure id="RBWv" class="m_original">
    <img src="https://novasapiens.ru/data/tg/dtf-hidden-assumptions/2.png" width="2400" />
  </figure>
  <h3 id="40ZF">Почему это работает</h3>
  <p id="SXZ2"><strong>Модель не планирует решения заранее — но отлично объясняет их пост-фактум.</strong> Код рождается как самая вероятная последовательность слов, промежуточные выборы никто не проговаривает. А вот разобрать уже готовый код и назвать, зачем выбран каждый вариант, модель умеет хорошо — это тот же навык, что объяснение чужого кода. Поэтому запрос «посмотри на свой код и найди, что ты решила сама» превращает молчаливые выборы в текст, который можно прочитать и оспорить. <strong>Точечная регенерация сужает зону риска.</strong> Команда «перепиши весь код» заставляет модель заново принимать все решения — из-за этого она может поменять и то, что тебя устраивало. Поэтому проси переписать только участок, зависящий от одного изменённого решения. Честные границы: редкие категории — безопасность и долговременное хранение — модель находит хуже всего, а они самые критичные; и если от одного решения зависело несколько кусков кода, правка может захватить не все. Список ускоряет проверку, но не отменяет её.</p>
  <h3 id="bDFa">Пример</h3>
  <p id="t1Q4">Приём работает не только с кодом. Просишь ChatGPT: «составь ТЗ на сайт для мастерской по ремонту обуви». Получаешь стройный документ — а внутри модель молча решила: движок WordPress, форма заявки без онлайн-оплаты, про мобильную версию — одна строчка. Разворачиваешь так:</p>
  <pre id="bZWB">Ты — опытный подрядчик, который проверяет ТЗ на скрытые решения.

Исходный запрос:
&quot;Составь ТЗ на сайт для мастерской по ремонту обуви&quot;

Готовое ТЗ:
[вставь ТЗ, которое выдала модель]

Перечисли каждое решение в ТЗ, которое я явно не просил.
Для каждого: категория, что решено, альтернатива,
критичность (низкая/средняя/высокая).
После списка жди моих правок — и переписывай только тот раздел,
который зависит от изменённого решения.</pre>
  <p id="IqMq">Модель выдаст список: выбрала WordPress (альтернатива — конструктор, дешевле в поддержке), не заложила онлайн-запись (критичность высокая — клиенты пишут вечером, когда мастерская закрыта), цены на сайте решила не показывать. Ты правишь одно — «онлайн-запись нужна» — и она переписывает только раздел про функциональность, не перетряхивая остальной документ.</p>
  <h3 id="zphq">Где пригодится</h3>
  <ul id="6kll">
    <li id="JNP1">Любой код от ИИ длиннее 10–15 строк — особенно там, где есть пароли, деньги и чужие данные</li>
    <li id="iaTk">ТЗ, договоры, планы, стратегии — любой документ, где модель заполняет пробелы за тебя</li>
    <li id="SYyh">Правки без эффекта домино: точечная регенерация вместо «перепиши всё»</li>
    <li id="kuT7">Правило: получил результат — сначала спроси «что ты решила сама?», потом внедряй</li>
  </ul>
  <p id="rcxD">Если хочешь такие находки из свежих исследований каждый день — их присылает бот <a href="https://t.me/NovaPaperAlert_bot" target="_blank">@NovaPaperAlert_bot</a>.</p>
  <p id="DYrY"><em>Опирался на исследование «AssumptionMiner: Extracting, Tracing, and Revising Implicit Assumptions in LLM Code Generation» (arXiv 2607.22898).</em></p>

]]></content:encoded></item><item><guid isPermaLink="true">https://teletype.in/@foxhunterx/yBcjd0mOE2H</guid><link>https://teletype.in/@foxhunterx/yBcjd0mOE2H?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx</link><comments>https://teletype.in/@foxhunterx/yBcjd0mOE2H?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx#comments</comments><dc:creator>foxhunterx</dc:creator><title>ChatGPT никогда не скажет «мне не хватает данных» — он придумает ответ. Чинится четырьмя блоками в промпте</title><pubDate>Wed, 09 Sep 2026 10:00:16 GMT</pubDate><media:content medium="image" url="https://img1.teletype.in/files/cc/d0/ccd06a8d-eb88-4368-bd64-8d08d3d6c2ca.png"></media:content><description><![CDATA[<img src="https://novasapiens.ru/data/tg/dtf-evidence-gap/1.png"></img>Спроси ChatGPT «какой ноутбук взять» — и он назовёт конкретную модель, не зная ни твоего бюджета, ни задач. Спроси «что делать с продуктом» без единой цифры — получишь уверенную стратегию. Фразу «мне не хватает данных» модель не говорит почти никогда: недостающее она молча придумывает. Врач-исследователь Koyar Afrasyab из шведской Kinvectum AB (июль 2026) прогнал 1200 клинических вопросов через четыре топ-модели и показал: четыре блока в промпте заставляют модель сначала проверить, хватает ли данных, — и честно останавливаться, когда не хватает. Проверил на бытовых вопросах — работает.]]></description><content:encoded><![CDATA[
  <p id="5tIh">Спроси ChatGPT «какой ноутбук взять» — и он назовёт конкретную модель, не зная ни твоего бюджета, ни задач. Спроси «что делать с продуктом» без единой цифры — получишь уверенную стратегию. Фразу «мне не хватает данных» модель не говорит почти никогда: недостающее она молча придумывает. Врач-исследователь Koyar Afrasyab из шведской Kinvectum AB (июль 2026) прогнал 1200 клинических вопросов через четыре топ-модели и показал: четыре блока в промпте заставляют модель сначала проверить, хватает ли данных, — и честно останавливаться, когда не хватает. Проверил на бытовых вопросах — работает.</p>
  <figure id="ABFT" class="m_original">
    <img src="https://novasapiens.ru/data/tg/dtf-evidence-gap/1.png" width="2400" />
  </figure>
  <h3 id="l57e">В чём проблема: модель оптимизирует «полезный ответ», а не честный</h3>
  <p id="3Vdq">Модель подбирает каждое следующее слово так, чтобы ответ выглядел полезным продолжением разговора. В обучении на человеческих оценках конкретный уверенный ответ стабильно получал балл выше, чем «мне не хватает информации», — из-за этого паттерн «остановись и переспроси» у модели почти выбит. Поэтому, когда в твоём вопросе дыра, она не тормозит: молча достраивает недостающие факты — бюджет, контекст, анамнез — и отвечает так, будто ты всё это ей дал. Снаружи подделку не видно: ответ структурный, уверенный, полный. В исследовании это называют уверенностью без оснований — галлюцинация, замаскированная под экспертизу. Как студент на экзамене, который не знает билет, но отвечает бодро: за уверенную чушь иногда ставят зачёт, за молчание — никогда.</p>
  <h3 id="IrOT">Решение: инвентаризация данных перед ответом</h3>
  <p id="z9C8">Не проси ответ сразу — заставь модель сначала провести инвентаризацию. Приём называется Evidence-Sufficiency Wrapper — обёртка, проверяющая достаточность данных. Это один промпт с четырьмя блоками: что известно → чего не хватает → хватает ли для ответа → и только потом сам ответ. Перед блоком «ОТВЕТ» модель обязана вынести вердикт «достаточно ли», и если нет — вместо совета выдаёт список: что собрать и почему это меняет решение. Всё в одном сообщении, без цепочек и повторных запросов.</p>
  <p id="ipeA"><strong>→ Что делать:</strong> оборачивай запрос в четыре блока:</p>
  <pre id="yfrH">Ты — {роль}.

Перед тем как отвечать, пройди структурированный анализ:

ЕСТЬ ДАННЫЕ: перечисли всё, что предоставлено в запросе
и что ты знаешь о ситуации

НЕТ ДАННЫХ: перечисли ключевые данные, которых не хватает
для обоснованного ответа на {тип задачи}

ДОСТАТОЧНО ЛИ: вынеси вердикт — можно ли дать обоснованный
ответ с тем, что есть? Обоснуй одним предложением.

ОТВЕТ: если данных достаточно — {что сделать}.
Если недостаточно — перечисли в порядке приоритета,
что нужно выяснить и почему это критично для решения.

{задача}</pre>
  <figure id="x85b" class="m_original">
    <img src="https://novasapiens.ru/data/tg/dtf-evidence-gap/2.png" width="2400" />
  </figure>
  <h3 id="xTwj">Почему это работает</h3>
  <p id="6i2u"><strong>Модель по умолчанию тянется к «полезному продолжению», а не к честности.</strong> В обучении уверенные ответы оценивались выше оговорок, поэтому при дыре в данных она достраивает картину сама, а не останавливается. <strong>Четыре блока меняют задачу: не «ответь», а «сначала перечисли».</strong> Перечислять и классифицировать — сильная сторона модели, поэтому пробелы становятся видны ей самой ещё до ответа: в исследовании одна только структура, без всяких запретов, дала 38% эффекта. Явная инструкция «если данных недостаточно — не отвечай, а скажи, чего не хватает» добавила остальные 62%: у модели появляется легальная точка остановки, и «полезным» становится не совет, а список недостающего. Границы приёма честно: на полных данных обёртка почти ничего не меняет — она работает именно на дырах. И следи за перегибом: часть моделей уходит в сверхосторожность и требует уточнений даже там, где всё есть, — у одной из протестированных точность упала с 75% до 17%. Лечится мягкой формулировкой: вместо «не отвечай» пиши «отвечай с явной оговоркой, чего не хватает».</p>
  <h3 id="XfAI">Пример</h3>
  <p id="BYca">Классика жанра — «какой ноутбук купить?». Обычный ChatGPT назовёт конкретную модель, не зная ни бюджета, ни задач. С обёрткой тот же вопрос выглядит так:</p>
  <pre id="m5kx">Ты — консультант по выбору техники.

Перед тем как отвечать, пройди структурированный анализ:

ЕСТЬ ДАННЫЕ: перечисли всё, что предоставлено в запросе.

НЕТ ДАННЫХ: перечисли ключевые данные, которых не хватает
для обоснованной рекомендации.

ДОСТАТОЧНО ЛИ: вынеси вердикт — можно ли рекомендовать
конкретную модель с тем, что есть? Обоснуй одним предложением.

ОТВЕТ: если данных достаточно — назови 2–3 модели с обоснованием.
Если недостаточно — перечисли в порядке приоритета, что нужно
выяснить и почему это критично для выбора.

Вопрос: какой ноутбук купить?</pre>
  <p id="qKm3">В «НЕТ ДАННЫХ» модель выпишет бюджет, задачи, вес, автономность, привязку к операционке. В «ДОСТАТОЧНО ЛИ» честно скажет: нет, рекомендовать рано. А в «ОТВЕТЕ» вместо случайной модели даст список вопросов в порядке важности — и объяснит, как каждый ответ меняет выбор. Тот же приём работает с договором, где не хватает ключевых условий, со справкой без контекста и с вопросом «что со мной, если болит бок».</p>
  <h3 id="H2as">Где пригодится</h3>
  <ul id="vinE">
    <li id="UqKU">Разбор документов — договор без ключевых условий, справка, выписка: модель сначала скажет, чего в них не хватает</li>
    <li id="4IHd">Здоровье — «что со мной по двум симптомам»: вместо диагноза из воздуха получишь список, что уточнить у врача</li>
    <li id="oUVW">Бизнес-решения без цифр — стратегия, запуск, выбор рынка: модель потребует выручку и данные о клиентах, а не нальёт воды</li>
    <li id="dmDo">Правило: если сам не уверен, что дал модели всё нужное, — оборачивай запрос в четыре блока</li>
  </ul>
  <p id="qLht">Если хочешь такие находки из свежих исследований каждый день — их присылает бот <a href="https://t.me/NovaPaperAlert_bot" target="_blank">@NovaPaperAlert_bot</a>.</p>
  <p id="T2rr"><em>Опирался на исследование «Judge-dependent safety gains and model-specific helpfulness costs of evidence-sufficiency prompting in clinical LLMs» (arXiv 2607.18086).</em></p>

]]></content:encoded></item><item><guid isPermaLink="true">https://teletype.in/@foxhunterx/ISemI3Dy2qZ</guid><link>https://teletype.in/@foxhunterx/ISemI3Dy2qZ?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx</link><comments>https://teletype.in/@foxhunterx/ISemI3Dy2qZ?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx#comments</comments><dc:creator>foxhunterx</dc:creator><title>Все пишут «думай пошагово». Для договоров и ТЗ это вредный совет: модель должна думать молча</title><pubDate>Sun, 06 Sep 2026 10:00:16 GMT</pubDate><media:content medium="image" url="https://img2.teletype.in/files/93/ae/93ae0cd0-3b81-46c6-b28a-cb95d3fa0660.png"></media:content><description><![CDATA[<img src="https://novasapiens.ru/data/tg/dtf-silent-thinking/1.png"></img>Первое, чему учат в промптинге: добавь «думай пошагово» — и ответ станет лучше. В математике так и есть. Но команда из Кембриджа (Lekang Jiang, Wenjun Sun, Stephan Goetz, июль 2026) проверила этот совет на текстах, где важна каждая деталь, — патентных формулах — и получила обратное: когда модель выписывает рассуждения в чат, она теряет конкретику. Причём оценивали не метрики, а лицензированные патентные поверенные: та же модель с теми же шагами, но молча, писала точнее. Весь приём — одна строчка запрета в промпте.]]></description><content:encoded><![CDATA[
  <p id="G8Ps">Первое, чему учат в промптинге: добавь «думай пошагово» — и ответ станет лучше. В математике так и есть. Но команда из Кембриджа (Lekang Jiang, Wenjun Sun, Stephan Goetz, июль 2026) проверила этот совет на текстах, где важна каждая деталь, — патентных формулах — и получила обратное: когда модель выписывает рассуждения в чат, она теряет конкретику. Причём оценивали не метрики, а лицензированные патентные поверенные: та же модель с теми же шагами, но молча, писала точнее. Весь приём — одна строчка запрета в промпте.</p>
  <figure id="NCoi" class="m_original">
    <img src="https://novasapiens.ru/data/tg/dtf-silent-thinking/1.png" width="2400" />
  </figure>
  <h3 id="CAUV">В чём проблема: рассуждая вслух, модель подменяет конкретику общими словами</h3>
  <p id="B9IN">Когда ты просишь модель показать ход рассуждений, она переключается в режим объяснения. А связный рассказ о своих шагах удобнее строить из обобщений — поэтому конкретное «отверстия диаметром 0,5 мм» превращается в «систему распределения воды», а точная сумма штрафа — в «финансовую ответственность». Это не сбой: модель так помогает себе рассуждать. В экспериментах видно, где всё ломается: уже на первом шаге, при извлечении деталей из источника, точность падала до 62–72%, и каждая потеря тянулась во второй и третий шаг. Самое показательное — модель знала правильный ответ: молча она воспроизводила те же детали, которые вслух теряла. Как хирург, которого заставили комментировать каждое движение: руки умеют, но пока он рассказывает — точность уходит.</p>
  <h3 id="tXCW">Решение: дай модели план шагов — и запрети его показывать</h3>
  <p id="ioja">Приём называется Implicit CoT — скрытые рассуждения. Ты по-прежнему даёшь модели структуру мышления: извлеки детали → сгруппируй → сформулируй. Но добавляешь запрет: «думай внутри, не выводя рассуждения» и «выведи ТОЛЬКО финальный текст». Все три шага происходят внутри одного запроса, в чате появляется только результат. В исследовании (693 патента, модели от Llama до GPT-4o) GPT-4o с этим приёмом получила у экспертов на 5,2 балла больше, чем с обычным промптом, а «думай вслух» с теми же самыми шагами — на 2,2 балла меньше, чем молча.</p>
  <p id="L0MH"><strong>→ Что делать:</strong> строй промпт по этому шаблону — и описывай шаги конкретно под свою задачу:</p>
  <pre id="WN2F">Ты — {роль с экспертизой в нужной области}.

Твоя задача: составить {тип текста: раздел договора / ТЗ / спецификация}
на основе следующего источника:

{источник — черновик, бриф, описание, данные}

Думай внутри, не выводя рассуждения:
— Шаг 1: извлеки все конкретные {ключевые элементы: для договора —
  условия и суммы; для ТЗ — требования и ограничения}
— Шаг 2: сгруппируй по {принципу: функциональным блокам /
  приоритетам / логическим зависимостям}
— Шаг 3: сформулируй в {стиле: формальном юридическом / техническом}
  с соблюдением {формата: нумерации / иерархии разделов}

Выведи ТОЛЬКО финальный {тип текста} — без пояснений,
без промежуточных шагов рассуждений.</pre>
  <figure id="dK0n" class="m_original">
    <img src="https://novasapiens.ru/data/tg/dtf-silent-thinking/2.png" width="2400" />
  </figure>
  <h3 id="JWt9">Почему это работает</h3>
  <p id="D99k"><strong>Вывод рассуждений в текст включает режим обобщения.</strong> Рассказ о своих шагах модель строит из общих слов, из-за этого детали теряются уже при извлечении из источника — и каждая потеря переходит в следующий шаг, поэтому в финальном тексте вместо сумм и параметров остаются расплывчатые описания. <strong>Запрет на вывод убирает пересказ, но оставляет план.</strong> Структура «извлеки → сгруппируй → сформулируй» всё равно запускает пошаговое рассуждение, а раз модель не переключается из режима «думаю» в режим «объясняю», её устойчивые шаблоны — как строится договор, как звучит ТЗ — не прерываются, поэтому конкретика из источника доезжает до результата. Границы приёма: на слабых моделях разница минимальна, для творческих задач без источника с деталями преимущества нет, а если результат неточный — временно сними запрет и посмотри, на каком шаге теряются детали.</p>
  <h3 id="PPJk">Пример</h3>
  <p id="cvhf">Клиент прислал бриф на две страницы: бюджет 450 000 ₽, запуск за 6 недель, три пакета работ, две интеграции и список того, что делать отказался. Попросишь «сначала проанализируй бриф, потом напиши КП» — и в тексте появится «гибкий бюджет» вместо суммы и «сжатые сроки» вместо шести недель. Вместо этого:</p>
  <pre id="uF5q">Ты — менеджер по продажам в digital-агентстве.

Твоя задача: составить коммерческое предложение
на основе брифа клиента:

[вставить бриф]

Думай внутри, не выводя рассуждения:
— Шаг 1: извлеки все конкретные цифры и условия: бюджет, сроки,
  состав работ, интеграции, что клиент исключил
— Шаг 2: сгруппируй по блокам: задача, решение, этапы,
  стоимость, что не входит в объём работ
— Шаг 3: сформулируй в деловом стиле с нумерацией разделов

Выведи ТОЛЬКО готовое коммерческое предложение — без пояснений,
без промежуточных шагов рассуждений.</pre>
  <p id="W6Jk">На выходе — готовое КП, где бюджет так и остался «450 000 ₽», а сроки — «6 недель». Если что-то всё же потерялось, включи режим отладки из исследования: временно замени последнюю строку на «Покажи все три шага рассуждений и финальный текст», найди шаг, где конкретика превратилась в общие слова, уточни его формулировку — и верни запрет.</p>
  <h3 id="AD53">Где пригодится</h3>
  <ul id="WCAT">
    <li id="Sigh">Договоры, оферты, регламенты — суммы, сроки и исключения доезжают до текста без искажений</li>
    <li id="YqzR">ТЗ и спецификации — требования и зависимости не размываются в «общий функционал»</li>
    <li id="ItaX">КП, резюме, отчёты и таблицы из исходных данных — каждая цифра из брифа остаётся цифрой</li>
    <li id="TRH0">Правило: есть источник, где важна каждая деталь, — запрещай вывод рассуждений; математика и мозговой штурм — оставь классическое «думай пошагово»</li>
  </ul>
  <p id="QIVZ">Если хочешь такие находки из свежих исследований каждый день — их присылает бот <a href="https://t.me/NovaPaperAlert_bot" target="_blank">@NovaPaperAlert_bot</a>.</p>
  <p id="3XJH"><em>Опирался на исследование «When Reasoning Hurts Legal Drafting: The Verbalization Bottleneck in Patent Claim Generation» (arXiv 2607.10480).</em></p>

]]></content:encoded></item><item><guid isPermaLink="true">https://teletype.in/@foxhunterx/X3EtWc-Pisy</guid><link>https://teletype.in/@foxhunterx/X3EtWc-Pisy?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx</link><comments>https://teletype.in/@foxhunterx/X3EtWc-Pisy?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx#comments</comments><dc:creator>foxhunterx</dc:creator><title>Просишь ChatGPT «проверь на ошибки» — получаешь «всё отлично». Ошибки при этом остаются</title><pubDate>Thu, 03 Sep 2026 10:00:16 GMT</pubDate><media:content medium="image" url="https://img2.teletype.in/files/da/80/da8092b8-379d-44c0-b568-bd43b68aa143.png"></media:content><description><![CDATA[<img src="https://novasapiens.ru/data/tg/dtf-vague-check/1.png"></img>Знакомая ситуация: скидываешь ChatGPT договор или текст, просишь «проверь на ошибки» — он хвалит структуру, цепляет пару мелочей, ты выдыхаешь. А главная дыра всплывает потом, когда документ уже отправлен. Amin Haeri и Mahdi Ghelichi из TD Bank (июль 2026) нашли причину: без явного списка требований модель находит примерно половину реальных проблем, а треть её замечаний — ложные тревоги. Стоит дать ей список и попросить проверить каждый пункт по очереди — и в их эксперименте она поймала все проблемы до одной, 30 из 30. Разница — один блок текста в промпте.]]></description><content:encoded><![CDATA[
  <p id="9W95">Знакомая ситуация: скидываешь ChatGPT договор или текст, просишь «проверь на ошибки» — он хвалит структуру, цепляет пару мелочей, ты выдыхаешь. А главная дыра всплывает потом, когда документ уже отправлен. Amin Haeri и Mahdi Ghelichi из TD Bank (июль 2026) нашли причину: без явного списка требований модель находит примерно половину реальных проблем, а треть её замечаний — ложные тревоги. Стоит дать ей список и попросить проверить каждый пункт по очереди — и в их эксперименте она поймала все проблемы до одной, 30 из 30. Разница — один блок текста в промпте.</p>
  <figure id="UoMN" class="m_original">
    <img src="https://novasapiens.ru/data/tg/dtf-vague-check/1.png" width="2400" />
  </figure>
  <h3 id="owyU">В чём проблема: без списка модель проверяет то, что сама считает важным</h3>
  <p id="5ChK">Когда ты пишешь «найди проблемы», модель не знает, что именно ты забыл, — твоих требований она не видела и угадать их не может. Из-за этого она проверяет то, что сама считает важным: типовые вещи, которые «обычно ломаются». Очевидное находит, а промахивается ровно там, где ты сам что-то упустил, — эти случаи никто явно не сформулировал, поэтому для неё их просто нет. Второй эффект — ложные тревоги: без правил модель судит «на глаз», и в исследовании треть её замечаний указывала на проблемы, которых не было. Количеством это не лечится: удвоение числа проверок дало почти ноль (+4 процентных пункта), а восемь независимых прогонов «проверь граничные случаи» вместе не дотянули до одного прохода по списку. Это как принимать квартиру у застройщика без чек-листа: посмотришь на ровные обои, скажешь «всё отлично» — а что розетки не работают, узнаешь через неделю.</p>
  <h3 id="itZE">Решение: список требований и проверка каждого по очереди</h3>
  <p id="U2uK">Не проси «проверить» — проси «проверить против списка». Составь 5–10 конкретных требований и попроси модель пройти по каждому отдельно: статус, что именно не так, цитата из материала. Если критериев под рукой нет, сначала попроси их составить: «Составь список из 7–10 конкретных, проверяемых критериев качества для [тип материала]. Каждый критерий должен быть объективным: можно ответить ДА или НЕТ» — и потом запускай проверку по этому списку. Формат вторичен: даже требования сплошным абзацем подняли результат с 2 до 27 пойманных проблем из 30, а нумерованный список добил до 30 из 30.</p>
  <p id="4oOD"><strong>→ Что делать:</strong> проверяй по явному списку требований:</p>
  <pre id="vger">Проверь {что проверяем} против следующего списка требований.

Требования:
1. {требование_1}
2. {требование_2}
3. {требование_3}
[... все требования]

Для каждого требования по очереди:
- Статус: ✅ выполнено / ⚠️ частично / ❌ нарушено
- Конкретное объяснение: что именно не так (если не выполнено)
- Цитата из материала, которая демонстрирует проблему (если применимо)

В конце — краткий список правок: что именно переписать и как.

Вот материал для проверки:
{текст / план / документ}</pre>
  <figure id="ESXk" class="m_original">
    <img src="https://novasapiens.ru/data/tg/dtf-vague-check/2.png" width="2400" />
  </figure>
  <h3 id="Kio7">Почему это работает</h3>
  <p id="CUwd"><strong>Без списка модель проверяет по собственному представлению о «важном».</strong> Она не знает, что именно ты пропустил, поэтому промахивается в тех самых неочевидных местах — и заодно выносит субъективные замечания «здесь слабовато», треть из которых оказывается ложной тревогой (33% против 0% при проверке по списку). <strong>Явный список превращает каждое требование в отдельное задание.</strong> Модель больше не выбирает, что проверять, — она обязана пройти всё по очереди, поэтому неочевидный случай перестаёт быть догадкой и становится пунктом, который нельзя пропустить. А формулировка «нарушено правило 4» даёт якорь: либо нарушено, либо нет — субъективность исчезает. Оптимум — 5–10 правил: больше 15 — внимание модели к каждому падает. Честная граница приёма: он работает там, где критерии в принципе существуют. Для творческих задач — «придумай, как лучше» — списка правил нет, и эффекта не будет.</p>
  <h3 id="MLiL">Пример</h3>
  <p id="0YPz">Снимаешь квартиру, собственник прислал договор на четыре страницы. «Проверь, всё ли ок» вернёт «в целом стандартный договор». Вместо этого:</p>
  <pre id="XjfB">Проверь договор аренды квартиры против следующего списка требований.

Требования:
1. Указан размер депозита и условия его возврата
2. Прописано, кто платит за коммуналку, интернет и мелкий ремонт
3. Есть условия досрочного расторжения и срок предупреждения —
   для обеих сторон
4. Зафиксировано, что плата не меняется в течение срока договора
5. Есть акт приёма-передачи с состоянием квартиры и мебели
6. Прописаны условия визитов собственника — только по договорённости

Для каждого требования по очереди:
- Статус: ✅ выполнено / ⚠️ частично / ❌ нарушено
- Конкретное объяснение: что именно не так
- Цитата из договора, которая демонстрирует проблему

В конце — краткий список: что попросить изменить до подписи.

Вот договор:
[текст договора]</pre>
  <p id="2TEj">Вместо «в целом нормально» получишь построчный разбор: «правило 1 частично: депозит указан, но не написано, когда и как он возвращается» — и готовый список правок для разговора с собственником. Тот же шаблон работает для статьи перед публикацией, лендинга и важного письма — меняются только требования.</p>
  <h3 id="zPWO">Где пригодится</h3>
  <ul id="sqQV">
    <li id="7RcO">Договоры и документы перед подписью — аренда, подряд, оферта: список условий вместо «глянь, всё ли ок»</li>
    <li id="jxd9">Тексты перед отправкой — статья, лендинг, письмо клиенту: явные требования вместо «свежего взгляда»</li>
    <li id="x8BT">КП и питчи — в роли списка возьми типичные возражения клиента или инвестора и проверь, закрыто ли каждое</li>
    <li id="g1sh">Правило: нет списка — нет проверки; сначала попроси модель составить критерии, потом проверяй по ним</li>
  </ul>
  <p id="aIHC">Если хочешь такие находки из свежих исследований каждый день — их присылает бот <a href="https://t.me/NovaPaperAlert_bot" target="_blank">@NovaPaperAlert_bot</a>.</p>
  <p id="o1rx"><em>Опирался на исследование «Specification Grounding Drives Test Effectiveness for LLM Code» (arXiv 2607.06636).</em></p>

]]></content:encoded></item><item><guid isPermaLink="true">https://teletype.in/@foxhunterx/yxkEvRebpN4</guid><link>https://teletype.in/@foxhunterx/yxkEvRebpN4?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx</link><comments>https://teletype.in/@foxhunterx/yxkEvRebpN4?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx#comments</comments><dc:creator>foxhunterx</dc:creator><title>Просишь ChatGPT разнести твой питч — он «критикует» его цитатами из твоего же текста</title><pubDate>Tue, 18 Aug 2026 10:00:16 GMT</pubDate><media:content medium="image" url="https://img4.teletype.in/files/7d/b8/7db845bd-5bba-407c-a53f-783d2866e03b.png"></media:content><description><![CDATA[<img src="https://novasapiens.ru/data/tg/dtf-echo-critique/1.png"></img>Знакомая схема: просишь ChatGPT сыграть придирчивого инвестора или вредного клиента, получаешь солидный «разбор» — и идея кажется проверенной. Теперь перечитай его аргументы: это фразы из твоего же питча, переставленные местами. Написал «натуральные ингредиенты» — «клиент» покупает, потому что ингредиенты натуральные. Atharva Pandey и Gautam Jajoo (июль 2026) сравнили такие симуляции с ответами реальных людей: причины, которые сочиняет модель, предсказывают поведение хуже, чем настоящие человеческие причины, случайно перемешанные между людьми. Хорошая новость: подмена ловится и чинится тремя ограничениями в промпте. Разбираю приём и даю готовый шаблон.]]></description><content:encoded><![CDATA[
  <p id="NR5T">Знакомая схема: просишь ChatGPT сыграть придирчивого инвестора или вредного клиента, получаешь солидный «разбор» — и идея кажется проверенной. Теперь перечитай его аргументы: это фразы из твоего же питча, переставленные местами. Написал «натуральные ингредиенты» — «клиент» покупает, потому что ингредиенты натуральные. Atharva Pandey и Gautam Jajoo (июль 2026) сравнили такие симуляции с ответами реальных людей: причины, которые сочиняет модель, предсказывают поведение хуже, чем настоящие человеческие причины, случайно перемешанные между людьми. Хорошая новость: подмена ловится и чинится тремя ограничениями в промпте. Разбираю приём и даю готовый шаблон.</p>
  <figure id="k3fi" class="m_original">
    <img src="https://novasapiens.ru/data/tg/dtf-echo-critique/1.png" width="2400" />
  </figure>
  <h3 id="XLjm">В чём проблема: модель собирает «мнение» из твоего же текста</h3>
  <p id="hyIs">Модель обучали подстраиваться под контекст: ответ, который согласуется с показанным текстом, выглядит уместным и полезным — такие ответы в обучении оценивали выше. Из-за этого, когда ты просишь её сыграть скептика, она строит «мнение» из самого доступного материала — твоего же питча. Поэтому продающие пункты возвращаются к тебе в виде причин: питч говорит «рынок растёт на 40%» — «инвестор» вкладывается, потому что рынок растёт на 40%. Хотя настоящий скептик первым делом усомнился бы в самой цифре. Снаружи подмена неотличима от анализа: вердикт есть, обоснование есть. Но ты слышишь не мнение рынка, а эхо собственных слов. Исследователи измерили масштаб: 94 реальных покупателя оценили три продукта и написали, почему готовы или не готовы купить. Потом те же причины попросили сочинить LLM от их лица — и сгенерированные причины предсказывали реальные решения хуже, чем настоящие человеческие, даже случайно перемешанные между людьми. То есть модель не слегка промахивается — она вообще не заглядывает в чужую голову, а переупаковывает твой текст.</p>
  <h3 id="Aebi">Решение: чек-лист причин, три голоса и запрет на цитаты</h3>
  <p id="0vfi">Подмена ломается тремя ограничениями в одном промпте. Первое: не давай модели объяснять решение свободным текстом — задай фиксированный чек-лист категорий (цена, доверие к цифрам, риск, привычка) и попроси отметить каждую «за», «против» или «не участвует». Второе: вместо одного усреднённого «клиента» запроси три контрастных голоса — скептик, нейтральный, энтузиаст — каждый отдельным блоком. Третье, ключевое: прямо запрети брать причины из твоего текста. Если в питче написано «рынок растёт на 40%», модель должна ответить не «рынок растёт», а верит ли персонаж этой цифре — и почему.</p>
  <p id="rrPU"><strong>→ Что делать:</strong> подставь свой текст в шаблон из исследования:</p>
  <pre id="1Mc7">Вот текст/концепция для оценки:
«{текст_концепции}»

Сыграй три роли человека, реагирующего на это. Роли:
- Скептик — ищет слабые места и сомневается
- Нейтральный — взвешивает плюсы и минусы поровну
- Энтузиаст — ищет, что могло бы убедить

Контекст персоны: {кто этот человек, его опыт и привычки в теме}

Для каждой роли:
1. Вердикт: согласится / откажется / нужно больше информации
2. Разбери причину строго по категориям (отметь «за», «против»
   или «не участвует»):
   - {категория_1}
   - {категория_2}
   - {категория_3}
   - {категория_4}

ВАЖНО: не бери причину прямо из текста концепции. Если там
написано «X», не пиши «нравится X» — напиши, ВЕРИТ ли персона
утверждению X и почему.

Выведи три роли отдельными блоками, без смешивания.</pre>
  <figure id="Ehvh" class="m_original">
    <img src="https://novasapiens.ru/data/tg/dtf-echo-critique/2.png" width="2400" />
  </figure>
  <h3 id="Sskk">Почему это работает</h3>
  <p id="QeUN"><strong>Свободный ответ соскальзывает в пересказ, потому что твой текст — самый доступный материал.</strong> Модель подбирает правдоподобное объяснение, а не независимое суждение, поэтому без ограничений «мнение» складывается из готовых формулировок питча. <strong>Жёсткая структура разворачивает сильную сторону модели против этой привычки.</strong> Модель хорошо держит заданный формат: попроси разложить причину по категориям — и она честно оценит каждую, включая неудобные «против». Раздельные роли не дают усреднить ответ до нейтрально-положительного, поэтому у скептика появляется место для настоящих сомнений. А запрет на цитаты меняет саму задачу: не «повтори утверждение», а «оцени, веришь ли ты ему» — это уже рассуждение, а не эхо. Честные оговорки: запрет снижает пересказ, но не убирает его полностью, а проверяли метод на небольшой выборке — 94 человека и три концепции. Так что это детектор и страховка, а не гарантия честности.</p>
  <h3 id="jTSe">Пример</h3>
  <p id="msBn">Проверяешь резюме перед откликом на вакансию продакт-менеджера — хочешь увидеть его глазами нанимающего, который листает десятки таких в неделю:</p>
  <pre id="7xSd">Вот моё резюме на вакансию продакт-менеджера:
«5 лет в b2c-продуктах. Запустил 3 крупные фичи. Поднял retention
на 18%. Строил аналитику с нуля. Ищу команду с сильной продуктовой
культурой»

Сыграй три роли нанимающего менеджера, который читает это резюме:
- Скептик — ищет слабые места и сомневается
- Нейтральный — взвешивает плюсы и минусы поровну
- Энтузиаст — ищет, что могло бы убедить позвать на интервью

Контекст персоны: senior продакт-лид, смотрит 40 резюме в неделю,
не доверяет красивым цифрам без деталей.

Для каждой роли:
1. Вердикт: позвать на интервью / отказать / нужно больше информации
2. Разбери причину строго по категориям (отметь «за», «против»
   или «не участвует»):
   - доверие к цифрам (retention +18% — верю или нет?)
   - релевантность опыта под вакансию
   - риски (пробелы, размытые формулировки)
   - ясность и конкретика текста

ВАЖНО: не бери причину прямо из текста резюме. Если написано
«поднял retention на 18%» — не пиши «поднял retention», а напиши,
ВЕРИТ ли менеджер этой цифре и почему.

Выведи три роли отдельными блоками, без смешивания.</pre>
  <p id="46Dh">Настоящая критика выглядит так: скептик пишет «цифре +18% не верю — не сказано, на какой базе и за какой срок считали». Этого в резюме нет — значит, модель рассуждает. Плохой знак: все три роли повторяют твои формулировки («сильный кандидат — поднял retention на 18%»). Это пересказ; ужесточи запрет: «не используй ни одного слова из текста как аргумент».</p>
  <h3 id="gxlo">Где пригодится</h3>
  <ul id="lcUE">
    <li id="gfn1">Питчи и презентации — прогон через «скептика-инвестора» до реальной встречи</li>
    <li id="awyl">Резюме и сопроводительные письма — проверка глазами уставшего HR до отклика</li>
    <li id="5Msg">Лендинги, посты, коммерческие предложения — реакция трёх типов аудитории до публикации</li>
    <li id="8DUT">Быстрый детектор: все роли цитируют твой текст как причину — это эхо, а не мнение</li>
  </ul>
  <p id="B0yY">Если хочешь такие находки из свежих исследований каждый день — их присылает бот <a href="https://t.me/NovaPaperAlert_bot" target="_blank">@NovaPaperAlert_bot</a>.</p>
  <p id="NG0y"><em>Опирался на исследование «Reason-Mediated Behavioral Models for Auditing LLM Social Simulators» (arXiv 2607.24649).</em></p>

]]></content:encoded></item><item><guid isPermaLink="true">https://teletype.in/@foxhunterx/8XHyrcHjWEj</guid><link>https://teletype.in/@foxhunterx/8XHyrcHjWEj?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx</link><comments>https://teletype.in/@foxhunterx/8XHyrcHjWEj?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx#comments</comments><dc:creator>foxhunterx</dc:creator><title>Просишь ChatGPT «добавь эмоций» — он молча выкидывает лимит длины из начала чата. Так ломается до 73% длинных диалогов</title><pubDate>Sat, 15 Aug 2026 10:00:16 GMT</pubDate><media:content medium="image" url="https://img1.teletype.in/files/45/9d/459df196-91ec-421e-894b-0744c2954df9.png"></media:content><description><![CDATA[<img src="https://novasapiens.ru/data/tg/dtf-verification-gate/1.png"></img>Знакомая история: дорабатываешь с ChatGPT письмо или план в несколько заходов — и к пятой правке текст выполняет последнюю просьбу, но растерял всё, о чём договаривались в начале: тон, длину, запреты. Исследователи (Yonghui Huang, июль 2026) прогнали 26 016 таких многошаговых сессий и показали: модель не забывает ранние требования — она молча решает, что новое важнее, и жертвует старыми. И есть промпт-приём, который стабильно возвращает контроль всем моделям — Verification Gate. Проверил на письме клиенту — работает.]]></description><content:encoded><![CDATA[
  <p id="ALHh">Знакомая история: дорабатываешь с ChatGPT письмо или план в несколько заходов — и к пятой правке текст выполняет последнюю просьбу, но растерял всё, о чём договаривались в начале: тон, длину, запреты. Исследователи (Yonghui Huang, июль 2026) прогнали 26 016 таких многошаговых сессий и показали: модель не забывает ранние требования — она молча решает, что новое важнее, и жертвует старыми. И есть промпт-приём, который стабильно возвращает контроль всем моделям — Verification Gate. Проверил на письме клиенту — работает.</p>
  <figure id="Sbyb" class="m_original">
    <img src="https://novasapiens.ru/data/tg/dtf-verification-gate/1.png" width="2400" />
  </figure>
  <h3 id="jXRM">В чём проблема: последняя правка перевешивает всё, что ты задал раньше</h3>
  <p id="CYtJ">Модель генерирует ответ, опираясь на ближайший контекст: последнее сообщение статистически весит больше, чем то, что написано пятью-шестью репликами раньше. Ранние требования не исчезают из истории — падает их вес. Из-за этого, когда новая просьба конфликтует со старым правилом («добавь эмоций» против «деловой тон»), модель тихо решает конфликт в пользу нового — и не предупреждает. Исследователи собрали 542 задачи, где к результату восемь раз подряд добавляли новые требования, и прогнали через них шесть моделей — от GPT-4o до Llama. К концу диалога от 40% до 73% задач потеряли хотя бы одно требование, которое раньше выполнялось. Все модели, без исключений. Причём когда вручную разобрали 384 поломки, выяснилось: главная причина — не «потеряла контекст», а конфликт нового со старым, который модель разрешила не в твою пользу. Как стажёр, который живёт последним поручением: попросил подать кофе в большой кружке — подал, но с сахаром, хотя «без сахара» было самым первым условием.</p>
  <h3 id="yc7Z">Решение: сверка всех требований перед каждой правкой</h3>
  <p id="qluX">Не кидай правку одной строкой. Перед каждым изменением давай модели явный список всех активных требований и требуй сверку после правки: каждый пункт — статус, конфликт — назвать вслух, а не исправлять молча. Приём называется Verification Gate — «проверочные ворота»: результат выходит наружу только после проверки. Это переключает модель из режима «выполни последнее» в режим «выполни новое, сохранив всё предыдущее». В исследовании это единственная стратегия, которая улучшила все шесть моделей: у DeepSeek-V3 доля задач без поломок выросла с 75,8% до 87,9%, у слабой Llama-3.1-8B — с 31,6% до 47,3%.</p>
  <p id="mb2F"><strong>→ Что делать:</strong> начиная со второй правки вставляй перед изменением этот шаблон:</p>
  <pre id="MHro">Список активных требований:
{требование_1}
{требование_2}
{требование_3}
[добавь столько, сколько нужно]

Новое требование: {новое_требование}

Текущая версия:
{текущий_контент}

Порядок работы:
1. Внеси новое требование в текущую версию
2. Проверь каждый пункт из списка: статус ✅ выполнено / ❌ нарушено
3. Если есть ❌ — назови конкретный конфликт и предложи версию без него
4. Если конфликт неразрешим — сообщи явно, не жертвуй старыми
   требованиями ради нового
5. Итоговый результат выдай только если все ✅</pre>
  <figure id="VTa6" class="m_original">
    <img src="https://novasapiens.ru/data/tg/dtf-verification-gate/2.png" width="2400" />
  </figure>
  <h3 id="ELCO">Почему это работает</h3>
  <p id="Rx97"><strong>Модель не хранит приоритеты — она читает ближайший контекст.</strong> Последняя просьба весит больше правила из начала чата, поэтому при конфликте модель молча жертвует старым: сигнала «это всё ещё обязательно» у неё нет. <strong>Явный список возвращает старым требованиям вес, а условие «выдай только если все ✅» запрещает тихий компромисс.</strong> Сверять текст с чеклистом модель умеет отлично — ей нужно лишь дать, что с чем сравнивать, поэтому вместо тихой поломки ты получаешь либо результат, где всё цело, либо честное «эти два требования несовместимы». Критична фраза «не жертвуй старыми требованиями молча»: без неё модель попробует «выполнить оба», размыв оба. И честно про границы: приём снижает регрессию, но не убирает совсем, а размытые пункты вроде «сохрани лёгкость» модель отметит ✅ там, где ты увидишь ❌ — формулируй требования конкретно.</p>
  <h3 id="bCB3">Пример</h3>
  <p id="C4QA">Пишешь клиенту письмо о повышении цен. В начале договорились: не больше 7 предложений, без извинений, деловой тон. После четвёртой правки письмо расползлось на 15 предложений и обросло «мы понимаем, что это неудобно». Пятую правку отправляешь уже так:</p>
  <pre id="fCw0">Список активных требований к тексту:
1. Не более 7 предложений
2. Без извинений и оправданий
3. Деловой, прямой тон
4. Партнёрская интонация, не директивная
5. Обоснование — через ценность, не через издержки

Новое требование: добавь абзац про расширенные условия поддержки

Текущая версия текста:
{текущее письмо}

Инструкция:
1. Внеси новое требование
2. Проверь каждый пункт из списка: статус ✅/❌
3. Если есть ❌ — назови конфликт явно и предложи версию без него
4. Если конфликт неразрешим — скажи об этом, не жертвуй старыми
   требованиями молча
5. Выдай финальный текст только если все пункты ✅</pre>
  <p id="FBe9">Модель сначала покажет сверку по всем пяти пунктам и только потом текст. А если новая просьба несовместима со старой — например «добавь эмоций» против «деловой тон» — конфликт всплывёт явным сообщением, а не потерей тона, которую заметишь через три правки.</p>
  <h3 id="tJnp">Где пригодится</h3>
  <ul id="tRX2">
    <li id="vj4h">Письма клиентам, офферы, посты — всё, что дорабатываешь в несколько заходов и где тон с длиной задал в начале</li>
    <li id="jF83">Сметы, ТЗ, планы — где новая правка тихо задевает соседние пункты</li>
    <li id="TjG4">Код с ИИ-ассистентом: «добавь функцию» часто ломает то, что уже работало (исследование именно об этом)</li>
    <li id="ul2h">Правило: со второй правки в любом длинном чате — сначала список активных требований, потом изменение</li>
  </ul>
  <p id="T4FN">Если хочешь такие находки из свежих исследований каждый день — их присылает бот <a href="https://t.me/NovaPaperAlert_bot" target="_blank">@NovaPaperAlert_bot</a>.</p>
  <p id="1ZkU"><em>Опирался на исследование «Regression Accumulation in Multi-Turn LLM Programming Conversations» (arXiv 2607.01855).</em></p>

]]></content:encoded></item><item><guid isPermaLink="true">https://teletype.in/@foxhunterx/cHIx5SYRpOv</guid><link>https://teletype.in/@foxhunterx/cHIx5SYRpOv?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx</link><comments>https://teletype.in/@foxhunterx/cHIx5SYRpOv?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx#comments</comments><dc:creator>foxhunterx</dc:creator><title>80 правил в промпте — и модель ломается. Красивый маркдаун не спасёт: у LLM нашли числовой порог отказа</title><pubDate>Tue, 11 Aug 2026 10:00:18 GMT</pubDate><media:content medium="image" url="https://img1.teletype.in/files/4c/d7/4cd7ca0e-202a-452f-b111-4e6b3109160b.png"></media:content><description><![CDATA[<img src="https://novasapiens.ru/data/tg/dtf-rule-limit/1.png"></img>Собираешь системный промпт для бота — тон, запреты, обязательные фразы — и список разрастается до сотни пунктов? Есть плохая новость с точной цифрой. Netanel Eliav из Machine Human Intelligence Lab (июль 2026) прогнал через пять моделей одни и те же наборы правил — от 10 до 160 штук, в четырёх форматах: маркдаун, обычный текст, сплошной рассказ, таблица. До 40 правил модели держат почти всё. На 80 — вероятность выполнить все правила сразу падает до нуля. У каждой модели. В каждом формате. Оформление не спасает вообще.]]></description><content:encoded><![CDATA[
  <p id="pKsa">Собираешь системный промпт для бота — тон, запреты, обязательные фразы — и список разрастается до сотни пунктов? Есть плохая новость с точной цифрой. Netanel Eliav из Machine Human Intelligence Lab (июль 2026) прогнал через пять моделей одни и те же наборы правил — от 10 до 160 штук, в четырёх форматах: маркдаун, обычный текст, сплошной рассказ, таблица. До 40 правил модели держат почти всё. На 80 — вероятность выполнить все правила сразу падает до нуля. У каждой модели. В каждом формате. Оформление не спасает вообще.</p>
  <figure id="lp5T" class="m_original">
    <img src="https://novasapiens.ru/data/tg/dtf-rule-limit/1.png" width="2400" />
  </figure>
  <h3 id="gqfR">В чём проблема: правила теряются из-за количества, а не оформления</h3>
  <p id="ySUD">Модель не ведёт список «выполнено / не выполнено». Пока она пишет ответ, все твои правила лежат в контексте разом, и каждое она соблюдает с высокой вероятностью, но не гарантированно. Из-за этого включается простая математика: одно правило выполняется, скажем, в 98% случаев, но чем больше правил одновременно, тем выше шанс, что при генерации хотя бы одно выпадет. Поэтому при 10–40 правилах всё выглядит прилично, на 80 идеальное соблюдение обнуляется, а на 120–160 наступает полный провал. Как жонглёр: каждый отдельный мяч он держит легко, но с каждым новым растёт шанс уронить любой из них — и цвет мячей ничего не меняет. Исследование это прямо показало: маркдаун, таблица, список и сплошной текст ломаются одинаково. Формат отвечает за то, КАК показать правила, а не за то, СКОЛЬКО модель удержит.</p>
  <h3 id="7S25">Решение: 10–15 критичных правил в промпте, остальное — отдельно</h3>
  <p id="7GYF">Не вылизывай формат — режь количество. Раздели правила на два уровня: 10–15 критичных, без которых ответ провалится, — в системный промпт; остальные — отдельными сообщениями по ходу диалога, не больше 15–20 за раз, с проверкой результата после каждого. Так модель на каждом шаге удерживает посильное число условий, а не всю сотню сразу. Если не знаешь, что критично, — попроси саму модель разбить твой список на критичные и вторичные: она уточнит, что важнее для задачи, потому что без приоритетов все правила выглядят равнозначными.</p>
  <p id="A38B"><strong>→ Что делать:</strong> дели правила на уровни по шаблону из исследования:</p>
  <pre id="sR2y">СИСТЕМНЫЙ ПРОМПТ (не больше 10-15 критичных правил):
{правило 1}
{правило 2}
{правило 3}

СООБЩЕНИЕ ПОЛЬЗОВАТЕЛЯ (доп. правила для конкретной задачи,
максимум 15-20):
{правило А}
{правило Б}

Если правил больше — раздели их на несколько последовательных
запросов и проверяй результат после каждого.</pre>
  <figure id="Q8JY" class="m_original">
    <img src="https://novasapiens.ru/data/tg/dtf-rule-limit/2.png" width="2400" />
  </figure>
  <h3 id="pkwj">Почему это работает</h3>
  <p id="4DNd"><strong>Правила теряются комбинаторно, а не из-за формата.</strong> Модель удерживает их все одновременно, без счётчика выполнения, поэтому каждое новое правило умножает шанс потерять любое из предыдущих — и на 80 штуках идеальное соблюдение падает до нуля независимо от оформления. <strong>Короткое ядро критичных правил возвращает надёжность.</strong> Ты снижаешь число одновременных условий до 10–15, поэтому шанс удержать их все разом снова становится высоким, а вторичные правила уходят в отдельные шаги — там они не конкурируют с критичными. Границы приёма: где размещать правила — в системном промпте или в сообщении — зависит от модели, единого ответа нет, тестируй на своей. Таблицы съедают примерно на треть больше токенов, чем текст, без надёжного выигрыша. И бонус-находка: у предела контекста модель не выдумывает факты (0 случаев из 5760 проверок), а честно отказывается отвечать — доля отказов подскакивает с 0% до 80–90%. Отказ — не каприз, а сигнал: режь документ на части.</p>
  <h3 id="LVoQ">Пример</h3>
  <p id="2u1X">Настраиваешь ИИ-консультанта для магазина одежды на маркетплейсе. Хочется заложить всё сразу: тон, запреты, форматирование, обязательные фразы — набралось 90 пунктов. Свалишь их в один системный промпт — часть потеряется гарантированно: порог в 80 уже пройден. Вместо этого оставляешь критичное ядро:</p>
  <pre id="wU1v">Ты — консультант интернет-магазина одежды. Вот КРИТИЧНЫЕ правила,
соблюдай их всегда:

1. Не используй слово &quot;гарантия&quot; — юридически чувствительно
2. Обращайся на &quot;вы&quot;
3. Не используй восклицательные знаки
4. Ответ не длиннее 3 предложений
5. Заканчивай ответ фразой &quot;Если нужна помощь — я на связи&quot;

Дополнительные правила для этого диалога (не более 15 за раз)
добавлю отдельным сообщением.</pre>
  <p id="35SB">Такое ядро из 5–6 правил модель держит стабильно. Остальные 85 пунктов уходят пачками по 15 в следующие сообщения — или превращаются в чек-лист, по которому ты проверяешь готовые ответы.</p>
  <h3 id="Pssu">Где пригодится</h3>
  <ul id="lYfq">
    <li id="IdkE">Системные промпты ботов поддержки и консультантов — где требования к тону и запретам множатся десятками</li>
    <li id="BKgo">Регламенты для рабочих ИИ-ассистентов: критичное — в промпт, остальное — чек-листом по готовому ответу</li>
    <li id="10nu">Брифы нейросети-копирайтеру: 10 главных требований работают лучше простыни из 60</li>
    <li id="Xmqe">Правило на каждый день: считай правила, а не вылизывай формат — порог один для маркдауна, таблицы и текста</li>
  </ul>
  <p id="iWJU">Если хочешь такие находки из свежих исследований каждый день — их присылает бот <a href="https://t.me/NovaPaperAlert_bot" target="_blank">@NovaPaperAlert_bot</a>.</p>
  <p id="TcOC"><em>Опирался на исследование «Prompt Design at Scale: How Format, Instruction Count, and Context Length Shape Instruction Adherence and Hallucination in Large Language Models» (arXiv 2607.19257).</em></p>

]]></content:encoded></item><item><guid isPermaLink="true">https://teletype.in/@foxhunterx/fmhfNloBetE</guid><link>https://teletype.in/@foxhunterx/fmhfNloBetE?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx</link><comments>https://teletype.in/@foxhunterx/fmhfNloBetE?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx#comments</comments><dc:creator>foxhunterx</dc:creator><title>Почему нейросети выдают пресные игровые тексты — и 3 рычага, которые это чинят</title><pubDate>Sat, 08 Aug 2026 10:00:18 GMT</pubDate><media:content medium="image" url="https://img2.teletype.in/files/1b/12/1b12edb2-f23e-4657-ba44-de8b4b627676.png"></media:content><description><![CDATA[<img src="https://novasapiens.ru/data/tg/dtf-narrative/1.png"></img>Гладко, но пресно: описания предметов, реплики NPC и лор от нейросети выходят безжизненными, и вставлять их в игру стыдно. Оказалось, дело не в кривом запросе — так модель работает по умолчанию. Учёные из Knowledge Lab Чикагского университета (Zehan Li и коллеги, 27 мая 2026) разобрали, почему так, и выделили три рычага, которые возвращают тексту живость. Проверил на своих игровых текстах — работает. Делюсь.]]></description><content:encoded><![CDATA[
  <p id="lHmg">Гладко, но пресно: описания предметов, реплики NPC и лор от нейросети выходят безжизненными, и вставлять их в игру стыдно. Оказалось, дело не в кривом запросе — так модель работает по умолчанию. Учёные из Knowledge Lab Чикагского университета (Zehan Li и коллеги, 27 мая 2026) разобрали, почему так, и выделили три рычага, которые возвращают тексту живость. Проверил на своих игровых текстах — работает. Делюсь.</p>
  <figure id="b4Dl" class="m_original">
    <img src="https://novasapiens.ru/data/tg/dtf-narrative/1.png" width="2400" />
  </figure>
  <h3 id="WCdD">Почему по умолчанию выходит пресно</h3>
  <p id="QWcV">Представьте повара, которому сказали приготовить блюдо, которое понравится тысяче случайных людей. Чтобы никого не обидеть, он убирает специи, соль и текстуру — и подаёт безвкусную овсянку. Формально еда, радости ноль. Нейросеть ровно так и обучена: на дообучении её натаскивали нравиться большинству, поэтому она тянется к «среднему по палате». Всё острое — конфликт, неожиданный поворот, дерзкий стиль — внутренний фильтр выкидывает как «нетипичный шум». В статье даже цифра есть: доля конфликта и удивления в тексте падает примерно с 47% до 7,5%. Вот тебе и «легендарный клинок героев» в каждом описании.</p>
  <h3 id="yJmb">Три рычага, которыми это лечится</h3>
  <p id="Zcxt">Ключевая мысль: модель куда лучше слушается конкретных координат, чем абстрактного «сделай интересно». Дай ей три — <strong>эмоции по этапам</strong>, <strong>ритм смены тем</strong> и <strong>стилевой якорь</strong> (имя реального автора/вселенной). И отдельно — прямо запрещай скучное: запрет работает сильнее разрешения.</p>
  <p id="7oXL">Вот шаблон, который я допиливаю под каждую задачу:</p>
  <pre id="SDQu">{Что написать: тема, объём}

ЭМОЦИОНАЛЬНЫЙ РИСУНОК:
— Начало: {эмоция / состояние}
— Середина: {момент конфликта / удивления}
— Финал: {чем заканчивается — честно, не обязательно хорошо}

РИТМ СМЕНЫ ТЕМ:
— {где задержаться: деталь / образ}
— {где резкий поворот: без подготовки}

СТИЛЬ: {конкретный автор / вселенная}

ЗАПРЕЩЕНО: нейтральное повествование / пафосный финал /
плавные переходы</pre>
  <h3 id="z9la">Почему рычаги вообще работают</h3>
  <p id="cTwP"><strong>Запрет сильнее разрешения.</strong> «Пиши атмосферно» оставляет модели тысячу вариантов, и она выберет самый средний. «Без плавных переходов, без пафосного финала» прямо блокирует скучный путь. <strong>Стилевой якорь смещает центр притяжения:</strong> назвал конкретную вселенную или автора — и текст утаскивает от безликого среднего в нужную сторону, чем известнее ориентир, тем чётче. Модель не «станет Мартином», но перестанет быть никем.</p>
  <h3 id="t80K">Как это выглядит на деле</h3>
  <p id="Q4No">Ставлю задачу — флейвор-текст для предмета в тёмном фэнтези. Обычный запрос выдаёт «древний меч, хранящий силу забытых героев» (зевок). А с рычагами:</p>
  <pre id="TU85">Напиши описание предмета для тёмного фэнтези-RPG: старый меч,
найденный в затопленном склепе. ~400 знаков, флейвор-текст.

ЭМОЦИОНАЛЬНЫЙ РИСУНОК:
— Начало: не пафос, а брезгливость — ржавчина, тина, чей-то палец на рукояти
— Середина: короткий укол — этим мечом убили не врага, а своего
— Финал: без морали, просто факт, от которого не по себе

РИТМ:
— Первая фраза медленно, деталь
— Потом резкий обрыв в другую сцену

СТИЛЬ: в духе флейвора Dark Souls / Elden Ring — скупо, мрачно, недосказанно

ЗАПРЕЩЕНО: пафос, «клинок героев», плавные переходы</pre>
  <p id="BROe">На выходе — не музейная табличка, а текст, который хочется прочитать вслух. Тот же приём я гоняю на репликах NPC, описаниях локаций и постах в сообщество проекта — везде оживает.</p>
  <h3 id="7PNI">Где пригодится</h3>
  <ul id="dri5">
    <li id="MkAr">Флейвор-тексты, описания предметов, локаций, лор</li>
    <li id="VViH">Реплики и диалоги NPC — чтобы не звучали как автоответчик</li>
    <li id="2pT4">Посты для сообщества проекта, девлоги, анонсы</li>
    <li id="COnn">Любой текст, который должен цеплять, а не усыплять</li>
  </ul>
  <p id="VrZk">Важная оговорка: это для художественных и «живых» текстов. Для документации, патчноутов и деловых писем нейтральность — наоборот плюс, туда рычаги не тащим. А если хочешь получать такие находки из свежих исследований каждый день — их присылает бот <a href="https://t.me/NovaPaperAlert_bot" target="_blank">@NovaPaperAlert_bot</a>.</p>
  <p id="E1jk"><em>Опирался на исследование «Narrative Flattening: How Post-Training Compresses Thematic, Affective, and Stylistic Variation in LLM Fiction» (arXiv 2605.27878).</em></p>

]]></content:encoded></item><item><guid isPermaLink="true">https://teletype.in/@foxhunterx/WUXzBKW2m1I</guid><link>https://teletype.in/@foxhunterx/WUXzBKW2m1I?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx</link><comments>https://teletype.in/@foxhunterx/WUXzBKW2m1I?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=foxhunterx#comments</comments><dc:creator>foxhunterx</dc:creator><title>ChatGPT ищет подвох там, где его нет — и портит ответ. Виновата форма вопроса</title><pubDate>Tue, 04 Aug 2026 10:00:15 GMT</pubDate><media:content medium="image" url="https://img1.teletype.in/files/01/39/0139543d-18a4-47f9-a6b7-8f107e551cee.png"></media:content><description><![CDATA[<img src="https://novasapiens.ru/data/tg/dtf-format-trap/1.png"></img>Заметил странное: задаёшь ChatGPT нормальный рабочий вопрос, а он вместо ответа уходит в философию и ищет какой-то скрытый смысл. Оказалось, дело не в вопросе, а в его ФОРМЕ. Психологи и айтишники из Принстонского университета (Bella Fascendini и коллеги, июнь 2026) показали: если запрос хоть немного похож на загадку, модель включает «режим подвоха» и промахивается — точность падает до 50,7%. Разобрался, как это выключать.]]></description><content:encoded><![CDATA[
  <p id="aHlG">Заметил странное: задаёшь ChatGPT нормальный рабочий вопрос, а он вместо ответа уходит в философию и ищет какой-то скрытый смысл. Оказалось, дело не в вопросе, а в его ФОРМЕ. Психологи и айтишники из Принстонского университета (Bella Fascendini и коллеги, июнь 2026) показали: если запрос хоть немного похож на загадку, модель включает «режим подвоха» и промахивается — точность падает до 50,7%. Разобрался, как это выключать.</p>
  <figure id="iUwF" class="m_original">
    <img src="https://novasapiens.ru/data/tg/dtf-format-trap/1.png" width="2400" />
  </figure>
  <h3 id="JZYn">В чём проблема: модель реагирует на форму вопроса раньше, чем на смысл</h3>
  <p id="wTKx">Прежде чем вникнуть в суть, модель определяет «жанр» вопроса по его форме. Увидела знакомую конструкцию «X произошло, но Y — как такое возможно?» — и сопоставила её с обучающими данными, где такие фразы почти всегда оказывались загадками с подвохом, а не прямыми вопросами. Дальше она отвечает не на твой вопрос, а на угаданный жанр: ищет скрытый смысл, которого нет. Форма перебивает содержание — так человек, услышав первые аккорды, затягивает знакомый припев, даже когда играют другую песню.</p>
  <h3 id="ZuhE">Решение: назови режим в первой строке</h3>
  <p id="1wvC">Одна фраза в начале запроса перебивает этот автоматизм — до того, как он сработает. Нужен прямой ответ — прямо скажи «отвечай буквально». Нужен креатив — наоборот, попроси искать нестандартную трактовку. Главное — не оставлять выбор режима на волю формы вопроса.</p>
  <p id="5kD9"><strong>→ Что делать:</strong> для прямого ответа добавь в начало:</p>
  <pre id="Pspn">Ответь на вопрос буквально. Не ищи скрытых смыслов, уловок
или нестандартных интерпретаций. Прими вопрос за чистую монету
и дай прямой ответ.

Вопрос: {твой вопрос}</pre>
  <figure id="ztMa" class="m_original">
    <img src="https://novasapiens.ru/data/tg/dtf-format-trap/2.png" width="2400" />
  </figure>
  <h3 id="wsOH">Почему это работает</h3>
  <p id="orQA"><strong>Режим ответа выбирает форма вопроса, а не его смысл.</strong> Знакомая структура «как такое возможно?» сама по себе переводит модель в поиск подвоха — поэтому она философствует даже там, где подвоха нет. <strong>Инструкция в первой строке задаёт режим раньше, чем сработает этот автоматизм.</strong> Ты называешь жанр сам — «отвечай буквально», — поэтому модель разбирает вопрос по факту, а не ищет второе дно. Оговорка: если модель видела этот вопрос дословно в обучении, она выдаст запомненный ответ, что бы ты ни дописал.</p>
  <h3 id="8koV">Пример</h3>
  <p id="e5Uw">Спрашиваешь иронично про сорванный дедлайн — и вместо разбора получаешь эссе о бренности бытия и хрупкости доверия. С явным режимом:</p>
  <pre id="0VqY">Ответь буквально, не ищи скрытых смыслов. Прими за чистую монету.

Вопрос: подрядчик обещал сдать работу за 10 дней, взял предоплату
50%, но пропал и не берёт трубку. Как такое возможно?</pre>
  <p id="7tNA">Вместо философии про доверие — прямой разбор: реальные причины и что делать дальше. Ровно то, что спрашивал.</p>
  <h3 id="7zr9">Где пригодится</h3>
  <ul id="MycF">
    <li id="FHIN">Рабочие вопросы, заданные иронично или витиевато — чтобы получить разбор, а не эссе</li>
    <li id="sb1l">Логические и бытовые задачи в форме «как так вышло»</li>
    <li id="38F2">Отладка и анализ ситуаций — ставь «режим: буквальный»</li>
    <li id="C450">И наоборот: когда нужен креатив — включай «изобретательный режим» осознанно, а не случайно</li>
  </ul>
  <p id="1K8Z">Если хочешь такие находки из свежих исследований каждый день — их присылает бот <a href="https://t.me/NovaPaperAlert_bot" target="_blank">@NovaPaperAlert_bot</a>.</p>
  <p id="CvY5"><em>Опирался на исследование «The Riddle Riddle: Testing Flexible Reasoning in Large Language Models and Humans» (arXiv 2606.27103).</em></p>

]]></content:encoded></item></channel></rss>