80 правил в промпте — и модель ломается. Красивый маркдаун не спасёт: у LLM нашли числовой порог отказа
Собираешь системный промпт для бота — тон, запреты, обязательные фразы — и список разрастается до сотни пунктов? Есть плохая новость с точной цифрой. Netanel Eliav из Machine Human Intelligence Lab (июль 2026) прогнал через пять моделей одни и те же наборы правил — от 10 до 160 штук, в четырёх форматах: маркдаун, обычный текст, сплошной рассказ, таблица. До 40 правил модели держат почти всё. На 80 — вероятность выполнить все правила сразу падает до нуля. У каждой модели. В каждом формате. Оформление не спасает вообще.
В чём проблема: правила теряются из-за количества, а не оформления
Модель не ведёт список «выполнено / не выполнено». Пока она пишет ответ, все твои правила лежат в контексте разом, и каждое она соблюдает с высокой вероятностью, но не гарантированно. Из-за этого включается простая математика: одно правило выполняется, скажем, в 98% случаев, но чем больше правил одновременно, тем выше шанс, что при генерации хотя бы одно выпадет. Поэтому при 10–40 правилах всё выглядит прилично, на 80 идеальное соблюдение обнуляется, а на 120–160 наступает полный провал. Как жонглёр: каждый отдельный мяч он держит легко, но с каждым новым растёт шанс уронить любой из них — и цвет мячей ничего не меняет. Исследование это прямо показало: маркдаун, таблица, список и сплошной текст ломаются одинаково. Формат отвечает за то, КАК показать правила, а не за то, СКОЛЬКО модель удержит.
Решение: 10–15 критичных правил в промпте, остальное — отдельно
Не вылизывай формат — режь количество. Раздели правила на два уровня: 10–15 критичных, без которых ответ провалится, — в системный промпт; остальные — отдельными сообщениями по ходу диалога, не больше 15–20 за раз, с проверкой результата после каждого. Так модель на каждом шаге удерживает посильное число условий, а не всю сотню сразу. Если не знаешь, что критично, — попроси саму модель разбить твой список на критичные и вторичные: она уточнит, что важнее для задачи, потому что без приоритетов все правила выглядят равнозначными.
→ Что делать: дели правила на уровни по шаблону из исследования:
СИСТЕМНЫЙ ПРОМПТ (не больше 10-15 критичных правил):
{правило 1}
{правило 2}
{правило 3}
СООБЩЕНИЕ ПОЛЬЗОВАТЕЛЯ (доп. правила для конкретной задачи,
максимум 15-20):
{правило А}
{правило Б}
Если правил больше — раздели их на несколько последовательных
запросов и проверяй результат после каждого.Почему это работает
Правила теряются комбинаторно, а не из-за формата. Модель удерживает их все одновременно, без счётчика выполнения, поэтому каждое новое правило умножает шанс потерять любое из предыдущих — и на 80 штуках идеальное соблюдение падает до нуля независимо от оформления. Короткое ядро критичных правил возвращает надёжность. Ты снижаешь число одновременных условий до 10–15, поэтому шанс удержать их все разом снова становится высоким, а вторичные правила уходят в отдельные шаги — там они не конкурируют с критичными. Границы приёма: где размещать правила — в системном промпте или в сообщении — зависит от модели, единого ответа нет, тестируй на своей. Таблицы съедают примерно на треть больше токенов, чем текст, без надёжного выигрыша. И бонус-находка: у предела контекста модель не выдумывает факты (0 случаев из 5760 проверок), а честно отказывается отвечать — доля отказов подскакивает с 0% до 80–90%. Отказ — не каприз, а сигнал: режь документ на части.
Пример
Настраиваешь ИИ-консультанта для магазина одежды на маркетплейсе. Хочется заложить всё сразу: тон, запреты, форматирование, обязательные фразы — набралось 90 пунктов. Свалишь их в один системный промпт — часть потеряется гарантированно: порог в 80 уже пройден. Вместо этого оставляешь критичное ядро:
Ты — консультант интернет-магазина одежды. Вот КРИТИЧНЫЕ правила, соблюдай их всегда: 1. Не используй слово "гарантия" — юридически чувствительно 2. Обращайся на "вы" 3. Не используй восклицательные знаки 4. Ответ не длиннее 3 предложений 5. Заканчивай ответ фразой "Если нужна помощь — я на связи" Дополнительные правила для этого диалога (не более 15 за раз) добавлю отдельным сообщением.
Такое ядро из 5–6 правил модель держит стабильно. Остальные 85 пунктов уходят пачками по 15 в следующие сообщения — или превращаются в чек-лист, по которому ты проверяешь готовые ответы.
Где пригодится
- Системные промпты ботов поддержки и консультантов — где требования к тону и запретам множатся десятками
- Регламенты для рабочих ИИ-ассистентов: критичное — в промпт, остальное — чек-листом по готовому ответу
- Брифы нейросети-копирайтеру: 10 главных требований работают лучше простыни из 60
- Правило на каждый день: считай правила, а не вылизывай формат — порог один для маркдауна, таблицы и текста
Если хочешь такие находки из свежих исследований каждый день — их присылает бот @NovaPaperAlert_bot.
Опирался на исследование «Prompt Design at Scale: How Format, Instruction Count, and Context Length Shape Instruction Adherence and Hallucination in Large Language Models» (arXiv 2607.19257).