<?xml version="1.0" encoding="utf-8" ?><rss version="2.0" xmlns:tt="http://teletype.in/" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:media="http://search.yahoo.com/mrss/"><channel><title>Ibragim</title><generator>teletype.in</generator><description><![CDATA[Ibragim]]></description><image><url>https://img3.teletype.in/files/e2/f5/e2f5c456-8764-4df4-9eeb-2349bddbf086.png</url><title>Ibragim</title><link>https://teletype.in/@ibragim_bad</link></image><link>https://teletype.in/@ibragim_bad?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=ibragim_bad</link><atom:link rel="self" type="application/rss+xml" href="https://teletype.in/rss/ibragim_bad?offset=0"></atom:link><atom:link rel="next" type="application/rss+xml" href="https://teletype.in/rss/ibragim_bad?offset=10"></atom:link><atom:link rel="search" type="application/opensearchdescription+xml" title="Teletype" href="https://teletype.in/opensearch.xml"></atom:link><pubDate>Tue, 28 Jul 2026 21:44:42 GMT</pubDate><lastBuildDate>Tue, 28 Jul 2026 21:44:42 GMT</lastBuildDate><item><guid isPermaLink="true">https://teletype.in/@ibragim_bad/swe-rebench-2026-07</guid><link>https://teletype.in/@ibragim_bad/swe-rebench-2026-07?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=ibragim_bad</link><comments>https://teletype.in/@ibragim_bad/swe-rebench-2026-07?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=ibragim_bad#comments</comments><dc:creator>ibragim_bad</dc:creator><title>SWE-rebench Leaderboard: большое мультиязычное обновление</title><pubDate>Mon, 27 Jul 2026 19:58:06 GMT</pubDate><media:content medium="image" url="https://img3.teletype.in/files/6b/73/6b7398e7-c8c9-46b6-9c8d-14e868fc4578.png"></media:content><description><![CDATA[<img src="https://img3.teletype.in/files/6f/9d/6f9d8b68-9485-4c63-b18a-7b6928b9dabd.png"></img>В свежем релизе SWE-rebench мы собрали 111 задач на пяти популярных языках программирования, ужесточили фильтрацию и добавили аналитику на базе траекторий агентов. Лидеры: Fable 5, Grok 4.5, Opus 5, GLM-5.2 и GPT‑5.6 Sol. При этом GPT‑5.6 Sol резко выделяется эффективностью траекторий: модель показывает высокое качество при существенно меньшем числе действий.]]></description><content:encoded><![CDATA[
  <p id="7Tp6"><strong>TL;DR: SWE-rebench</strong> выходит за пределы Python. В новом релизе — 111 задач на пяти языках (<strong>Go, Java, Python, Rust, TypeScript</strong>), 13 моделей и 4 агента, по 5 прогонов на каждую пару «модель–задача»: 9 435 траекторий. Лидер по Pass@1 — <strong>Fable 5 64,5%</strong>, но разрыв в топе минимальный. Ещё мы поймали модели на попытках нагуглить оригинальные решения в интернете (примеры читинга приложили).</p>
  <figure id="iFni" class="m_column">
    <img src="https://img3.teletype.in/files/68/ba/68ba272d-4e3d-4097-8228-ff0ebe3d50e5.png" width="2170" />
  </figure>
  <h2 id="ATF7">Что такое SWE-rebench</h2>
  <p id="ZMaZ"><strong>SWE-rebench </strong>— динамический бенчмарк для кодовых агентов, который мы регулярно обновляем. Мы собираем свежие задачи на основе реальных PR из open-source-репозиториев на пяти языках: Go, Java, Python, Rust и TypeScript. Агент получает репозиторий и описание задачи, исследует код, вносит изменения и запускает тесты в рабочей среде.</p>
  <h3 id="a33a">Что добавили в этот релиз</h3>
  <ul id="3gbC">
    <li id="iNR4"><strong>Мультиязычный срез (111 задач):</strong> Go (21), Java (21), Python (20), Rust (25), TypeScript (24).</li>
    <li id="ievj"><strong>13 моделей + 4 готовых агента:</strong> проверили как отдельные модели в едином окружении (на базе SWE-agent), так и полноценные агентские продукты (Claude Code, Codex, Cursor, Junie).</li>
    <li id="A4hx"><strong>9 435 оценённых прогонов:</strong> каждая пара «модель–задача» запускалась по 5 раз для оценки воспроизводимости.</li>
    <li id="SZaZ"><strong>Контекст 524K токенов:</strong> увеличили окно, чтобы длинные сессии не обрывались из-за лимитов.</li>
  </ul>
  <h3 id="JXAO">Как читать результаты</h3>
  <p id="zFMx">Мы оцениваем модели по трём метрикам:</p>
  <p id="2mvf"><strong>Pass@1 </strong>— средний процент успеха с первой попытки (главный показатель «в среднем»).</p>
  <p id="yOe8"><strong>Pass@5</strong> — процент задач, решённых хотя бы в 1 из 5 попыток (максимальный потенциал модели).</p>
  <p id="VtXv"><strong>Pass all 5 </strong>— процент задач, решённых во всех 5 из 5 попыток.</p>
  <p id="3Pa6">Стоимость одного прогона (rollout) рассчитывается с учётом раздельной тарификации кэширования:</p>
  <pre id="oHEp" data-lang="python">cost = (
    input_tokens * price_in
    + output_tokens * price_out
    + cache_read_tokens * price_read
    + cache_create_tokens * price_create
) / 10**6</pre>
  <figure id="slOs" class="m_column">
    <img src="https://img4.teletype.in/files/7e/34/7e34b5eb-4e05-41de-873d-44b4758b4430.png" width="1504" />
    <figcaption>Больше моделей на странице <a href="https://swe-rebench.com/" target="_blank">лидерборда</a>.</figcaption>
  </figure>
  <ul id="rpp1">
    <li id="aSN3"><strong>Fable 5</strong> занимает первое место по <strong>Pass@1 = 64,5%.</strong></li>
    <li id="ExW5"><strong>Opus 5 </strong>демонстрирует наивысшую стабильность и воспроизводимость: решает во всех пяти попытках <strong>52,3%</strong> задач.</li>
    <li id="KvYV"><strong>GLM-5.2</strong> имеет самый широкий потенциальный охват:<strong> Pass@5 = 81,1%</strong>, хотя воспроизводит результат реже лидеров.</li>
    <li id="rcF8"><strong>GPT‑5.6 Sol</strong> показывает экономичность: качество на уровне лидеров при расходе всего около 0,6 млн токенов на задачу.</li>
  </ul>
  <p id="LRMH">Прогоны некоторых моделей в их нативных обёртках показали результат ниже. Анализ траекторий объясняет почему: универсальные агенты оптимизированы под широкий спектр пользовательских сценариев. Наше же окружение (harness), архитектурно близкое к стандартному SWE-agent, заточено строго под цикл решения SWE-задач.</p>
  <p id="2ods">Детальные конфигурации, prompts и лимиты действий доступны в разделе <strong>Insights</strong> на странице <a href="https://swe-rebench.com/" target="_blank">SWE-rebench Leaderboard</a>.</p>
  <h3 id="Whtu">Среднее качество против воспроизводимости: зачем смотреть на Pass all 5</h3>
  <p id="2YzB">В реальной разработке инженер обычно запускает кодового агента один раз, а не пять раз параллельно в надежде выбрать удачный результат. Вероятность успеха отдельного запуска описывает <strong>Pass@1,</strong> но она не показывает, насколько результат воспроизводим от попытки к попытке. Для этого нужен <strong>Pass all 5</strong> — доля задач, решённых во всех пяти прогонах.</p>
  <ul id="ieap">
    <li id="g5u5"><strong>Высокая стабильность: Opus 5 (52,3%) и Fable 5 (51,4%) </strong>демонстрируют лучшую повторяемость в текущем наборе.</li>
    <li id="TMfe"><strong>Широкий охват при меньшей стабильности: GLM-5.2 </strong>лидирует по потенциальному охвату с <strong>Pass@5 = 81,1%,</strong> но её <strong>Pass all 5 </strong>составляет <strong>39,6%</strong>. Модель добирается до большего числа задач, однако реже воспроизводит успех во всех попытках.</li>
    <li id="VkHY"><strong>Самый заметный разрыв</strong>: <strong>MiniMax M3 </strong>хотя бы раз решает 69,4% задач, но во всех пяти прогонах — только 20,7%.</li>
  </ul>
  <p id="9ahT">Именно совместное чтение<strong> Pass@1, Pass@5 и Pass all 5</strong> отделяет среднее качество от потенциального охвата и воспроизводимости.</p>
  <p id="eyhG"></p>
  <h3 id="GYUU">Некоторые модели пытаются «читерить» и как мы такое ловим </h3>
  <p id="kq9Z">В тестовых контейнерах полностью вырезана будущая Git-история, однако у агентов остаётся доступ в интернет для чтения документации и получения внешних зависимостей. Это создаёт риск, что вместо самостоятельного решения агент найдёт оригинальный pull request, commit или готовый patch.</p>
  <p id="rZDf">В первых прогонах (1-я волна) системный промпт не содержал явного запрета на поиск исходного решения. Чтобы оценить, насколько модели склонны к поиску решений в интернете, мы анализировали их траектории. Фильтры траекторий находили попытки искать хэши, pull request и patches через &#x60;curl&#x60;, GitHub API, поисковые запросы и обработку ответов с помощью &#x60;grep&#x60;. Такие траектории исключались и отправлялись на чистый rerun с обновлённым prompt.</p>
  <p id="3P4F">Исторические волны очистки по отдельным моделям:</p>
  <figure id="Yha7" class="m_column">
    <img src="https://img2.teletype.in/files/15/85/15858e55-0b2f-4286-8cd5-511b3d553d58.png" width="2198" />
  </figure>
  <p id="63Gr"></p>
  <h3 id="chPW"><strong>Примеры читинга:</strong></h3>
  <figure id="fCym" class="m_column">
    <img src="https://img4.teletype.in/files/bf/e6/bfe6800b-4c9a-42de-a4d2-b8d1e62f47a2.png" width="1794" />
    <figcaption>GPT-5.6-Sol наивный промпт</figcaption>
  </figure>
  <p id="VXcd">А вот пример из траектории <strong>Grok-4.5,</strong> который даже после явного запрета подсматривал решения.</p>
  <figure id="RCg8" class="m_column">
    <img src="https://img1.teletype.in/files/0a/9e/0a9e521f-a72c-4627-b958-c9b60c972786.png" width="1806" />
  </figure>
  <p id="4xUc"></p>
  <h3 id="jNri">Срез по языкам программирования</h3>
  <blockquote id="NwLR"><strong>&gt; Дисклеймер:  </strong>любой бенчмарк — это фиксированная выборка задач. В этом релизе на каждый язык приходится от 20 до 25 задач, поэтому высокий результат подсвечивает специализацию на текущем наборе, но не гарантирует абсолютного превосходства на любых проектах этого языка. Лучшие результаты выделены в таблице.</blockquote>
  <p id="fnU6"></p>
  <figure id="nAY4" class="m_retina">
    <img src="https://img4.teletype.in/files/b6/e5/b6e5272f-bff1-44dd-b6bb-6b196352c705.png" width="1103" />
    <figcaption>На каждый язык приходится 20–25 задач. Обведён лучший результат в колонке.</figcaption>
  </figure>
  <h3 id="KrOV">Ключевые наблюдения:</h3>
  <ul id="VJ8e">
    <li id="Pzlu"><strong>Rust: </strong>GPT‑5.6 Sol показывает лучший результат — 68,0%.</li>
    <li id="F77F"><strong>Go: </strong>лидирует Fable 5 с 74,3%.</li>
    <li id="ydO0"><strong>TypeScript: </strong>лучший результат у Opus 5 — 78,3%. При этом MiniMax M3, заметно уступающая в общем зачёте, достигает 61,7%.</li>
    <li id="WXAF"><strong>Python:</strong> лучший точечный результат у GLM-5.2 — 57,0%.</li>
    <li id="aHdn"><strong>Java:</strong> среди моделей общего scaffold лидирует Grok 4.5 с 60,0%. В объединённом зачёте Junie на базе Grok 4.5 достигает 62,9%, но это уже результат всей агентной системы.</li>
  </ul>
  <p id="Kc8L"></p>
  <h3 id="DM8e">Эффективность траекторий и поведение моделей</h3>
  <p id="1ZBz">Количество шагов и расходуемых токенов кардинально различаются даже у моделей одного уровня точности.</p>
  <blockquote id="D8hA"><strong>Замечание по времени:</strong> wall time сильно зависит от инфраструктурной загрузки, пропускной способности API и сетевых задержек. Он даёт полезную опорную точку, но не изолирует скорость самой модели. Например, Grok 4.5 завершает медианную траекторию за 8,9 минуты при среднем расходе 2,4 млн токенов — быстрее нескольких моделей с сопоставимым или меньшим объёмом контекста.</blockquote>
  <figure id="BZDa" class="m_retina">
    <img src="https://img2.teletype.in/files/98/de/98de2c2c-69f2-4370-8cc3-6d29c27397d3.png" width="1099" />
  </figure>
  <h3 id="3sHW">В чём секрет GPT‑5.6 Sol?</h3>
  <p id="uECs">GPT‑5.6 Sol делает в среднем всего 18,4 действия на задачу! Для сравнения: GLM-5.2 совершает 94 действия, а Sonnet 5 — 74.</p>
  <p id="76oO">У Sol короткий и плотный цикл: минимум поиска → точечное чтение → правка → запуск тестов.</p>
  <p id="KS8M">Каждое 5-е действие Sol (19,9%) — это запуск тестов (у Grok — 10,6%, у Fable — 16,1%).</p>
  <p id="9gfG">Почему Codex (на базе Sol) тратит больше токенов, чем чистый Sol в нашем агенте? Codex делает больше шагов и вынужден многократно перечитывать разросшуюся историю контекста.</p>
  <p id="3MsO">При этом почти все дополнительные токены — дешёвые cache-read, а не новый ввод модели.</p>
  <figure id="eFVF" class="m_retina">
    <img src="https://img1.teletype.in/files/0e/78/0e78f10e-046f-41fd-8d35-998f90a49e9d.png" width="1092" />
  </figure>
  <h2 id="R0wD">Как выглядит пайплайн подготовки данных:</h2>
  <ol id="B7gO">
    <li id="CY01"><strong>Воронка отбора:</strong> из пула в 5 000+ реальных PR за июнь 2026 года мы отобрали более 450 кандидатов и собрали для них Docker-образы. После прогона через модели и повторного QA в финальный срез выбрали 111 задач. Мы отсеяли тривиальные задачи, задачи с плохим описанием или те, что требуют недоступного внешнего контекста.</li>
    <li id="qqVk"><strong>Доработка тестов:</strong> чтобы исключить неоднозначности, мы привлекали агентов к расширению и переписыванию автотестов, а затем прогоняли их на моделях разного уровня (от слабых до сильных). Это гарантирует, что тесты проверяют именно суть проблемы, а не падают из-за случайных мелочей.</li>
  </ol>
  <h2 id="HfXS">Как мы предотвращаем читинг и подглядывание решений</h2>
  <p id="ZOgV">Чтобы оценки были честными, а агенты не «списывали» решения из интернета или истории Git, мы защищаем бенчмарк на нескольких уровнях:</p>
  <ol id="fpJp">
    <li id="mn9b"><strong>Оценка в чистом контейнере: </strong>извлекается только созданный агентом patch и прогоняется в свежем Docker-контейнере с эталонными (скрытыми) тестами. Агент не может пройти проверку, просто отредактировав тесты под себя.</li>
    <li id="flfS"><strong>Очистка Git-истории:</strong> из репозитория удаляются все будущие коммиты и упоминания оригинального PR.</li>
    <li id="AA0s"><strong>Промпт-ограничения:</strong> системный промпт явно запрещает искать оригинальные PR и патчи во внешних источниках.</li>
    <li id="AFlb"><strong>Аудит логов (траекторий): </strong>все прогоны проверяются на аномалии: поиск хэшей коммитов, обращения к GitHub API или скачивание .patch-файлов.</li>
  </ol>
  <h2 id="JwLG">Выводы</h2>
  <p id="0l8y">1. Каждый бенчмарк <strong> подсвечивает разные свойства моделей, но не является универсальным мерилом.</strong> Для собственных проектов проверяйте, что ваши задачи похожи на задачи бенчмарка, либо соберите свой небольшой эвал.</p>
  <p id="jYZO">2.<strong> Делайте несколько запусков и смотрите на разные метрики, а не только pass@1.</strong> Один rollout даёт слишком шумную картину. Стоимость задачи, pass all 5 и другие метрики важны, если вы масштабируете использование модели. </p>
  <p id="Wyms">3. <strong>Аудит траекторий — критическая часть evals. </strong>Чем умнее становятся модели, тем сложнее ловить их на читинге, и аудит траекторий будет требовать всё больше ресурсов.</p>
  <h3 id="7jVz">Что дальше?</h3>
  <p id="tnY2">Следующий релиз SWE-rebench планируется через 3–4 недели.</p>
  <p id="s7OR">В планах:</p>
  <ul id="T3Gq">
    <li id="zEKO"><strong>Локальные модели: </strong>расширить пул моделей для локальной разработки. Laguna-S-2.1, MiMo V2.5 и другие. Пожалуйста, напишите, какие модели вы хотите здесь увидеть.</li>
    <li id="a5qC"><strong>Новые флагманы: </strong>прогнать свежие версии Gemini и Kimi, которые не вошли в этот релиз.</li>
    <li id="6tTH"><strong>Reasoning budgets для моделей gpt и opus</strong>.</li>
  </ul>
  <p id="fBVC">Детальные результаты, задачи и исходные pull request доступны на странице <a href="https://swe-rebench.com" target="_blank">SWE-rebench Leaderboard.</a></p>
  <h3 id="f1nn">Присоединяйтесь к сообществу</h3>
  <p id="zqfG">Следите за анонсами и обсуждайте задачи в нашем <a href="https://discord.gg/V8FqXQ4CgU" target="_blank">Discord</a> — там мы публикуем свежие задачи немного раньше официальных релизов.</p>
  <p id="lmO3">Подписывайтесь на канал <a href="http://t.me/c0mmit" target="_blank">@c0mmit </a>— там я публикую свежие апдейты. Буду рад обсудить результаты и ответить на ваши вопросы в комментариях!</p>

]]></content:encoded></item></channel></rss>