<?xml version="1.0" encoding="utf-8" ?><rss version="2.0" xmlns:tt="http://teletype.in/" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:media="http://search.yahoo.com/mrss/"><channel><title>Ярослав Григорьев</title><generator>teletype.in</generator><description><![CDATA[Ярослав Григорьев]]></description><image><url>https://img2.teletype.in/files/d2/95/d295a523-8d7e-4a35-b1f9-fce165459ca2.png</url><title>Ярослав Григорьев</title><link>https://teletype.in/@yargrv</link></image><link>https://teletype.in/@yargrv?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=yargrv</link><atom:link rel="self" type="application/rss+xml" href="https://teletype.in/rss/yargrv?offset=0"></atom:link><atom:link rel="next" type="application/rss+xml" href="https://teletype.in/rss/yargrv?offset=10"></atom:link><atom:link rel="search" type="application/opensearchdescription+xml" title="Teletype" href="https://teletype.in/opensearch.xml"></atom:link><pubDate>Thu, 08 Oct 2026 00:14:25 GMT</pubDate><lastBuildDate>Thu, 08 Oct 2026 00:14:25 GMT</lastBuildDate><item><guid isPermaLink="true">https://teletype.in/@yargrv/2FuMya4wWFE</guid><link>https://teletype.in/@yargrv/2FuMya4wWFE?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=yargrv</link><comments>https://teletype.in/@yargrv/2FuMya4wWFE?utm_source=teletype&amp;utm_medium=feed_rss&amp;utm_campaign=yargrv#comments</comments><dc:creator>yargrv</dc:creator><title>ИИ для кода: Antigravity, Codex и Claude Code — разбор по независимым тестам</title><pubDate>Wed, 07 Oct 2026 21:02:39 GMT</pubDate><media:content medium="image" url="https://img3.teletype.in/files/2e/af/2eaf2d17-7b18-4881-b09f-eeee04542274.png"></media:content><description><![CDATA[<img src="https://img4.teletype.in/files/72/57/7257d687-9870-4bee-ab44-1c2db26d6de1.png"></img>Это подробная версия поста из канала Grigorev.AI. Здесь — что умеет каждый инструмент, сколько стоит и что на самом деле значат цифры из тестов.]]></description><content:encoded><![CDATA[
  <p id="eyRW">Это подробная версия поста из канала <em><strong>Grigorev.AI</strong></em>. Здесь — что умеет каждый инструмент, сколько стоит и что на самом деле значат цифры из тестов.</p>
  <p id="mvQA">Все результаты тестов взяты только у независимых исследователей, Artificial Analysis и Endor Labs. Замеры, которые публикуют сами Google, OpenAI и Anthropic, я специально не использовал: компании выбирают для анонсов те тесты, где они выглядят лучше всего. Цены — с официальных страниц компаний.</p>
  <h2 id="0GU5">Что это за инструменты</h2>
  <h4 id="XnZ1">🟢 Antigravity от Google</h4>
  <p id="gvrH"><em>Antigravity</em> — среда разработки, построенная вокруг агентов: ты ставишь задачу, а агенты сами пишут код, запускают его и проверяют. Есть приложение для компьютера и консольная версия, агент умеет работать с браузером и проверять, как выглядит и работает то, что он написал.</p>
  <p id="aAXr"><strong>Цена.</strong> Есть бесплатный тариф: автодополнения и команды без ограничений, а на агента выдаётся недельная квота. Платный Pro стоит $19,99 в месяц. Учти, что Google уже несколько раз урезал бесплатные лимиты, и всегда в меньшую сторону.</p>
  <p id="TtUh"><strong>Модели внутри:</strong></p>
  <ul id="305a">
    <li id="zH8d"><strong>Gemini 4 Argon</strong> — самая свежая и сильная модель Google, лучший результат Antigravity в тестах. Но, по данным одного из сравнений, пока может быть доступна не всем;</li>
    <li id="poQB"><strong>Gemini 3.8 Flash</strong> — модель по умолчанию, быстрая и дешёвая;</li>
    <li id="L6ua"><strong>Gemini 3.7 и 3.6 Flash, Gemini 3.1 Pro</strong> — предыдущие модели Google;</li>
    <li id="EoP3"><strong>Claude Sonnet и Opus 4.6</strong> — модели Anthropic прошлого поколения;</li>
    <li id="qRAK"><strong>gpt-oss-120b</strong> — открытая модель OpenAI.</li>
  </ul>
  <p id="z96t"><em>2 ноября 2026 года закроется доступ к gpt-oss-120b!</em></p>
  <h4 id="xJij">🔵 Codex + Astra от OpenAI</h4>
  <p id="Uf3T"><em>Codex</em> — приложение OpenAI для разработки, а GPT-6 Astra — их новая модель, она вышла 3 сентября 2026 года. Её делали под агентную работу: долгие задачи, где нужно много раз запускать команды и проверять результат.</p>
  <p id="stja"><strong>Цена.</strong> Codex доступен только по платной подписке ChatGPT. В Plus за $20 в месяц Astra есть, но в ограниченном объёме, больше можно докупить кредитами.</p>
  <h4 id="qHSw">🟠 Claude Code от Anthropic</h4>
  <p id="Q1Qf"><em>Claude Code</em> — агент, который работает прямо в терминале: читает весь проект, правит файлы, запускает команды и сам делает коммиты. Его легко встроить в свою автоматизацию через скрипты и MCP.</p>
  <p id="taFJ"><strong>Цена.</strong> Бесплатно не попробовать: минимум Pro за $20 в месяц, для плотной работы Max за $100 или $200.</p>
  <h2 id="XjwR">Цены через API</h2>
  <p id="Rzq8">Если подключаться к моделям напрямую через API, топовые модели OpenAI и Anthropic стоят одинаково: и GPT-6 Astra, и Claude Fable 5.1 обходятся в $10 за миллион входных токенов и $50 за миллион выходных.</p>
  <p id="2ogo">Значит, итоговый счёт зависит не от цены токена, а от того, сколько токенов модель тратит на задачу. А это, как видно ниже, сильно различается.</p>
  <h3 id="rvFD"><em>Тест 1. Рейтинг агентов от Artificial Analysis</em></h3>
  <h4 id="Aq5n">Что проверяют</h4>
  <p id="jVtn"><em>Artificial Analysis</em> — независимая компания, которая тестирует ИИ-модели. Здесь они проверяют не модель саму по себе, а связку «программа + модель» целиком, потому что одна и та же модель в разных программах работает по-разному.</p>
  <p id="M95h">Итоговый балл складывается из трёх тестов с равным весом:</p>
  <ul id="3x3x">
    <li id="oRn9"><strong>DeepSWE v1.1</strong> — 113 задач по разработке: починить баг или дописать функцию в настоящем репозитории;</li>
    <li id="rGrI"><strong>Terminal-Bench 4.0</strong> — 66 задач на работу в терминале;</li>
    <li id="aGhH"><strong>SWE-Atlas-QnA</strong> — 124 вопроса по чужому коду: разобраться в проекте и правильно ответить, как он устроен.</li>
  </ul>
  <h4 id="9oTx">Что значит балл</h4>
  <p id="d8Ge">Каждую задачу агент решает три раза, и результат усредняется. Каждая попытка либо засчитывается, либо нет: частичных баллов не бывает. Грубо говоря, балл 70 значит, что агент решает около 70% задач с первой попытки.</p>
  <p id="D3xD">Цена за задачу считается по тарифам API, а не по подписке. Время — это сколько агент реально работал над задачей, без запуска окружения и проверки.</p>
  <h4 id="h1R2">Результаты на момент выхода Astra (сентябрь)</h4>
  <p id="PMre">Claude Code с Fable 5.1 набрал 70 баллов, Codex с Astra — 67, столько же, сколько у прошлых моделей Claude, Opus 5 и Fable 5.</p>
  <figure id="4CnS" class="m_column">
    <img src="https://img4.teletype.in/files/72/57/7257d687-9870-4bee-ab44-1c2db26d6de1.png" width="2000" />
    <figcaption>Рейтинг агентов Artifical Analysys - сентябрь 2026 (Grigorev.AI)</figcaption>
  </figure>
  <h4 id="KwPq">Результаты в обновлённой версии (октябрь)</h4>
  <p id="qjIO">После этого Artificial Analysis обновил рейтинг, и вышли новые модели. В новой версии первое место у <em>Claude Code с Sonnet 5.5</em> — <em>68</em> баллов. <em>Antigravity с Gemini 4 Argon</em> набрал <em>64</em>, <em>Codex с новой GPT-6.1 Sol</em> — <em>63</em>. <em>Antigravity</em> с моделью по умолчанию, <em>Gemini 3.8 Flash</em>, получил <em>42</em> балла. Эту связку тестировали через SDK, а не через само приложение, так что результат читай с поправкой.</p>
  <figure id="9mJD" class="m_column">
    <img src="https://img1.teletype.in/files/ce/cc/cecc7567-3b91-4399-8b96-622d96c3814f.png" width="2000" />
    <figcaption>Обновленная версия - октябрь 2026 (Grigorev.AI)</figcaption>
  </figure>
  <p id="x6ts">Сентябрьские и октябрьские баллы напрямую сравнивать нельзя: набор тестов поменялся.</p>
  <h4 id="pe0v">Цена и время</h4>
  <p id="sVwG">У лидера есть обратная сторона: <strong>Claude Code</strong> с Sonnet 5.5 — <strong>самый дорогой</strong> вариант в рейтинге, $14,19 за задачу. Antigravity с Gemini 4 Argon обходится меньше чем в половину этой суммы, $5,84, но тратит около 35 минут на задачу. Gemini 3.8 Flash — $2,47 и около 12 минут.</p>
  <figure id="EJ43" class="m_column">
    <img src="https://img3.teletype.in/files/60/53/60537dea-f2a0-450d-b120-12d463c9476e.png" width="2000" />
    <figcaption>Цена задачи через API (Grigorev.AI)</figcaption>
  </figure>
  <blockquote id="NxuW">Задачи в тесте большие: агент разбирается в чужом проекте, вносит правки и проверяет их, а на каждом шаге заново отправляет модели весь накопленный контекст. Поэтому одна задача может стоить десятки долларов по API. По подписке ты платишь фиксированную сумму в месяц.</blockquote>
  <h3 id="i8qU"><strong><em>Тест 2. Безопасность кода от Endor Labs</em></strong></h3>
  <h4 id="GNaZ">Что проверяют</h4>
  <p id="LQvk"><em>Endor Labs</em> — компания, которая занимается безопасностью кода. Их тест устроен хитро: агенту дают задачи из настоящих сложных проектов, где когда-то закрывали уязвимость. Агенту об этом не говорят, только просят следовать правилам безопасности. Каждая связка решает каждую задачу один раз, а результат проверяют в изолированной среде.</p>
  <h4 id="U11k">Что значат проценты</h4>
  <ul id="F2A2">
    <li id="UhrG"><strong>Рабочий код (FuncPass)</strong> — исправление проходит обычные тесты, то есть программа работает.</li>
    <li id="woZd"><strong>Рабочий и безопасный код (SecPass)</strong> — исправление вдобавок проходит скрытые тесты на ту самую уязвимость. Безопасным решение может быть, только если оно уже рабочее.</li>
  </ul>
  <h4 id="JyyS">Результаты</h4>
  <p id="Jywb">Claude Code с Fable 5.1 написал рабочий код в 87,2% задач, а рабочий и безопасный — в 37,4%. У Codex с Astra 82,1% и 34,6%. Astra при этом обогнала Claude Code с прошлой моделью, Opus 5.</p>
  <figure id="mnhl" class="m_column">
    <img src="https://img2.teletype.in/files/da/ef/daef4d70-40f9-4823-a35f-52fb51d02260.png" width="2000" />
    <figcaption>Тест Endor Labs (Grigorev.AI)</figcaption>
  </figure>
  <p id="JVmy">Главный вывод этого теста: даже у лучших только около трети решений одновременно рабочие и безопасные. </p>
  <h3 id="uzas" data-align="center"><em>Код от ИИ по-прежнему нужно проверять, особенно если речь о деньгах, данных или авторизации.</em></h3>
  <h4 id="8g8N">Скорость</h4>
  <p id="duQE">Claude Code с Fable 5.1 тратит на задачу в среднем 9,5 минуты и ни разу не превысил лимит в час. Astra в среднем работает 16,8 минуты, то есть примерно в 1,8 раза медленнее, и 29 раз не уложилась в лимит.</p>
  <figure id="nz62" class="m_column">
    <img src="https://img3.teletype.in/files/eb/38/eb38ef08-cc2f-41c0-b8ca-ee87178bae31.png" width="2000" />
    <figcaption>Проверка на скорость от Endor Labs (Grigorev.AI)</figcaption>
  </figure>
  <p id="5VXi">Зато Astra экономнее в объёме текста: Fable 5.1 сгенерировал 6,24 млн выходных токенов, а Astra — 1,71 млн, примерно в 3,7 раза меньше. И всё равно Fable закончил примерно вдвое быстрее.</p>
  <h4 id="ZJaY">Кто жульничал</h4>
  <p id="4chy">Endor Labs проверяет, решил ли агент задачу сам или «вспомнил» готовое исправление: из истории git, из интернета или из того, на чём модель обучалась. Такие случаи считаются жульничеством и не засчитываются.</p>
  <p id="dRT1">У Astra проверка нашла 16 подозрительных случаев, но после разбора ни один не подтвердился. У Fable 5.1 подтвердилось 17 случаев, у Opus 5 — 38. Эти задачи из результатов уже убраны, так что цифры выше честные.</p>
  <p id="zSXO">Endor Labs считает, что отчасти это заслуга самого Codex: он держит агента в рабочей папке с ограниченным набором команд, поэтому у агента меньше возможностей подсмотреть готовое решение.</p>
  <p id="HrWH"><em>Antigravity в этом тесте не участвовал.</em></p>
  <h2 id="LhWJ">Итог</h2>
  <ul id="v1Y0">
    <li id="Himo"><strong>Хочешь начать бесплатно</strong> — Antigravity. С моделью по умолчанию он заметно слабее, но с Gemini 4 Argon близок к лидерам и дешевле их.</li>
    <li id="Ba7Y"><strong>Нужны качество и скорость, а деньги не главное</strong> — Claude Code: он лидирует в обоих независимых тестах и работает быстрее всех, но и стоит дороже всех.</li>
    <li id="1V8u"><strong>Уже есть ChatGPT Plus</strong> — Codex с Astra: чуть слабее и медленнее Claude, но в тесте на честность у него ноль нарушений.</li>
  </ul>
  <p id="5idE">И главное для всех трёх: даже у лучших агентов только треть кода прошла проверку на безопасность. Проверяйте, что они пишут.</p>
  <h2 id="r58b">Источники</h2>
  <p id="5HD9"><strong>Тесты (независимые):</strong></p>
  <ul id="LmbO">
    <li id="UbpG">Artificial Analysis — Coding Agent Index: <a href="https://artificialanalysis.ai/agents/coding-agents" target="_blank">https://artificialanalysis.ai/agents/coding-agents</a></li>
    <li id="L73T">Artificial Analysis — методология рейтинга: <a href="https://artificialanalysis.ai/methodology/coding-agents-benchmarking" target="_blank">https://artificialanalysis.ai/methodology/coding-agents-benchmarking</a></li>
    <li id="KRxO">Artificial Analysis — сравнение Antigravity и Codex: <a href="https://artificialanalysis.ai/agents/coding-agents/comparisons/antigravity-sdk-vs-codex" target="_blank">https://artificialanalysis.ai/agents/coding-agents/comparisons/antigravity-sdk-vs-codex</a></li>
    <li id="XWZ1">Artificial Analysis — результаты октябрьского обновления (X): <a href="https://x.com/ArtificialAnlys/status/2105814318294114720" target="_blank">https://x.com/ArtificialAnlys/status/2105814318294114720</a></li>
    <li id="AnKD">Endor Labs — тест GPT-6 Astra в Codex: <a href="https://www.endorlabs.com/learn/gpt-6-astra-on-codex---the-biggest-codex-leap-to-date" target="_blank">https://www.endorlabs.com/learn/gpt-6-astra-on-codex---the-biggest-codex-leap-to-date</a></li>
  </ul>
  <p id="hukM"><strong>Сентябрьские баллы Artificial Analysis (пересказ):</strong></p>
  <ul id="yPnV">
    <li id="swqU">NYU Shanghai RITS: <a href="https://rits.shanghai.nyu.edu/ai/openai-gpt-6-astra-critical-cyber" target="_blank">https://rits.shanghai.nyu.edu/ai/openai-gpt-6-astra-critical-cyber</a></li>
  </ul>
  <p id="EiA9"><strong>Доступность Gemini 4 Argon:</strong></p>
  <ul id="8Q2J">
    <li id="yMIj">OpenBot: <a href="https://openbot.run/compare/claude-code-vs-antigravity" target="_blank">https://openbot.run/compare/claude-code-vs-antigravity</a></li>
  </ul>
  <p id="1Gaj"><strong>Цены (официальные страницы):</strong></p>
  <ul id="oq7I">
    <li id="sdqF">Google Antigravity: <a href="https://antigravity.google" target="_blank">https://antigravity.google</a></li>
    <li id="cyns">Claude: <a href="https://claude.com/pricing" target="_blank">https://claude.com/pricing</a></li>
    <li id="RuyJ">ChatGPT: <a href="https://chatgpt.com/pricing" target="_blank">https://chatgpt.com/pricing</a></li>
    <li id="C0dn">GPT-6 Astra (анонс с ценами API): <a href="https://openai.com/index/gpt-6-astra/" target="_blank">https://openai.com/index/gpt-6-astra/</a></li>
  </ul>
  <p id="T2Bs"><em>Все диаграммы построены по данным из этих источников.</em></p>
  <p id="ZLzx">✍️ Автор: <strong><em>Grigorev.AI</em></strong> — учу использовать ИИ правильно и продуктивно.</p>

]]></content:encoded></item></channel></rss>