Today

ИИ для кода: Antigravity, Codex и Claude Code — разбор по независимым тестам

Это подробная версия поста из канала Grigorev.AI. Здесь — что умеет каждый инструмент, сколько стоит и что на самом деле значат цифры из тестов.

Все результаты тестов взяты только у независимых исследователей, Artificial Analysis и Endor Labs. Замеры, которые публикуют сами Google, OpenAI и Anthropic, я специально не использовал: компании выбирают для анонсов те тесты, где они выглядят лучше всего. Цены — с официальных страниц компаний.

Что это за инструменты

🟢 Antigravity от Google

Antigravity — среда разработки, построенная вокруг агентов: ты ставишь задачу, а агенты сами пишут код, запускают его и проверяют. Есть приложение для компьютера и консольная версия, агент умеет работать с браузером и проверять, как выглядит и работает то, что он написал.

Цена. Есть бесплатный тариф: автодополнения и команды без ограничений, а на агента выдаётся недельная квота. Платный Pro стоит $19,99 в месяц. Учти, что Google уже несколько раз урезал бесплатные лимиты, и всегда в меньшую сторону.

Модели внутри:

  • Gemini 4 Argon — самая свежая и сильная модель Google, лучший результат Antigravity в тестах. Но, по данным одного из сравнений, пока может быть доступна не всем;
  • Gemini 3.8 Flash — модель по умолчанию, быстрая и дешёвая;
  • Gemini 3.7 и 3.6 Flash, Gemini 3.1 Pro — предыдущие модели Google;
  • Claude Sonnet и Opus 4.6 — модели Anthropic прошлого поколения;
  • gpt-oss-120b — открытая модель OpenAI.

2 ноября 2026 года закроется доступ к gpt-oss-120b!

🔵 Codex + Astra от OpenAI

Codex — приложение OpenAI для разработки, а GPT-6 Astra — их новая модель, она вышла 3 сентября 2026 года. Её делали под агентную работу: долгие задачи, где нужно много раз запускать команды и проверять результат.

Цена. Codex доступен только по платной подписке ChatGPT. В Plus за $20 в месяц Astra есть, но в ограниченном объёме, больше можно докупить кредитами.

🟠 Claude Code от Anthropic

Claude Code — агент, который работает прямо в терминале: читает весь проект, правит файлы, запускает команды и сам делает коммиты. Его легко встроить в свою автоматизацию через скрипты и MCP.

Цена. Бесплатно не попробовать: минимум Pro за $20 в месяц, для плотной работы Max за $100 или $200.

Цены через API

Если подключаться к моделям напрямую через API, топовые модели OpenAI и Anthropic стоят одинаково: и GPT-6 Astra, и Claude Fable 5.1 обходятся в $10 за миллион входных токенов и $50 за миллион выходных.

Значит, итоговый счёт зависит не от цены токена, а от того, сколько токенов модель тратит на задачу. А это, как видно ниже, сильно различается.

Тест 1. Рейтинг агентов от Artificial Analysis

Что проверяют

Artificial Analysis — независимая компания, которая тестирует ИИ-модели. Здесь они проверяют не модель саму по себе, а связку «программа + модель» целиком, потому что одна и та же модель в разных программах работает по-разному.

Итоговый балл складывается из трёх тестов с равным весом:

  • DeepSWE v1.1 — 113 задач по разработке: починить баг или дописать функцию в настоящем репозитории;
  • Terminal-Bench 4.0 — 66 задач на работу в терминале;
  • SWE-Atlas-QnA — 124 вопроса по чужому коду: разобраться в проекте и правильно ответить, как он устроен.

Что значит балл

Каждую задачу агент решает три раза, и результат усредняется. Каждая попытка либо засчитывается, либо нет: частичных баллов не бывает. Грубо говоря, балл 70 значит, что агент решает около 70% задач с первой попытки.

Цена за задачу считается по тарифам API, а не по подписке. Время — это сколько агент реально работал над задачей, без запуска окружения и проверки.

Результаты на момент выхода Astra (сентябрь)

Claude Code с Fable 5.1 набрал 70 баллов, Codex с Astra — 67, столько же, сколько у прошлых моделей Claude, Opus 5 и Fable 5.

Рейтинг агентов Artifical Analysys - сентябрь 2026 (Grigorev.AI)

Результаты в обновлённой версии (октябрь)

После этого Artificial Analysis обновил рейтинг, и вышли новые модели. В новой версии первое место у Claude Code с Sonnet 5.5 — 68 баллов. Antigravity с Gemini 4 Argon набрал 64, Codex с новой GPT-6.1 Sol — 63. Antigravity с моделью по умолчанию, Gemini 3.8 Flash, получил 42 балла. Эту связку тестировали через SDK, а не через само приложение, так что результат читай с поправкой.

Обновленная версия - октябрь 2026 (Grigorev.AI)

Сентябрьские и октябрьские баллы напрямую сравнивать нельзя: набор тестов поменялся.

Цена и время

У лидера есть обратная сторона: Claude Code с Sonnet 5.5 — самый дорогой вариант в рейтинге, $14,19 за задачу. Antigravity с Gemini 4 Argon обходится меньше чем в половину этой суммы, $5,84, но тратит около 35 минут на задачу. Gemini 3.8 Flash — $2,47 и около 12 минут.

Цена задачи через API (Grigorev.AI)
Задачи в тесте большие: агент разбирается в чужом проекте, вносит правки и проверяет их, а на каждом шаге заново отправляет модели весь накопленный контекст. Поэтому одна задача может стоить десятки долларов по API. По подписке ты платишь фиксированную сумму в месяц.

Тест 2. Безопасность кода от Endor Labs

Что проверяют

Endor Labs — компания, которая занимается безопасностью кода. Их тест устроен хитро: агенту дают задачи из настоящих сложных проектов, где когда-то закрывали уязвимость. Агенту об этом не говорят, только просят следовать правилам безопасности. Каждая связка решает каждую задачу один раз, а результат проверяют в изолированной среде.

Что значат проценты

  • Рабочий код (FuncPass) — исправление проходит обычные тесты, то есть программа работает.
  • Рабочий и безопасный код (SecPass) — исправление вдобавок проходит скрытые тесты на ту самую уязвимость. Безопасным решение может быть, только если оно уже рабочее.

Результаты

Claude Code с Fable 5.1 написал рабочий код в 87,2% задач, а рабочий и безопасный — в 37,4%. У Codex с Astra 82,1% и 34,6%. Astra при этом обогнала Claude Code с прошлой моделью, Opus 5.

Тест Endor Labs (Grigorev.AI)

Главный вывод этого теста: даже у лучших только около трети решений одновременно рабочие и безопасные.

Код от ИИ по-прежнему нужно проверять, особенно если речь о деньгах, данных или авторизации.

Скорость

Claude Code с Fable 5.1 тратит на задачу в среднем 9,5 минуты и ни разу не превысил лимит в час. Astra в среднем работает 16,8 минуты, то есть примерно в 1,8 раза медленнее, и 29 раз не уложилась в лимит.

Проверка на скорость от Endor Labs (Grigorev.AI)

Зато Astra экономнее в объёме текста: Fable 5.1 сгенерировал 6,24 млн выходных токенов, а Astra — 1,71 млн, примерно в 3,7 раза меньше. И всё равно Fable закончил примерно вдвое быстрее.

Кто жульничал

Endor Labs проверяет, решил ли агент задачу сам или «вспомнил» готовое исправление: из истории git, из интернета или из того, на чём модель обучалась. Такие случаи считаются жульничеством и не засчитываются.

У Astra проверка нашла 16 подозрительных случаев, но после разбора ни один не подтвердился. У Fable 5.1 подтвердилось 17 случаев, у Opus 5 — 38. Эти задачи из результатов уже убраны, так что цифры выше честные.

Endor Labs считает, что отчасти это заслуга самого Codex: он держит агента в рабочей папке с ограниченным набором команд, поэтому у агента меньше возможностей подсмотреть готовое решение.

Antigravity в этом тесте не участвовал.

Итог

  • Хочешь начать бесплатно — Antigravity. С моделью по умолчанию он заметно слабее, но с Gemini 4 Argon близок к лидерам и дешевле их.
  • Нужны качество и скорость, а деньги не главное — Claude Code: он лидирует в обоих независимых тестах и работает быстрее всех, но и стоит дороже всех.
  • Уже есть ChatGPT Plus — Codex с Astra: чуть слабее и медленнее Claude, но в тесте на честность у него ноль нарушений.

И главное для всех трёх: даже у лучших агентов только треть кода прошла проверку на безопасность. Проверяйте, что они пишут.

Источники

Тесты (независимые):

Сентябрьские баллы Artificial Analysis (пересказ):

Доступность Gemini 4 Argon:

Цены (официальные страницы):

Все диаграммы построены по данным из этих источников.

✍️ Автор: Grigorev.AI — учу использовать ИИ правильно и продуктивно.