ИИ для кода: Antigravity, Codex и Claude Code — разбор по независимым тестам
Это подробная версия поста из канала Grigorev.AI. Здесь — что умеет каждый инструмент, сколько стоит и что на самом деле значат цифры из тестов.
Все результаты тестов взяты только у независимых исследователей, Artificial Analysis и Endor Labs. Замеры, которые публикуют сами Google, OpenAI и Anthropic, я специально не использовал: компании выбирают для анонсов те тесты, где они выглядят лучше всего. Цены — с официальных страниц компаний.
Что это за инструменты
🟢 Antigravity от Google
Antigravity — среда разработки, построенная вокруг агентов: ты ставишь задачу, а агенты сами пишут код, запускают его и проверяют. Есть приложение для компьютера и консольная версия, агент умеет работать с браузером и проверять, как выглядит и работает то, что он написал.
Цена. Есть бесплатный тариф: автодополнения и команды без ограничений, а на агента выдаётся недельная квота. Платный Pro стоит $19,99 в месяц. Учти, что Google уже несколько раз урезал бесплатные лимиты, и всегда в меньшую сторону.
- Gemini 4 Argon — самая свежая и сильная модель Google, лучший результат Antigravity в тестах. Но, по данным одного из сравнений, пока может быть доступна не всем;
- Gemini 3.8 Flash — модель по умолчанию, быстрая и дешёвая;
- Gemini 3.7 и 3.6 Flash, Gemini 3.1 Pro — предыдущие модели Google;
- Claude Sonnet и Opus 4.6 — модели Anthropic прошлого поколения;
- gpt-oss-120b — открытая модель OpenAI.
2 ноября 2026 года закроется доступ к gpt-oss-120b!
🔵 Codex + Astra от OpenAI
Codex — приложение OpenAI для разработки, а GPT-6 Astra — их новая модель, она вышла 3 сентября 2026 года. Её делали под агентную работу: долгие задачи, где нужно много раз запускать команды и проверять результат.
Цена. Codex доступен только по платной подписке ChatGPT. В Plus за $20 в месяц Astra есть, но в ограниченном объёме, больше можно докупить кредитами.
🟠 Claude Code от Anthropic
Claude Code — агент, который работает прямо в терминале: читает весь проект, правит файлы, запускает команды и сам делает коммиты. Его легко встроить в свою автоматизацию через скрипты и MCP.
Цена. Бесплатно не попробовать: минимум Pro за $20 в месяц, для плотной работы Max за $100 или $200.
Цены через API
Если подключаться к моделям напрямую через API, топовые модели OpenAI и Anthropic стоят одинаково: и GPT-6 Astra, и Claude Fable 5.1 обходятся в $10 за миллион входных токенов и $50 за миллион выходных.
Значит, итоговый счёт зависит не от цены токена, а от того, сколько токенов модель тратит на задачу. А это, как видно ниже, сильно различается.
Тест 1. Рейтинг агентов от Artificial Analysis
Что проверяют
Artificial Analysis — независимая компания, которая тестирует ИИ-модели. Здесь они проверяют не модель саму по себе, а связку «программа + модель» целиком, потому что одна и та же модель в разных программах работает по-разному.
Итоговый балл складывается из трёх тестов с равным весом:
- DeepSWE v1.1 — 113 задач по разработке: починить баг или дописать функцию в настоящем репозитории;
- Terminal-Bench 4.0 — 66 задач на работу в терминале;
- SWE-Atlas-QnA — 124 вопроса по чужому коду: разобраться в проекте и правильно ответить, как он устроен.
Что значит балл
Каждую задачу агент решает три раза, и результат усредняется. Каждая попытка либо засчитывается, либо нет: частичных баллов не бывает. Грубо говоря, балл 70 значит, что агент решает около 70% задач с первой попытки.
Цена за задачу считается по тарифам API, а не по подписке. Время — это сколько агент реально работал над задачей, без запуска окружения и проверки.
Результаты на момент выхода Astra (сентябрь)
Claude Code с Fable 5.1 набрал 70 баллов, Codex с Astra — 67, столько же, сколько у прошлых моделей Claude, Opus 5 и Fable 5.
Результаты в обновлённой версии (октябрь)
После этого Artificial Analysis обновил рейтинг, и вышли новые модели. В новой версии первое место у Claude Code с Sonnet 5.5 — 68 баллов. Antigravity с Gemini 4 Argon набрал 64, Codex с новой GPT-6.1 Sol — 63. Antigravity с моделью по умолчанию, Gemini 3.8 Flash, получил 42 балла. Эту связку тестировали через SDK, а не через само приложение, так что результат читай с поправкой.
Сентябрьские и октябрьские баллы напрямую сравнивать нельзя: набор тестов поменялся.
Цена и время
У лидера есть обратная сторона: Claude Code с Sonnet 5.5 — самый дорогой вариант в рейтинге, $14,19 за задачу. Antigravity с Gemini 4 Argon обходится меньше чем в половину этой суммы, $5,84, но тратит около 35 минут на задачу. Gemini 3.8 Flash — $2,47 и около 12 минут.
Задачи в тесте большие: агент разбирается в чужом проекте, вносит правки и проверяет их, а на каждом шаге заново отправляет модели весь накопленный контекст. Поэтому одна задача может стоить десятки долларов по API. По подписке ты платишь фиксированную сумму в месяц.
Тест 2. Безопасность кода от Endor Labs
Что проверяют
Endor Labs — компания, которая занимается безопасностью кода. Их тест устроен хитро: агенту дают задачи из настоящих сложных проектов, где когда-то закрывали уязвимость. Агенту об этом не говорят, только просят следовать правилам безопасности. Каждая связка решает каждую задачу один раз, а результат проверяют в изолированной среде.
Что значат проценты
- Рабочий код (FuncPass) — исправление проходит обычные тесты, то есть программа работает.
- Рабочий и безопасный код (SecPass) — исправление вдобавок проходит скрытые тесты на ту самую уязвимость. Безопасным решение может быть, только если оно уже рабочее.
Результаты
Claude Code с Fable 5.1 написал рабочий код в 87,2% задач, а рабочий и безопасный — в 37,4%. У Codex с Astra 82,1% и 34,6%. Astra при этом обогнала Claude Code с прошлой моделью, Opus 5.
Главный вывод этого теста: даже у лучших только около трети решений одновременно рабочие и безопасные.
Код от ИИ по-прежнему нужно проверять, особенно если речь о деньгах, данных или авторизации.
Скорость
Claude Code с Fable 5.1 тратит на задачу в среднем 9,5 минуты и ни разу не превысил лимит в час. Astra в среднем работает 16,8 минуты, то есть примерно в 1,8 раза медленнее, и 29 раз не уложилась в лимит.
Зато Astra экономнее в объёме текста: Fable 5.1 сгенерировал 6,24 млн выходных токенов, а Astra — 1,71 млн, примерно в 3,7 раза меньше. И всё равно Fable закончил примерно вдвое быстрее.
Кто жульничал
Endor Labs проверяет, решил ли агент задачу сам или «вспомнил» готовое исправление: из истории git, из интернета или из того, на чём модель обучалась. Такие случаи считаются жульничеством и не засчитываются.
У Astra проверка нашла 16 подозрительных случаев, но после разбора ни один не подтвердился. У Fable 5.1 подтвердилось 17 случаев, у Opus 5 — 38. Эти задачи из результатов уже убраны, так что цифры выше честные.
Endor Labs считает, что отчасти это заслуга самого Codex: он держит агента в рабочей папке с ограниченным набором команд, поэтому у агента меньше возможностей подсмотреть готовое решение.
Antigravity в этом тесте не участвовал.
Итог
- Хочешь начать бесплатно — Antigravity. С моделью по умолчанию он заметно слабее, но с Gemini 4 Argon близок к лидерам и дешевле их.
- Нужны качество и скорость, а деньги не главное — Claude Code: он лидирует в обоих независимых тестах и работает быстрее всех, но и стоит дороже всех.
- Уже есть ChatGPT Plus — Codex с Astra: чуть слабее и медленнее Claude, но в тесте на честность у него ноль нарушений.
И главное для всех трёх: даже у лучших агентов только треть кода прошла проверку на безопасность. Проверяйте, что они пишут.
Источники
- Artificial Analysis — Coding Agent Index: https://artificialanalysis.ai/agents/coding-agents
- Artificial Analysis — методология рейтинга: https://artificialanalysis.ai/methodology/coding-agents-benchmarking
- Artificial Analysis — сравнение Antigravity и Codex: https://artificialanalysis.ai/agents/coding-agents/comparisons/antigravity-sdk-vs-codex
- Artificial Analysis — результаты октябрьского обновления (X): https://x.com/ArtificialAnlys/status/2105814318294114720
- Endor Labs — тест GPT-6 Astra в Codex: https://www.endorlabs.com/learn/gpt-6-astra-on-codex---the-biggest-codex-leap-to-date
Сентябрьские баллы Artificial Analysis (пересказ):
- NYU Shanghai RITS: https://rits.shanghai.nyu.edu/ai/openai-gpt-6-astra-critical-cyber
- Google Antigravity: https://antigravity.google
- Claude: https://claude.com/pricing
- ChatGPT: https://chatgpt.com/pricing
- GPT-6 Astra (анонс с ценами API): https://openai.com/index/gpt-6-astra/
Все диаграммы построены по данным из этих источников.
✍️ Автор: Grigorev.AI — учу использовать ИИ правильно и продуктивно.