
В свежем релизе SWE-rebench мы собрали 111 задач на пяти популярных языках программирования, ужесточили фильтрацию и добавили аналитику на базе траекторий агентов. Лидеры: Fable 5, Grok 4.5, Opus 5, GLM-5.2 и GPT‑5.6 Sol. При этом GPT‑5.6 Sol резко выделяется эффективностью траекторий: модель показывает высокое качество при существенно меньшем числе действий.