
Разбор · Опубликовали 04.10.2026
Закрытый контур стоит качества: российские агенты против Claude и Codex на 25 настоящих задачах
Безопасник прав, что не пускает код наружу. Но у этого решения есть цена в задачах, и её можно посчитать.
Текст написан инженером, который ведёт vibecoding.ru, вместе с машиной агентов · таблицы РуБенча и условия вендоров проверены 4 октября 2026
На 11 одинаковых задачах РуБенча Claude Code и Codex довели до зачёта 25 попыток из 33, а российские SourceCraft и Koda — 21 и 17.
Лучший российский агент решал как Claude Haiku 4.5, младшая модель Anthropic. А чем надёжнее контур прячет код, тем меньше о нём известно, и цену компании приходится считать самой.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
1. На одних задачах лучший российский агент решал как младшая модель Claude
Честно сравнить агентов можно только на одинаковых задачах. В РуБенче их 11: починки вышли после 17 июня 2026 года, когда модели таблицы уже не учились.
Каждый агент решал каждую задачу три раза, без права доработать сданное. Так у строки получается 33 попытки, и счёт идёт в доле зачтённых.
Лучший российский агент довёл до зачёта столько же попыток, сколько младшая модель Claude
Четыре лидера
Claude Code: Opus 4.8, Opus 5, Sonnet 5 · Codex: GPT-5.6 Luna
75,8 %
25 из 33
6,1–9,0
Codex + GPT-5.5
прошлая модель Codex
72,7 %
24 из 33
7,2
Claude Code + Haiku 4.5
младшая модель Anthropic
63,6 %
21 из 33
5,1
SourceCraft CLI
Яндекс, модель ds
63,6 %
21 из 33
9,4
Koda CLI
модель koda-pro на открытой GLM 5.2
51,5 %
17 из 33
11,5
Antigravity + Gemini 3.1 Pro
48,5 %
16 из 33
2,5
SourceCraft CLI
Яндекс, старая модель legacy
30,3 %
10 из 33
3,8
РуБенч, раунд 2, срез Fresh-11: 11 задач с починками после 17.06.2026, по три захода. В колонке «Мин» медиана минут на задачу. Синим отмечены зарубежные агенты, оранжевым российские. Строка Gemini 3.5 Flash опущена, Codex с GPT-5.6 Sol в срез не вошёл. /rubench/blog/round-02, снято 4 октября 2026.
Из четырёх задач лидер без доработки закрывает три, SourceCraft — две с половиной, Koda две. Остальное доделывает человек.
С SourceCraft разница чуть больше одной задачи из одиннадцати, это близко к шуму: одна задача стоит 9 пунктов. С Koda разница почти в три задачи, и она уже заметна.
В полной таблице раунда, где у агентов разные задачи, SourceCraft выглядит сильнее: 66,7 %, ровно как Codex с прошлой моделью GPT-5.5. Koda — 51,5 %, рядом с Claude Code и Haiku 4.5.
Оба российских агента работали в облаке вендора в РФ, то есть это российский контур, а не закрытый. Своих серверов в РуБенче нет, о них глава 5.

2. Этим цифрам можно верить: судит скрытый тест, а подсмотренные ответы вычтены
Наш сайт строят Claude Code и Codex, и вопрос «не подсуживаете ли своим» законный.
Зачёт ставит не жюри, а скрытый от агента тест автора настоящей починки. Задачи взяты из пяти живых репозиториев, ТЗ написаны по-русски заново.
Второй предохранитель — проверка записей работы. Два сканера разобрали все 437 попыток раунда: не нашёл ли агент готовую починку в сети или на диске.
У российских агентов таких случаев ноль. У Codex с GPT-5.6 они есть: после вычета лидер опускается с 82,6 до 71,0 %, а Luna с 75,4 до 65,2 %, ниже SourceCraft.
После вычета подсмотренных ответов Codex с GPT-5.6 Luna опускается ниже SourceCraft
РуБенч, раунд 2, страницы /rubench и /rubench/blog/round-02, сняты 4 октября 2026. В колонке «Задач» число задач, прошедших проверку на свежесть у этой модели. «После вычета» засчитывает подсмотренные зачёты провалами, прочерк значит, что такой счёт для строки не публиковался. Строки Gemini опущены.
Себя мы тоже ловили. С 15 июля стартовый код одной задачи уже содержал готовую починку, мы нашли это сами и исключили 16 таких попыток.
Границы у замера тоже есть. В строке от 11 до 25 задач, одна задача стоит 4–9 пунктов, поэтому разница меньше десяти пунктов считается шумом.
Что и как мы проверяли
| Факт | Что известно | Проверено |
|---|---|---|
| РуБенч, раунд 2 | 25 задач из пяти живых репозиториев на четырёх языках, это ошибки с тестом автора проекта, без фронтенда и долгих доработок. ТЗ на русском, по три захода на задачу, зачёт ставит скрытый тест автора починки. Российские агенты запускались в своих CLI, как у клиента. Раунд закрыт 18.07.2026, обновлён 27.07 и 06.09.2026, страница /rubench снята 4 октября 2026 | 2026-10-04 |
| Срез Fresh-11 | 11 задач с починками после 17.06.2026, позже даты, до которой училась любая модель таблицы. У всех строк одни и те же задачи, одна задача стоит 9 пунктов. У Koda одна попытка сорвалась на квоте вендора и считается проваленной | 2026-10-04 |
| Проверка записей работы | 437 попыток второго раунда, два независимых сканера и проверяющий судья. Подсмотренных ответов у российских агентов и Gemini 0 из 293, у Codex + GPT-5.6 Luna 8 из 69, у Codex + GPT-5.6 Sol 13 из 75. У Opus 5 после вычета 75,4 %, один случай из 60 | 2026-10-04 |
| Смена моделей у вендоров | SourceCraft CLI 0.0.99 от 19.08.2026 удалил модель legacy, ds стало другим именем модели по умолчанию, саму модель Яндекс не называет. Koda в июле держала koda-pro на GLM 5.2, с 17.09.2026 на GLM 5.3, koda-base на Qwen 3.8 Flash, по постам канала вендора | 2026-10-04 |
| GigaCode | Тариф «Бизнес» от 1 699 ₽ за пользователя в месяц, лицензии SaaS и on-premise. Агент для терминала доступен только участникам организаций. Независимых замеров агента не нашли, в MERA Code есть лишь модель GigaCode 1.4 | 2026-10-04 |
| Мировые рейтинги | DeepSWE v1.1, 113 задач, все модели в одном агенте, таблица 22.09.2026. GLM-5.3 69 %, Claude Opus 5 и GPT-6 Astra 74 %, превью Gemini 3.1 Pro 11,7 %. Artificial Analysis, рейтинг агентов для кода на 04.10.2026. OpenCode + GLM-5.3 53,6, Claude Code + Sonnet 5.5 68,4, Claude Code + Opus 5.5 66,0 | 2026-10-04 |
| Свои серверы | Koda от 2,5 млн ₽ разово или 2 490 ₽ с человека в месяц при минимуме 350 000 ₽ в месяц, без аренды видеокарт. GLM-5.3 в FP8 встаёт на один сервер 8×H200 по рецепту vLLM. У GigaChat 3.5 432 млрд параметров, веса под MIT с июля 2026. Cloud.ru берёт за Qwen3-Coder-Next 122 ₽ за 1 млн входных токенов, тариф с 02.10.2026 | 2026-10-04 |
| Спрос | Wordstat по РФ, 4 октября 2026. «gigacode» 8 625, «sourcecraft code assistant» 730, «корпоративные нейросети» 268, «ии в закрытом контуре» 76, «локальная llm для программирования» 94 | 2026-10-04 |
3. Замер российского агента стареет за месяц-два: вендоры меняют модель под тем же именем
Июльские строки SourceCraft и Koda описывают продукты, которых больше нет. Оба вендора сменили модели под прежними именами: Яндекс 19 августа, Koda 17 сентября.
За лето под теми же именами трижды сменилась модель и один раз испортилась задача
07.07
Claude Code на 5 задачах из 25 молча подменил Fable 5 на Opus 4.8. Подмену увидели только в полных записях работы агента. Вывод: модель пишется в журнал каждой попытки.
15.07
На нашей машине прогонов стартовый код одной задачи стал содержать готовую починку, и 16 попыток пяти агентов получили решённую задачу. Вывод: свою ошибку ищем сами и исправляем открыто.
19.08
Яндекс убрал из SourceCraft CLI модель legacy, а имя ds стало другим названием модели по умолчанию. Какая модель внутри, вендор не называет. Вывод: июльские 66,7 % относятся к прежней модели.
06.09
Мы опубликовали поправку, 16 испорченных попыток исключены, строки SourceCraft, Gemini и Opus 5 пересчитаны. Вывод: поправка живёт на той же странице, что и таблица.
17.09
Koda перевела koda-pro с GLM 5.2 на GLM 5.3, а koda-base — на Qwen 3.8 Flash. По замеру самой Koda новая koda-pro решает 54,3 % её задач против 46,7 % у прежней. Вывод: июльские 51,5 % сняты на модели, которой за этим именем больше нет.
Блог РуБенча, раунды 1 и 2, поправка 06.09.2026; история версий SourceCraft CLI и канал новостей Koda, проверено 4 октября 2026.
Правило для компании отсюда не зависит от вендора. В журнале каждой задачи должно стоять имя модели, которая реально работала, а не только агента.
Перемерить их честно на нашем наборе пока нельзя: новые модели вышли позже задач и могли видеть ответы при обучении. Перезамер ждёт свежего набора с починками после августа.
4. GigaCode ищут 8 625 раз в месяц, а открытых замеров его агента нет
GigaCode от Сбера ищут 8 625 раз в месяц, SourceCraft Code Assistant — 730 (Wordstat, 4 октября). На РуБенче GigaCode нет.
Агент GigaCode для терминала продают только организациям, и снаружи его не запустить. Облачный агент на GitVerse устроен иначе, его мы ещё не мерили.
Чем закрытее вариант, тем меньше у него открытых замеров
Карточки инструментов vibecoding.ru, сайты вендоров и списки стран Anthropic и OpenAI, проверено 4 октября 2026; рейтинг MERA Code — 4 октября 2026.
Компания, которая ставит GigaCode в контур, получает данные в РФ и цену в рублях. О качестве ей остаётся судить по словам вендора или своему замеру.
Отсюда первое правило: до покупки мест попросите вендора прогнать агента на ваших закрытых задачах. Или прогоните сами по пяти шагам из последней главы.
Если часть кода всё-таки можно отдать наружу, как компании из РФ подключить Claude Code, разобрано в статье про Claude Code для команды.
5. Открытая модель на своих серверах почти догнала лидеров, но свою связку придётся мерить самим
Самый закрытый вариант — свои серверы, тогда код не выходит из сети компании. Туда ставят коробку вендора, как GigaCode или Koda, или открытую модель, которую можно скачать самим.
Оценка Qwen Code для компании требует задач на своём коде и согласованного способа доступа.
У пяти способов держать код в РФ или у себя замер есть только у трёх
Сайты вендоров, тарифы Cloud.ru с 2 октября 2026 и карточки инструментов vibecoding.ru, проверено 4 октября 2026; Artificial Analysis, рейтинг агентов для кода на 4 октября 2026; сервер для GLM-5.3 — по рецепту vLLM, на который ссылается Zhipu.
Открытые модели для кода — это GLM, Qwen и DeepSeek, а из российских GigaChat 3.5, которую Сбер выложил в июле. Ей тоже нужен сервер с восемью видеокартами.
Локальных моделей в РуБенче нет, каждый агент работал через облако вендора. Ближе всего Koda: в июле её koda-pro стояла на открытой GLM 5.2 с дообучением и решила 51,5 % против 75,8 % у лидеров.
Свежая открытая модель отстаёт меньше. На бенчмарке DeepSWE, где все модели работают в одном агенте, GLM-5.3 решает 69 %, а Claude Opus 5 и GPT-6 Astra — по 74 %.
Свежая открытая GLM-5.3 почти догнала закрытых лидеров, прошлая GLM-5.2 отставала на 30 пунктов
GPT-6 Astra
OpenAI, закрытая
74 %
Claude Opus 5
Anthropic, закрытая
74 %
GLM-5.3
Zhipu, открытая
69 %
DeepSeek V4 Pro
DeepSeek, открытая
63 %
GLM-5.2
Zhipu, открытая; на ней Koda стояла в июле
44 %
DeepSWE v1.1 (Datacurve): 113 задач, все модели работают в одном агенте mini-swe-agent, у каждой лучшая настройка. Таблица обновлена 22 сентября 2026, снято 4 октября 2026. У открытых моделей веса выложены на Hugging Face.
Но агент вокруг модели значит не меньше. Превью Gemini 3.1 Pro закрывает 12 % задач DeepSWE в простом общем агенте и 47,2 % у нас в Antigravity от Google.
Рейтинг агентов Artificial Analysis меряет пары целиком, и там открытая пара отстаёт заметнее.
В рейтинге агентов открытая пара OpenCode с GLM-5.3 отстаёт от лидера на 15 пунктов
Claude Code + Sonnet 5.5
лидер рейтинга
68,4
Claude Code + Opus 5.5
Anthropic
66,0
Codex + GPT-6.1 Sol
OpenAI
62,9
OpenCode + GLM-5.3
открытый агент и открытая модель
53,6
Codex + DeepSeek V4 Pro
открытая модель
43,1
Artificial Analysis, Coding Agent Index v1.5 на 4 октября 2026: балл по набору DeepSWE, Terminal-Bench и SWE-Atlas. Показаны пять из 14 основных пар.
Железо для большой открытой модели — отдельные расходы. GLM-5.3 в облегчённом формате встаёт на один сервер с восемью видеокартами H200, а цена Koda их аренду не включает.
Своя модель — это не бесплатная копия Claude. Это отдельный проект: серверы с видеокартами, человек, который их ведёт, и свой замер качества.
6. Не весь код обязан жить в контуре: разделите его и замерьте на своих задачах
Выбор «весь код внутрь или весь наружу» ложный. Контур можно провести по коду, а не по компании.
Внутри остаются модули рядом с данными клиентов, платежами и ключами доступа. Сайт, внутренние панели и тесты можно отдать сильнейшему агенту, если позволяет политика.
Цену контура для своего кода можно посчитать тем же способом, что и РуБенч
Способ повторяет устройство РуБенча: задачи с тестом автора починки, ТЗ словами, три захода, модель в журнале каждой попытки.
Наша подписка на агентную разработку работает той же машиной, что строит этот сайт, на Claude Code и Codex. Если компания запрещает отдавать им любой код, подписка вам не подходит.
Если часть кода отдать можно, запишитесь на бесплатный звонок: за 30 минут разберём, какую часть отдать агентам.
7. Частые вопросы
Какой российский аналог Claude Code сильнее?+
По замеру РуБенча в июле 2026 года сильнее SourceCraft CLI от Яндекса: 66,7 % задач, вровень с Codex и GPT-5.5. У Koda 51,5 %. С тех пор оба сменили модели, а открытых замеров GigaCode мы не нашли. Все российские агенты с ценами и доступом собраны в подборке российских нейросетей для кода.
Что такое ИИ в закрытом контуре?+
Это когда код и данные не выходят из сети компании, а модель и агент работают на её серверах. С ним путают российский контур, где код уходит в облако вендора, но не покидает РФ.
Можно ли развернуть нейросеть для программирования локально?+
Да. Открытый агент вроде OpenCode подключается к модели на вашей машине через Ollama или LM Studio, и код не покидает сеть. Большой модели вроде GLM-5.3 нужен сервер с восемью видеокартами H200, а качество придётся мерить на своих задачах.
GigaCode бесплатный или нет?+
Для личных проектов есть бесплатный тариф вместе с агентным режимом, это условия на 26 сентября 2026 года. Компаниям Сбер продаёт тариф «Бизнес» от 1 699 ₽ за пользователя в месяц, облачный или для установки на свои серверы. Разбор — в карточке GigaCode.
Подойдёт ли нам подписка vibecoding.ru, если код нельзя выносить?+
Нет, если запрет касается всего кода: машина подписки пишет код в Claude Code и Codex. Если часть кода отдать можно, посмотрите агентную разработку для компании: начать можно с бесплатного звонка на 30 минут.
Когда РуБенч перемерит российских агентов?+
Когда соберём свежий набор задач с починками после августа 2026 года. Новые модели SourceCraft и Koda вышли позже задач нынешнего набора и могли видеть ответы. Письмо о новом раунде приходит подписчикам РуБенча.
Источники
- РуБенч, раунд 2: таблица, цены задач, поправка 06.09.2026 · vibecoding.ru (снято 4 октября 2026) — наш замер
- Раунд 2: срез Fresh-11 и проверка 437 попыток · блог РуБенча, 18.07.2026 — наш замер
- Сейфгард Claude Code подменял Fable 5 на Opus 4.8 · блог РуБенча, раунд 1 — наш замер
- Данные и записи работы РуБенча: раунды, реестр подсмотренных ответов · GitHub — открытые данные
- Koda: «Koda Pro на основе GLM 5.2» · канал вендора, 08.07.2026 — официальный канал
- Koda: «Koda Pro на основе GLM 5.3», Koda Base на Qwen 3.8 Flash · канал вендора, 17.09.2026 — официальный канал
- Koda для компаний: on-premise и подписка на свой контур · kodacode.ru (4 октября 2026) — официальный прайс
- SourceCraft CLI 0.0.99: модель legacy удалена, ds — имя модели по умолчанию · Яндекс, 19.08.2026 — официальная документация
- SourceCraft, тарифы с 1 октября 2026 · Яндекс — официальный прайс
- Запуск SourceCraft и обещание on-premise · пресс-релиз Яндекса, 26.02.2025 — пресс-релиз
- GigaCode для компаний: тариф «Бизнес» · Сбер, GitVerse (4 октября 2026) — официальный прайс
- GigaCode: лицензии SaaS и on-premise · документация GitVerse (4 октября 2026) — официальная документация
- GigaCode CLI — только для участников организации · документация GitVerse (4 октября 2026) — официальная документация
- MERA Code: лидерборд моделей для кода (4 октября 2026) — открытый бенчмарк
- DeepSWE v1.1: 113 задач, модели в одном агенте · Datacurve (таблица 22 сентября 2026) — открытый бенчмарк
- Coding Agent Index v1.5: агенты для кода · Artificial Analysis (4 октября 2026) — независимый замер
- GLM-5.2 и GLM-5.3: открытые веса · Zhipu, Hugging Face — карточка модели
- GLM-5.3: запуск в FP8 на одном сервере 8×H200 · рецепты vLLM — документация движка
- GigaChat 3.5: 432 млрд параметров, лицензия MIT · Сбер, Hugging Face — карточка модели
- Cloud.ru Evolution Foundation Models: тарифы с 2 октября 2026 и список внутренних моделей — официальный прайс
- Страны, где Anthropic продаёт Claude · anthropic.com (4 октября 2026) — официальный сайт
- Страны, где работает API OpenAI · platform.openai.com (4 октября 2026) — официальная документация
- Счётчик токенов машины vibecoding.ru: Claude Code и Codex · vibecoding.ru (4 октября 2026) — наш замер
- Wordstat: «gigacode», «ии в закрытом контуре», «локальная llm для программирования» · Яндекс (4 октября 2026) — замер спроса
Запомнить
1. Контур стоит качества. На одних задачах лучший российский агент июля решал как младшая модель Claude. Называйте эту цену числом, когда решаете про контур.
2. Имя агента — не модель. Пишите модель в журнал каждой задачи: вендоры меняют её без предупреждения.
3. У GigaCode и у модели на своих серверах нет открытых замеров на вашем коде. До покупки прогоните агента на своих задачах.
4. Своя модель — отдельный проект. Закладывайте в бюджет сервер с видеокартами и человека, который его ведёт.
5. Контур проводят по коду, а не по компании. Где его провести, можно разобрать на бесплатном звонке.