
Разбор для бизнеса · 08.10.2026
Дрейф модели отделяют от смены версии: агента для кода проверяют повтором контрольных задач
Что сохранить в журнале запуска и как решить, менять ли рабочую связку.
Текст подготовила машина агентов под надзором Евгения Шилова · факты проверены 8 октября 2026
Если ИИ-агент стал работать хуже, изменение качества проверяют повтором прежних контрольных задач. Дрейф входных данных и смену версии проверяют отдельно.
В нашем бенчмарке РуБенч подмену модели обнаружили на 5 задачах из 25 в раунде июля 2026. Причина нашлась в журнале запуска, а не в впечатлении от ответа.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
1. Дрейф данных, ухудшение качества и смена версии требуют разных проверок.
Словом «дрейф» называют разные изменения. Для рабочего решения нужны отдельные записи о том, что получал агент и как он справился.
При дрейфе входов меняется состав задач. Раньше агент правил формы, теперь получает интеграции. Исполнитель работает на другом материале.
Ухудшение качества проверяют на прежнем материале по прежнему зачёту. Новая ошибка в новой задаче ещё не показывает, что старые задачи агент решает хуже.
Симптом и причина записываются отдельно.
Источник: определения Evidently, обновление 09.01.2025; механика контроля Anthropic, 09.01.2026. Применение к разработке и последняя строка: редакционное объяснение, 08.10.2026.
В ML concept drift означает изменение связи входа с правильным ответом. Новое бизнес-требование записывают как новое требование, без диагноза по одному примеру.
Те же слова задачи не гарантируют те же входы. Агент мог прочитать обновлённую документацию или получить другую историю переписки.
Постоянный набор задач даёт точку сравнения. Новые задачи дополняют его отдельной группой, чтобы рост проекта не выглядел ухудшением старой связки.
Что и как мы проверяли
| Факт | Что известно | Проверено |
|---|---|---|
| Определения | Evidently, обновление 09.01.2025. Изменение входов, качества и версии разведены; примеры для разработки предложены редакцией | 2026-10-08 |
| Версии | Прочитана документация Anthropic. Закреплённый ID не исключает изменения обслуживающей инфраструктуры. Не все продукты раскрывают фактическую модель | 2026-10-08 |
| Протокол | Механика независимых попыток взята из инженерного блога Anthropic от 09.01.2026. Три попытки предложены для старта по примеру РуБенча, без обещания статистической значимости | 2026-10-08 |
| Наши наблюдения | РуБенч, раунды июля и поправка сентября 2026. Проверены публичные разборы подмены и исходного кода. Своего замера дрейфа неизменной связки и клиентского кейса нет | 2026-10-08 |
| Цена | Живой /services: «Один проект», 250 000 ₽ в месяц. Это разработка по подписке, не цена отдельного аудита модели. Контроль и приёмку предлагается согласовать на старте | 2026-10-08 |
2. Название модели не фиксирует весь запуск.
В журнале нужны и выбранная модель, и та, которая исполняла задачу. Подмена в РуБенче показала разницу между выбором пользователя и работой продукта.
Закреплённый ID сужает круг причин. Anthropic обещает постоянный снимок за ID, но допускает изменения обслуживающей инфраструктуры при прежних весах модели.
Среду тоже фиксируют. В неё входят версия агента, правила для ИИ-агентов и инструменты. Их смена меняет проверяемую связку.
Запись запуска позволяет повторить поручение.
Источник: Anthropic, документация версий и статья об оценке агентов; форма записи предложена редакцией 08.10.2026. Не все продукты открывают фактическую модель и параметры.
3. Контрольные задачи сохраняют вместе с исходным кодом и зачётом.
Контрольная задача хранит состояние до починки. Если запускать её на сегодняшнем коде, готовое исправление или новая зависимость изменит экзамен.
Постановка задачи агенту и критерий приёмки остаются постоянными. Команда проверяет результат без доверия ответу.
Без сохранённых старых результатов нынешний прогон станет первой базой. Сравнение с памятью о прошлых ответах не подтверждает историческое ухудшение.
В РуБенче используются 25 задач, по 3 независимых попытки на каждую. Это устройство раунда, а не обязательный размер набора для вашей компании.
Командный набор покрывает свою работу. В него входят прежние удачные задачи и сохранённые ошибки, чтобы не выбрать только удобные примеры.
Проверка результата хранится отдельно от материалов агента. Иначе исполнитель сможет изменить проверку вместо починки продукта.
Открытый рейтинг помогает выбрать кандидата. На своём наборе CTO проверяет другую вещь: сохранит ли кандидат работу конкретного проекта.
Контроль проверяет поведение продукта.
Источник: публичные задачи РуБенча, проверены 08.10.2026. Это примеры проверки поведения, не замер вашего проекта.
4. Повторы сравнивают по задачам, а не по удачному ответу.
Одна попытка показывает один исход. Модель отвечает с вариациями, поэтому одиночный провал и одиночный успех ещё не описывают её обычную работу.
Для первого сравнения предлагаем по 3 независимых попытки на задачу, как в РуБенче. Это стартовый протокол, а не доказательство статистической значимости.
Каждая попытка начинается с чистой копии. Следы предыдущей починки и подсказки ревьюера меняют вход, даже если текст задачи остался прежним.
Одинаковые условия важнее знакомого текста задачи.
Источник: механика независимых попыток Anthropic, 09.01.2026, и РуБенча. Последовательность для команды предложена редакцией 08.10.2026.
Доступные старую и новую связки чередуют в одном окне. При подозрении на изменение прежнего ID текущий прогон сравнивают с сохранёнными результатами.
Дорешивание записывают отдельным режимом. Лучший ответ после подсказок нельзя сравнивать с первой самостоятельной попыткой.
У каждой попытки остаётся свой исход. Общий процент прячет ситуацию, когда агент лучше чинит формы, но перестал справляться с входом пользователя.
Каждая попытка остаётся отдельной строкой.
Источник: редакционный шаблон на основе Anthropic и РуБенча, 08.10.2026. Таблица не содержит результатов проведённого нами эксперимента.
Зачёт проверяет состояние продукта. Фраза агента «всё работает» не заменяет запуск проверки на его патче.
Модель-ревьюер помогает разбирать поведение. Решение об ошибке опирается на критерий, а спорные случаи разбирает инженер.
Изменившийся тест тоже нуждается в проверке. Если он отвергает допустимую починку, новый незачёт ничего не говорит о деградации модели.
Зачёт собирают из результата и разбора.
Источник: Anthropic, оценка агентов, 09.01.2026; применение к командному прогону предложено редакцией 08.10.2026.
5. РуБенч выявил подмену модели и ошибку самого прогона.
РуБенч дал две разные причины недоверия к результату. Их удалось отделить, потому что сохранялись журналы и исходное состояние задачи.
Подмена относилась к продукту «Claude Code + Fable 5» в июле 2026. Это не основание обвинять нынешнюю версию или говорить о дрейфе данных.
Ошибка стартового кода действовала в обратную сторону. Агент получал уже решённую задачу, поэтому зачёт приписывал ему чужую работу.
Подмена исполнителя и испорченный старт дали разные ошибки.
07.07
На 5 задачах из 25 продукт подменял Fable 5 на Opus 4.8. Подменённые задачи убрали из зачёта этой модели. Правило: фактического исполнителя сверяют по траекториям
06.09
Опубликована поправка: с 15.07 старт AIOH3 содержал готовую починку. 16 затронутых ячеек исключили. В проверку перед раундом добавили сверку старта с исходным git-кодом
Источник: публичные разборы РуБенча, 07.07 и 06.09.2026, перепроверены 08.10.2026.
В новой колонке сентября подмен не обнаружили в 75 траекториях. Но другой снимок и другой момент прогона не дают замера дрейфа одной закреплённой модели.
Наш опыт относится к бенчмарку и машине агентов на vibecoding.ru. Своего клиентского кейса дрейфа и повторного замера неизменной связки у нас нет.
В курсе агентной разработки разбираются задачи, правила и проверки. «Разные модели под разные задачи» означает проверку роли модели, а не смену процесса по рейтингу.
6. Решение принимает инженер по причинам ошибок и цене исправления.
Причину разбирают до замены всего процесса. При подмене нужен контроль маршрута, при испорченном старте нужен новый валидный прогон.
На выбор в закрытом контуре распространяется тот же принцип. Размещение у себя не заменяет проверки на задачах проекта.
Подтверждённый повторяемый провал пополняет контрольные задачи. Так контроль приводит к решению и следующему прогону, а не заканчивается отчётом.
Причина определяет следующее действие.
Источник: предложенный редакцией протокол, 08.10.2026. Порог допустимого ухудшения задаёт команда заранее; критические ошибки разбираются отдельно от среднего процента.
Инженер ведёт машину агентов. В работе команды с агентами он выбирает задачи, принимает риск и сохраняет решение вместе с результатами контроля.
Ссылка на тест для руководителя теперь ведёт на страницу разработки. Там можно записаться на звонок и обсудить рабочий процесс.
Если вести контроль некому, можно обсудить подписку на разработку. На 8 октября 2026 тариф «Один проект» стоит 250 000 ₽ в месяц. Контроль и приёмку согласуют на старте.
7. Частые вопросы
Что считать дрейфом модели простыми словами?+
В разговоре так называют изменение поведения со временем. Для решения нужны точные записи: поменялись входы, качество по прежнему зачёту или исполнитель. Само слово не устанавливает причину.
Можно ли доказать смену модели, если продукт не раскрывает исполнителя?+
По одному поведению это не устанавливают. Можно подтвердить изменение результата связки, но без данных о фактическом исполнителе причина остаётся гипотезой.
Нужно ли менять модель-ревьюера вместе с исполнителем?+
Для сравнения сохраняют прежнюю приёмку. Если одновременно поменять исполнителя и судью, новый результат будет зависеть от обеих замен. Новую приёмку проверяют отдельно.
Нужны ли всем 25 задач и три попытки?+
Это устройство РуБенча, а не норматив. Команда выбирает задачи по своей работе, а число попыток увеличивает, когда разброс мешает решению. Три попытки сами по себе не доказывают статистическую значимость.
Когда повторять контроль?+
Перед сменой модели, агента, правил или инструментов, после необъяснимого ухудшения и по принятому командой расписанию. Старые задачи сохраняются, новая работа проверяется отдельной группой.
Источники
- Evidently: дрейф входных данных и смежные термины, обновление 9 января 2025 — руководство разработчика
- Anthropic: ID, закреплённые снимки и обслуживающая инфраструктура, проверено 8 октября 2026 — официальная документация
- Anthropic: Demystifying evals for AI agents, 9 января 2026 — инженерный блог
- РуБенч: задачи и устройство раунда, обновление 6 сентября 2026 — наш бенчмарк
- РуБенч: подмена модели, находка раунда 1 от 7 июля 2026 — наш разбор траекторий
- РуБенч: новая колонка и поправка исходного кода, 6 сентября 2026 — наш разбор прогона
- Тариф «Один проект», цена проверена 8 октября 2026 — наша публичная цена
- Курс «Агентная разработка»: модели, задачи, правила и проверки — наш курс
Запомнить
- Изменение качества проверяют повтором задач. Причину устанавливают отдельно.
- Сохраняют выбранную и фактическую модель, вход и среду. Названия продукта недостаточно.
- Каждая попытка получает чистый старт. Зачёт хранится отдельно от работы агента.
- Подмену и сбой среды отделяют от ошибки кода. Спорный результат разбирает инженер.
- Решение заканчивается новым контрольным прогоном. Пригодность связки проверяется на работе проекта.