
Разбор для бизнеса · Опубликовали 08.10.2026
Детерминированность ответа не гарантирует одинаковую правку агента при повторном запуске
Что сравнивать при повторном запуске ИИ-агента и какой результат принимать у исполнителя.
Материал собран машиной агентов под надзором Евгения Шилова · факты проверены 8 октября 2026
Детерминированность ответа не гарантирует одинаковую правку ИИ-агента при повторном запуске. Даже совпавшее «готово» ничего не говорит о файлах, которые он изменил.
CTO принимает код и его проверки. Опираемся на три прогона РуБенча и машину vibecoding.ru; своего клиентского кейса повторных запусков у нас нет.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
1. Ответ, правку и поведение программы сравнивают отдельно.
Что должно совпасть при повторе? Текст ответа, изменения файлов и работа программы отвечают на разные вопросы. Отчёт агента описывает результат, но не заменяет его.
Детерминированный ответ воспроизводится при одинаковом полном входе. У агента в этот вход попадают и прочитанные файлы, и ответы инструментов.
Разные правки могут пройти одинаковые проверки. Одинаковые правки могут одинаково неверно считать скидку. Это пример различия свойств, не замер нашего продукта.
В документации Anthropic даже temperature 0 не гарантирует одинакового ответа API. В примере OpenAI с seed от 06.11.2023 обещание тоже ограничено.
Одинаковые слова не заменяют проверку кода.
Редакционная схема сравнения, 08.10.2026; ограничения повторяемости ответа сверены по документации Anthropic и OpenAI.
2. Одинаковая просьба ещё не фиксирует запуск агента.
Почему одинаковый запрос даёт разные правки? Агент получает новые сведения по ходу работы. Другой стартовый код или ответ команды меняет вход следующего обращения к модели.
Сохраняйте задачу для агента с исходной версией проекта. После первой правки код уже другой; независимым попыткам нужен тот же чистый старт.
Проверьте, что каждая попытка прочитала одинаковые правила для агентов. Запуск без инструкции меняет условия, даже если просьба та же.
У повторного запуска есть несколько частей входа.
Редакционный протокол сравнения, 08.10.2026. Его основания: методика и поправки РуБенча; это рекомендация, не уже проведённый эксперимент.
3. РуБенч меряет успех повторных попыток, а не совпадение файлов.
Что показывают три прогона РуБенча? В раунде 2 каждая из 25 задачполучила три независимых захода. Скрытый тест автора починки принимал результат каждого захода.
Скрытый тест оценивает починку задачи. Он не требует одинакового текста ответа или способа исправления. Три зачёта могли бы получиться на разных правках.
Разброс зачёта не равен частоте изменения файлов. Нового эксперимента с неизменным полным входом мы для статьи не проводили. РуБенч показывает исходы в своём протоколе.
У Opus 4.8 преимущество перед Sonnet 5 составляет 4 процентных пункта, а разброс равен ±6,1 пункта. Такого сравнения средних мало, чтобы выбирать инструмент для компании.
Среднее не расскажет, какие задачи проваливались. Для пилота нужны результаты каждой попытки по задачам вашей компании. Общий рейтинг этого не заменяет.
Это урок выбора, а не обещание нашей подписки. Ни процент зачёта, ни число прогонов РуБенча не предсказывают результат на репозитории клиента.
Разница средних меньше опубликованного разброса.
/rubench, раунд 2 от 18.07.2026, обновление 06.09.2026; проверено 08.10.2026. Символ ± на витрине назван разбросом, не доверительным интервалом.
4. Повторяться может и ошибка проверки.
Если результат повторился, можно ли его принять? Совпадение показывает устойчивость к повтору в данных условиях. Правильность задаёт отдельное требование к результату.
Проверяющая модель тоже меняет трактовку правила. У нас вычислимую пунктуацию отдали обычному коду; между прогонами приёмки текст редактировали.
Инженер ведёт машину агентов на сайте; ход работы виден в открытом журнале работы. Истории поломок объясняют наши правила проверки. Они не превращаются в клиентский кейс.
Что ломало сравнение запусков и какое правило появилось.
07.07
Раунд 1 РуБенча: агент переключался на другую модель, а выбранное имя оставалось прежним. Рельса стала сверять фактическую модель каждого сообщения и браковать ячейку при расхождении.
22.08
Приёмка текстов: последовательные прогоны по-разному применяли правила пунктуации. Вычислимые нарушения передали машинной проверке, чтобы решение не зависело от трактовки модели.
06.09
Поправка РуБенча: стартовая задача на машине прогонов уже содержала готовую починку. 16 ячеек исключили, результаты пересчитали; перед раундом добавили проверку чистоты набора.
Публичные разборы РуБенча и редакционный журнал машины. Записи перечитаны 08.10.2026; первичный протокол калибровки приёмника публично не опубликован.
Подмена модели в июльском раунде повторялась при повторе задачи. Такая повторяемость не делала выбранное имя модели верным. Кадр показывает именно это историческое расхождение.
Одного «готово» мало, чтобы восстановить причину расхождения. Сохраняйте ответы инструментов и след действий: неодинаковый diff ещё не диагноз.
5. Повторно запускайте проверки сохранённого кода.
Сохраните подготовленный код и повторите его проверки на тех же данных. Новый вызов агента создаёт нового кандидата, а не воспроизводит приёмку старого.
Учебный пример: цена 1 000 ₽, скидка 10 %, итог 900 ₽. Проверка должна отвергать исходные 1 000 ₽; два одинаковых неверных итога не доказывают правильность.
Если та же программа даёт разные результаты, разберите её зависимость от времени, данных и внешних ответов. Менять промпт в этот момент рано.
Сначала повтор проверки, затем разбор расхождения.
Рекомендуемая процедура редакции, 08.10.2026. Не требует заново генерировать код для каждого повтора.
6. Принимают запущенную версию по исходной задаче.
От исполнителя нужны исходная задача, правка от согласованной версии и результаты проверок. Совпадение переписки не служит критерием готовности.
Зафиксируйте ответственность за ошибку до приёмки. Кто принимает версию, разбирает сбой и возвращает предыдущий код? Ответ модели этого не решает.
Роль руководителя разработки здесь состоит в выборе критериев. Проверяющий сверяет код с исходной задачей; новое требование сохраняет её следующей версией.
Один результат сдачи содержит код и доказательство проверки.
Рекомендуемый пакет приёмки, 08.10.2026. Гарантия одинаковой генерации в него не включена.
Если цикл уже ведёт ваша команда, сравнивайте кандидатов по её проверкам. Если вести его некому, следующий шаг можно обсудить с исполнителем.
В подписке «Один проект» цена составляет 250 000 ₽ в месяц, один поток работы. Тариф проверен 08.10.2026.
Для первой задачи согласуйте сдачу запускаемого кода и проверок с сохранением исходного задания. Одинаковые слова модели не заменяют этот результат.
Что и как мы проверяли
| Факт | Что известно | Проверено |
|---|---|---|
| Ответ модели | Раздел Temperature документации Anthropic и пример OpenAI Cookbook от 06.11.2023 с seed. Оба ограничивают обещание повторяемости ответа API. Новый эксперимент с API для статьи не проводили | 2026-10-08 |
| РуБенч | Раунд 2 закрыт 18.07.2026, обновлён 06.09.2026. 25 задач, три независимых захода; скрытый тест оценивает успех. Разница Opus 4.8 и Sonnet 5 составляет 4 процентных пункта при опубликованном разбросе ±6,1 пункта. Совпадение файлов этот показатель не меряет | 2026-10-08 |
| Истории машины | Публичные разборы подмены модели в раунде 1 и поправки стартового кода от 06.09.2026 сверены с первичными записями. Калибровка приёмника от 22.08.2026 дана редакционным пересказом закрытого журнала. Между её прогонами текст правили; это не тест неизменного входа | 2026-10-08 |
| Подписка | Живой тариф /services: «Один проект», 250 000 ₽ в месяц, один поток работы. Пакет приёмки в статье является рекомендацией, а не опубликованной гарантией одинаковых правок. Своего клиентского кейса повторных запусков у нас нет | 2026-10-08 |
7. Частые вопросы
Полностью детерминированный агент всё-таки может сделать одинаковую правку?+
Да, если одинаков его полный вход и всё, что влияет на выполнение, тоже фиксировано. Одинаковая фраза в чате ещё не задаёт этих условий. Проверять надо весь запуск, а не название свойства модели.
В интерфейсе агента можно выставить seed?+
Это зависит от конкретного продукта. Пример OpenAI относится к API, а не к любому интерфейсу агента. Не считайте параметры запроса доступными переключателями программы без проверки её документации.
Кэш ответа заменит воспроизводимый запуск?+
Кэш может вернуть сохранённый текст. Он не восстанавливает версию файлов, данные и результаты команд. Повторное выполнение действий ещё может изменить состояние программы.
Сколько повторов достаточно для приёмки?+
Универсального числа нет. Три захода в РуБенче составляют протокол этого бенчмарка. Для вашей задачи число проверок и сценарии задают заранее; повтор зелёного теста не расширяет то, что тест проверяет.
Что делать, если та же проверка то проходит, то падает?+
Сохранить кандидат, входные данные и оба результата. Проверить зависимости от времени, случайных значений и внешних ответов, затем устранить найденную причину. Перезапуск агента до зелёного скрывает источник расхождения.
Источники
- Anthropic, Glossary, раздел Temperature · проверено 08.10.2026 — официальная документация
- OpenAI Cookbook, пример с seed (06.11.2023) · проверено 08.10.2026 — официальный пример API
- РуБенч, раунд 2 (18.07.2026, обновление 06.09.2026) · проверено 08.10.2026 — наш бенчмарк
- Сейфгард Fable 5 молча подменяет модель, разбор раунда 1 от 07.07.2026 — публичные траектории
- Поправка стартового кода РуБенча (06.09.2026) · проверено 08.10.2026 — разбор и пересчёт
- /open: публичный контекст машины. Калибровка 22.08 дана редакционным пересказом, первичный протокол закрыт — наш опыт
- «Один проект», тариф и условия · проверено 08.10.2026 — наша услуга
Запомнить
1. Назовите предмет сравнения: текст ответа, изменение файлов или поведение программы.
2. Для сравнения попыток сохраняйте одинаковую базовую версию, задачу и условия запуска.
3. Принимайте сохранённый код по проверкам, которые обнаруживали исходную ошибку.
4. Повторяйте исполнение проверки; новую генерацию оценивайте как нового кандидата.
5. Совпадение не доказывает правильность. При расхождении сохраняйте след запуска и разбирайте причину.