
Разбор · 08.10.2026
Prompt caching уменьшает цену повторного чтения контекста, когда обращения агента используют общий префикс
Когда кэширование промптов снижает расходы ИИ-агента, почему скидка на всю задачу меньше скидки на чтение и что CTO должен измерить перед выводом об экономии.
Текст собран машиной под надзором автора проекта · факты проверены по первоисточникам 8 октября 2026
Prompt caching снижает расходы на повторное чтение совпадающего начала запроса, но скидка на всю задачу будет меньше скидки на эти токены. Собственного замера экономии от кэша и клиентского кейса у нашей машины пока нет.
Для CTO проверка начинается с двух вещей: какой контекст агент повторяет и сколько стоит принятая задача со всеми попытками. Прайс показывает возможную экономию; журнал обращений показывает, получила ли её компания.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
1. Кэш работает на совпадающем начале запроса.
В Claude API агент отправляет контекст вместе с очередным обращением к модели. Там лежат инструкции, описание инструментов и история работы. Поэтому короткая просьба исправить тест может сопровождаться длинным входом.
Повторяющийся блок ставят перед меняющимися данными задачи. Например, правила для агента остаются в начале, а новый результат теста добавляется после них. Этот общий начальный блок называют префиксом.
Модель использует сохранённую обработку совпавшего префикса и обрабатывает новый хвост. Пересказать те же правила другими словами недостаточно: совпасть должно содержимое до границы кэша. Кэширование не заменяет передачу инструкций в запросе.
Общие правила остаются впереди, результат шага добавляется после них.
Anthropic, Prompt caching; проверено 08.10.2026. Порядок Claude API: tools, system, messages. Для повторяемого общего блока границу ставят в конце этого блока.
2. Скидку на чтение нельзя переносить на весь счёт.
Для Claude Sonnet 4.6 чтение кэша стоит $0,30 за миллион токенов вместо $3 обычного входа. Это скидка 90 % на уже сохранённую часть, по прайсу Anthropic на 08.10.2026. Первая запись на пять минут стоит дороже обычного входа: $3,75 за миллион.
Возьмём расчётную серию из 20 обращений. В каждом 10 000 токенов общего начала, 2 000 новых входных токенов и 1 000 токенов ответа. Первый запрос создаёт кэш, следующие 19 попадают в него до истечения срока.
При этих допущениях счёт за токены падает с $1,02 до $0,5145, на 49,6 %. Ответы продолжают стоить $15 за миллион токенов. Работа инженера и внешних инструментов в эту арифметику не входит.
В расчётной серии экономия всех токенов составляет 49,6 %.
Редакционный расчёт по стандартному прайсу Claude API, Sonnet 4.6, 08.10.2026. Префикс с кэшем: 10 000 × $3,75 / 1 000 000 + 19 × 10 000 × $0,30 / 1 000 000. Без Batch и надбавок; одинаковый объём ответов задан условием, а не измерен.
Запись нужна в расчёте даже при высоком проценте попаданий. Если агент каждый раз создаёт новый кэш и не читает его повторно, эта часть входа обходится дороже обычного тарифа. Одна строка «кэш включён» экономию не доказывает.
3. Промахи кэша объясняются сборкой контекста и паузами.
Общие инструкции не гарантируют общего префикса. Если перед ними каждый раз стоит новая дата, начало уже изменилось. Для такой структуры в Claude API нужен отдельный неизменный блок с границей перед переменными данными.
Сохранённый префикс действует ограниченное время. В Claude API по умолчанию это пять минут; есть запись на час за $6 на миллион токенов для выбранной модели. Срок идёт от начала обращения, а чтение обновляет его.
Причину промаха ищут по запросу и полям расхода.
Anthropic, Prompt caching; 08.10.2026. Минимум префикса для Sonnet 4.6 в Claude API составляет 1 024 токена. У другой модели и платформы условия проверяют отдельно.
Агент Claude Code использует prompt caching автоматически, по официальному руководству на 08.10.2026. Его отчёт расходов помогает увидеть категории токенов. Для цены всей задачи к основному разговору добавляют обращения субагентов и повторные попытки.
4. Наш счётчик расходов не измеряет отдельный эффект кэша.
Инженер ведёт машину агентов на vibecoding.ru, а её учёт расходов машины сравнивает API-эквивалент токенов с подписками. На 08.10.2026 там стоит ×36 за окно с 1 июля по 8 октября, 100 дней. Этот множитель относится к способу оплаты.
API-эквивалент уже учитывает тарифы записи и чтения кэша. Сравнить его с подписками и назвать разницу экономией caching нельзя. На странице также отмечены модели без прайса, поэтому её итог не годится для точного замера скидки кэша.
В учёте мы исправляли базу сравнения и состав расходов.
27.09
Разные способы расчёта подписок не сходились. Правило после исправления: оба публичных экрана используют один расчёт по дням за одинаковое окно.
03.10
В цене машины не было работы инженера. Правило после исправления: стоимость инженера включена в сравнение способов разработки.
Журнал машины, записи 27.09 и 03.10.2026, сверены 08.10.2026. Это исправления учёта, не истории промахов prompt cache.
Для собственного доказательства кэша нужна другая пара: одни условия задачи и модели, отдельно обычный вход, запись, чтение и выход. Такой контрольной пары мы не публиковали. Пример выше показывает арифметику тарифа, а не результат нашей разработки.
5. Эффект проверяют по расходам на принятую задачу.
Замер начинается с одинакового критерия готовой задачи. Дешёвое обращение, после которого нужны новые попытки и ручная починка, ещё не означает дешёвую разработку. Сохранённый ошибочный контекст тоже можно читать по льготной цене.
В сравнении сохраняют модель, инструкции, инструменты и условия приёмки. Сначала считают влияние тарифа на один зафиксированный набор токенов, затем проверяют повторяемый набор задач целиком. Изменение модели или числа попыток учитывают отдельно от кэша.
Журнал связывает токены с результатом каждой задачи.
Редакционный протокол замера, 08.10.2026. В Claude API поля usage: input_tokens, cache_creation_input_tokens, cache_read_input_tokens, output_tokens. Разную длительность записи считают по соответствующим тарифам. Протокол не является нашим проведённым экспериментом.
Высокая доля чтения из кэша объясняет токены, но не срок выпуска. Если задачи не закрываются быстрее , отдельно смотрят очередь, проверки и переделки. Для следующего шага есть разбор для руководителя.
6. В подписке экономией моделей управляет исполнитель.
При собственной разработке CTO поручает инженеру замер и сравнивает полный бюджет задач. При подписке на разработку использование моделей для разработки ведёт исполнитель внутри фиксированной цены. Клиент оценивает принятый результат и поток работы.
Тариф «Один проект» на 08.10.2026 стоит 250 000 ₽ в месяц. Модели для кода включены в цену по условиям /services. Экономия prompt caching не оформляется отдельной скидкой клиенту.
У каждого способа оплаты своя проверка расходов.
Условия /services проверены 08.10.2026; способ проверки сформулирован редакцией. Расходы ИИ-функций самого продукта клиента не входят в этот расчёт кэша разработки.
Кэш полезен там, где общий контекст повторяется достаточно часто и совпадения подтверждены журналом обращений. Следующее решение CTO опирается на цену принятой задачи. Процент скидки в прайсе остаётся одним из входных данных.
Что и как мы проверяли
| Факт | Что известно | Проверено |
|---|---|---|
| Механизм | Прочитана официальная документация Anthropic: общий префикс, граница, срок жизни, минимум длины и поля расхода. Условия Claude API не перенесены на других провайдеров | 2026-10-08 |
| Цена серии | Прайс Claude Sonnet 4.6 сверён с таблицей prompt caching. Расчёт по 20 обращениям, заданным объёмам и 19 попаданиям в кэш. Это арифметический сценарий, не проведённый эксперимент | 2026-10-08 |
| Опыт машины | Сверены живые /open и /open/api-costs. Множитель подписок против API не измеряет эффект кэша; на экране есть предупреждение о моделях без цены. Исправления учёта сверены по записям журнала 27 сентября и 3 октября | 2026-10-08 |
| Цена услуги | Тариф «Один проект» и состав включённого использования моделей для разработки сверены с живой /services. Экономия кэша внутри фиксированной цены не является отдельной скидкой клиенту | 2026-10-08 |
| Что не измеряли | Своего клиентского кейса и контрольной серии с кэшем и без него нет. Расчёт по прайсу показывает влияние тарифов при заданных объёмах; экономию на задачах компании он не измеряет | 2026-10-08 |
7. Частые вопросы
Кэширование промптов и prompt caching означают одно и то же?+
Да, в этой статье это сохранение обработки повторяющегося начала запроса. Условия зависят от модели и провайдера; здесь разобран Claude API.
Можно ли убрать правила из следующих запросов, раз они в кэше?+
Нет. Prompt caching проверяет переданный префикс. Если убрать инструкции, это уже другое обращение; кэш не служит долговременной памятью агента.
Кэш увеличивает окно контекста?+
Нет. Он меняет обработку и тариф совпадающей части входа. Размер окна и требования к содержимому запроса остаются ограничениями выбранной модели.
При подписке на Claude Code появится денежная скидка?+
Из API-прайса её вывести нельзя. У подписки свои условия оплаты и лимитов, а льготные API-токены не превращаются в возврат части фиксированного платежа.
Источники
- Anthropic: Prompt caching — Официальная документация
- Anthropic: Pricing — Официальный прайс
- Claude Code: Costs — Официальная документация
- Расходы машины vibecoding.ru — Наш публичный счётчик
- Условия разработки — Наш сайт
Запомнить
- Стабильное начало даёт шанс повторного чтения из кэша. Ставьте меняющиеся данные после общего блока.
- В счёте остаются запись, новый вход и ответы. Считайте все категории по тарифу выбранной модели.
- Включённый кэш не доказывает попаданий. Сверяйте их с полями расхода и временем обращений.
- Экономию компании показывает принятая задача. Добавляйте субагентов, переделки и работу инженера.
- Кратность подписок против API не измеряет caching. Для вывода об эффекте кэша нужна отдельная контрольная пара.