Когда рабочая нагрузка переходит от прототипа к продакшену, стоимость становится первоклассным проектным ограничением. Самая способная модель может оказаться слишком дорогой в масштабе, а самая дешёвая модель может не дотягивать по качеству. Грамотное управление стоимостью означает понимание того, как каждый рычаг стоимости влияет на качество результата, потому что одни рычаги размениваются на качество, а другие — нет. Claude Platform даёт вам прямой контроль над этим компромиссом. Вы выбираете модель, уровень усилия и архитектуру для каждого запроса, что позволяет разместить рабочую нагрузку практически в любой точке границы «стоимость — интеллект».
Рычаги бывают двух видов:
Каждый рычаг сопровождается измеренными результатами и правилом, когда он окупается. В измерениях Anthropic кэширование подсказок оказалось крупнейшим рычагом с большим отрывом: оно сократило стоимость агентного цикла в 2,5–3,7 раза на бенчмарках этого руководства и уменьшило счёт небольшого агента сортировки обращений на 83%, или на 88% с добавлением обрезки входных данных. Мультимодельные рычаги уже; вторая модель окупалась в двух формах — советник и оркестратор.
Сопоставьте свою ситуацию со строкой.
| Ваша ситуация | Сделайте это | Где |
|---|---|---|
| Любая нагрузка, любая модель | Включите кэширование подсказок и обрежьте ненужные токены; и то и другое бесплатно | Кэшируйте повторяющийся контекст · Обрежьте токены |
| Расходы слишком высоки; качество в порядке | Понижайте усилие на текущей модели | Настройте усилие |
| Вы выбираете или меняете модели | Сравнивайте по стоимости выполненной задачи, а не по токену | Сравните модели |
| Качество недостаточно хорошее | Если вы понизили усилие, верните его; иначе попробуйте следующий уровень выше при усилии low | Настройте усилие · Сравните модели |
Попытки заканчиваются с stop_reason: max_tokens | Повысьте max_tokens; 64 000 покрыло каждый измеренный ход и не стоило ничего дополнительно на решённую задачу | Установите бюджеты |
| Вы можете проверять результаты (тесты, верификатор) | Запускайте всё на низком усилии и перезапускайте неудачи на значении по умолчанию (high); на измеренном бенчмарке кодирования доля прохождения сохранилась примерно при половине стоимости | Перезапускайте неудачи |
| Агентные циклы с несколькими очень дорогими запусками | Установите бюджет задачи (бета; в настоящее время недоступен на Claude Sonnet 5), бюджет сессии Claude Managed Agents и лимит расходов рабочего пространства | Установите бюджеты |
| Более дешёвая модель застревает только на трудных решениях | Добавьте передового советника. Он окупается, когда его цена значительно выше цены исполнителя и к нему действительно обращаются, поэтому сначала оцените модель советника отдельно на низком усилии и измерьте частоту обращений | Стратегия советника |
| Работа превышает одно контекстное окно | Делегируйте разделы более дешёвым исполнителям | Стратегия оркестратора |
Эти результаты являются внутренними для Anthropic (Упомянутые бенчмарки) и носят ориентировочный характер, а не являются гарантиями, поэтому измеряйте на собственной нагрузке с помощью четырёхшагового метода.
Кэширование подсказок, гигиена токенов, пакетная обработка и аудит подсказок под вашу текущую модель — всё это снижает то, что вы платите, не снижая качества результата. Действуют две оговорки: пакетная обработка обменивает задержку на свою скидку, а редактирование контекста, рычаг гигиены токенов, в запуске, измеренном в этом разделе, стоило больше, чем сэкономило.
Включите кэширование подсказок раньше любого другого рычага, потому что каждый ход агентной задачи повторно отправляет весь растущий разговор: «system prompt» (системную подсказку), определения инструментов и каждый предыдущий ход. Задача из 40 ходов отправляет свой первый ход 40 раз, поэтому стоимость задачи растёт примерно пропорционально квадрату числа ходов. Кэширование не прекращает повторную отправку, но каждая повторная отправка стоит примерно в десять раз меньше и обрабатывается быстрее: префикс тарифицируется по ставке чтения из кэша, десятой части цены ввода, а каждый ход платит ставку записи в кэш 1,25x только за то, что ново.
Во всех измеренных запусках Anthropic чтения из кэша регулярно являются крупнейшей отдельной составляющей стоимости задачи, что делает кэширование более ценным, чем большинство решений о выборе модели. Anthropic оценила запуски WideSearch1 и DeepResearch Bench II7 с кэшированием и без него:

Время жизни кэша по умолчанию составляет 5 минут, а ходы агентного цикла разделены секундами, поэтому скидка применяется к большинству токенов на каждом ходу; запуски на диаграмме достигли доли попаданий от 81% до 90%. Экономия варьируется в зависимости от глубины эпизода, потому что более короткие циклы перечитывают меньше, но кэширование оставалось крупнейшим отдельным рычагом на каждой измеренной модели и бенчмарке.
Если ваш цикл ждёт людей между ходами, используйте длительность кэша 1 час. Запись стоит дороже (2x цены ввода вместо 1,25x), но окупается при первом предотвращённом промахе, потому что промах повторно отправляет весь префикс по полной цене и записывает его снова.
Настройка требует мало работы. Автоматическое кэширование расставляет точки разрыва за вас; в противном случае навык Claude API, поставляемый с Claude Code, может добавить кэширование в существующую интеграцию по одной подсказке. Следующий фрагмент показывает, как навык добавляет его в тестовую обвязку, которая произвела эти измерения:
$ claude
> /claude-api add prompt caching to this integration
Done. Prompt caching is now wired into the harness. Two changes:
- build_system() now adds cache_control: {"type": "ephemeral"} to the
system block. Since the API renders tools -> system -> messages, this
one breakpoint caches the entire static prefix -- the full tool array
plus the system prompt.
- apply_moving_cache_breakpoints() strips any stale markers, then marks
the last content block of the two most recent user turns. The older
marker is the read point matching the prefix the previous request
cached; the newer one extends the cache for the next request.
That's 3 breakpoints total, under the limit of 4.
...Эти размещения точек разрыва следуют стандартному шаблону из раздела Явные точки разрыва кэша.
Три настройки могут сломать ваш кэш во время задачи. Изменение effort между запросами делает кэшированный префикс недействительным, поэтому меняйте его только там, где вы всё равно перекэшировали бы, например на границе компактизации. Изменение бюджета задачи на полпути делает то же самое, поэтому устанавливайте его один раз, в первом запросе. Каждый проход редактирования контекста делает префикс недействительным с точки очистки, и следующий запрос платит за перекэширование всего, что после неё, поэтому очищайте несколькими крупными партиями, а не множеством мелких. Вносите все три изменения в естественных паузах, затем убедитесь, что чтения из кэша не упали; если упали, диагностика кэша покажет, где префикс разошёлся.
Большинство агентных запросов несут токены, которые никогда не влияют на ответ. Их обрезка ничего не стоит в качестве результата, хотя не каждый рычаг здесь экономил деньги при измерении. Два места, куда стоит посмотреть:
Рычаги взаимодействуют с кэшем и друг с другом, поэтому оценивайте их по чистому эффекту и используйте диагностику кэша, чтобы убедиться, что ваш кэшированный префикс переживает каждое изменение. Anthropic включала рычаги по одному для агента сортировки обращений, обрабатывающего 20 реальных отчётов об ошибках со скриншотами из публичного репозитория (а для второй панели — более длинный вариант той же работы):

Кэширование сделало почти всю работу, а обрезка довела итог до 88%. Каждый столбец — один запуск, поэтому различия в $0,10 — это шум; показанные здесь — нет. Компактизации нужна сессия, достаточно длинная, чтобы её запустить: запуск на 20 обращений так и не достиг нижнего порога в 50 000 токенов после обрезки входных данных, но на более длинном варианте второй панели она сработала один раз и сократила счёт ещё на 38%.
Редактирование контекста — единственный рычаг здесь, который не бесплатен. Каждый проход очистки перезаписывает кэшированный разговор, что работает против кэширования подсказок; в этом запуске редактирование контекста стоило больше, чем сэкономило. Используйте его, чтобы освободить место в контекстном окне, и очищайте несколькими крупными партиями.
Batch API снимает 50% с каждого токена запроса, включая кэшированные, в обмен на то, что результаты приходят в любое время в течение 24 часов. Направляйте каждый запрос, которого никто не ждёт, через пакет, а интерактивный путь оставьте для остального. Пакетирование — второй по величине бесплатный рычаг после кэширования для автономной агентной работы: оценочных запусков, дозаполнений и запланированных заданий, таких как периодический запуск агента сортировки обращений из измерения обрезки токенов. Оно сочетается со всем на этой странице, кроме интерактивности, но недоступно для сессий Claude Managed Agents, которые интерактивны по замыслу (см. цены Claude Managed Agents).
Каждое поколение моделей реагирует на подсказки по-разному, поэтому подсказка накапливает текст, написанный для модели, которую вы больше не используете. Обычный случай — чрезмерно конкретная инструкция, добавленная для компенсации более старой модели: «проверь дважды», «будь максимально тщательным», обязательная пошаговая процедура или самодельный черновик для рассуждений. Более новая модель следует им буквально, производя лишние раунды инструментов и лишний текст, так что счёт растёт без выигрыша в точности. Аудит подсказок под модель, которую вы используете сейчас, и снова при каждой смене модели — это бесплатный выигрыш.
Аудит — это одна команда. Навык Claude API, поставляемый с Claude Code, имеет команду prompt-audit, которая читает подсказки и код запросов проекта и сообщает, что было написано для другой модели. Этот сокращённый фрагмент показывает её запуск на подсказке службы поддержки и коде запросов, содержащих эти шаблоны:
$ claude
> /claude-api prompt-audit
10 findings. The three that matter most:
1. budget_tokens returns a 400 on Opus 5 (support_agent.py:10). This code
does not run against its own target model. Everything else here is
quality; this one is an outage.
2. The prompt contains two live contradictions. Line 15 says confirm before
every refund, line 17 says process every eligible refund immediately.
Line 19 asks for a complete recap *and* a three-sentence maximum.
3. The reasoning scaffold and the 6-step script fight the model rather than
steer it. <scratchpad> + "reason step by step" is now a request
parameter, not prose; the mandatory 6-step procedure plus "investigate
fully even when the ticket looks simple" forces four tool calls on a
"where's my package" ticket.
...
-After any refund or escalation, verify twice before submitting: re-fetch
-the order, re-check every figure in your reply against the fresh lookup,
-and review the reply a second time for errors.
+Before submitting a refund or an escalation, re-fetch the order and confirm
+every figure in your reply matches the fresh lookup.Затем команда предлагает свои правки в виде diff (показан один фрагмент) и перечисляет, что она намеренно оставила нетронутым: окно возврата средств, требование к тону и планку качества. Вы проверяете патч, а не переписанный текст.
Эффект измерим. На оценке службы поддержки14 подсказки, написанные для Claude Opus 4.8, стоили на 36% больше за тикет на Claude Opus 5 без изменения точности. Прогон аудита по тем же подсказкам сделал Opus 5 и дешевле неаудированной версии (на 14%), и точнее (97% тикетов вместо 92%, прирост за пределами шума). При миграции с Claude Sonnet 4.6 на Claude Sonnet 5 аудит снял 14% при той же точности:

Два вида устаревшего текста имеют разную цену. Инструкции, которым новая модель следует слишком буквально, стоят денег: удаление «проверь дважды» сократило стоимость Opus 5 за тикет на треть, а удаление «будь максимально тщательным» — почти на столько же. Текст, который больше не подходит модели, вместо этого стоит точности: устаревшая настройка мышления, противоречивые правила и самодельный черновик, конфликтующий с собственным мышлением модели, каждый вернул от 7 до 11 пунктов на Opus 5 при удалении:

Те же шаблоны встречаются в описаниях инструментов и навыках, и их стоит удалять и там.
Эти рычаги определяют, где одна модель располагается между стоимостью и интеллектом: выбор модели, усилие, перезапуск неудач на более высокой настройке, а также бюджеты и ограничения, в рамках которых она работает. Начните с перебора усилия на текущей модели (Настройте усилие). От самой низкой к самой высокой стоимости и способности текущие модели — это Claude Haiku 4.5, Claude Sonnet 5, Claude Opus 5 и Claude Fable 5 (передовая модель); в Обзоре моделей есть полная линейка и цены.
Прайс-листы написаны за токен, и за токен передовая модель выглядит дорогой: цена за токен Claude Fable 5 в несколько раз выше, чем у Claude Sonnet 5. Однако вы платите за выполненные задачи, поэтому сравнивайте модели по стоимости выполненной задачи. Более способная модель завершает задачу с меньшим объёмом работы: меньше ходов, меньше поиска, меньше перечитывания собственного контекста и меньше возвратов назад. Надбавка за токен регулярно перекрывается тем, что всего делается меньше.
Anthropic измерила это напрямую на DeepResearch Bench II7, бенчмарке исследовательских отчётов, достаточно сложном, чтобы разделить модели:

Передовая модель на усилии low была точнее и примерно на 10% дешевле за задачу, чем модель среднего уровня, несмотря на разрыв в цене за токен. Однако она побеждает не всегда. На подмножестве SWE-bench Pro3 этой страницы, которое обе модели в значительной степени насыщают и чьи баллы несопоставимы с публичной таблицей лидеров, Claude Opus 5 в одиночку сравнялся с Claude Fable 5 в одиночку (91,7% против 91,3%, в пределах шума между запусками) примерно при 60% его стоимости. На более сложной работе, такой как задачи DeepResearch Bench II, преимущество Fable появляется снова.
Для большинства агентных нагрузок начинайте с Claude Opus 5: за токен он стоит вдвое меньше, чем Fable 5, и в 2,5 раза больше, чем Sonnet 5, а на том подмножестве кодирования он сравнялся с точностью Fable. На другом конце Claude Haiku 4.5 отвечал на вопросы GPQA Diamond9 примерно за десятую часть стоимости Opus 5 за вопрос, с точностью 63% против 92% у Opus, и отставал гораздо сильнее на длинных задачах кодирования. Он подходит для высокообъёмной работы с проверяемыми результатами, а не для длинных агентных циклов.
Ранжирование переворачивается в зависимости от нагрузки, и ни один прайс-лист не скажет вам, в какую сторону. Оценивайте каждого кандидата по стоимости выполненной задачи на собственном трафике, включая Claude Opus 5 и передовую модель на пониженном усилии.
Оценивайте хвост вашей нагрузки, а не медиану: сравнивайте модели на самой сложной десятой части ваших задач, а не на типичной. На типичной задаче все модели выглядят похоже, и самая дешёвая выглядит лучшей, но счёт определяется задачами, которые более дешёвая модель проваливает, потому что проваленная задача всё равно тарифицирует свои токены, затем повторную попытку, затем всё, во что провал обходится дальше по цепочке. Хвост — это также то, куда уходят деньги, даже когда ничего не проваливается. На запуске WideSearch1 из 20 задач две задачи несли 43% расходов:

Мультимодельные стратегии существуют для того, чтобы тратить передовой интеллект на этот хвост, не платя передовые ставки за остальное.
Усилие — самый прямой способ настроить модель под вашу задачу. Параметр effort управляет тем, сколько мышления, вызовов инструментов и самопроверки выполняет модель, и значение по умолчанию (high) подходит для требовательных задач. Стоимость масштабируется со всей этой активностью; точность масштабируется только с той частью, которая нужна вашей задаче. Ниже потолка модели самые высокие уровни усилия оплачивают глубину, которую задача никогда не использует.
На бенчмарках исследований и интеллектуальной работы (WideSearch1, DeepWideSearch6, BrowseComp4 и GDPval2, все с Claude Fable 5) кривая точности относительно стоимости почти плоская: low уступал от 1 до 3 пунктов за скидку от трети до половины стоимости задачи, medium соответствовал точности значения по умолчанию при 70–85% его стоимости, а значение по умолчанию не купило ничего измеримого сверх medium ни на одном из четырёх. На DeepWideSearch low также сравнялся с оркестратором с исполнителем Claude Sonnet 5 при стоимости на 20% ниже: понижение усилия победило изменение архитектуры.
Более низкие настройки также быстрее, что важно, когда ограничением является задержка. В этих запусках low занимал 4,5 минуты на задачу на DeepWideSearch против 7,9 минуты при значении по умолчанию. На корпусном бенчмарке, чьи входные данные не помещаются ни в одно контекстное окно, Fable 5 занимал 7,9, 9,1 и 11,4 часа на эпизод при low, medium и значении по умолчанию.
Долгосрочное кодирование — другая форма. На SWE-bench Pro3 Claude Opus 5 уступил около 2 пунктов на medium за половину стоимости и около 8 пунктов на low за четверть: реальный компромисс, который перезапуск неудач на более высоком усилии превращает обратно в экономию. Эта диаграмма отображает точность относительно стоимости для бенчмарков исследований и интеллектуальной работы и для SWE-bench Pro:

Отсюда следуют два вывода. Во-первых, постройте эту кривую для собственной нагрузки, прежде чем добавлять вторую модель: в этих внутренних измерениях мультимодельная конфигурация, которая выглядела дешевле одиночной модели по умолчанию, стоила больше, чем та же модель на более низком усилии. Во-вторых, эта кривая — одномодельная базовая линия, которую должна превзойти любая мультимодельная стратегия, поэтому шаг 2 измерения на собственной нагрузке строит базовую линию по уровням усилия.
Более низкое усилие действительно стоит точности на нагрузках, достигающих потолка модели, где точность по-настоящему масштабируется с глубиной рассуждений. На DeepResearch Bench II7, где каждый отчёт вознаграждает глубокое рассуждение по каждой подтеме, каждый шаг усилия покупал около 2,4 пункта балла по рубрике; на этой кривой нет бесплатного сокращения стоимости:

Одно лишь описание задачи не раскрывает, какой вид нагрузки у вас, поэтому переберите два или три уровня усилия на выборке собственного трафика и считайте ответ с кривой. Тестируйте каждый уровень в отдельной сессии: изменение усилия посреди сессии делает кэш недействительным (см. Кэшируйте повторяющийся контекст) и искажает сравнение. Подробности о параметре см. в разделе Усилие.
Когда результат задачи проверяем, самая дешёвая политика на кривой усилия — не фиксированная настройка: запускайте каждую задачу на низкой настройке и перезапускайте только неудачи на более высокой.
Anthropic вычислила эту политику задача за задачей по запускам усилия на подмножестве SWE-bench Pro3 из раздела Настройте усилие. С Claude Opus 5 на low провалились 16% задач; при их перезапуске на значении по умолчанию прошли около 93% примерно за $0,70 каждая, против 91,7% за $1,39 при запуске всего на значении по умолчанию: та же доля прохождения за половину стоимости, с учётом проваленных дешёвых попыток. Старт с medium вместо этого решил около 94% примерно за $0,95. Большая часть небольшого прироста — это вторая попытка (перезапуск собственных неудач значения по умолчанию на значении по умолчанию даёт примерно тот же балл за большие деньги), поэтому используйте эту политику ради экономии, а не ради прироста:

Действуют два условия. Во-первых, вам нужен сигнал неудачи (здесь — собственные тесты бенчмарка); проверяющий, который пропускает плохую работу, пропустит и эти неудачи. Во-вторых, каждая неудача первого прохода занимает реальное время двух запусков, поэтому экономия оплачивается задержкой на неудачах.
Большинство запусков агентных задач дёшевы, но меньшинство тратит во много раз больше медианной стоимости на поиск, повторную проверку и избыточное тестирование. Бюджет задачи нацелен на этот хвост. Модель видит живой обратный отсчёт токенов для всей задачи и саморегулируется, обрезая малоценные поиски, пропуская избыточную проверку и завершая работу вместо того, чтобы уходить в спираль.
Anthropic измерила долю прохождения и стоимость задачи на SWE-bench Pro3 с Claude Fable 5 по мере ужесточения бюджета:

Щедрый бюджет уступил около 2,7 пункта доли прохождения за 18% экономии стоимости, а самый жёсткий допустимый бюджет уступил 4,4 пункта за 47% экономии. Бюджеты здесь покупали эффективность, а не точность.
Три элемента управления выполняют три разные работы. Бюджет задачи экономит деньги, потому что модель его видит. max_tokens — это предохранительное ограничение, которое ничего не экономит. На Claude Managed Agents бюджет сессии — это жёсткий долларовый стоп позади обоих. Установите все три: бюджет задачи, высокий max_tokens и ограничение сессии для запуска, который вы никогда не хотите видеть в счёте, с лимитом расходов рабочего пространства в качестве последней страховки.
task-budgets-2026-03-13) на Claude Opus 5, Claude Fable 5, Claude Opus 4.8 и Claude Opus 4.7, но не на Claude Sonnet 5; сначала проверьте таблицу поддержки. Начните около 90-го процентиля использования токенов вашего цикла, затем ужесточайте (Выбор бюджета показывает, как собрать это распределение). Бюджеты ниже текущего нижнего порога в 20 000 токенов отклоняются, а очень жёсткие бюджеты могут вызывать поведение, похожее на отказ. Устанавливайте бюджет один раз, в первом запросе, потому что изменение посреди задачи делает кэш недействительным. Бюджет носит рекомендательный характер, направляя модель, а не останавливая её, поэтому проверяйте соблюдение на своей нагрузке.max_tokens ограничивает один ответ, невидимо для модели, поэтому его понижение не заставляет модель экономить. Ходы, которым нужно было место, отбрасываются и всё равно тарифицируются. На внутреннем бенчмарке задач по репозиторию12 ограничение в 16 384 токена оборвало 15% попыток Claude Opus 5 и треть попыток Claude Fable 5, ни одна из них не была решена. Ограниченные запуски тратили меньше на попытку, но покупали пропорционально меньше решений, поэтому стоимость решённой задачи была такой же, как при 64 000. При этой настройке ничего не обрывалось, и Fable решил 54,6% задач вместо 36,6% на задачах, оценённых в обоих запусках (на отдельном срезе подмножества SWE-bench Pro3, описанном в ссылке 12, 92% вместо 90%). Повтор ограниченных попыток только добавляет стоимость: при том же ограничении они никогда не удавались, а при более высоком вы также платите за потраченную впустую попытку. Установите max_tokens в 64 000 для агентной работы (128 000, максимум, при усилии xhigh или max), используйте потоковую передачу ответов такого размера, считайте stop_reason: max_tokens неудачей и экономьте деньги с помощью усилия и бюджетов задач, которые модель может видеть.stop_reason: budget_reached; повышение бюджета возобновляет её. Он обеспечивается платформой, работает на любой модели с прейскурантной ценой (включая Claude Sonnet 5) и сочетается с рекомендательным бюджетом задачи. Развёртывания применяют то же поле к каждому запуску.Первая из двух диаграмм max_tokens отображает стоимость на попытку и на решённую задачу при каждом ограничении:

Вторая отображает длину вывода за ход относительно ограничений:

Мультимодельные архитектуры подходят для нагрузок, сложность задач в которых варьируется настолько, что разные шаги лучше всего обслуживаются разными моделями. Когда ваш трафик смешивает рутинную работу, с которой надёжно справляется меньшая модель, с более сложными шагами, требующими передовых возможностей, разделение работы сохраняет передовой интеллект там, где он важен, тогда как большинство токенов тарифицируется по ставкам меньшей модели. Когда нагрузке не хватает такой смеси, потому что её сложность однородна или она представляет собой одну зависимую цепочку, одна хорошо настроенная модель обычно является лучшим выбором. Каждый раздел о стратегии даёт правило, как отличить эти два случая.
Две стратегии покрывают большинство нагрузок, и они различаются тем, какая модель держит основной цикл:
| Стратегия | Поток управления | Роль передовой модели | Подходит для | Стоимость передовой модели масштабируется с |
|---|---|---|---|---|
| Советник | Меньшая модель ведёт цикл, эскалирует по требованию | Консультирует по планам и исправлениям | Последовательная работа, сложная местами, например множество ходов агента кодирования между несколькими настоящими решениями | Тем, как часто исполнитель застревает |
| Оркестратор | Передовая модель ведёт цикл, делегирует основную массу работы | Планирует, распределяет и синтезирует | Работа, которая расходится веером по действительно независимым файлам, документам или случаям, особенно если её больше одного контекстного окна | Тем, насколько сложно координировать части |
В стратегии советника (advisor strategy) более дешёвая модель-исполнитель (executor) ведёт цикл агента и выполняет большинство ходов. Когда она сталкивается с решением, требующим более глубокого суждения, например выбором подхода или восстановлением после сбоя, она вызывает более интеллектуальную модель-советника (advisor) за стратегическим руководством, а затем продолжает работу. Большинство токенов тарифицируется по ставкам исполнителя, и лишь редкие консультации — по ставкам советника.
Чтобы использовать её, добавьте в запрос инструмент советника. Эта бета-функция выполняет всю стратегию на стороне сервера в одном запросе /v1/messages: исполнитель выдаёт вызов инструмента, Anthropic выполняет инференс советника, и исполнитель продолжает работу с полученным советом; вы не пишете никакого кода оркестрации. В Claude Managed Agents дайте сессии советника, добавив запись advisor в список multiagent агента; основной поток сессии консультируется с ним тем же способом. Claude Code тоже это поддерживает; см. эскалацию сложных решений с помощью инструмента советника.

Что определяет выигрыш. Советник видит задачу только через вызовы исполнителя, поэтому то, насколько он помогает, определяют две вещи.
Первая — разрыв между моделями. Советник может передать только те возможности, которых не хватает исполнителю: на GPQA Diamond9 исполнитель Claude Haiku 4.5 очень много выиграл от советника Claude Opus 5, исполнитель Claude Sonnet 5 выиграл несколько пунктов, а передовой исполнитель — почти ничего.
Вторая, и хрупкая, — спрашивает ли исполнитель на самом деле (частота консультаций, consult rate). Исполнитель на низком уровне усилия может перестать замечать, что застрял: пара, которая консультируется по большинству задач при уровне усилия по умолчанию, может скатиться к консультациям почти ни по одной при снижении усилия и тогда набирает меньше, чем исполнитель в одиночку. Частота также зависит от задачи: на DeepSWE10 исполнитель Sonnet 5 с низким усилием продолжал спрашивать и выиграл 23 пункта; на SWE-bench Pro3 тот же исполнитель перестал. Когда исполнитель всё же спрашивает, он проходит большую часть пути. По всем парам на следующей диаграмме советник закрыл от 60% до 90% разрыва до более сильной модели, при том что эта модель оплачивалась только за консультации, что и делает возможными случаи экономии:

Частота консультаций реагирует на подсказки. Только со встроенным описанием инструмента исполнители вызывают его недостаточно часто, особенно в задачах программирования, поэтому документация инструмента советника даёт системную подсказку, которая просит один вызов перед существенной работой и один перед завершением, примерно два-три вызова на задачу. Пара для программирования, измеренная далее, работала в таком ритме — около двух консультаций на каждую задачу. На той странице также описано, как подтолкнуть недостаточно часто вызывающего исполнителя и как ограничить число вызовов на стороне клиента, чтобы ограничить стоимость. Так что следите за частотой консультаций: запрашивайте её в подсказке, измеряйте и восстанавливайте уровень усилия исполнителя, если она обрушивается.
Когда это окупается по стоимости. Советник экономит деньги, когда несколько коротких консультаций, тарифицируемых по ставке советника, заменяют запуск модели советника на всю задачу. Это работает лучше всего, когда модель советника стоит значительно дороже модели исполнителя, поэтому самая экономичная конфигурация — передовой советник над исполнителем среднего уровня. Пара может держаться на уровне даже в верхней части диапазона, потому что совет также экономит токены исполнителя: исполнитель, которому подсказали правильный подход, исследует меньше тупиков, что может покрыть консультации.
На внутреннем бенчмарке агентного программирования11, запущенном с простым агентом на API, исполнитель Claude Opus 5 с советником Claude Fable 5 оказался самой точной из измеренных конфигураций: 85,7% решённых попыток за $8,40 за попытку. Он находится выше линии, проходящей через собственные настройки усилия каждой модели, но лишь на пункт-два выше лучшей из них (Opus в одиночку на настройке по умолчанию, 84,4% за $8,50, и Fable в одиночку на medium, 83,4% за $8,20), что один прогон не отделяет от шума. Fable в одиночку на уровне усилия medium достигает примерно той же точности, что и пара (83,4% против 85,7%), примерно за те же деньги ($8,20 против $8,40 за попытку):

Более раннее измерение через режим советника Claude Code дало тот же порядок. Читайте этот результат как форму, которую стоит проверить на вашей нагрузке, а не как экономию: в верхней части диапазона советник покупает немного точности по передовой цене, а случай экономии относится к парам с более широким разрывом в возможностях, таким как следующий случай чтения диаграмм. Цена в задержке — это сами консультации: около двух дополнительных вызовов передовой модели на задачу на этом бенчмарке, каждый на критическом пути задачи.
Когда это окупается вместо повышения усилия. Там, где разрыв в возможностях шире и точность нагрузки реагирует на усилие, исполнитель с низким усилием, консультирующийся с советником, может быть более дешёвым шагом вверх, чем повышение собственного усилия исполнителя, потому что советник оплачивается только на задачах, которым он нужен.
На Chartography13, публичном бенчмарке чтения диаграмм, запущенном на Claude Managed Agents с его советником, исполнитель Claude Opus 5 на уровне усилия low с советником Claude Fable 5 набрал 67,5 за $0,60 за задачу. Это выше линии, проходящей через собственные настройки усилия любой из моделей (Opus в одиночку поднялся с 49 до 75 между low и medium за $0,38 до $0,94), хотя собственные настройки исполнителя medium и по умолчанию всё ещё удерживают высшие баллы — по цене в 1,6 и 3,3 раза выше:

Исполнитель с низким усилием консультировался с советником по 86% задач — условие, которое пара на SWE-bench Pro не выполнила. Измерьте частоту консультаций в вашем цикле агента, прежде чем полагаться на эту конфигурацию.
Какой бы ни была пара, сначала оцените стоимость модели советника в одиночку на низком усилии; это базовый уровень, который нужно превзойти. Перепроверяйте при каждом выпуске модели, потому что выпуски сдвигают и разрыв в возможностях, и соотношение цен.
Когда это подходит. Стратегия советника подходит для нагрузок, где ходы в основном механические, но отличный план имеет значение: агенты программирования, использование компьютера и многошаговые исследовательские конвейеры. Она плохо подходит, когда каждый ход действительно требует передовых возможностей, когда планировать нечего (одноходовые вопросы и ответы) или когда ваш исполнитель уже близок по возможностям к советнику.
В стратегии оркестратора (orchestrator strategy) цикл ведёт передовая модель. Она декомпозирует задачу, раздаёт подзадачи более дешёвым моделям-работникам (workers) и объединяет их результаты. Собственная расшифровка оркестратора остаётся короткой, потому что работники поглощают насыщенное токенами исследование, так что большинство токенов тарифицируется по ставкам работников, а план и синтез по-прежнему исходят от передовой модели.
Чтобы построить её, используйте мультиагентную оркестрацию в Claude Managed Agents: настройте агента-координатора (оркестратора) и список агентов-работников, каждый со своей моделью. Полный рабочий пример с координатором Claude Fable 5 и работниками Claude Sonnet 5 см. в рецепте Claude Cookbook Паттерн координатора: большие модели для планирования, маленькие модели для исполнения.

Этот паттерн экономит реальное время, когда работники могут выполняться параллельно: на корпусном бенчмарке8 эпизод занял чуть больше 2 часов, когда координатор запускал документированный лимит платформы в 25 параллельных работников, по сравнению с 11,4 часа в одиночку. Деньги он экономил только в двух измеренных ситуациях. На работе, с которой одна модель могла справиться сама, та же модель на более низком усилии каждый раз оказывалась дешевле.
Случай 1: страховка от хвоста стоимости на рутинной работе. Передовая модель, работающая в одиночку, иногда зацикливается на рутинной задаче, которую обычно решила бы. Поскольку заранее нельзя сказать, какие это будут задачи, несколько таких прогонов доминируют в счёте. Координатор, передающий рутинную работу более дешёвому работнику, ограничивает этот хвост, потому что любое зацикливание теперь происходит по ставкам работника.
Anthropic измерила это на намеренно лёгком срезе BrowseComp4 (10 задач, которые одиночная модель надёжно решает; 50 делегированных и 70 одиночных прогонов). Координатор Claude Fable 5 с одним работником Claude Sonnet 5 стоил в среднем чуть меньше половины от Fable в одиночку и около трети на 90-м процентиле ($12 против $33), а единственный самый дорогой прогон одиночной модели, за $84, к тому же оказался неверным:

Делегирование окупилось на рутинной, обычно решаемой доле работы — вопреки интуиции, что работники нужны для сложных задач. На полном, более сложном наборе BrowseComp экономика перевернулась. Если у вашего трафика длинный хвост стоимости на рутинных задачах, это тот случай оркестратора, который стоит измерить первым.
Случай 2: работа больше одного контекстного окна. Одиночная модель должна обрабатывать такой большой вход последовательно, по одному контекстному окну (context window) за раз, платя за повторное чтение собственного состояния на каждом проходе. Работники читают каждый свой раздел, параллельно и по ставкам работников. Насыщенная чтением работа, которая всё же помещается в одно контекстное окно, — это задача выбора модели, а не делегирования: по одной лишь стоимости чтения оркестратор выигрывает только тогда, когда ни один контекст не может вместить работу.
Anthropic построила бенчмарк для этого случая8: корпус в 21,6 миллиона токенов из 14 публичных пакетов Python со 130 заложенными дефектами, слишком большой для любого контекстного окна. Снижение усилия не может помочь, потому что счёт — это само чтение корпуса: Claude Fable 5 в одиночку стоил от $720 до $764 за эпизод на каждой настройке усилия, и менялась только его точность. Конфигурация с координатором стоила более чем на 60% меньше любой из этих настроек и набрала на 2–6 пунктов меньше Fable на medium или по умолчанию, при этом безоговорочно превзойдя базовый уровень Claude Sonnet 5 в одиночку:

Учёт токенов показывает почему. Оба счёта — это в основном чтение корпуса, обслуживаемое из кэша: конфигурация с координатором прочитала около 570 миллионов кэшированных токенов за эпизод, почти втрое больше примерно 200 миллионов у одиночной модели, и всё равно стоила меньше половины, потому что её чтения тарифицировались по ставке чтения из кэша Claude Sonnet 5, а не Claude Fable 5. Fable 5 на усилии по умолчанию всё ещё удерживает пиковую точность — по цене в 2,8 раза выше конфигурации с координатором, так что делегирование здесь покупает большую часть точности, но не всю.
Когда делегирование не окупается. Оркестратор что-то покупает только тогда, когда есть массовая работа для передачи: много независимых частей, в идеале слишком много для одного контекстного окна. Когда работа — одна зависимая цепочка или помещается в один контекст, оркестратор платит за план, передачу и слияние, которые одиночная модель получает бесплатно. В каждом таком измеренном случае модель координатора в одиночку на более низком усилии выигрывала.
BrowseComp4 показывает границу внутри одного бенчмарка. Делегирование окупилось на рутинном срезе и проиграло на полном, более сложном наборе, где передовая модель в одиночку достигла точности конфигурации с координатором при стоимости на 22–30% ниже. Независимая внешняя работа сообщает о том же паттерне5. Если работа — одна цепочка, помещается в один контекст без длинного хвоста стоимости или одиночная модель на более низком усилии уже соответствует вашей планке, не стройте оркестратор.
Большинство случаев сводится к одному вопросу: делится ли работа на независимые части или это один ответ, достигаемый через цепочку зависимых шагов? Таблица стратегий сопоставляет два ответа с двумя стратегиями.
Если вы не уверены, пока ничего не стройте:
Мультимодельные результаты на этой странице оценивались в сравнении с той же моделью на более низком усилии и со следующей моделью ниже, работающей в одиночку. Это то сравнение, которое стоит провести на вашей собственной нагрузке, и поэтому первый шаг — прогон по уровням усилия.
Когда вы всё же добавляете советника, это определение инструмента, а не перестройка архитектуры.
Числа на этой странице относятся к июлю и августу 2026 года, по прейскурантным ценам того времени, и будут смещаться по мере изменения моделей и цен. Ваша частота эскалации, то, насколько чисто делятся задачи, и длина расшифровки тоже их сдвигают. Метод остаётся тем же:
usage каждого ответа по их собственным ставкам, суммируя по запросам задачи (Usage and Cost API сообщает агрегат).Следующий пример вычисляет стоимость одного запроса из шага 1 по прейскурантным ценам Claude Opus 5:
# Цены за миллион токенов со страницы цен; измените эти два значения для другой модели.
INPUT_PER_MTOK = 5.00 # Claude Opus 5
OUTPUT_PER_MTOK = 25.00
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-opus-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello, Claude"}],
)
usage = response.usage
cost = (
usage.input_tokens * INPUT_PER_MTOK
# Запись в кэш — 1,25x цены ввода (5-минутный кэш); чтение из кэша — 0,1x.
+ (usage.cache_creation_input_tokens or 0) * INPUT_PER_MTOK * 1.25
+ (usage.cache_read_input_tokens or 0) * INPUT_PER_MTOK * 0.10
+ usage.output_tokens * OUTPUT_PER_MTOK
) / 1_000_000
print(f"Request cost: ${cost:.6f}")В циклах агентов слагаемое чтения из кэша обычно самое большое из четырёх; если нет, проверьте, что кэширование задействовано. Когда включены инструмент советника или компактизация, некоторые токены сообщаются только в usage.iterations, а не в итогах верхнего уровня, поэтому суммируйте по usage.iterations, оценивая записи advisor_message по ставкам модели советника.
В следующей таблице перечислены рычаги в том порядке, в котором их стоит пробовать:
| Рычаг | Экономия в этих прогонах | Цена в качестве | Задержка | Где |
|---|---|---|---|---|
| Кэширование подсказок | Стоимость снижена в 2,5–3,7 раза на циклах агентов; 83% на прогоне триажа | Нет | Быстрее | Кэшируйте повторяющийся контекст |
| Обрезка входа | Ещё 5 процентных пунктов на прогоне триажа | Нет | Нейтрально | Обрезайте входные и контекстные токены |
| Компактизация | 38% на длинном прогоне триажа; ничего на коротких циклах | Не измерено | Нейтрально | Обрезайте входные и контекстные токены |
| Batch API | 50% | Нет | Результаты в течение 24 часов | Пакетируйте работу, которая может подождать |
| Аудит подсказок под текущую модель | 14% на обеих измеренных миграциях | Нет; выигрыш на одной | Быстрее (меньше раундов инструментов) | Проверяйте подсказки под текущую модель |
| Более низкое усилие | Интеллектуальная работа: medium 15–30%, low от трети до половины; длинное программирование: medium около половины, low около трёх четвертей | 1–3 пункта на интеллектуальной работе, 2–8 на длинном программировании | Быстрее | Настраивайте усилие |
| Перезапуск неудач | Около половины при той же доле прохождения | Нет | Два прогона на задачах, которые не проходят | Перезапускайте неудачи на более высоком усилии |
| Бюджет задачи | 18–47% | 3–4 пункта | Быстрее | Задавайте бюджеты и лимиты вывода |
Повышение max_tokens | Нет на решённую задачу, но больше решённых задач | Выигрыш 2–18 пунктов | Нейтрально | Задавайте бюджеты и лимиты вывода |
| Советник | Зависит от разрыва в возможностях и частоты консультаций; пара для чтения диаграмм набрала выше кривых усилия обеих моделей, пара для программирования — лишь незначительно | Небольшой выигрыш | Около двух дополнительных вызовов на задачу | Стратегия советника |
| Оркестратор | Более чем на 60% ниже передовой модели за пределами одного контекстного окна; около половины на рутинных хвостах | На 2–6 пунктов ниже передовой модели | Намного быстрее на больших входах | Стратегия оркестратора |
Все измерения — внутренние прогоны этих бенчмарков в Anthropic. Если не указано иное, стоимость приведена в долларах США по прейскурантным ценам августа 2026 года; цифры для Claude Sonnet 5 используют $2 и $10 за миллион входных и выходных токенов. Диаграммы с пометкой «notional USD» (условные доллары США) оценивают счётчики токенов каждого запроса по этим ставкам, а не сообщают счета.
low, затем по умолчанию на его неудачах — решено от 92,5% до 93,6% по парам прогонов примерно за $0,70; сначала medium — от 93,8% до 94,2% примерно за $0,95; перезапуск по умолчанию на собственных неудачах — 94,0% за $1,58; всё по умолчанию — от 90,9% до 92,5% за $1,39. Пары с исполнителем Claude Sonnet 5 на диаграмме советника получены из той же серии августа 2026 года на этом подмножестве: пара Sonnet плюс Opus запускалась дважды (прогон и точная репликация), а пара с низким усилием — один раз; цифры бюджета задачи — один прогон на бюджет на том же подмножестве. Цифра Claude Fable 5 в разделе Сравнение моделей — одиночный прогон июля 2026 года, он же базовый уровень без бюджета на диаграмме бюджета задачи; каждый прогон с бюджетом завершил все 482 задачи без ошибок обвязки.low и medium; пара в среднем давала около двух консультаций советника на попытку; стоимость указана за попытку. Цифры Claude Code — прогоны июля 2026 года тех же задач, один прогон на конфигурацию, стоимость приблизительная.Самый большой бесплатный выигрыш на этой странице: настройка, сроки жизни и диагностика.
Обменивайте интеллект на задержку и стоимость в рамках одной модели.
Оцените возможности, скорость и стоимость по всему семейству моделей Claude.
Дайте циклам агентов обратный отсчёт токенов, по которому они саморегулируются.
Установите жёсткий долларовый лимит на сессию Managed Agents.
Смотрите текущие цены за токен для каждой модели Claude.
Применяйте эти рычаги по одному к работающему агенту в запускаемом ноутбуке, со стоимостью за задачу после каждого шага.
Посмотрите разбор Claude Fable 5 и паттернов советника и оркестратора.
Was this page helpful?