Оптимизация стоимости и интеллекта
Балансируйте стоимость и интеллект на Claude Platform, опираясь на измеренные результаты для кэширования подсказок, усилия, выбора модели, бюджетов и мультимодельных стратегий.
Когда рабочая нагрузка переходит от прототипа к продакшену, стоимость становится первостепенным ограничением проектирования. Самая способная модель может оказаться слишком дорогой в масштабе, а самая дешёвая модель может не дотягивать по качеству. Грамотное управление стоимостью означает понимание того, как каждый рычаг стоимости влияет на качество вывода, потому что одни рычаги обмениваются на качество, а другие нет. Claude Platform даёт вам прямой контроль над этим компромиссом. Вы выбираете модель, уровень «effort» (усилия) и архитектуру для каждого запроса, что позволяет разместить рабочую нагрузку практически в любой точке границы «стоимость — интеллект».
Стоимость и интеллект обычно изображают как границу, на которой одно покупается за другое. Первая группа рычагов на этой странице приближает рабочую нагрузку к этой границе, сокращая стоимость без ущерба для качества; только вторая группа перемещает вдоль неё:

Рычаги бывают двух видов:
- Бесплатные выигрыши сокращают расходы, не затрагивая качество: «prompt caching» (кэширование подсказок), гигиена токенов, аудит подсказок относительно модели, которую вы используете, пакетная обработка со скидкой 50% для работы, которая может подождать до 24 часов, и лимиты расходов рабочего пространства в качестве страховки.
- Компромиссы обменивают стоимость на интеллект: выбор модели, усилие, ограничения вывода и бюджеты задач, а также мультимодельные архитектуры.
Каждый рычаг сопровождается измеренными результатами и правилом, когда он окупается. В измерениях Anthropic кэширование подсказок оказалось крупнейшим рычагом с большим отрывом: оно сократило стоимость агентного цикла в 2,7–5,3 раза на бенчмарках этого руководства и сократило счёт небольшого агента сортировки обращений на 83%, или на 88% с добавлением обрезки входных данных. Мультимодельные рычаги уже; вторая модель окупалась в двух формах — советник и оркестратор.
Начните здесь
Сопоставьте вашу ситуацию со строкой.
| Ваша ситуация | Сделайте это | Где |
|---|---|---|
| Любая рабочая нагрузка, любая модель | Включите кэширование подсказок и обрежьте ненужные токены; и то и другое бесплатно | Кэшируйте повторяющийся контекст · Обрежьте токены |
| Человек ждёт между ходами | Используйте 1-часовую длительность кэша, как только примерно 1 ход из 20 следует за паузой от 5 минут до часа и лишь немногие промежутки превышают час. На Claude Fable 5.1 поддерживайте 5-минутный кэш тёплым, пока паузы длятся минуты, и покупайте 1-часовую длительность, когда паузы приближаются к часу | Выберите длительность кэша |
| Расходы слишком высоки; качество в порядке | Понижайте усилие на вашей текущей модели | Настройте усилие |
| Вы не на последней модели | Обновитесь; текущая модель решает больше задач при стоимости за решённую задачу от примерно на 40% ниже до примерно на 20% выше | Обновите модель |
| Вы выбираете или меняете модели | Сравнивайте по стоимости за выполненную задачу, а не за токен | Сравните модели |
| Качество недостаточно хорошее | Если вы понизили усилие, восстановите его; иначе попробуйте следующий уровень выше при усилии low | Настройте усилие · Сравните модели |
Попытки заканчиваются с stop_reason: max_tokens | Поднимите max_tokens; 64 000 покрыли все, кроме 2 из 14 000 ходов, измеренных при усилии по умолчанию, а 128 000 не стоили ничего дополнительно за решённую задачу | Установите бюджеты |
| Вы можете проверять выводы (тесты, верификатор) | Запускайте всё при низком усилии и перезапускайте неудачи при значении по умолчанию (high); на измеренном бенчмарке кодирования доля прохождения сохранилась примерно при половине стоимости | Перезапустите неудачи |
| Агентные циклы с несколькими очень дорогими запусками | Установите бюджет задачи (бета; проверьте таблицу поддержки, для каких моделей), бюджет сессии Claude Managed Agents и лимит расходов рабочего пространства | Установите бюджеты |
| Более дешёвая модель застревает только на трудных решениях | Добавьте передового советника. Он окупается, когда его цена значительно выше исполнителя и к нему действительно обращаются, поэтому сначала оцените модель советника отдельно при низком усилии и измерьте частоту обращений | Стратегия советника |
| Работа превышает одно контекстное окно | Делегируйте разделы более дешёвым исполнителям | Стратегия оркестратора |
Эти результаты являются внутренними для Anthropic (Упомянутые бенчмарки) и ориентировочными, а не гарантиями, поэтому измеряйте на собственной рабочей нагрузке с помощью четырёхшагового метода.
Сократите расходы без потери качества
Кэширование подсказок, гигиена токенов, пакетная обработка и аудит подсказок относительно вашей текущей модели — всё это снижает то, что вы платите, не снижая качества вывода. Действуют две оговорки: пакетная обработка обменивает задержку на свою скидку, а редактирование контекста, рычаг гигиены токенов, стоило больше, чем сэкономило, в запуске, измеренном в этом разделе.
Кэшируйте повторяющийся контекст
Почему кэширование идёт первым
Включите кэширование подсказок раньше любого другого рычага, потому что каждый ход агентной задачи повторно отправляет весь растущий разговор: «system prompt» (системную подсказку), определения инструментов и каждый предыдущий ход. Задача из 40 ходов отправляет свой первый ход 40 раз, поэтому стоимость задачи растёт примерно как квадрат числа ходов. Кэширование не прекращает повторную отправку, но каждая повторная отправка стоит примерно в десять раз меньше и обрабатывается быстрее: префикс тарифицируется по ставке чтения из кэша, десятой части цены ввода, и каждый ход платит ставку записи в кэш 1,25x только за то, что ново.
Как выглядит хороший результат. За полный день реального трафика агентные циклы читали медианно 84% своего ввода из кэша, а верхние 10% обвязок, для кодирования или нет, читали 94% или больше17. Глубоко в задаче хорошо построенный цикл платит полную цену менее чем за 1% своего ввода. Ниже примерно 80% ищите что-то, что ломает кэш (см. Что ломает кэш).
Во всех измеренных запусках Anthropic чтения из кэша регулярно являются крупнейшей отдельной составляющей стоимости задачи, что делает кэширование более ценным, чем большинство решений о выборе модели. Anthropic оценила запуски DeepResearch Bench II7 с кэшированием и без него:

Время жизни кэша по умолчанию — 5 минут, а ходы агентного цикла разделены секундами, поэтому скидка применяется к большинству токенов на каждом ходу. Запуски на диаграмме кэширования читали от 79% до 90% своих входных токенов из кэша. Экономия варьируется в зависимости от глубины эпизода, потому что более короткие циклы перечитывают меньше, но кэширование оставалось крупнейшим отдельным рычагом на каждой измеренной модели и бенчмарке.
Выберите длительность кэша
Если ваш цикл ждёт человека между ходами, используйте 1-часовую длительность кэша. Запись в неё стоит дороже (2x цены ввода вместо 1,25x). Промах при любой длительности тарифицирует весь префикс по цене записи вместо цены чтения, поэтому более длинная длительность окупается, как только несколько ходов за сессию следуют за паузой от 5 минут до часа.
Чтобы решить, посчитайте промежутки между последовательными запросами в разговоре:
- Более чем примерно 1 промежуток из 20 попадает между 5 минутами и часом, а промежутки более часа редки: используйте 1-часовую длительность.
- Ходы приходят с интервалом в секунды: оставайтесь на 5-минутном значении по умолчанию. Когда ничего не приостанавливалось, оно стоило на 15% меньше, чем 1-часовая настройка, на Claude Sonnet 5 и на 11% меньше на Claude Opus 5.
- Промежутки более часа обычны: оставайтесь на значении по умолчанию. Промежуток более часа истекает для обеих длительностей, и 1-часовая настройка затем перезаписывает префикс по своей более высокой цене записи, поэтому она проигрывает на каждом из таких промежутков. Если из ваших пауз длиннее 5 минут примерно 60% или более также превышают час, оставайтесь на значении по умолчанию; 1-часовая длительность окупается только тогда, когда по крайней мере около 40% длинных пауз заканчиваются в пределах часа.
Anthropic измерила задачу сортировки обращений из раздела Обрежьте входные и контекстные токены с паузами, вставленными перед некоторыми ходами для имитации задержки человека16. На обеих измеренных моделях 1-часовой кэш становился более дешёвой настройкой, как только примерно 1 ход из 30 следовал за паузой, так что правило 1 из 20 оставляет запас, и разрыв быстро расширяется после точки пересечения, потому что каждый ход после паузы на 5-минутной настройке перезаписывает весь префикс. Каждая текущая модель использует одни и те же множители записи в кэш, и каждая модель, кроме Claude Fable 5.1 и Claude Mythos 5.1, — одну и ту же цену чтения, поэтому точка пересечения находится в том же диапазоне на других моделях; Fable 5.1 — случай, рассматриваемый далее. Точность оставалась в пределах шума между запусками в каждой ячейке. Ход после паузы сохранял свою задержку тёплого кэша на 1-часовой настройке. Следующая диаграмма показывает стоимость за сессию в зависимости от доли ходов после паузы на Claude Sonnet 5:

Anthropic также измерила дополнительные запросы, которые поддерживают 5-минутный кэш тёплым. На Claude Sonnet 5 и Claude Opus 5 они не сэкономили ничего измеримого по сравнению с 1-часовой длительностью при любой доле ходов после паузы и стоили больше при паузе перед каждым ходом, поэтому используйте длительность вместо них.
На Claude Fable 5.1 самая дешёвая настройка другая. Её чтение из кэша стоит 0,025x цены ввода ($0,25 за миллион токенов), тогда как её записи в кэш сохраняют стандартные множители, поэтому поддерживающий запрос, который перечитывает префикс, дёшев, а надбавка за запись 1-часовой длительности — больший счёт. Anthropic измерила задачу сортировки на Claude Fable 5.1 с теми же тремя настройками19. Поддержание 5-минутного кэша тёплым стоило на 13–20% меньше за сессию, чем 1-часовой кэш, всякий раз, когда паузы длились минуты; только при паузах около 45 минут 1-часовой кэш выигрывал, примерно на 12 центов за сессию. На Claude Fable 5.1 поддерживайте 5-минутный кэш тёплым, пока человек отсутствует минуты, и покупайте 1-часовую длительность, когда паузы приближаются к часу:

Чтобы поддерживать кэш тёплым, отправьте предыдущий запрос снова с max_tokens, установленным в 0, в течение 4 минут от начала предыдущего запроса и каждые 4 минуты после этого, убрав stream, если он был установлен. Отсчитывайте от начала запроса, а не от конца его ответа: 5-минутное время жизни кэша отсчитывается от начала запроса, который записал или обновил запись, поэтому время, потраченное ответом на генерацию, засчитывается в него. Это запрос предварительного прогрева: он обновляет время жизни кэша, ничего не генерирует и тарифицирует только чтение из кэша. Не меняйте ни байта префикса и не используйте max_tokens: 1, который сэмплирует токен без причины. Повторно отправляйте заголовки запроса, а не только его тело: если ваши запросы несут заголовок anthropic-beta (скажем, для бюджета задачи), поддерживающему запросу нужен тот же заголовок, иначе поля, закрытые бета-доступом, в воспроизводимом теле будут отклонены. Запрос с max_tokens: 0 отклоняется, когда запрос устанавливает thinking.type: "enabled" (адаптивное мышление по умолчанию на Claude Fable 5.1 подходит), структурированные выводы или принудительный выбор инструмента (его ограничения); на таких рабочих нагрузках покупайте вместо этого 1-часовую длительность.
# В течение 4 минут с начала последнего запроса (время генерации засчитывается
# в срок жизни кэша) повторно отправьте этот запрос с max_tokens, равным
# 0, убрав stream (запрос с max_tokens: 0 не поддерживает потоковую передачу). Отправьте те же
# заголовки, что и в исходном запросе, включая любой заголовок anthropic-beta.
jq '.max_tokens = 0 | del(.stream)' last_request.json | \
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
--data-binary @-Включите кэширование
Настройка требует мало работы. Автоматическое кэширование расставляет точки разрыва за вас; в противном случае навык Claude API, поставляемый с Claude Code, может добавить кэширование в существующую интеграцию по одной подсказке. Следующий фрагмент показывает, как навык добавляет его в обвязку, которая произвела эти измерения:
$ claude
> /claude-api add prompt caching to this integration
Done. Prompt caching is now wired into the harness. Two changes:
- build_system() now adds cache_control: {"type": "ephemeral"} to the
system block. Since the API renders tools -> system -> messages, this
one breakpoint caches the entire static prefix -- the full tool array
plus the system prompt.
- apply_moving_cache_breakpoints() strips any stale markers, then marks
the last content block of the two most recent user turns. The older
marker is the read point matching the prefix the previous request
cached; the newer one extends the cache for the next request.
That's 3 breakpoints total, under the limit of 4.
...Эти размещения точек разрыва следуют стандартному шаблону из раздела Явные точки разрыва кэша.
Что ломает кэш
Несколько вещей могут сломать ваш кэш во время задачи. Всё, что меняется от запроса к запросу, например метка времени или позиция в очереди, размещённое перед стабильным префиксом, превращает каждый запрос в полную запись в кэш: на запуске сортировки из раздела Обрежьте входные и контекстные токены 25-токенная строка статуса в начале системной подсказки стоила $4,24 за запуск вместо $0,59 — больше, чем запуск с выключенным кэшированием. Держите текст, меняющийся от запроса к запросу, в самом новом ходе пользователя.
Кэш — это побайтово точное совпадение префикса по запросу в порядке (инструменты, затем системная подсказка, затем сообщения), поэтому изменение в любом месте делает недействительным всё после него. Изменение effort или конфигурации мышления между запросами делает кэш недействительным с этой точки и далее, а на некоторых моделях также инструменты и системную подсказку перед ней; любая правка системной подсказки делает кэш недействительным с этой точки и далее; установка или изменение формата вывода делает кэш недействительным для всего разговора; добавление, удаление или изменение порядка определения инструмента делает недействительным всё. Страница кэширования подсказок перечисляет эти случаи, кроме формата вывода, который описан в разделе структурированные выводы. На самых последних моделях меняйте инструкции с помощью системного сообщения в середине разговора, сообщения {"role": "system"}, добавленного в messages, вместо редактирования поля верхнего уровня system: кэшированный префикс остаётся нетронутым. Проверьте на той странице, какие модели это поддерживают. На моделях, которые это поддерживают, изменение усилия для отдельного сообщения также оставляет кэшированный префикс нетронутым. Ставки наиболее высоки на Claude Fable 5.1 и Claude Mythos 5.1: поломка перезаписывает префикс по 1,25x цены ввода вместо чтения по 0,025x, поэтому на префиксе в 100 000 токенов один сломанный ход стоит $1,25 вместо $0,03, в 50 раз больше чтения, против 12,5 раз ($0,63 вместо $0,05) на Claude Opus 5.
Anthropic измерила это на длинных сессиях агента сортировки18. Изменение усилия и добавленный инструмент, сделанные в середине сессии, перезаписали 39 000 и 60 000 кэшированных токенов, и эти сессии стоили $0,95 за сессию. Те же два изменения на первом запросе после компактизации стоили $0,75, а на запросе, который вызвал компактизацию, — $0,92, потому что проход суммаризации компактизации затем повторно обработал контекст в 81 000 токенов по цене записи в кэш: этот проход суммаризации стоил $0,21 против $0,04, когда те же изменения пришли на один запрос позже, при точности в пределах шума между запусками в каждой ветви:

Изменение бюджета задачи на полпути делает недействительным любой кэшированный префикс, содержащий значение бюджета, поэтому устанавливайте его один раз, на первом запросе. Каждый проход редактирования контекста делает префикс недействительным с точки, которую он очищает, и следующий запрос платит за повторное кэширование всего после неё, поэтому очищайте несколькими большими партиями, а не многими маленькими. На Claude Fable 5.1 и Claude Mythos 5.1 каждое из этих действий стоит в 50 раз больше цены чтения за токен, поэтому там они важнее всего. Делайте каждое изменение, ломающее кэш, на естественных границах, затем убедитесь, что чтения из кэша не упали; если упали, диагностика кэша показывает, где префикс разошёлся.
Обрежьте входные и контекстные токены
Большинство агентных запросов несут токены, которые никогда не влияют на ответ. Их обрезка редко стоит качества вывода, хотя не каждый рычаг здесь экономил деньги при измерении. Два места, куда стоит посмотреть:
- Обрезка ввода. Динамическая фильтрация в инструменте web fetch не пускает шаблонный текст из загруженных страниц, изменение размера изображений подбирает правильный размер для визуальных входных данных, а поиск инструментов с отложенной загрузкой загружает определения инструментов только при необходимости (измерено далее в этом разделе). Программный вызов инструментов позволяет Claude выполнять несколько вызовов инструментов из кода, так что в контекст попадает только отфильтрованный результат; его документация сообщает о 24% меньшем количестве входных токенов на бенчмарках агентного поиска при более высоком балле. Раздел Управление контекстом инструментов сравнивает поиск инструментов, программный вызов инструментов, кэширование подсказок и редактирование контекста.
- Жизненный цикл контекста. Редактирование контекста очищает устаревшие результаты инструментов, а автоматическая компактизация с её порогом не даёт длинным циклам тащить всю свою историю вперёд.
Рычаги взаимодействуют с кэшем и друг с другом, поэтому оценивайте их по чистому эффекту и используйте диагностику кэша, чтобы убедиться, что ваш кэшированный префикс переживает каждое изменение. Anthropic измерила их на агенте сортировки issue, обрабатывающем 20 реальных отчётов об ошибках со скриншотами из публичного репозитория, и на более длинном варианте той же задачи с в 2,6 раза большим количеством токенов. При включённом кэшировании обрезка ввода (изменение размера изображений и поиск инструментов) сняла ещё 26% с короткого запуска и 21% с длинного.
Отложите неиспользуемые определения инструментов
Каждое определение инструмента, прикреплённое к запросу, является вводом на каждом ходу, а несколько серверов MCP в сумме дают сотни таких определений. Anthropic запустила агента сортировки с его собственными двумя инструментами плюс каталогом реальных определений инструментов с публичных серверов MCP, всего до 502 инструментов, загружая их все или помечая дополнительные как defer_loading за поиском инструментов:

При каждом загруженном определении стоимость запуска почти удвоилась по мере роста каталога, следуя за токенами схем в каждом запросе. С поиском инструментов она оставалась ровной при любом размере каталога, на 45% меньше при 502 инструментах. Точность составляла от 15 до 18 из 20 в каждой ячейке в обоих случаях, и модель ни разу не вызвала неправильный инструмент, так что в этом масштабе каталог стоит денег, а не корректности. То же верно для инструментов, приходящих через коннектор MCP: при подключённом публичном сервере GitHub MCP откладывание его набора инструментов (default_config: {defer_loading: true}) сократило запуск на 20% при той же точности.
Держите файлы данных вне подсказки
Когда модели нужно вычислять по таблице, загрузите её с помощью Files API и позвольте модели запрашивать её с помощью выполнения кода вместо вставки в подсказку. Anthropic задала 25 агрегатных вопросов15 (суммы, отфильтрованные подсчёты, группировки и фильтр по дате) по публичному CSV из 1862 строк, с ответами, вычисленными pandas:

Вставленная в подсказку, таблица составляет около 91 000 входных токенов на каждом запросе, и Claude Sonnet 5 правильно ответил на 6 из 25 вопросов. Загруженная, с выполнением кода, — он ответил на все 25, и запуск стоил примерно в двенадцать раз меньше. Claude Opus 5 показал ту же картину.
Управляйте жизненным циклом контекста
Рычаги контекста окупаются только на сессии, достаточно длинной, чтобы в них нуждаться:

На запуске из 20 issue они ничего не сэкономили, а редактирование контекста стоило на 74% больше. На длинном запуске обрезка сэкономила 39%, а компактизация 32%, тогда как редактирование контекста ничего не изменило. Обрезка — это несколько строк, которые вы пишете сами: на каждой границе задачи заменяйте большие устаревшие результаты инструментов однострочной выдержкой. Она хорошо кэшируется, потому что правки находятся в хвосте разговора, куда следующая задача всё равно добавляет новое содержимое: 89% чтений из кэша на первом запросе после границы и 81% на запросах между границами. В масштабе всего запуска обрезка и редактирование контекста кэшируются примерно одинаково хорошо. Обрезка дешевле, потому что редактирование контекста перезаписывает в середине задачи содержимое, которое обрезка удаляет (около двух третей разрыва), и потому что она держит контекст примерно вдвое меньшим (оставшаяся треть). Если вы используете редактирование контекста, очищайте несколькими большими партиями. Обрезка, адаптированная из обвязки:
import re
PRUNED = "[pruned at issue boundary]"
def prune_task_boundary(messages, tool_name_by_id, threshold=2000):
"""Call once per task boundary. Replaces large, stale search results with a one-line extract."""
for message in messages:
if message["role"] != "user" or not isinstance(message["content"], list):
continue
for block in message["content"]:
if not (isinstance(block, dict) and block.get("type") == "tool_result"):
continue
if tool_name_by_id.get(block.get("tool_use_id")) != "search_issues":
continue
result_text = block.get("content")
if not isinstance(result_text, str) or len(result_text) <= threshold:
continue
if result_text.startswith(PRUNED):
continue # already pruned on an earlier boundary
# ограничиваем однострочные результаты, чтобы выдержка оставалась короткой
first_line = result_text.split("\n", 1)[0].strip()[:200]
refs = re.findall(r"#(\d+)", result_text)[:5]
extract = f"{PRUNED} {first_line}"
if refs:
extract += " kept refs: " + " ".join("#" + r for r in refs)
block["content"] = extractПакетируйте работу, которая может подождать
Batch API снимает 50% с каждого токена запроса, включая кэшированные, в обмен на то, что результаты приходят в любое время в течение 24 часов. Направляйте каждый запрос, которого никто не ждёт, через пакет, а интерактивный путь оставьте для остального. Пакетирование — второй по величине бесплатный рычаг после кэширования для агентной работы без присмотра: оценочные запуски, дозаполнения и запланированные задания, такие как регулярный запуск агента сортировки issue из измерения обрезки токенов. Оно сочетается со всем на этой странице, кроме интерактивности, но недоступно для сессий Claude Managed Agents, которые интерактивны по замыслу (см. цены Claude Managed Agents).
Проведите аудит подсказок относительно текущей модели
Каждое поколение моделей реагирует на подсказки по-разному, поэтому подсказка накапливает текст, написанный для модели, которую вы больше не используете. Обычный случай — чрезмерно конкретная инструкция, добавленная для компенсации более старой модели: «проверь дважды», «будь максимально тщательным», обязательная пошаговая процедура или самодельный черновик для рассуждений. Более новая модель следует им буквально, производя дополнительные раунды инструментов и дополнительный текст, так что счёт растёт без выигрыша в точности. Аудит подсказок относительно модели, которую вы используете сейчас, и снова при каждой смене модели — это бесплатный выигрыш.
Аудит — это одна команда. Навык Claude API, поставляемый с Claude Code, имеет команду prompt-audit, которая читает подсказки и код запросов проекта и сообщает, что было написано для другой модели. Этот сокращённый фрагмент показывает её запуск на подсказке службы поддержки и коде запросов, содержащих эти шаблоны:
$ claude
> /claude-api prompt-audit
10 findings. The three that matter most:
1. budget_tokens returns a 400 on Opus 5 (support_agent.py:10). This code
does not run against its own target model. Everything else here is
quality; this one is an outage.
2. The prompt contains two live contradictions. Line 15 says confirm before
every refund, line 17 says process every eligible refund immediately.
Line 19 asks for a complete recap *and* a three-sentence maximum.
3. The reasoning scaffold and the 6-step script fight the model rather than
steer it. <scratchpad> + "reason step by step" is now a request
parameter, not prose; the mandatory 6-step procedure plus "investigate
fully even when the ticket looks simple" forces four tool calls on a
"where's my package" ticket.
...
-After any refund or escalation, verify twice before submitting: re-fetch
-the order, re-check every figure in your reply against the fresh lookup,
-and review the reply a second time for errors.
+Before submitting a refund or an escalation, re-fetch the order and confirm
+every figure in your reply matches the fresh lookup.Затем команда предлагает свои правки в виде diff (показан один фрагмент) и перечисляет, что она намеренно оставила нетронутым: окно возврата средств, требование к тону и планку качества. Вы проверяете патч, а не переписанный текст.
Эффект измерим. На оценке службы поддержки14 подсказки, написанные для Claude Opus 4.8, стоили на 36% больше за тикет на Claude Opus 5 без изменения точности. Запуск аудита по тем же подсказкам сделал Opus 5 и дешевле неаудированной версии (на 14%), и точнее (97% тикетов против 92%, выигрыш за пределами шума). При миграции с Claude Sonnet 4.6 на Claude Sonnet 5 аудит снял 14% при той же точности:

Два вида устаревшего текста имеют разную цену. Инструкции, которым новая модель следует слишком буквально, стоят денег: удаление «проверь дважды» сократило стоимость Opus 5 за тикет на треть, а удаление «будь максимально тщательным» — почти на столько же. Текст, который больше не подходит модели, вместо этого стоит точности: устаревшая настройка мышления, противоречивые правила и самодельный черновик, конфликтующий с собственным мышлением модели, каждый восстановил от 7 до 11 пунктов на Opus 5 при удалении:

Те же шаблоны, как правило, появляются в описаниях инструментов и навыках, которые тоже стоит проверить.
Обменивайте стоимость на интеллект
Эти рычаги определяют, где одна модель находится между стоимостью и интеллектом: выбор модели, усилие, перезапуск неудач при более высокой настройке, а также бюджеты и ограничения, в рамках которых она работает. Начните с перебора усилия на вашей текущей модели (Настройте усилие). От самой низкой к самой высокой стоимости и способности текущие модели — это Claude Haiku 4.5, Claude Sonnet 5, Claude Opus 5 и Claude Fable 5.1 (передовая модель); в Обзоре моделей есть полная линейка и цены.
Сравнивайте модели по стоимости за задачу
Прайс-листы написаны за токен, и за токен передовая модель выглядит дорогой: цена за токен Claude Fable 5.1 в несколько раз выше, чем у Claude Sonnet 5. Однако вы платите за выполненные задачи, поэтому сравнивайте модели по стоимости за выполненную задачу. Более способная модель завершает задачу с меньшим объёмом работы: меньше ходов, меньше поиска, меньше перечитывания собственного контекста и меньше возвратов назад. Надбавка за токен часто перекрывается тем, что всего делается меньше.
Anthropic измерила это на подмножестве SWE-bench Pro3, оценённом так, как выставляется счёт клиенту:

Claude Fable 5.1 при усилии low решил 88,6% задач за $0,54 за решённую задачу против 77,4% за $0,84 у Claude Sonnet 5 при его значении по умолчанию: на 11 пунктов больше за 35% меньше за решённую задачу, несмотря на цену за токен в пять раз выше. Однако он не всегда выигрывает. На том же подмножестве, которое обе модели в значительной степени насыщают и чьи баллы несопоставимы с публичной таблицей лидеров, Claude Opus 5 в одиночку сравнялся с Claude Fable 5.1 в одиночку при значении по умолчанию (91,7% по сравнению с 92,1%, в пределах шума между запусками) примерно на 15% дешевле за решённую задачу ($1,01 против $1,19), а Opus 5 при low решил 84,0% за $0,25. А на длинных исследовательских циклах передовая модель делает больше работы, а не меньше: на DeepResearch Bench II7 Fable 5.1 при low набрал на 10 пунктов выше Sonnet 5 (66% против 56%) примерно при четырёхкратной стоимости за задачу ($4,66 против $1,20), потому что он выполняет более длинный исследовательский цикл по большему контексту. Claude Opus 5 при своём значении по умолчанию набрал 71% на той же основе за $6,71 за задачу, выше Fable 5.1 при его значении по умолчанию (65% за $7,12), так что и в исследованиях Fable 5.1 оправдывает свою цену только при low.
Для большинства агентных рабочих нагрузок начните с Claude Fable 5.1 при усилии low и повышайте усилие там, где он промахивается. За токен он стоит вдвое больше, чем Claude Opus 5, на некэшированном вводе, но вдвое меньше на кэшированном вводе ($0,25 против $0,50 за миллион), а в агентном цикле кэшированный ввод — крупнейшее слагаемое. На бенчмарке кодирования из раздела Стратегия советника Fable 5.1 при medium сравнялся с Opus 5 при его значении по умолчанию примерно за треть стоимости за попытку ($2,91 против $8,50). На Chartography13, бенчмарке чтения диаграмм, Fable 5.1 при low набрал 62,5 за $0,15 за диаграмму по сравнению с 49 за $0,38 у Opus 5 при low. На подмножестве SWE-bench Pro Claude Opus 5 при своём значении по умолчанию остаётся более дешёвым путём к высшему баллу, как отмечено ранее. На другом конце Claude Haiku 4.5 отвечал на вопросы GPQA Diamond9 примерно за десятую часть стоимости Opus 5 за вопрос, с точностью 63% по сравнению с 92% у Opus, и отставал гораздо сильнее на длинных задачах кодирования. Он подходит для высокообъёмной работы с проверяемыми выводами, а не для длинных агентных циклов.
Ранжирование переворачивается в зависимости от рабочей нагрузки, и никакой прайс-лист не скажет вам, в какую сторону. Оценивайте каждого кандидата по стоимости за выполненную задачу на собственном трафике, включая Claude Opus 5 и передовую модель при сниженном усилии.
Оценивайте хвост вашей рабочей нагрузки, а не медиану: сравнивайте модели на самой трудной десятой части ваших задач, а не на типичной. На типичной задаче каждая модель выглядит похоже, и самая дешёвая выглядит лучшей, но счёт определяется задачами, которые более дешёвая модель проваливает, потому что проваленная задача всё равно тарифицирует свои токены, затем повторную попытку, затем всё, чего провал стоит дальше по цепочке. Хвост — это также то, куда уходят деньги, даже когда ничего не проваливается. На запуске WideSearch1 из 20 задач две задачи несли 43% расходов:

Мультимодельные стратегии существуют, чтобы тратить передовой интеллект на этот хвост, не платя передовые ставки за остальное.
Обновите модель
Если вы отстаёте на модель или две, самый дешёвый рычаг — строка модели. Anthropic прогнала недавние модели Claude Opus, Claude Sonnet и Claude Fable через одну и ту же обвязку на подмножестве SWE-bench Pro3, каждую при её поставляемых значениях по умолчанию и по ценам прайс-листа, и прогнала линейку Opus снова на Terminal-Bench 320:

Anthropic оценивает линейку Opus одинаково за токен во всех версиях, поэтому любая разница происходит от того, сколько работы каждая модель делает за задачу: при оценке так, как выставляется счёт клиенту, Claude Opus 4.8 решает ту же долю задач, что и Claude Opus 4.7, на 14% дешевле за решённую задачу, а Claude Opus 5 затем решает на 12 пунктов больше задач на 21% дороже за решённую задачу. Claude Opus 5 при усилии low превосходит значение по умолчанию Opus 4.8 на этом бенчмарке примерно за 30% его стоимости за решённую задачу, так что самое дешёвое обновление — новая модель при более низкой настройке. Экономия Sonnet 5 происходит от его более низкой цены за токен, которая более чем компенсирует дополнительные токены, которые он использует за задачу по сравнению с Sonnet 4.6: на 15% меньше за решённую задачу при 5 дополнительных пунктах. Передовой уровень выиграл так же: Claude Fable 5.1 соответствует баллу Claude Fable 5 на 43% дешевле за решённую задачу, в основном за счёт более низкой цены чтения из кэша. Это направление не гарантировано: на DeepResearch Bench II7 то же обновление стоит на 41% больше за задачу при high (на 79% больше при low) за свои 2–3 дополнительных пункта на задачах, чистых в каждой ветви (ссылка 7), потому что новая модель делает там больше работы за задачу. Цены ввода и вывода те же, а чтение из кэша в 4 раза дешевле, поэтому измерьте обновление на собственной рабочей нагрузке, прежде чем предполагать, что оно экономит.
На более трудной работе разрыв расширяется. На Terminal-Bench 320, где задачи достаточно трудны, чтобы счёт определяла доля прохождения, а не токены, Claude Opus 4.7, Opus 4.8 и Opus 5 каждый тратят от $8 до $15 за задачу, но решают 7%, 15% и 41% задач, так что стоимость за решённую задачу падает с $183 до $63 до $28 вверх по лестнице. Надбавка в 21%, которую Claude Opus 5 несёт над Opus 4.8 на насыщенном подмножестве кодирования, становится экономией в 56% на Terminal-Bench 3, где более старая модель в основном проваливается: чем больше ваша рабочая нагрузка побеждает старую модель, тем больше обновление экономит за результат.
Сравнивайте по стоимости за решённую задачу, а не за токен: тот же текст стоит примерно на 30% больше токенов на Claude Opus 4.7 и более поздних, поэтому сравнение за токен делает более новые модели дороже по построению.
Настройка усилия
«Effort» (усилие) — самый прямой способ настроить модель под вашу задачу. Параметр effort управляет тем, сколько мышления, вызовов инструментов и самопроверки выполняет модель, а значение по умолчанию (high) подходит для требовательных задач. Стоимость растёт вместе со всей этой активностью; точность растёт только с той её частью, которая нужна вашей задаче. Ниже потолка возможностей модели самые высокие уровни усилия оплачивают глубину, которую задача никогда не использует.
На бенчмарках исследовательской и интеллектуальной работы (WideSearch1, DeepWideSearch6, BrowseComp4 и GDPval2, все с Claude Fable 5) кривая точности относительно стоимости почти плоская: low уступал от 1 до 3 пунктов при снижении стоимости на задачу на треть–половину, medium соответствовал точности значения по умолчанию примерно при 70–87% его стоимости, а значение по умолчанию не давало ничего измеримого сверх medium ни на одном из четырёх. На DeepWideSearch low также сравнялся с оркестратором с работником Claude Sonnet 5 при стоимости на 29% ниже: снижение усилия превзошло изменение архитектуры.
Более низкие настройки усилия часто быстрее, что важно, когда ограничением является «latency» (задержка). В этих запусках low занимал 4,5 минуты на задачу на DeepWideSearch по сравнению с 7,9 минуты при значении по умолчанию. На корпусном бенчмарке, входные данные которого не помещаются ни в одно «context window» (контекстное окно), Fable 5.1 занимал 15,2, 17,5 и 19,9 часа на эпизод при low, medium и high.
Долгосрочное программирование — это область, где усилие действительно покупает точность. На SWE-bench Pro3 Claude Opus 5 уступил около 2 пунктов при medium за половину стоимости и около 8 пунктов при low за четверть: реальный компромисс, который повторный запуск неудач при более высоком усилии превращает обратно в экономию. Эта диаграмма показывает точность относительно стоимости для бенчмарков исследовательской и интеллектуальной работы и для SWE-bench Pro:

Отсюда следуют два вывода. Во-первых, постройте эту кривую для собственной рабочей нагрузки, прежде чем добавлять вторую модель: в этих внутренних измерениях многомодельная конфигурация, которая выглядела дешевле одиночной модели по умолчанию, стоила дороже, чем та же модель при более низком усилии. Во-вторых, эта кривая — базовый уровень одиночной модели, который должна превзойти любая многомодельная стратегия, поэтому шаг 2 измерения на собственной рабочей нагрузке строит базовые уровни по всем уровням усилия.
Сложная работа не требует автоматически высокого усилия. На DeepResearch Bench II7 Claude Fable 5.1 набрал почти одинаковые баллы при low, medium и high, тогда как стоимость на задачу выросла с $4,66 до $7,12, так что повышение усилия в этом случае не увеличивает качество результата заметным образом; на 21 задаче, чистой в каждой ветви (ссылка 7), Claude Fable 5 также был плоским по усилию, хотя основа диаграммы из 33 задач, которая отбрасывает собственные прерванные попытки каждой модели, показывает его рост. Измеряйте кривую на модели, которую вы поставляете, а не на той, которую измеряли в прошлый раз:

Одно лишь описание задачи не раскрывает, какой тип рабочей нагрузки у вас, поэтому прогоните два или три уровня усилия на выборке собственного трафика и считайте ответ с кривой. Тестируйте каждый уровень в отдельной сессии: изменение усилия верхнего уровня в середине сессии инвалидирует кэш (см. Кэшируйте повторяющийся контекст) и искажает сравнение. Подробности о параметре см. в разделе Усилие.
Повторный запуск неудач при более высоком усилии
Когда результат задачи проверяем, самая дешёвая политика на кривой усилия — это не фиксированная настройка: запускайте каждую задачу при низкой настройке и повторно запускайте только неудачи при более высокой.
Anthropic вычислила эту политику задача за задачей по запускам с разным усилием на подмножестве SWE-bench Pro3 из раздела Настройка усилия. С Claude Opus 5 при low 16% задач завершились неудачей; при их повторном запуске со значением по умолчанию прошло около 93% примерно за $0,45 каждая против 91,7% за $0,93 при запуске всего со значением по умолчанию: та же доля успешных решений за половину стоимости, с учётом неудачных дешёвых попыток. Старт с medium вместо этого решил около 94% примерно за $0,61. Большая часть небольшого прироста — это вторая попытка (повторный запуск собственных неудач значения по умолчанию при значении по умолчанию даёт примерно тот же балл за большие деньги), поэтому используйте эту политику ради экономии, а не ради прироста:

Действуют два условия. Во-первых, вам нужен сигнал неудачи (здесь — собственные тесты бенчмарка); проверяющий механизм, который пропускает плохую работу, пропускает и эти неудачи. Во-вторых, каждая неудача первого прохода занимает реальное время двух запусков, поэтому экономия оплачивается задержкой на неудачах.
Установка бюджетов и ограничений вывода
Большинство запусков агентных задач дёшевы, но меньшинство тратит во много раз больше медианной стоимости на поиск, повторную проверку и избыточное тестирование. Бюджет задачи нацелен на этот хвост. Модель видит живой обратный отсчёт токенов для всей задачи и саморегулируется, сокращая малоценные поиски, пропуская избыточную проверку и завершая работу вместо того, чтобы уходить в спираль.
Anthropic измерила долю успешных решений и стоимость на задачу на SWE-bench Pro3 с Claude Fable 5.1 по мере ужесточения бюджета:

Щедрый бюджет сократил стоимость на задачу на 44% примерно за 3 пункта доли успешных решений, на границе шума между запусками, а самый жёсткий допустимый бюджет сократил её на 58% за 6 пунктов. Бюджеты купили здесь эффективность ценой доли успешных решений, которая растёт по мере ужесточения бюджета.
Три элемента управления выполняют три разные задачи. Бюджет задачи экономит деньги, потому что модель его видит. max_tokens — это предохранительное ограничение: его снижение сократило стоимость на попытку, не снизив стоимость на решённую задачу. На Claude Managed Agents бюджет сессии — это жёсткий долларовый стоп позади обоих. Установите все три: бюджет задачи, высокий max_tokens и ограничение сессии для запуска, который вы никогда не хотите видеть в счёте, с лимитом расходов рабочего пространства в качестве последней страховки.
- Бюджеты задач находятся в бета-версии (бета-заголовок
task-budgets-2026-03-13) на самых последних моделях; проверьте таблицу поддержки, чтобы узнать на каких. Начните около 90-го процентиля использования токенов вашего цикла, затем ужесточайте (Выбор бюджета показывает, как собрать это распределение). Бюджеты ниже текущего минимума в 20 000 токенов отклоняются, а очень жёсткие бюджеты могут вызывать поведение, похожее на отказ. Устанавливайте бюджет один раз, в первом запросе, потому что изменение в середине задачи инвалидирует кэш. Бюджет носит рекомендательный характер, направляя модель, а не останавливая её, поэтому проверяйте его соблюдение на своей рабочей нагрузке. max_tokensограничивает один ответ невидимо для модели, поэтому его снижение не заставляет модель экономить. Ходы, которым требовалось это пространство, отбрасываются и всё равно оплачиваются. На внутреннем бенчмарке задач по репозиториям12 ограничение в 16 384 токена прервало 15% попыток Claude Opus 5 и 43% попыток Claude Fable 5.1 при усилии по умолчанию, и только 9 из 117 ограниченных попыток Fable всё же прошли. Ограниченные запуски тратили меньше на попытку, но покупали пропорционально меньше решений, поэтому стоимость на решённую задачу была примерно такой же, как при 64 000 ($21 против $22). При 64 000 2 из примерно 14 000 ходов при усилии по умолчанию всё ещё были обрезаны, и Fable 5.1 решил 58,5% задач вместо 36,3% (на отдельном срезе подмножества SWE-bench Pro3, описанном в ссылке 12, разницы нет: 94 из 100 при любом ограничении). Повторение ограниченных попыток редко помогает: при том же ограничении большинство из них снова терпят неудачу, а при более высоком вы также платите за потраченную впустую попытку. Установитеmax_tokensв 64 000 для агентной работы или в 128 000, максимум, когда одна обрезанная попытка обходится дорого; при 128 000 Fable 5.1 решил 60,0% при той же стоимости на решённую задачу. Используйте потоковую передачу ответов такого размера, рассматривайтеstop_reason: max_tokensкак неудачу и экономьте деньги с помощью усилия и бюджетов задач, которые модель может видеть.- Бюджеты сессий на Claude Managed Agents — это жёсткий стоп. Бюджет сессии — это долларовое ограничение на одну сессию по прейскурантным ставкам для токенов, поисков и времени сессии. При достижении ограничения сессия приостанавливается с
stop_reason: budget_reached; повышение бюджета возобновляет её. Он обеспечивается платформой, работает на любой модели с прейскурантной ценой, включая модели, где бюджеты задач ещё недоступны, и сочетается с рекомендательным бюджетом задачи. Развёртывания применяют то же поле к каждому запуску.
Просите более короткие ответы. Выходные токены стоят в пять раз дороже входных на Claude Sonnet 5, а в цикле агента каждый токен, который пишет модель, возвращается как входной на каждом последующем ходе, поэтому вы платите за длинный ответ снова и снова. Anthropic запустила задачу триажа с тремя инструкциями для финального ответа, по три запуска каждая, с той же моделью и инструментами. Исходная просила две строки:
4. Finish with exactly two lines:
LABEL: <one of: bug-confirmed, needs-more-info, duplicate-candidate, feature-request, upstream-issue, perf, ui-polish>
SUMMARY: <one or two sentences for the engineering team>Более короткий вариант просил одну:
4. Finish with exactly one line in this form:
DECISION | LABEL | REASON
where DECISION is one of: triage-now, needs-info, close-duplicate; LABEL is one of: bug-confirmed, needs-more-info, duplicate-candidate, feature-request, upstream-issue, perf, ui-polish; REASON is one clause under 15 words. Output nothing after that line.Более длинный вариант просил служебную записку с пятью озаглавленными разделами: краткое описание проблемы, доказательства, проверка на дубликаты, рекомендуемая метка и следующие шаги. Для одной проблемы — поставленной в очередь подсказки, которая никогда не отправляется после пропущенного вопроса, — первые два ответа были:
LABEL: bug-confirmed
SUMMARY: When a user submits a new prompt instead of answering an agent's pending question, the question is cancelled/skipped but the new prompt remains stuck in "QUEUED" state indefinitely since it's waiting on a response to the now-cancelled question; the queued prompt should be processed immediately after cancellation.triage-now | bug-confirmed | Clear repro steps show prompt queues indefinitely after cancelled question.
Однострочный ответ использовал на 39% меньше выходных токенов, чем двухстрочный оригинал, и стоил на 14% меньше за запуск. Служебная записка использовала в шесть раз больше выходных токенов и стоила в 2,8 раза дороже однострочного ответа. Все три набрали баллы в пределах шума между запусками друг относительно друга по сравнению с эталонными метками, так что форматы различаются в том, что вы платите, гораздо больше, чем в том, что они делают правильно. Просите ответ, который вы будете читать, а не тот, который выглядит основательным.
При более низком ограничении max_tokens обе модели тратят меньше на попытку, но решают пропорционально меньше задач, поэтому стоимость на решённую задачу почти не меняется:

Почти каждый ход завершается намного ниже любого из ограничений. Редкий длинный ход — это то, что покупает более высокое ограничение:

Комбинирование моделей
Многомодельные архитектуры подходят для рабочих нагрузок, сложность задач в которых варьируется достаточно, чтобы разные шаги лучше всего обслуживались разными моделями. Когда ваш трафик смешивает рутинную работу, с которой надёжно справляется меньшая модель, с более сложными шагами, требующими передовых возможностей, разделение работы сохраняет передовой интеллект там, где он важен, тогда как большинство токенов оплачивается по ставкам меньшей модели. Когда рабочей нагрузке не хватает такой смеси, потому что её сложность однородна или она представляет собой одну зависимую цепочку, одна хорошо настроенная модель обычно является лучшим выбором. Каждый раздел о стратегии даёт правило, позволяющее различить эти два случая.
Две стратегии покрывают большинство рабочих нагрузок, и они различаются тем, какая модель держит основной цикл:
| Стратегия | Поток управления | Роль передовой модели | Подходит для | Стоимость передовой модели масштабируется с |
|---|---|---|---|---|
| Советник | Меньшая модель ведёт цикл, эскалирует по требованию | Консультирует по планам и исправлениям | Последовательная работа, сложная местами, например множество ходов агента программирования между несколькими реальными решениями | Тем, как часто исполнитель застревает |
| Оркестратор | Передовая модель ведёт цикл, делегирует основной объём работы | Планирует, распределяет и синтезирует | Работа, которая разветвляется по действительно независимым файлам, документам или случаям, особенно объёмом более одного контекстного окна | Тем, насколько сложно координировать части |
Стратегия советника: эскалация сложных решений
В стратегии «advisor» (советник) более дешёвая модель-«executor» (исполнитель) ведёт цикл агента и выполняет большинство ходов. Когда она сталкивается с решением, требующим более глубокого суждения, например выбором подхода или восстановлением после сбоя, она вызывает более интеллектуальную модель-советника для стратегического руководства, а затем продолжает. Большинство токенов оплачивается по ставкам исполнителя, и только эпизодические консультации — по ставкам советника.
Чтобы использовать её, добавьте инструмент советника в свой запрос. Эта бета-функция выполняет всю стратегию на стороне сервера в одном запросе /v1/messages: исполнитель выдаёт вызов инструмента, Anthropic выполняет инференс советника, и исполнитель продолжает с полученным советом; вы не пишете никакого кода оркестрации. На Claude Managed Agents дайте сессии советника, добавив запись advisor в список multiagent агента; основной поток сессии консультируется с ним таким же образом. Claude Code также поддерживает это; см. эскалацию сложных решений с помощью инструмента советника.

Что определяет отдачу. Советник видит задачу только через вызовы исполнителя, поэтому две вещи решают, насколько он помогает.
Первая — разрыв между моделями. Советник может передать только те возможности, которых не хватает исполнителю: на GPQA Diamond9 исполнитель Claude Haiku 4.5 получил очень много от советника Claude Opus 5, исполнитель Claude Sonnet 5 получил несколько пунктов, а передовой исполнитель — почти ничего.
Вторая, и хрупкая, — спрашивает ли исполнитель на самом деле («consult rate», частота обращений). Исполнитель при низком усилии может перестать обнаруживать, что он застрял: пара, которая консультируется по большинству задач при усилии по умолчанию, может упасть до консультаций почти ни по одной при снижении усилия, и тогда набирает меньше баллов, чем исполнитель в одиночку. Частота также варьируется по задачам: на DeepSWE10 исполнитель Sonnet 5 при низком усилии продолжал спрашивать и получил 23 пункта; на SWE-bench Pro3 тот же исполнитель перестал. Когда исполнитель спрашивает, он восстанавливает большую часть разрыва. Среди пар на следующей диаграмме, исполнитель которых продолжал спрашивать, советник закрыл как минимум половину разрыва до более сильной модели (пара для программирования превзошла более сильную модель напрямую), и вы платите за более сильную модель только на консультациях, что и делает возможными случаи экономии:

Частота обращений реагирует на подсказки. Только со встроенным описанием инструмента исполнители вызывают его недостаточно часто, особенно в работе по программированию, поэтому документация инструмента советника даёт «system prompt» (системную подсказку), которая просит один вызов перед существенной работой и один перед завершением, около двух–трёх вызовов на задачу. Пара для программирования, измеренная далее, работала в этом ритме, около двух консультаций на каждую задачу. Та страница также описывает подталкивание недостаточно вызывающего исполнителя и ограничение вызовов на стороне клиента для ограничения стоимости. Так что следите за частотой обращений: задавайте её подсказкой, измеряйте её и восстанавливайте усилие исполнителя, если она обрушивается.
Когда это окупается по стоимости. Советник экономит деньги, когда несколько коротких консультаций, оплачиваемых по ставке советника, заменяют запуск модели советника на всю задачу. Это работает лучше всего, когда модель советника стоит значительно дороже модели исполнителя, поэтому наиболее экономически эффективная конфигурация — передовой советник над исполнителем среднего уровня. Пара может держаться даже на вершине диапазона, потому что совет также экономит токены исполнителя: исполнитель, которому подсказали правильный подход, исследует меньше тупиков, что может покрыть консультации.
На внутреннем бенчмарке агентного программирования11, запущенном с простым агентом API, исполнитель Claude Opus 5 с советником Claude Fable 5.1 был самой точной измеренной конфигурацией при $7,69 за попытку. Она находится выше линии, проходящей через собственные настройки усилия каждой модели: на 3,5 пункта выше Opus 5 в одиночку при настройке по умолчанию за немного меньшие деньги — разрыв, который пять попыток на задачу отделяют от шума, — и примерно на 2,5 пункта выше модели советника в одиночку примерно за полтора раза большие деньги:

Более раннее измерение через режим советника Claude Code дало тот же порядок. Читайте этот результат как форму для проверки на вашей рабочей нагрузке: советник покупает несколько пунктов примерно по собственной цене исполнителя. Более широкий разрыв в возможностях не гарантирует лучшей сделки. Цена в задержке — это сами консультации: около двух дополнительных вызовов передовой модели на задачу на этом бенчмарке, каждый на критическом пути задачи.
Когда более сильная модель в одиночку — лучший шаг. Там, где точность рабочей нагрузки реагирует на усилие, сравните пару с моделью советника в одиночку при сниженной настройке, прежде чем строить её: советник оплачивается только на задачах, которым он нужен, но консультация, срабатывающая на большинстве задач, стоит дороже, чем запуск самой более сильной модели. На Chartography13 та же пара сравнялась с Claude Fable 5.1 в одиночку при medium в пределах шума между запусками (65,0 против 67,5) примерно при 2,6-кратной стоимости на задачу, потому что к советнику обращались почти по каждой задаче. Сначала измерьте собственную частоту обращений: если исполнитель спрашивает по большинству своих задач, вы платите ставки советника по всей рабочей нагрузке, и запуск самой модели советника — более дешёвый путь к тому же баллу.
Какой бы ни была пара, сначала оцените стоимость модели советника в одиночку при низком усилии; это базовый уровень, который нужно превзойти. Перепроверяйте при каждом выпуске модели, потому что выпуски сдвигают и разрыв в возможностях, и соотношение цен.
Когда это подходит. Стратегия советника подходит для рабочих нагрузок, где ходы в основном механические, но отличный план важен: агенты программирования, использование компьютера и многошаговые исследовательские конвейеры. Она плохо подходит, когда каждый ход действительно требует передовых возможностей, когда нечего планировать (однократные вопросы и ответы) или когда ваш исполнитель уже близок к возможностям советника.
Стратегия оркестратора: делегирование основного объёма работы
В стратегии «orchestrator» (оркестратор) передовая модель держит цикл. Она декомпозирует задачу, распределяет подзадачи более дешёвым моделям-«workers» (работникам) и объединяет их результаты. Собственная стенограмма оркестратора остаётся короткой, потому что работники поглощают насыщенное токенами исследование, поэтому большинство токенов оплачивается по ставкам работников, тогда как план и синтез по-прежнему исходят от передовой модели.
Чтобы построить её, используйте многоагентную оркестрацию в Claude Managed Agents: настройте агента-координатора (оркестратора) и список агентов-работников, каждый со своей моделью. Полный рабочий пример с передовым координатором и работниками Claude Sonnet 5 см. в рецепте Claude Cookbook Паттерн координатора: большие модели для планирования, маленькие модели для выполнения.

Этот паттерн экономит реальное время, когда работники могут выполняться параллельно: на корпусном бенчмарке8 эпизод занимал около 2,3 часа с координатором, запускающим документированный лимит платформы в 25 одновременных работников, по сравнению с 15–20 часами в одиночку. Он экономил деньги только в двух измеренных ситуациях. На работе, с которой одна модель могла справиться в одиночку, та же модель при более низком усилии была дешевле каждый раз.
Случай 1: страховка от хвоста стоимости на рутинной работе. Передовая модель, работающая в одиночку, иногда уходит в спираль на рутинной задаче, которую она обычно решила бы. Поскольку вы не можете заранее сказать, какие это будут задачи, несколько таких запусков доминируют в счёте. Координатор, передающий рутинную работу более дешёвому работнику, ограничивает этот хвост, потому что любой уход в спираль теперь происходит по ставкам работника.
Anthropic измерила это на намеренно лёгком срезе BrowseComp4 (10 задач, которые одиночная модель надёжно решает; 50 делегированных и 70 одиночных запусков). Координатор Claude Fable 5 с одним работником Claude Sonnet 5 стоил примерно вдвое меньше, чем Claude Fable 5 в одиночку в среднем, и примерно втрое меньше на 90-м процентиле ($12 по сравнению с $33), а единственный самый дорогой запуск одиночной модели, за $84, был ещё и неправильным:

Делегирование окупилось на рутинной, обычно решаемой доле работы — противоположность интуиции, что работники нужны для сложных задач. На полном, более сложном наборе BrowseComp экономика перевернулась. Если у вашего трафика длинный хвост стоимости на рутинных задачах, это случай оркестратора, который нужно измерить первым.
Случай 2: работа больше одного контекстного окна. Одиночная модель должна обрабатывать входные данные такого размера последовательно, по одному контекстному окну за раз, платя за повторное чтение собственного состояния на каждом проходе. Работники читают каждый свой раздел, параллельно и по ставкам работников. Насыщенная чтением работа, которая всё же помещается в одно контекстное окно, — это проблема выбора модели, а не проблема делегирования: по одной лишь стоимости чтения оркестратор выигрывает только тогда, когда ни один контекст не может вместить работу.
Anthropic построила бенчмарк для этого случая8: корпус в 21,6 миллиона токенов из 14 публичных пакетов Python со 130 заложенными дефектами, слишком большой для любого контекстного окна. Снижение усилия не может помочь, потому что счёт — это само чтение корпуса: Claude Fable 5.1 в одиночку стоил от $468 до $552 за эпизод по трём настройкам усилия, и менялась только его точность. Конфигурация координатора, ведущий Claude Fable 5.1 над 25 работниками Claude Sonnet 5, стоила примерно вдвое меньше этих настроек (на 47–55% меньше) и набрала на 10–12 пунктов ниже них, примерно за 2,3 часа на эпизод против 15–20, при этом напрямую превзойдя базовый уровень Claude Sonnet 5 в одиночку:

Учёт токенов показывает масштаб чтения: конфигурация координатора прочитала около 560 миллионов кэшированных токенов за эпизод, примерно в полтора раза больше, чем приблизительно 365 миллионов одиночной модели, почти все из них по ставке чтения из кэша Claude Sonnet 5, и всё равно стоила примерно вдвое меньше в целом. Fable 5.1 при усилии high по-прежнему удерживает пиковую точность примерно при 2,2-кратной стоимости конфигурации координатора, так что делегирование здесь покупает большую часть точности, но не всю.
Когда делегирование не окупается. Оркестратор покупает что-то только тогда, когда есть объём для передачи: много независимых частей, в идеале слишком много для одного контекстного окна. Когда работа — одна зависимая цепочка или помещается в один контекст, оркестратор платит за план, передачу и объединение, которые одна модель получает бесплатно. В каждом таком измеренном случае модель координатора в одиночку при более низком усилии выигрывала.
Граница — сложность задачи, а не бенчмарк: на полном, более сложном наборе BrowseComp4 Claude Fable 5 в одиночку достиг точности конфигурации координатора при стоимости на 22–30% ниже. Независимая внешняя работа сообщает о том же паттерне5. Если работа — одна цепочка, помещается в один контекст без длинного хвоста стоимости или одна модель при более низком усилии уже соответствует вашей планке, не стройте оркестратор.
Выбор между стратегиями
Большинство случаев сводится к одному вопросу: разделяется ли работа на независимые части или это один ответ, достигаемый через цепочку зависимых шагов? Таблица стратегий сопоставляет два ответа с двумя стратегиями.
Если вы не уверены, пока ничего не стройте:
- Сначала прогоните усилие на вашей текущей модели. Это самый дешёвый эксперимент на этой странице, и большинство рабочих нагрузок на нём заканчиваются.
- Если прогон показывает разрыв, оцените стоимость более сильной модели в одиночку при низком усилии. Это число, которое должна превзойти пара с советником, и пары на этой странице, которые его превзошли, были теми, чей исполнитель действительно консультировался.
Многомодельные результаты на этой странице оценивались относительно той же модели при более низком усилии и относительно следующей модели ниже, работающей в одиночку. Это сравнение, которое нужно провести на собственной рабочей нагрузке, и причина, по которой первый шаг — прогон усилия.
Когда вы всё же добавляете советника, это определение инструмента, а не перестройка архитектуры.
Измерение на собственной рабочей нагрузке
Числа на этой странице отражают прейскурантные цены на момент измерения и будут смещаться по мере изменения моделей и цен. Ваша частота эскалации, то, насколько чисто разделяются задачи, и длина стенограммы также их сдвигают. Метод остаётся тем же:
- Возьмите несколько задач из производственных логов, взвешенных как реальный трафик, и напишите проверки результата для каждой: тесты проходят, тикет закрыт, количество строк правильное. Записывайте стоимость на задачу рядом с баллом: оцените пять тарифицируемых счётчиков токенов в
usageкаждого ответа по их собственным ставкам (некэшированный ввод, 5-минутные и 1-часовые записи в кэш по 1,25x и 2x цены ввода, чтения из кэша и вывод), суммированные по запросам задачи (Usage and Cost API сообщает агрегат). - Постройте базовые уровни для уровней моделей по всем уровням усилия, а не только по умолчанию, и постройте график балла относительно расходов. Многомодельная конфигурация должна превзойти всю кривую одиночной модели.
- Если кривая показывает разрыв, который усилие не может закрыть, добавьте подходящую многомодельную стратегию и повторно запустите набор.
- Запустите победителя в теневом режиме на срезе трафика перед переключением, затем продолжайте запускать набор.
Следующий пример вычисляет стоимость шага 1 для одного запроса по прейскурантным ценам Claude Opus 5:
# Цены за миллион токенов со страницы цен; измените эти три значения для другой модели.
INPUT_PER_MTOK = 5.00 # Claude Opus 5
# 0,1x от цены ввода; 0,025x для Claude Fable 5.1 и Claude Mythos 5.1
CACHE_READ_PER_MTOK = 0.50
OUTPUT_PER_MTOK = 25.00
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-opus-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello, Claude"}],
)
usage = response.usage
cache_writes = usage.cache_creation
writes_1h = cache_writes.ephemeral_1h_input_tokens if cache_writes else 0
writes_5m = cache_writes.ephemeral_5m_input_tokens if cache_writes else 0
cost = (
usage.input_tokens * INPUT_PER_MTOK
# Запись в 1-часовой кэш — 2x от цены ввода, в 5-минутный — 1,25x; чтение — по цене чтения из кэша.
+ writes_1h * INPUT_PER_MTOK * 2.0
+ writes_5m * INPUT_PER_MTOK * 1.25
+ (usage.cache_read_input_tokens or 0) * CACHE_READ_PER_MTOK
+ usage.output_tokens * OUTPUT_PER_MTOK
) / 1_000_000
print(f"Request cost: ${cost:.6f}")В циклах агентов слагаемое чтения из кэша обычно самое большое из пяти; если нет, проверьте, что кэширование задействовано. Когда включён инструмент советника или компактизация, некоторые токены сообщаются только в usage.iterations, а не в итогах верхнего уровня, поэтому суммируйте по usage.iterations, оценивая записи advisor_message по ставкам модели советника.
В следующей таблице перечислены рычаги в порядке, в котором их стоит пробовать:
| Рычаг | Экономия в этих запусках | Цена в качестве | Задержка | Где |
|---|---|---|---|---|
| Кэширование подсказок | Стоимость снижена в 2,7–5,3 раза на циклах агентов; 83% на запуске триажа | Нет | Быстрее | Кэшируйте повторяющийся контекст |
| 1-часовая длительность кэша | Дешевле 5-минутного значения по умолчанию, как только примерно 1 ход из 20 следует за паузой от 5 минут до часа и немногие промежутки превышают час, кроме Claude Fable 5.1, где поддержание 5-минутного кэша тёплым дешевле, пока паузы длятся минуты, а 1-часовая длительность выигрывает, когда паузы приближаются к часу; без пауз значение по умолчанию стоило на 15% меньше на Claude Sonnet 5 и на 11% меньше на Claude Opus 5 | Нет | Остаётся тёплым после паузы | Выберите длительность кэша |
| Сокращение ввода | Ещё 5 процентных пунктов на запуске триажа | Нет | Нейтрально | Сократите входные и контекстные токены |
| Удаление устаревших результатов инструментов на границах задач | 39% на длинном запуске триажа (компактизация 32%); ничего на коротких циклах | Не измерено | Нейтрально | Сократите входные и контекстные токены |
| Поиск инструментов | 45% с 500 прикреплёнными определениями инструментов; 20% с сервером GitHub MCP | Нет | Нейтрально | Сократите входные и контекстные токены |
| Файлы данных через выполнение кода | 92% на задаче с данными из 25 вопросов | Прирост, 25 из 25 вместо 6 из 25 | Быстрее | Сократите входные и контекстные токены |
| Batch API | 50% | Нет | Результаты в течение 24 часов | Пакетируйте работу, которая может подождать |
| Аудит подсказок относительно текущей модели | 14% на обеих измеренных миграциях | Нет; прирост на одной | Быстрее (меньше раундов инструментов) | Проведите аудит подсказок относительно текущей модели |
| Обновление модели | Opus 4.8 на Opus 5: на 12 пунктов больше при стоимости на решённую задачу на 21% выше (Opus 5 при low превосходит Opus 4.8 примерно за 30% стоимости); Sonnet 4.6 на Sonnet 5: на 15% меньше на решённую задачу, на 5 пунктов больше; Fable 5 на Fable 5.1: на 43% меньше на решённую задачу при примерно том же балле | Прирост | Нейтрально | Обновите модель |
| Снижение усилия | Интеллектуальная работа: medium 13–31%, low треть–половина; длинное программирование: medium около половины, low около трёх четвертей | 1–3 пункта на интеллектуальной работе, 2–8 на длинном программировании | Быстрее | Настройка усилия |
| Повторный запуск неудач | Около половины при той же доле успешных решений | Нет | Два запуска на задачах, которые терпят неудачу | Повторный запуск неудач при более высоком усилии |
| Бюджет задачи | 44–58% | 3–6 пунктов | Быстрее | Установка бюджетов и ограничений вывода |
| Просьба о более коротких ответах | 39% выходных токенов, 14% стоимости на запуске триажа | Нет | Быстрее | Установка бюджетов и ограничений вывода |
Повышение max_tokens | Нет на решённую задачу, но больше решённых задач | Прирост до 22 пунктов на внутреннем наборе; нет на публичной паре | Нейтрально | Установка бюджетов и ограничений вывода |
| Советник | Зависит от разрыва в возможностях и частоты обращений; пара для программирования набрала на 3,5 пункта выше Opus 5 в одиночку и примерно на 2,5 выше Fable 5.1 в одиночку, пара для чтения диаграмм сравнялась с моделью советника в одиночку при medium примерно за 2,6-кратную цену | Небольшие приросты | Около двух дополнительных вызовов на задачу | Стратегия советника |
| Оркестратор | Около половины относительно передовой модели, как за пределами одного контекстного окна, так и на рутинных хвостах (последнее измерено на Claude Fable 5) | На 10–12 пунктов ниже передовой модели | Намного быстрее на больших входных данных | Стратегия оркестратора |
Упомянутые бенчмарки
За исключением случаев, когда в ссылке указано иное, измерения представляют собой внутренние прогоны этих бенчмарков, выполненные Anthropic. Если не указано иное, стоимость приведена в долларах США по прейскурантным ценам, действовавшим на момент прогона каждого бенчмарка; показатели Claude Sonnet 5 рассчитаны по ставкам $2 и $10 за миллион входных и выходных токенов. На графиках с пометкой «notional USD» (условные доллары США) количество токенов каждого запроса оценивается по этим ставкам, а не по фактическим счетам.
- WideSearch: Wong et al., «WideSearch: Benchmarking Agentic Broad Info-Seeking», arXiv:2508.07999, 2025. Задачи широкого веб-исследования, оцениваемые по полноте и точности многострочной таблицы; 200 задач, 3 прогона на конфигурацию, выполнено 1–2 августа 2026 года. График концентрации затрат — это отдельный прогон из 20 задач, 3 прогона на задачу, выполненный 3–4 августа 2026 года, со стоимостью, рассчитанной по записям биллинга для каждого запроса.
- GDPval: OpenAI, «GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks», 2025. Результаты интеллектуального труда, оцениваемые по рубрикам задач; прогон из 210 задач опубликованного золотого набора, одна попытка на задачу, выполнен 2 августа 2026 года. Оценку выставляет модель Claude, поэтому абсолютные баллы могут отличаться от опубликованных результатов.
- SWE-bench Pro: Scale AI, «SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?», 2025. Подмножество из 482 задач, отобранное по совместимости с оценочной обвязкой Anthropic; баллы несопоставимы с публичной таблицей лидеров. Для Claude Opus 5 при уровне усилий по умолчанию усреднены два прогона; настройки с пониженным уровнем усилий — одиночные прогоны; все выполнены 4 августа 2026 года. Показатели эскалации получены позадачно из этих прогонов: сначала
low, затем уровень по умолчанию на его неудачах — решено от 92,5% до 93,6% в зависимости от сочетания прогонов примерно за $0,45; сначалаmedium— от 93,8% до 94,2% примерно за $0,61; повторный прогон уровня по умолчанию на его собственных неудачах — 94,0% за $1,06; всё на уровне по умолчанию — от 90,9% до 92,5% за $0,93. Стоимость на этом подмножестве рассчитана так, как тарифицируется организация клиента: предыдущая подсказка каждого запроса как чтение из кэша, а его новые токены как запись в 5-минутный кэш, по собственным записям использования прогонов, сверенным с клиентской бухгалтерской книгой; собственная тарификация оценочной организации, которая выставляет счёт за кэш страницами по 8 192 токена, дала показатели в 1,4–1,8 раза выше. Сочетания с исполнителем Claude Sonnet 5 на графике советника взяты из той же серии измерений на этом подмножестве: сочетание Sonnet плюс Opus прогонялось дважды (7 и 8 августа 2026 года, прогон и точное воспроизведение), сочетание с низким уровнем усилий — один раз (8 августа 2026 года), а Claude Sonnet 5 в одиночку — дважды (77,4%, базовый уровень для обеих строк Pro). Точка Claude Fable 5 в разделе «Обновите модель» — среднее трёх прогонов при уровне усилий по умолчанию, выполненных 26 августа 2026 года и оценённых тем же способом. Показатели бюджета задачи для Claude Fable 5.1 — один прогон на бюджет (два при 35 000 токенов) на том же подмножестве при уровне усилий по умолчанию, выполнены 26 августа 2026 года, с прогоном без бюджета в тот же день (92,1%, $1,10 за задачу) в качестве базового уровня; более ранний набор при уровне усилийlow, выполненный 21 августа 2026 года, набрал 88,6% без бюджета при $0,48 за задачу. Сравнение в разделе Сравните модели сопоставляет этот одиночный прогон с двумя объединёнными прогонами Claude Sonnet 5 на том же подмножестве; при уровне усилий Fable 5.1 по умолчанию пара читается в обратную сторону — на 41% дороже за решённую задачу, чем Sonnet 5. Лестница обновлений — один прогон на модель при её поставляемых настройках по умолчанию (по два для Opus 5 и Sonnet 5, а точка Fable 5 — как описано выше), прогоны Opus и Sonnet выполнены на одной неделе в одной обвязке и организации. - BrowseComp: Wei et al., «BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents», OpenAI, 2025. Показатели по уровням усилий используют срез из 500 задач, от одного до трёх прогонов на настройку, выполнены 3 августа 2026 года, причём точка по умолчанию объединяет два прогона от 26–27 июля 2026 года. График страхования затрат использует 10 надёжно решаемых задач из среза в 26 задач, 50 делегированных прогонов (1–2 августа 2026 года) и 70 одиночных прогонов (50 от 2–3 августа 2026 года; 20 архивных от 12–13 июля и 1 августа 2026 года), $6,45 против $11,99 за прогон в ожидаемом выражении; делегированные показатели имеют полосу погрешности измерения около 20%.
- Масштабирование агентных архитектур: Kim et al., «Towards a Science of Scaling Agent Systems», arXiv:2512.08296, 2025. Независимое внешнее исследование, цитируемое только ради направления вывода о том, когда делегирование не окупается, а не ради каких-либо цифр.
- DeepWideSearch: «DeepWideSearch: Benchmarking Depth and Width in Agentic Information Seeking», arXiv:2510.20168, 2025. 220 вопросов охватывают 15 предметных областей, каждый сочетает сбор многострочных данных с многошаговым поиском; измерено на постоянном наборе строк бенчмарка, 3 прогона на конфигурацию, выполнено 2 августа 2026 года (точка команды с одним работником прогонялась 26–27 июля 2026 года).
- DeepResearch Bench II: Li et al., «DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Report», arXiv:2601.08536, 2026. Его 132 исследовательские задачи в 22 предметных областях оцениваются по бинарным рубрикам, выведенным экспертами; измерено на подмножестве из 50 задач, стратифицированном по всем темам, одна попытка на задачу, 3 прогона на настройку, на Claude Managed Agents с собственными инструментами платформы для веб-поиска и загрузки страниц (26–27 августа 2026 года); оценка выставлена по 33 задачам, от которых не отказалась ни одна конфигурация, с удалением попыток, прерванных производственными классификаторами безопасности; стоимость — это то, что выставляется клиенту: запросы платформы плюс плата за веб-поиск. Баллы — среднее каждой модели на базе 33 задач с удалением её собственных прерванных задач; на 21 задаче, чистой во всех ветвях, Claude Fable 5.1 удерживает преимущество в 2–3 пункта над Claude Fable 5 на каждом уровне усилий, и обе модели показывают ровные результаты по уровням усилий. График кэширования переоценивает те же запросы, считая каждый входной токен по ставке без кэширования. Судьёй выступает Claude Opus 4.6 по рубричному протоколу бенчмарка; в оригинале используется другой судья, и судья от Anthropic может отдавать предпочтение фирменному стилю. Claude Opus 5 при уровне усилий по умолчанию прогонялся на той же поверхности и подмножестве, три прогона, 28 августа 2026 года: 68,8% на исходных 50 задачах, 70,8% на базе 33 задач и 71,1% на наборе из 21 задачи, при $6,71 за задачу ($23,72 без кэширования); ни одна из его попыток не была прервана классификаторами безопасности при развёртывании защитных механизмов более новом, чем то, при котором прогонялись другие модели.
- Поиск дефектов в корпусе: внутренний бенчмарк Anthropic для работы, превышающей одно контекстное окно: корпус в 21,6 миллиона токенов из исходных кодов 14 публичных пакетов Python со 130 внедрёнными дефектами и детерминированной оценкой; протокол зафиксирован до прогонов и прошёл внутреннюю проверку; три прогона на конфигурацию. Каждая конфигурация прогонялась на Claude Managed Agents. Командная конфигурация на графике — это прогон, в котором координатор Claude Fable 5.1 выполнил весь поиск внутри платформы при её документированном лимите в 25 одновременных работников Claude Sonnet 5, выполнен 30 августа 2026 года; его три эпизода набрали F1 0,764, 0,825 и 0,791 после аудита лишних находок (исходные 0,751, 0,821 и 0,781) за $225, $234 и $283. Одиночная конфигурация Claude Sonnet 5 прогонялась 3–4 августа 2026 года; одиночные конфигурации Claude Fable 5.1 прогонялись 24–25 августа 2026 года при стартовых настройках обслуживания платформы, три сида на настройку уровня усилий, на той же сборке корпуса. Образ песочницы содержал установленные копии части корпуса, и финальный шаг сборки Claude Fable 5.1 сравнивал результаты с ними в 7 из 9 эпизодов; переоценка без этих добавлений сдвинула затронутые сиды не более чем на 3 пункта. Абсолютное значение F1 специфично для этой сборки корпуса и несопоставимо между бенчмарками; сравнения конфигураций выполнены на равных условиях.
- GPQA Diamond: Rein et al., «GPQA: A Graduate-Level Google-Proof Q&A Benchmark», 2023. Подмножество Diamond из 198 вопросов, два прогона на конфигурацию, выполнено 7 августа 2026 года, оценка моделью по эталонным ответам, токены советника тарифицируются по каждому запросу. Проверка безопасности платформы отказала в ответе на два вопроса по биологии на исполнителях Sonnet и Opus; их исключение не меняет ни одно сравнение более чем на один пункт.
- DeepSWE: Datacurve, «DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks», arXiv:2607.07946, 2026. Набор содержит 113 оригинальных задач на пяти языках с программными верификаторами. Сочетания — по два прогона каждое, выполнены 7 августа 2026 года, с тарификацией токенов советника по каждому запросу, и использовали клиентский цикл советника вместо инструмента советника, с идентичным учётом. Переборы уровней усилий для одной модели — одиночные прогоны, оценённые по количеству токенов, приближение с учётом кэша. Стоимость за задачу — итоги прогона, делённые на 113.
- Внутренний бенчмарк агентного программирования: внутренний бенчмарк Anthropic: 370 задач по репозиториям, оцениваемых собственными тестами репозиториев. Показатели API измерены с ограничением вывода в 128 000 токенов, один прогон на конфигурацию: Opus 5 в одиночку при уровне усилий по умолчанию 9–10 августа 2026 года, Claude Fable 5.1 в одиночку при пяти явно заданных значениях уровня усилий 20 августа 2026 года и сочетание 24–25 августа 2026 года. Попыток на задачу: пять для сочетания и контрольного прогона Opus в одиночку, одна для точек одной модели; сочетание в среднем давало около двух консультаций с советником на попытку; стоимость указана за попытку. Показатели Claude Code — прогоны тех же задач с 8 по 23 июля 2026 года, один прогон на конфигурацию, стоимость приблизительная.
- Внутренний бенчмарк задач по репозиториям (измерение ограничения): отдельный внутренний набор Anthropic примерно из 130 задач по репозиториям, прогонявшийся 8–10 августа 2026 года (Claude Opus 5) и 20 августа 2026 года (Claude Fable 5.1), с простым агентным циклом через API, одна попытка на задачу. Прогоны Claude Fable 5.1 — 135 задач на каждое ограничение при явно заданном уровне усилий по умолчанию: показатель для 16 384 токенов усредняет два прогона (36,3% в обоих); показатели для 64 000 и 128 000 — одиночные прогоны (58,5% и 60,0%). Шесть задач вызывали отказ по соображениям безопасности в каждом прогоне и засчитаны как неудачи. Показатель Opus 5 для 16 384 токенов усредняет два прогона, а его показатель для 64 000 — одиночный прогон (оценено 124 задачи). Показатели ограничения для SWE-bench Pro — один прогон Claude Fable 5.1 на каждое ограничение при уровне усилий по умолчанию, выполнены 26 августа 2026 года, на подмножестве из 100 задач, стратифицированном из набора в 482 задачи из ссылки 3, несопоставимы с его баллами; оба ограничения набрали одинаково при уровне по умолчанию. Распределения по ходам на графике взяты из прогона Opus при 64 000 и прогона Claude Fable 5.1 при 128 000; ни один ход Opus не достиг своего ограничения, а один ход Fable 5.1 достиг 128 000 (0,46% его ходов превысили 16 384).
- Chartography: Surge AI, «Chartography», 2026. Полный опубликованный набор из 100 вопросов, измерен 8–10 августа 2026 года с реализацией Anthropic на Claude Managed Agents (стандартная облачная песочница; конфигурации с советником используют советника Managed Agents). Оценку выставляет Claude Sonnet 4.6 вместо эталонного судьи, и бенчмарк прогоняется с инструментами, поэтому баллы сопоставимы между конфигурациями здесь, но не с опубликованной таблицей лидеров. Два прогона на конфигурацию, объединённые; разброс между прогонами составлял от 4 до 10 пунктов. Стоимость не включает время песочницы, которое добавляло менее 1%. Одиночные прогоны Claude Fable 5.1 — от 24 августа 2026 года при стартовых настройках обслуживания платформы, два прогона на настройку; шесть попыток достигли 15-минутного ограничения сессии и получили 0 баллов, а на два графика в каждом прогоне ответил Claude Opus 5 после отказа по соображениям безопасности. Исполнитель Claude Opus 5 с низким уровнем усилий и советником Claude Fable 5.1 прогонялся дважды 30 августа 2026 года при тех же настройках (63,0 и 67,0, среднее 65,0, при $0,72 за график; к советнику обращались в 88% задач в каждом прогоне, и 4 из его 219 ответов вместо него дал Claude Opus 5, каждый раз после того, как производственный фильтр безопасности остановил собственный ответ советника). Сравнение частоты консультаций для более ранних сочетаний получено повторным прогоном тех же конфигураций на Messages API с набором инструментов контейнера, 10–11 августа 2026 года.
- Оценка аудита подсказок службы поддержки: составленный Anthropic набор из 44 обращений в поддержку с детерминированной оценкой, прогонявшийся в начале августа 2026 года и представленный 8 августа 2026 года, при шести системных подсказках, каждая из которых добавляет к одной и той же чистой подсказке один паттерн, распространённый в подсказках, написанных для Claude Opus 4.8 и Claude Sonnet 4.6. Каждая точка графика — один из трёх случаев (старая модель, новая модель на той же подсказке, новая модель после аудита), усреднённый по шести подсказкам и 44 обращениям. Прирост точности Opus 5 имеет 95-процентный доверительный интервал от 3 до 8 пунктов; различия в точности Sonnet находятся в пределах шума.
- Набор вопросов по файлу данных: составленный Anthropic набор из 25 агрегирующих вопросов по срезу в 1 862 строки публичного CSV-файла о продажах алкоголя, с эталонными ответами, вычисленными pandas, и оценкой по точному совпадению, прогонявшийся на Claude Sonnet 5 и Claude Opus 5 с отключённым мышлением (ветвь с данными в контексте не может завершиться при настройке по умолчанию), ограничением вывода в 4 000 токенов и без кэширования подсказок, три прогона на конфигурацию, выполнено 19 августа 2026 года. Файловая ветвь загружает CSV через Files API и использует инструмент
code_execution_20260120. - Измерение длительности кэша: задание по сортировке 20 обращений из раздела Сократите входные и контекстные токены, прогонявшееся 23 августа 2026 года на Claude Sonnet 5 и Claude Opus 5 на Messages API с той же обвязкой, ячейки Claude Opus 5 с
max_tokens, повышенным до 4 096, с паузами, вставленными перед случайно выбранной долей ходов (ни одного, 5%, 10% и каждый ход по 6 минут на всех 20 обращениях на обеих моделях, плюс каждый ход по 2 минуты на Claude Sonnet 5; 20-минутные паузы на подмножестве из 5 обращений на обеих моделях; 45-минутные паузы на подмножестве из 5 обращений только на Claude Sonnet 5). Три прогона на ячейку, стоимость вычислена по полямusageкаждого ответа в организации с клиентским биллингом по прейскурантным ценам, точность — по тем же золотым меткам. Точка пересечения — около 3,3% ходов на обеих моделях: медиана доли безубыточности каждой сессии, вычисленной моделью затрат по размерам контекста этой сессии ход за ходом, по всем 45 сессиям Claude Sonnet 5 и 36 сессиям Claude Opus 5 на двадцать обращений, вошедшим в анализ (каждое расписание пауз, прогнанное на полном задании, при всех трёх настройках кэша, по три прогона; ячейки на 5 обращений в него не входят). Ячейка 5% дала ничью на Claude Sonnet 5, потому что паузы в этой выборке пришлись на небольшие префиксы. Правило страницы «1 из 20» лежит выше измеренной точки пересечения. Anthropic измерила запросы поддержания активности, обновляющие 5-минутный кэш, только в качестве компаратора. В лучшем случае они сравнялись с настройкой на 1 час и стоили дороже при паузе перед каждым ходом, поэтому не используйте их на этих двух моделях; на Claude Fable 5.1 арифметика меняется на обратную (ссылка 19). - Доля чтений из кэша в производственной среде: агрегированное использование Claude API первой стороны за 14 дней, заканчивающихся 23 августа 2026 года, только прямой продукт API, внутренние организации Anthropic исключены, ни одна организация не идентифицирована. Организация-день считается агентным циклом, когда её запросы содержат определения инструментов и результаты инструментов, её подсказки содержат в среднем 9 или более предыдущих вызовов инструментов, использовалось кэширование и она сделала не менее 10 таких запросов (в API нет идентификатора разговора, поэтому это служит заменой длины разговора): 303 003 организации-дня по 106 487 организациям, медианная доля чтений из кэша 84,2% всех входных токенов, верхний квартиль 91,7%. Метки сценариев использования (заявленный организацией сценарий использования или, в противном случае, классифицированный) покрывают 74% этих организаций-дней и 99% их токенов; организации, занимающиеся программированием, дают 87% агентных входных токенов и читают медианно 88,5% (90,9% при 25 или более предыдущих вызовах инструментов), верхний квартиль 93,4%, причём около 72% организаций-дней в программировании находятся на уровне 80% или выше; агенты поддержки, исследований и данных читают от 84% до 85%. Верхний дециль организаций-дней читает 95,9% или более для программирования и от 94,2% до 94,8% для агентов поддержки, исследований, данных и прочих. Разбивка на уровне запросов при 25 или более предыдущих вызовах инструментов получена из шестичасовой выборки: программирование — 92% чтение, 7% запись, менее 1% без кэширования. Организации без меток, в основном небольшие, читают медианно 11%. Организации-дни без определений инструментов читают медианно 34,6%. Независимый запрос по тому же окну, который восстанавливает разговоры из 10 или более запросов вместо оценки организаций-дней, даёт медиану 90,2%; разница в охвате, а не в данных.
- Измерение момента компактизации: длинный вариант агента сортировки из раздела Сократите входные и контекстные токены, прогонявшийся 24 августа 2026 года на Claude Sonnet 5 с 5-минутным кэшем, стоимость по полям использования по прейскурантным ценам, пять сессий на ветвь: ветвь без изменений при уровне усилий по умолчанию на всём протяжении ($0,81 за сессию) и две ветви, которые начинают с низкого уровня усилий и вносят одни и те же два изменения, ломающие кэш, — переключение на уровень усилий по умолчанию и один добавленный инструмент — либо в середине сессии на запросах 12 и 17 ($0,95), либо вместе на первом запросе после первой компактизации ($0,75). Четвёртая ветвь из шести сессий, прогонявшаяся 25 августа 2026 года, вносила те же два изменения на запросе, который вызвал первую компактизацию ($0,92 за сессию): проход суммаризации этого запроса записал контекст в 81 000 токенов в кэш вместо того, чтобы прочитать его, поэтому этот проход стоил $0,21 против $0,04 за тот же проход в ветви на границе. Сессии впервые компактизировались на запросе с 21 по 25 (16 из 21 сессии — на запросе 22), как только подсказка превышала порог компактизации в 80 000 токенов, а две сессии без изменений компактизировались второй раз ближе к концу. Более низкий итог ветви на границе по сравнению с ветвью без изменений отражает её запросы с низким уровнем усилий до изменения и эти вторые компактизации, а не кэширование: затраты двух ветвей на перезапись различаются менее чем на цент. Ветвь с изменениями в середине сессии заплатила $0,23 за сессию за перезаписи кэша; разница между ветвью в середине сессии и ветвью на границе составила $0,20 с 95-процентным доверительным интервалом от $0,11 до $0,29. Одна сессия в середине сессии прошла дёшево ($0,82) после того, как её модель неправильно вызвала инструмент поиска после компактизации и получила пустые результаты; она включена, и без неё ветвь в среднем даёт $0,98. Точность в среднем составила 14,2 из 20 меток в каждой ветви от 24 августа и 14,7 в ветви от 25 августа; чтения из кэша составили 91% токенов подсказки без изменений, 85% в середине сессии, 91% на границе и 86% при изменениях на вызывающем запросе.
- Измерение длительности кэша на Claude Fable 5.1: то же задание по сортировке 20 обращений и та же обвязка, что и в ссылке 16, прогонявшиеся 23 и 26 августа 2026 года на стартовом снимке Claude Fable 5.1 по его стартовым ценам ($10 за вход, $12,50 за 5-минутную запись, $20 за 1-часовую запись, $0,25 за чтение из кэша, $50 за вывод за миллион токенов), три настройки на расписание: 5-минутный кэш, 1-часовой кэш и 5-минутный кэш, поддерживаемый тёплым запросом
max_tokens: 0на неизменённом префиксе каждые 4 минуты простоя (прогоны от 23 августа пинговали сmax_tokens: 1; каждый пинг от 26 августа обновлял кэш и не тарифицировал вывод). Расписания: без пауз, 10% ходов и каждый ход по 6 минут на всех 20 обращениях, а также 45-минутные паузы на подмножестве из 5 обращений; три прогона на ячейку, стоимость вычислена по полямusageкаждого ответа по прейскурантным ценам, точность — по тем же золотым меткам (от 12 до 17 точных меток из 20). Средние за сессию на 26 августа для настроек 5 минут, 1 час и поддержания активности: без пауз $2,42, $3,09, $2,29; 10% с паузами $4,50, $2,96, $2,36; каждый ход $22,89, $3,01, $2,62; ячейки от 23 августа согласуются в пределах 6%. Показатели для 45 минут ($1,68, $0,59 и $0,71 за сессию на 5 обращений) взяты из чистого повторного прогона 26 августа после того, как инцидент с биллингом кэша испортил первые ячейки того дня; прогоны от 23 августа дали $1,67, $0,58 и $0,70. Точка пересечения между настройками 5 минут и 1 час — 3,1% ходов, та же мера, что и в ссылке 16. - Terminal-Bench 3: 74 задачи публичного бенчмарка терминальных агентов, прогонявшиеся на Claude Managed Agents с двумя пользовательскими инструментами — оболочкой и редактором файлов, которые оценочная обвязка запускает в собственном контейнере каждой задачи, — вместо встроенных инструментов платформы, а в остальном при настройках платформы по умолчанию для внешних учётных записей, два прогона на модель при уровне усилий
high, 27–28 августа 2026 года. Баллы — исходные доли успешных прохождений по 148 попыткам на модель; одиночные прогоны колеблются на 5–11 пунктов. Стоимость — это то, что было бы выставлено клиенту по прейскурантным ценам, переоценённое запрос за запросом по записям использования прогонов с 5-минутным временем жизни кэша. Claude Opus 4.7 завершил 11 из своих 148 попыток на своём ограничении вывода.
Следующие шаги
Самый крупный бесплатный выигрыш на этой странице: настройка, время жизни и диагностика.
Обменивайте интеллект на задержку и стоимость в рамках одной модели.
Оцените возможности, скорость и стоимость по всему семейству моделей Claude.
Дайте агентным циклам обратный отсчёт токенов, по которому они саморегулируются.
Установите жёсткий долларовый лимит на сессию Managed Agents.
Посмотрите текущие цены за токен для каждой модели Claude.
Применяйте эти рычаги по одному к работающему агенту в исполняемом ноутбуке, со стоимостью за задачу после каждого шага.
Посмотрите пошаговый разбор паттернов советника и оркестратора.
Was this page helpful?