Claude Opus 4.8 专为复杂的智能体编码和企业级工作而构建。它在 Claude Opus 4.7 的基础上进行了改进。本页面总结了发布时的所有新内容,包括快速模式(Claude API 上的研究预览版)以及更低的 1,024 令牌最小可缓存提示长度。
| 模型 | API 模型 ID | 描述 |
|---|---|---|
| Claude Opus 4.8 | claude-opus-4-8 | 适用于复杂的智能体编码和企业级工作 |
Claude Opus 4.8 在 Claude API、Amazon Bedrock、Google Cloud 和 Microsoft Foundry 上默认支持 1M 令牌上下文窗口、128k 最大输出令牌、自适应思考,以及与 Claude Opus 4.7 相同的工具集和平台功能。
有关完整的定价和规格信息,请参阅模型概述。
Claude Opus 4.8 接受在 messages 数组中紧跟用户轮次之后的 role: "system" 消息(需遵守放置规则)。这使您可以在长时间运行的对话中稍后追加更新的指令,而无需重述完整的系统提示。以这种方式更新指令可以保留早期轮次的提示缓存命中,并降低智能体循环的输入成本。无需 beta 标头。有关使用详情,请参阅对话中系统消息。
拒绝响应中的 stop_details 对象(自 Claude Opus 4.7 起可用)现已公开记录在文档中。当 Claude 拒绝完成请求时,除了现有的 refusal 停止原因外,该对象还会描述拒绝的类别。您的应用程序可以使用它来区分不同类别的被拒绝请求,并将用户引导至正确的后续步骤。无需 beta 标头。有关类别列表,请参阅拒绝与回退;有关处理指南,请参阅停止原因与回退。
Claude Opus 4.8 上的 effort 参数在所有平台(包括 Claude API 和 Claude Code)上的默认值均为 high。如果您目前已显式设置 effort,则您的设置保持不变。有关各级别的指南,请参阅 Effort。
快速模式现已作为研究预览版在 Claude API 上为 Claude Opus 4.8 提供。设置 speed: "fast" 并使用 fast-mode-2026-02-01 beta 标头,即可以高级定价从同一模型获得高达 2.5 倍的每秒输出令牌速度。有关访问权限、支持的模型和定价,请参阅快速模式。
Claude Opus 4.8 上的最小可缓存提示长度为 1,024 个令牌,低于 Claude Opus 4.7 上的 2,048 个令牌。在 Claude Opus 4.7 上因过短而无法缓存的提示现在无需更改代码即可创建缓存条目。有关各模型的最小值,请参阅提示缓存。
这些约束与 Claude Opus 4.7 相同,因此已在 Claude Opus 4.7 上运行的代码无需更改。它们仅适用于 Messages API。Claude 托管智能体不受影响。
在 Claude Opus 4.8 上,将 temperature、top_p 或 top_k 设置为非默认值会返回 400 错误,与 Claude Opus 4.7 相同。请省略这些参数,并使用提示来引导模型的行为。
与 Claude Opus 4.7 一样,Claude Opus 4.8 不支持扩展思考预算。设置 thinking: {type: "enabled", budget_tokens: N} 会返回 400 错误。
以下差异对比(diff)将为 Claude Opus 4.6 或更早版本编写的请求更新为可在 Claude Opus 4.8 上运行。删除的行(-)设置了旧的模型 ID 和 Claude Opus 4.8 会拒绝的手动思考预算。添加的行(+)设置了新的模型 ID,切换到自适应思考,并通过在顶层 output_config 字段中传递的 effort 参数来控制思考深度。模型会在每个轮次自行决定何时思考以及思考多少。如果您完全移除 thinking 字段,请求将在不进行思考的情况下运行:
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
- model="claude-opus-4-6",
+ model="claude-opus-4-8",
max_tokens=16000,
- thinking={"type": "enabled", "budget_tokens": 10000},
+ thinking={"type": "adaptive"},
+ output_config={"effort": "high"},
messages=[
{
"role": "user",
"content": "Explain why the sum of two even numbers is always even.",
}
],
)与 Claude Opus 4.7 相比,Claude Opus 4.8 在以下方面实现了行为改进:
启用自适应思考后,Claude Opus 4.8 仅在判断当前轮次需要时才触发推理。对于简单的查询和简短的智能体步骤,它会直接响应。对于复杂的多步骤问题,它会先推理再回答。与相同 effort 级别下的 Claude Opus 4.7 相比,这减少了双峰工作负载上浪费的思考令牌。与 Claude Opus 4.7 一样,除非您在请求中显式设置 thinking: {type: "adaptive"},否则思考功能处于关闭状态。
这些不是 API 破坏性变更,但可能需要更新提示。有关完整指南,请参阅迁移到 Claude Opus 4.8。
medium 允许稍多的思考,high 稍少,而 xhigh 则大幅增加。如果您针对 Claude Opus 4.7 调整过某个 effort 级别,请在调整之前先在该级别上重新建立成本和延迟基准。有关分步迁移说明和完整的迁移检查清单,请参阅迁移到 Claude Opus 4.8。如果您从 Claude Opus 4.6 或更早版本升级,还需应用 Claude Opus 4.7 迁移步骤。这些步骤涵盖了仅升级到 Claude Opus 4.8 所不涉及的破坏性变更。如果您使用 Claude Code 或 Agent SDK,Claude API 技能可以自动将这些迁移步骤应用到您的代码库。
从之前的 Claude 版本迁移到最新 Claude 模型的指南。
使用 effort 参数控制 Claude 响应时使用的令牌数量,在响应完整性和令牌效率之间进行权衡。
通过自适应思考模式,让 Claude 动态决定何时以及在多大程度上使用扩展思考。
对话中系统消息如何保留缓存命中。
了解每个 stop_reason 值的含义,以及如何在您的应用程序中处理截断、工具使用、暂停轮次和拒绝。
从 Claude Opus 模型获得高达 2.5 倍的每秒输出令牌速度。
Was this page helpful?