Claude Opus 4.8 專為複雜的代理式程式編寫與企業工作而打造。它以 Claude Opus 4.7 為基礎。本頁面總結了發布時的所有新內容,包括快速模式(Claude API 上的研究預覽版)以及降低至 1,024 個 token 的最小可快取提示長度。
| 模型 | API 模型 ID | 說明 |
|---|---|---|
| Claude Opus 4.8 | claude-opus-4-8 | 適用於複雜的代理式程式編寫與企業工作 |
Claude Opus 4.8 在 Claude API、Amazon Bedrock、Google Cloud 和 Microsoft Foundry 上預設支援 1M token 上下文視窗、128k 最大輸出 token、自適應思考,以及與 Claude Opus 4.7 相同的工具集與平台功能。
如需完整的定價與規格,請參閱模型概述。
Claude Opus 4.8 接受在 messages 陣列中緊接於使用者回合之後的 role: "system" 訊息(須遵守放置規則)。這讓您可以在長時間執行的對話中稍後附加更新的指令,而無需重述完整的系統提示。以這種方式更新指令可保留先前回合的提示快取命中,並降低代理式迴圈的輸入成本。不需要 beta 標頭。請參閱對話中系統訊息以了解使用詳情。
拒絕回應上的 stop_details 物件(自 Claude Opus 4.7 起提供)現已公開記錄於文件中。當 Claude 拒絕完成請求時,除了現有的 refusal 停止原因外,此物件還會描述拒絕的類別。您的應用程式可以使用它來區分不同類別的被拒絕請求,並將使用者引導至正確的下一步。不需要 beta 標頭。請參閱拒絕與備援以了解類別清單,以及停止原因與備援以了解處理指引。
Claude Opus 4.8 上的 effort 參數預設值在所有介面上皆為 high,包括 Claude API 和 Claude Code。如果您目前已明確設定 effort,您的設定將保持不變。請參閱 Effort 以了解各層級的指引。
快速模式現已作為研究預覽版在 Claude API 上提供給 Claude Opus 4.8 使用。搭配 fast-mode-2026-02-01 beta 標頭設定 speed: "fast",即可從相同模型獲得最高 2.5 倍的每秒輸出 token 數,並採用進階定價。請參閱快速模式以了解存取方式、支援的模型與定價。
Claude Opus 4.8 的最小可快取提示長度為 1,024 個 token,低於 Claude Opus 4.7 的 2,048 個 token。在 Claude Opus 4.7 上因太短而無法快取的提示,現在無需變更程式碼即可建立快取項目。請參閱提示快取以了解各模型的最小值。
這些限制與 Claude Opus 4.7 相同,因此已在 Claude Opus 4.7 上執行的程式碼無需變更。這些限制僅適用於 Messages API。Claude Managed Agents 不受影響。
在 Claude Opus 4.8 上,將 temperature、top_p 或 top_k 設定為非預設值會傳回 400 錯誤,與 Claude Opus 4.7 相同。請省略這些參數,並使用提示來引導模型的行為。
與 Claude Opus 4.7 相同,Claude Opus 4.8 不支援擴展思考預算。設定 thinking: {type: "enabled", budget_tokens: N} 會傳回 400 錯誤。
以下 diff 將為 Claude Opus 4.6 或更早版本編寫的請求更新為可在 Claude Opus 4.8 上執行。移除的行(-)設定了舊的模型 ID 以及 Claude Opus 4.8 會拒絕的手動思考預算。新增的行(+)設定了新的模型 ID、切換至自適應思考,並透過傳入頂層 output_config 欄位的 effort 參數來控制思考深度。模型會在每個回合自行決定何時思考以及思考多少。如果您完全移除 thinking 欄位,請求將在不思考的情況下執行:
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
- model="claude-opus-4-6",
+ model="claude-opus-4-8",
max_tokens=16000,
- thinking={"type": "enabled", "budget_tokens": 10000},
+ thinking={"type": "adaptive"},
+ output_config={"effort": "high"},
messages=[
{
"role": "user",
"content": "Explain why the sum of two even numbers is always even.",
}
],
)與 Claude Opus 4.7 相比,Claude Opus 4.8 針對以下方面的行為改進:
啟用自適應思考後,Claude Opus 4.8 僅在判斷該回合需要時才觸發推理。在簡單的查詢和簡短的代理式步驟中,它會直接回應。在複雜的多步驟問題中,它會先推理再回答。與相同 effort 層級的 Claude Opus 4.7 相比,這減少了雙峰工作負載上浪費的思考 token。與 Claude Opus 4.7 相同,除非您在請求中明確設定 thinking: {type: "adaptive"},否則思考功能為關閉狀態。
這些並非 API 破壞性變更,但可能需要更新提示。請參閱遷移至 Claude Opus 4.8 以取得完整指引。
medium 允許稍多的思考,high 稍少,而 xhigh 則大幅增加。如果您曾針對 Claude Opus 4.7 調整過某個 effort 層級,請在調整之前先在該層級重新建立成本與延遲的基準。如需逐步遷移說明與完整的遷移檢查清單,請參閱遷移至 Claude Opus 4.8。如果您是從 Claude Opus 4.6 或更早版本升級,也請套用 Claude Opus 4.7 遷移步驟。這些步驟涵蓋了僅升級至 Claude Opus 4.8 所未涵蓋的破壞性變更。如果您使用 Claude Code 或 Agent SDK,Claude API skill 可以自動將這些遷移步驟套用至您的程式碼庫。
從先前的 Claude 版本遷移至最新 Claude 模型的指南。
使用 effort 參數控制 Claude 回應時使用的 token 數量,在回應完整性與 token 效率之間取得平衡。
透過自適應思考模式,讓 Claude 動態決定何時以及使用多少擴展思考。
對話中系統訊息如何保留快取命中。
了解每個 stop_reason 值的含義,以及如何在您的應用程式中處理截斷、工具使用、暫停的回合與拒絕。
從 Claude Opus 模型獲得最高 2.5 倍的每秒輸出 token 數。
Was this page helpful?