Claude Platform Docs
最佳實務測試與評估

降低延遲

透過選擇更快的模型(例如 Claude Haiku 4.5)、精簡提示與輸出的 token 數量,以及串流回應,來降低 Claude 的回應延遲。

「Latency」(延遲)是指模型處理提示並生成輸出所需的時間。延遲可能受到多種因素影響,例如模型的大小、提示的複雜度,以及支援模型與互動端點的底層基礎設施。


如何衡量延遲

在討論延遲時,您可能會遇到幾個術語與衡量指標:

  • 基準延遲(Baseline latency): 這是模型處理提示並生成回應所花費的時間,不考慮每秒的輸入與輸出 token 數。它能讓您大致了解模型的速度。
  • 「Time to first token」(首個 token 時間),即 TTFT: 此指標衡量從送出提示開始,到模型生成回應的第一個 token 所需的時間。當您使用「streaming」(串流)(稍後會詳細說明)並希望為使用者提供反應靈敏的體驗時,這項指標特別重要。

若想更深入了解這些術語,請參閱詞彙表。


如何降低延遲

1. 選擇合適的模型

降低延遲最直接的方法之一,就是為您的使用情境選擇合適的模型。Anthropic 提供一系列模型,各自具備不同的能力與效能特性。請考量您的具體需求,並在速度與輸出品質方面選擇最符合您需求的模型。

對於速度至關重要的應用程式,Claude Haiku 4.5 在維持高智慧水準的同時,提供最快的回應時間:

client = anthropic.Anthropic()

# 對於時間敏感的應用程式,請使用 Claude Haiku 4.5
message = client.messages.create(
    model="claude-haiku-4-5",
    max_tokens=100,
    messages=[
        {
            "role": "user",
            "content": "Summarize this customer feedback in 2 sentences: [feedback text]",
        }
    ],
)
print(message.content[0].text)

如需更多關於模型指標的詳細資訊,請參閱模型概覽頁面。

2. 最佳化提示與輸出長度

在維持高效能的前提下,盡量減少輸入提示與預期輸出中的 token 數量。模型需要處理與生成的 token 越少,回應速度就越快。

以下是一些協助您最佳化提示與輸出的技巧:

  • 清楚但簡潔: 力求在提示中清楚且簡潔地傳達您的意圖。避免不必要的細節或冗餘資訊,同時請記住 Claude 缺乏關於您使用情境的上下文,如果指示不清楚,可能無法做出您預期的邏輯推斷。
  • 要求較短的回應: 直接要求 Claude 保持簡潔。如果 Claude 輸出的長度超出預期,請要求 Claude 收斂其冗長的表達。
  • 設定適當的輸出上限: 使用 max_tokens 參數為生成回應的最大長度設定硬性上限。這可以防止 Claude 生成過長的輸出。
  • 嘗試調整 temperature: temperature 參數控制輸出的隨機性。較低的值(例如 0.2)有時能產生更聚焦且更短的回應,而較高的值(例如 0.8)則可能產生更多樣化但可能更長的輸出。

在提示清晰度、輸出品質與 token 數量之間找到適當的平衡,可能需要一些實驗。

3. 串流回應

串流是一項讓模型能在完整輸出完成之前就開始回傳回應的功能。這可以顯著提升您應用程式的感知回應速度,因為使用者可以即時看到模型的輸出。

啟用串流後,您可以在模型輸出抵達時即時處理,同步更新您的使用者介面或平行執行其他任務。

請造訪串流訊息,了解如何為您的使用情境實作串流。


後續步驟

透過允許表達不確定性、以直接引述作為回應依據,以及使用引用來驗證主張,將 Claude 輸出中的幻覺降到最低。

透過 server-sent events 逐步串流 Messages API 回應,包括文字、工具使用與擴展思考的增量內容。

Was this page helpful?