最佳實務測試與評估
降低延遲
透過選擇更快的模型(例如 Claude Haiku 4.5)、精簡提示與輸出的 token 數量,以及串流回應,來降低 Claude 的回應延遲。
「Latency」(延遲)是指模型處理提示並生成輸出所需的時間。延遲可能受到多種因素影響,例如模型的大小、提示的複雜度,以及支援模型與互動端點的底層基礎設施。
如何衡量延遲
在討論延遲時,您可能會遇到幾個術語與衡量指標:
- 基準延遲(Baseline latency): 這是模型處理提示並生成回應所花費的時間,不考慮每秒的輸入與輸出 token 數。它能讓您大致了解模型的速度。
- 「Time to first token」(首個 token 時間),即 TTFT: 此指標衡量從送出提示開始,到模型生成回應的第一個 token 所需的時間。當您使用「streaming」(串流)(稍後會詳細說明)並希望為使用者提供反應靈敏的體驗時,這項指標特別重要。
若想更深入了解這些術語,請參閱詞彙表。
如何降低延遲
1. 選擇合適的模型
降低延遲最直接的方法之一,就是為您的使用情境選擇合適的模型。Anthropic 提供一系列模型,各自具備不同的能力與效能特性。請考量您的具體需求,並在速度與輸出品質方面選擇最符合您需求的模型。
對於速度至關重要的應用程式,Claude Haiku 4.5 在維持高智慧水準的同時,提供最快的回應時間:
client = anthropic.Anthropic()
# 對於時間敏感的應用程式,請使用 Claude Haiku 4.5
message = client.messages.create(
model="claude-haiku-4-5",
max_tokens=100,
messages=[
{
"role": "user",
"content": "Summarize this customer feedback in 2 sentences: [feedback text]",
}
],
)
print(message.content[0].text)如需更多關於模型指標的詳細資訊,請參閱模型概覽頁面。
2. 最佳化提示與輸出長度
在維持高效能的前提下,盡量減少輸入提示與預期輸出中的 token 數量。模型需要處理與生成的 token 越少,回應速度就越快。
以下是一些協助您最佳化提示與輸出的技巧:
- 清楚但簡潔: 力求在提示中清楚且簡潔地傳達您的意圖。避免不必要的細節或冗餘資訊,同時請記住 Claude 缺乏關於您使用情境的上下文,如果指示不清楚,可能無法做出您預期的邏輯推斷。
- 要求較短的回應: 直接要求 Claude 保持簡潔。如果 Claude 輸出的長度超出預期,請要求 Claude 收斂其冗長的表達。
- 設定適當的輸出上限: 使用
max_tokens參數為生成回應的最大長度設定硬性上限。這可以防止 Claude 生成過長的輸出。 - 嘗試調整 temperature:
temperature參數控制輸出的隨機性。較低的值(例如 0.2)有時能產生更聚焦且更短的回應,而較高的值(例如 0.8)則可能產生更多樣化但可能更長的輸出。
在提示清晰度、輸出品質與 token 數量之間找到適當的平衡,可能需要一些實驗。
3. 串流回應
串流是一項讓模型能在完整輸出完成之前就開始回傳回應的功能。這可以顯著提升您應用程式的感知回應速度,因為使用者可以即時看到模型的輸出。
啟用串流後,您可以在模型輸出抵達時即時處理,同步更新您的使用者介面或平行執行其他任務。
請造訪串流訊息,了解如何為您的使用情境實作串流。
後續步驟
Was this page helpful?