Vision
Claudes Vision-Fähigkeiten ermöglichen es, Bilder zu verstehen und zu analysieren, und eröffnen spannende Möglichkeiten für multimodale Interaktion.
Dieser Leitfaden beschreibt, wie du Bilder an Claude sendest, welche Limits und Kosten gelten und wo du Hinweise für koordinatenbasierte Workflows findest.
Bilder an Claude senden
Nutze Claudes Vision-Fähigkeiten über:
- claude.ai. Lade ein Bild hoch, wie du es mit einer Datei tun würdest, oder ziehe ein Bild per Drag-and-drop direkt in das Chatfenster.
- Playground in der Claude Console. Füge Bilder direkt zu einem beliebigen User-Nachrichtenblock hinzu.
- API-Anfrage. Siehe die folgenden Beispiele.
Über die API stellst du Claude Bilder als image-Content-Blöcke bereit, wobei du einen von drei Quelltypen verwendest:
- Ein base64-kodiertes Bild, das in den Request-Body eingebettet ist
- Eine URL-Referenz auf ein online gehostetes Bild
- Eine
file_id, die von der Files API zurückgegeben wird (einmal hochladen, beliebig oft referenzieren)
Beispiel mit base64-kodiertem Bild
image1_data = "iVBORw0KGgoAAAANSUhEUgAAAAEAAAABCAIAAACQd1PeAAAADElEQVR4nGP4z8AAAAMBAQDJ/pLvAAAAAElFTkSuQmCC"
image1_media_type = "image/png"
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-opus-5-5",
max_tokens=1024,
messages=[
{
"role": "user",
"content": [
{
"type": "image",
"source": {
"type": "base64",
"media_type": image1_media_type,
"data": image1_data,
},
},
{"type": "text", "text": "Describe this image."},
],
}
],
)
print(message)Beispiel mit URL-basiertem Bild
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-opus-5-5",
max_tokens=1024,
messages=[
{
"role": "user",
"content": [
{
"type": "image",
"source": {
"type": "url",
"url": "https://platform.claude.com/docs/images/vision-example.jpg",
},
},
{"type": "text", "text": "Describe this image."},
],
}
],
)
print(message)Beispiel mit Files-API-Bild
Für Bilder, die du wiederholt verwendest, oder wenn du den Kodierungsaufwand vermeiden möchtest, verwende die Files API. Lade das Bild einmal hoch und referenziere dann die zurückgegebene file_id in nachfolgenden Nachrichten, anstatt die base64-Daten erneut zu senden.
client = anthropic.Anthropic()
# Lade die Bilddatei hoch
with open("vision-example.jpg", "rb") as f:
file_upload = client.files.upload(file=("vision-example.jpg", f, "image/jpeg"))
# Verwende die hochgeladene Datei in einer Nachricht
message = client.messages.create(
model="claude-opus-5-5",
max_tokens=1024,
messages=[
{
"role": "user",
"content": [
{
"type": "image",
"source": {"type": "file", "file_id": file_upload.id},
},
{"type": "text", "text": "Describe this image."},
],
}
],
)
print(message.content)Siehe Messages-API-Beispiele für weiteren Beispielcode und Parameterdetails.
Mehrere Bilder
Du kannst mehrere Bilder in eine einzelne Anfrage aufnehmen, und Claude analysiert sie gemeinsam. Das ist nützlich, um Bilder zu vergleichen, nach Unterschieden zu fragen oder mit einer Sequenz wie den Seiten eines Dokuments zu arbeiten. Wenn du mehrere Bilder sendest, leite jedes mit einem kurzen Textlabel ein (Image 1:, Image 2: und so weiter), damit du in deinem Prompt und in Folge-Turns namentlich darauf verweisen kannst.
image1_data = "iVBORw0KGgoAAAANSUhEUgAAAAEAAAABCAIAAACQd1PeAAAADElEQVR4nGP4z8AAAAMBAQDJ/pLvAAAAAElFTkSuQmCC"
image2_data = "iVBORw0KGgoAAAANSUhEUgAAAAEAAAABCAIAAACQd1PeAAAADElEQVR4nGNgYPgPAAEDAQAIicLsAAAAAElFTkSuQmCC"
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-opus-5-5",
max_tokens=1024,
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Image 1:"},
{
"type": "image",
"source": {
"type": "base64",
"media_type": "image/png",
"data": image1_data,
},
},
{"type": "text", "text": "Image 2:"},
{
"type": "image",
"source": {
"type": "base64",
"media_type": "image/png",
"data": image2_data,
},
},
{"type": "text", "text": "How are these images different?"},
],
}
],
)
print(message)In einer mehrstufigen Konversation fügst du neue Bilder in späteren user-Turns auf dieselbe Weise hinzu. Claude hat Zugriff auf jedes Bild aus früheren Turns, sodass Folgefragen wie „Sind diese den ersten beiden ähnlich?“ funktionieren, ohne dass du die früheren Bilder erneut in den Inhalt des neuen Turns aufnehmen musst.
Bildlimits und Kosten
Anfragelimits
Die maximale Anzahl von Bildern pro Nachricht oder Anfrage beträgt:
- 20 pro Nachricht auf claude.ai.
- 100 pro Anfrage über die API, für Modelle mit einem „context window“ (Kontextfenster) von 200k Token.
- 600 pro Anfrage über die API, für alle anderen Modelle.
Die maximalen Abmessungen pro Bild betragen 8000x8000 px.
Wenn eine einzelne API-Anfrage mehr als 20 Bilder enthält, gilt für jedes Bild in dieser Anfrage ein strengeres Abmessungslimit pro Bild. Alle image-Blöcke in der Anfrage zählen zu diesem Schwellenwert, einschließlich Bildern aus früheren Konversations-Turns, die du erneut sendest, und Bildern, die in tool_result-Inhalten verschachtelt sind (zum Beispiel Screenshots, die an das Computer-Use-Tool zurückgegeben werden). Auf Amazon Bedrock und Google Cloud zählen auch Dokumentblöcke wie PDFs zu diesem Schwellenwert. Bilder, die das strengere Limit überschreiten, werden mit einem invalid_request_error abgelehnt, dessen Meldung auf „many-image requests“ verweist und das aktuelle Limit in Pixeln angibt. Um auf allen Plattformen unter dem Limit zu bleiben, skaliere entweder jedes Bild so, dass keine der beiden Abmessungen 2000 px überschreitet, oder beschränke die Anfrage auf 20 oder weniger Bild- und Dokumentblöcke.
Die maximale Größe pro Bild beträgt:
- 10 MB (base64-kodiert) bei direkter Nutzung der Claude API.
- 5 MB (base64-kodiert) auf Amazon Bedrock und Google Cloud.
- 10 MB auf claude.ai.
Unterstützte Formate
Claude unterstützt JPEG-, PNG-, GIF- und WebP-Bilder (image/jpeg, image/png, image/gif, image/webp). Animationen werden nicht unterstützt, und es wird nur das erste Frame verwendet.
Auflösung und Token-Kosten
Claude betrachtet Bilder in Patches statt in Pixeln. Jeder Patch ist ein 28×28-Pixel-Block des Bildes, der als „visual token“ (visuelles Token) bezeichnet wird. Ein Bild kostet daher ⌈width / 28⌉ × ⌈height / 28⌉ visuelle Token.
Jedes Modell hat eine maximale native Bildauflösung, ausgedrückt als Limit für die lange Kante und als Limit für visuelle Token. Bilder, die eines der beiden Limits überschreiten, werden vor der Verarbeitung herunterskaliert; siehe Wie Claude Bilder skaliert und auffüllt für die genaue Regel. Die Ausnahme sind Screenshots und Zoom-Bilder, die du an die Toolsets für Computer Use und Browser Use zurückgibst: Die API lehnt ein tool_result-Bild, das die Limits des Modells überschreitet, mit einem Validierungsfehler ab, anstatt es herunterzuskalieren. Skaliere diese Bilder daher in deiner Anwendung, bevor du sie zurückgibst. Damit jedes andere übergroße Bild mit einem Fehler abgelehnt statt herunterskaliert wird, setze das transformations-Feld des Bildblocks.
| Auflösungsstufe | Modelle | Max. lange Kante | Max. visuelle Token |
|---|---|---|---|
| Hochauflösend | Claude 4.7 und neuere Modelle | 2576 px | 4784 |
| Standard | Alle anderen Modelle | 1568 px | 1568 |
Die Unterstützung für hohe Auflösung ist bei den aufgeführten Modellen automatisch aktiv und erfordert weder einen Beta-Header noch ein clientseitiges Opt-in.
Die folgende Tabelle zeigt die herunterskalierte Auflösung und die Kosten in visuellen Token für mehrere Bildgrößen auf jeder Stufe:
| Bildgröße | Standard-Stufe: herunterskaliert auf | Standard-Stufe: Token | Hochauflösende Stufe: herunterskaliert auf | Hochauflösende Stufe: Token |
|---|---|---|---|---|
| 200x200 px (0,04 Megapixel) | Nicht skaliert | 64 | Nicht skaliert | 64 |
| 1000x1000 px (1 Megapixel) | Nicht skaliert | 1296 | Nicht skaliert | 1296 |
| 1092x1092 px (1,19 Megapixel) | Nicht skaliert | 1521 | Nicht skaliert | 1521 |
| 1920x1080 px (2,07 Megapixel) | 1456x819 px | 1560 | Nicht skaliert | 2691 |
| 2000x1500 px (3 Megapixel) | 1269x952 px | 1564 | Nicht skaliert | 3888 |
| 3840x2160 px (8,29 Megapixel) | 1456x819 px | 1560 | 2576x1449 px | 4784 |
Wenn ein Bild herunterskaliert wird, skaliert Claude es auf die größte Größe, die in die Limits der Stufe passt, und behält dabei das Seitenverhältnis bei. Dadurch werden die Token-Kosten gedeckelt. Die genaue Regel und eine Referenzimplementierung findest du unter Wie Claude Bilder skaliert und auffüllt.
Um die Kosten abzuschätzen, multipliziere die Token-Anzahl mit dem Preis pro Token des Modells, das du verwendest. Zum Beispiel kostet das 1000×1000-Bild bei Claude Haiku 4.5 mit 1 $ pro Million Input-Token (Standard-Stufe) etwa 1,30 $ pro tausend Bilder. Bei Claude Opus 5 mit 5 $ pro Million (hochauflösende Stufe) kostet dasselbe Bild etwa 6,48 $ pro tausend und das 4K-Bild etwa 23,92 $ pro tausend.
Hochauflösende Bilder können bis zu etwa dreimal mehr visuelle Token verbrauchen als dasselbe Bild auf einem Modell der Standard-Stufe. Wenn du die zusätzliche Detailtreue, die hohe Auflösung für Computer Use, Screenshot-Verständnis und dichte Dokumente bietet, nicht benötigst, führe vor dem Senden ein Downsampling der Bilder durch, um die Token-Kosten zu kontrollieren. Um die Latenz zu minimieren und koordinatenbasierte Workflows zu vereinfachen, skaliere Bilder bevorzugt vor dem Hochladen.
Hinweise zur Bildqualität
Wenn du Claude Bilder bereitstellst, beachte für beste Ergebnisse Folgendes:
- Bildklarheit: Stelle sicher, dass Bilder klar und nicht zu unscharf oder verpixelt sind.
- Text: Wenn das Bild wichtigen Text enthält, achte darauf, dass er lesbar und nicht zu klein ist. Vermeide es, wichtigen visuellen Kontext wegzuschneiden, nur um den Text zu vergrößern.
- Skalierung: Berücksichtige, dass dein Bild möglicherweise skaliert wird, wenn es zu groß ist (siehe Auflösung und Token-Kosten); dadurch kann zum Beispiel Text schlechter lesbar werden. Ziehe in Erwägung, deine Bilder vorab zu skalieren, zuzuschneiden oder beides. Damit ein übergroßes Bild mit einem Fehler abgelehnt statt skaliert wird (wichtig für Koordinaten-Workflows), markiere den Bildblock mit
"oversized_image": "error". - Bildkomprimierung: Das Komprimieren von Bildern vor dem Senden mit einem verlustbehafteten Format wie JPEG oder WebP (verlustbehafteter Modus) kann die Latenz verringern, indem die Größe der Anfragen reduziert wird. Dies kann jedoch Artefakte einführen, die der Modellleistung schaden, insbesondere wenn mehrere Komprimierungsdurchläufe angewendet werden. Starke JPEG-Komprimierung kann zum Beispiel Text schwer lesbar machen. Vergewissere dich, dass deine Komprimierungseinstellungen für die Aufgabe geeignet sind, indem du die tatsächlich an die API gesendeten Bilder überprüfst.
Koordinaten und Bounding Boxes
Für „bounding boxes“ (Begrenzungsrahmen), Punkte und Pixelkoordinaten siehe Koordinaten und Bounding Boxes. Claude gibt absolute Pixelkoordinaten relativ zu dem Bild zurück, das es nach der Skalierung sieht; dieser Leitfaden behandelt, wie Claude Bilder skaliert und auffüllt und wie du vorab skalierst oder umrechnest, damit die Koordinaten mit deinem Originalbild übereinstimmen.
Einschränkungen
Obwohl Claudes Fähigkeiten zum Bildverständnis auf dem neuesten Stand sind, gibt es einige Einschränkungen, die du kennen solltest:
- Personenidentifikation: Claude darf nicht verwendet werden, um Personen in Bildern namentlich zu identifizieren, und lehnt dies ab.
- Genauigkeit: Claude kann halluzinieren oder Fehler machen, wenn es Bilder von geringer Qualität, gedrehte Bilder oder sehr kleine Bilder unter 200 Pixeln interpretiert.
- Räumliches Denken: Claudes Koordinaten- und Lokalisierungsausgaben sind Näherungswerte. Befolge die Hinweise in Koordinaten und Bounding Boxes und überprüfe die Ausgaben, bevor du dich auf sie verlässt.
- Zählen: Claude kann ungefähre Anzahlen von Objekten in einem Bild angeben, ist aber möglicherweise nicht immer exakt, insbesondere bei großen Mengen kleiner Objekte.
- KI-generierte Bilder: Claude kann nicht feststellen, ob ein Bild KI-generiert ist, und kann falsch liegen, wenn es danach gefragt wird. Verlasse dich nicht darauf, um gefälschte oder synthetische Bilder zu erkennen.
- Unangemessene Inhalte: Claude verarbeitet keine unangemessenen oder expliziten Bilder, die gegen die Acceptable Use Policy verstoßen.
- Anwendungen im Gesundheitswesen: Obwohl Claude allgemeine medizinische Bilder analysieren kann, ist es nicht dafür ausgelegt, komplexe diagnostische Scans wie CTs oder MRTs zu interpretieren. Claudes Ausgaben sollten nicht als Ersatz für professionelle medizinische Beratung oder Diagnose betrachtet werden.
Überprüfe und verifiziere Claudes Bildinterpretationen stets sorgfältig, insbesondere bei Anwendungsfällen mit hohem Risiko. Verwende Claude nicht ohne menschliche Aufsicht für Aufgaben, die perfekte Präzision oder sensible Bildanalyse erfordern.
FAQ
JPEG, PNG, GIF und WebP. Siehe Unterstützte Formate.
Ja. Verwende im image-Content-Block den Quelltyp url anstelle von base64. Siehe das Beispiel mit URL-basiertem Bild.
Ja. Siehe Anfragelimits für die Limits pro Bild und die Gesamtlimits für die Anfragegröße über die Claude API, Amazon Bedrock, Google Cloud und claude.ai hinweg.
Bis zu 600 pro API-Anfrage (100 für Modelle mit einem Kontextfenster von 200k Token) und 20 pro Turn auf claude.ai. Siehe Anfragelimits für Details und das niedrigere Abmessungslimit pro Bild, das bei mehr als 20 Bildern gilt.
Nein, Claude parst oder empfängt keine Metadaten aus Bildern, die ihm übergeben werden.
Nein. Bild-Uploads sind flüchtig und werden nicht über die Dauer der API-Anfrage hinaus gespeichert. Hochgeladene Bilder werden automatisch gelöscht, nachdem sie verarbeitet wurden.
Informationen dazu, wie hochgeladene Bilder und andere Daten behandelt werden, findest du auf der Seite mit der Datenschutzrichtlinie von Anthropic. Anthropic verwendet hochgeladene Bilder nicht, um Modelle zu trainieren.
Wenn Claudes Bildinterpretation falsch erscheint:
- Stelle sicher, dass das Bild klar, hochwertig und korrekt ausgerichtet ist.
- Probiere Prompt-Engineering-Techniken aus, um die Ergebnisse zu verbessern.
- Wenn das Problem weiterhin besteht, markiere die Ausgabe in claude.ai (Daumen hoch/runter) oder kontaktiere das Support-Team.
Dein Feedback hilft, Claude zu verbessern!
Nein, Claude ist ausschließlich ein Modell zum Bildverständnis. Es kann Bilder interpretieren und analysieren, aber es kann keine Bilder generieren, produzieren, bearbeiten, manipulieren oder erstellen.
Nächste Schritte
Erhalte Tipps und Best-Practice-Techniken für Aufgaben wie das Interpretieren von Diagrammen und das Extrahieren von Inhalten aus Formularen.
Sieh dir die Messages-API-Dokumentation an, einschließlich Beispiel-API-Aufrufen mit Bildern.
Was this page helpful?