Este guia cobre os padrões de prompting específicos do Claude Opus 4.8. Para as mudanças de API envolvidas na migração do Claude Opus 4.8 para o modelo Opus mais recente, consulte Migrando para o Claude Opus 5 a partir do Claude Opus 4.8. Para técnicas que se aplicam a todos os modelos Claude atuais, consulte Melhores práticas de prompting.
Claude Opus 4.8 tem pontos fortes particulares em trabalho agêntico de longo horizonte, trabalho de conhecimento, visão e tarefas de memória. Ele tem bom desempenho imediato em prompts existentes do Claude Opus 4.7. Os padrões a seguir cobrem os comportamentos que mais frequentemente exigem ajustes.
Para as mudanças de parâmetros de API desde o Claude Opus 4.7 (parâmetros de amostragem, padrão de esforço, padrão de janela de contexto de 1M, mensagens de sistema no meio da conversa e detalhes de parada por recusa), consulte Migrando para o Claude Opus 5 a partir do Claude Opus 4.7, que cobre as mesmas mudanças no caminho para o modelo Opus mais recente; Claude Opus 4.8 compartilha esses comportamentos.
Claude Opus 4.8 calibra o comprimento da resposta de acordo com o quão complexa ele julga a tarefa ser, em vez de adotar uma verbosidade fixa por padrão. Isso geralmente significa respostas mais curtas em consultas simples e muito mais longas em análises abertas.
Se seu produto depende de um certo estilo ou verbosidade de saída, você pode precisar ajustar seus prompts. Como exemplo, para diminuir a verbosidade, você pode adicionar:
Provide concise, focused responses. Skip non-essential context, and keep examples minimal.Se você observar exemplos específicos de tipos de verbosidade (como explicações excessivas), pode adicionar instruções adicionais no seu prompt para evitá-los. Exemplos positivos mostrando como Claude pode se comunicar com o nível apropriado de concisão tendem a ser mais eficazes do que exemplos negativos ou instruções que dizem ao modelo o que não fazer.
O parâmetro effort permite ajustar a inteligência do Claude versus o gasto de tokens, trocando capacidade por maior velocidade e custos mais baixos. Comece com o nível de esforço xhigh para casos de uso de codificação e agênticos, e use no mínimo o esforço high para a maioria dos casos de uso sensíveis à inteligência. Experimente outros níveis de esforço para ajustar ainda mais o uso de tokens e a inteligência:
max: O esforço máximo pode proporcionar ganhos de desempenho em alguns casos de uso, mas pode apresentar retornos decrescentes com o aumento do uso de tokens. Essa configuração também pode, às vezes, ser propensa a pensar demais. Teste o esforço máximo para tarefas que exigem inteligência.xhigh: O esforço extra alto é a melhor configuração para a maioria dos casos de uso de codificação e agênticos.high: Essa configuração equilibra uso de tokens e inteligência. Para a maioria dos casos de uso sensíveis à inteligência, use no mínimo o esforço high.medium: Bom para casos de uso sensíveis a custo que precisam reduzir o uso de tokens abrindo mão de inteligência.low: Reserve para tarefas curtas e bem delimitadas e cargas de trabalho sensíveis à latência que não são sensíveis à inteligência.Claude Opus 4.8 respeita os níveis de esforço estritamente, especialmente na extremidade baixa. Em low e medium, o modelo limita seu trabalho ao que foi pedido em vez de ir além. Isso é bom para latência e custo, mas em tarefas moderadamente complexas executadas com esforço low há algum risco de pensamento insuficiente.
Se você observar raciocínio superficial em problemas complexos, aumente o esforço para high ou xhigh em vez de contornar com prompting. Se você precisar manter o esforço em low por questões de latência, adicione orientação direcionada:
This task involves multistep reasoning. Think carefully through the problem before responding.O esforço provavelmente será mais importante para este modelo do que para qualquer Opus anterior, então experimente ativamente ao fazer o upgrade.
No Claude Opus 4.8, o pensamento fica desativado a menos que você defina explicitamente thinking: {type: "adaptive"}. O comportamento de acionamento do pensamento adaptativo é direcionável. Se você perceber que o modelo está pensando com mais frequência do que gostaria, o que pode acontecer com prompts do sistema grandes ou complexos, adicione orientação para direcioná-lo. Como sempre, meça o efeito de quaisquer mudanças de prompting no desempenho. Exemplo:
Thinking adds latency and should only be used when it will meaningfully improve answer quality — typically for problems that require multistep reasoning. When in doubt, respond directly.Por outro lado, se você estiver executando cargas de trabalho difíceis em medium e observando pensamento insuficiente, a primeira alavanca é aumentar o esforço. Se você precisar de controle mais fino, use prompting diretamente para isso.
Se você estiver executando o Claude Opus 4.8 com esforço max ou xhigh, defina um orçamento grande de tokens máximos de saída para que o modelo tenha espaço para pensar e agir através de seus subagentes e chamadas de ferramentas. Comece com 64k tokens e ajuste a partir daí.
Claude Opus 4.8 tem uma tendência a favorecer o raciocínio em vez de chamadas de ferramentas. Isso produz melhores resultados na maioria dos casos. No entanto, aumentar a configuração de esforço é uma alavanca útil para aumentar o nível de uso de ferramentas, especialmente em trabalho de conhecimento. As configurações de esforço high ou xhigh mostram substancialmente mais uso de ferramentas em busca agêntica e codificação. Para cenários em que você deseja mais uso de ferramentas, você também pode ajustar seu prompt para instruir explicitamente o modelo sobre quando e como usar adequadamente suas ferramentas. Por exemplo, se você perceber que o modelo não está usando suas ferramentas de busca na web, descreva claramente por que e como ele deveria usá-las.
Claude Opus 4.8 fornece atualizações mais regulares e de maior qualidade ao usuário ao longo de traces agênticos longos. Se você adicionou scaffolding para forçar mensagens de status intermediárias ("Após cada 3 chamadas de ferramentas, resuma o progresso"), tente removê-lo. Se você perceber que o comprimento ou o conteúdo das atualizações voltadas ao usuário do Claude Opus 4.8 não estão bem calibrados para seu caso de uso, descreva explicitamente no prompt como essas atualizações devem ser e forneça exemplos.
Claude Opus 4.8 interpreta prompts de forma literal e explícita, particularmente em níveis de esforço mais baixos. Ele não generaliza silenciosamente uma instrução de um item para outro, e não infere solicitações que você não fez. A vantagem desse literalismo é precisão e menos retrabalho, e ele geralmente tem melhor desempenho em casos de uso de API com prompts cuidadosamente ajustados, extração estruturada e pipelines onde você deseja comportamento previsível. Se você precisar que Claude aplique uma instrução de forma ampla, declare o escopo explicitamente (por exemplo, "Aplique esta formatação a todas as seções, não apenas à primeira").
Como com qualquer modelo novo, o estilo de prosa em escrita de formato longo pode mudar. Claude Opus 4.8 tende a um estilo direto e opinativo, com frases de validação mínimas e uso parcimonioso de emojis. Se seu produto depende de uma voz específica, reavalie os prompts de estilo em relação à nova linha de base.
Por exemplo, se a voz do seu produto é mais calorosa ou mais conversacional, adicione:
Use a warm, collaborative tone. Acknowledge the user's framing before answering.Claude Opus 4.8 tende a criar menos subagentes por padrão. No entanto, esse comportamento é direcionável por meio de prompting; dê ao Claude Opus 4.8 orientação explícita sobre quando subagentes são desejáveis. Um exemplo simples para um caso de uso de codificação:
Do not spawn a subagent for work you can complete directly in a single response (e.g. refactoring a function you can already see).
Spawn multiple subagents in the same turn when fanning out across items or reading multiple files.Claude Opus 4.8 tem fortes instintos de design, com um estilo padrão consistente: fundos em creme quente/off-white (~#F4F1EA), tipografia display serifada (Georgia, Fraunces, Playfair), acentos de palavras em itálico e um destaque em terracota/âmbar. Isso funciona bem para briefs editoriais, de hospitalidade e de portfólio, mas parecerá inadequado para dashboards, ferramentas de desenvolvimento, fintech, saúde ou aplicativos empresariais. O padrão aparece em apresentações de slides e interfaces web.
Esse padrão é persistente. Instruções genéricas ("não use creme", "deixe limpo e minimalista") tendem a mudar o modelo para uma paleta fixa diferente em vez de produzir variedade. Duas abordagens funcionam de forma confiável:
1. Especifique uma alternativa concreta. O modelo segue especificações explícitas com precisão:
Design a desktop landing page for a supplement brand called AEFRM.
The visual direction should come from a cold monochrome atmosphere using pale silver-gray tones that gradually deepen into blue-gray and near-black, similar to a misted metallic surface.
The page should feel sharp and controlled, with a strong sense of structure and restraint.
Use this tonal system across the full page instead of introducing bright accent colors.
Use the uploaded image on the hero design in black and white.
The layout should be built with clear horizontal sections and a centered max-width container. Use 4px corner radius consistently across cards, buttons, inputs, and media frames. Margins should feel generous, with enough empty space around each section so the page breathes.
Typography should use a square, angular sans-serif with wider letter spacing than usual, especially in headings and navigation, so the text feels more engineered and less compressed. Headline text can be large and uppercase, while supporting copy remains short and sparse. The sub texts should be written with Alumni Sans SC in 4-6px like tiny little texts on corners bottom centre like that.
For the structure, start with a hero section containing a strong product statement, one short supporting paragraph, and a clean product placeholder or packshot frame. Below that, add a benefit grid with three or four blocks, then a formulation or ingredients section, and finally a cta.
Buttons should be flat and precise, with subtle hover changes using transition: all 160ms ease out where brightness and border contrast shift slightly rather than using dramatic motion.
Color palette should stay within this range:
#E9ECEC, #C9D2D4, #8C9A9E, #44545B, #11171B.2. Faça o modelo propor opções antes de construir. Isso quebra o padrão e dá controle aos usuários. Se você anteriormente dependia de temperature para variedade de design, use esta abordagem; ela produz direções significativamente diferentes entre execuções. Exemplo de prompt:
Before building, propose 4 distinct visual directions tailored to this brief (each as: bg hex / accent hex / typeface — one-line rationale). Ask the user to pick one, then implement only that direction.Além disso, Claude Opus 4.8 requer menos prompting de design de frontend do que modelos anteriores para evitar padrões genéricos que os usuários chamam de estética "AI slop". Com modelos anteriores, a Anthropic recomendava um trecho de prompt mais longo na skill frontend-design. No entanto, Claude Opus 4.8 gera frontends distintos e criativos com orientação de prompting mais mínima. Este trecho de prompt funciona bem com os conselhos de prompting anteriores para variedade:
<frontend_aesthetics>
NEVER use generic AI-generated aesthetics like overused font families (Inter, Roboto, Arial, system fonts), cliched color schemes (particularly purple gradients on white or dark backgrounds), predictable layouts and component patterns, and cookie-cutter design that lacks context-specific character. Use unique fonts, cohesive colors and themes, and animations for effects and micro-interactions.
</frontend_aesthetics>O uso de tokens e o comportamento do Claude Opus 4.8 podem diferir entre agentes de codificação autônomos e assíncronos com um único turno de usuário e agentes de codificação interativos e síncronos com múltiplos turnos de usuário. Especificamente, ele tende a usar mais tokens em configurações interativas, principalmente porque raciocina mais após os turnos do usuário. Isso pode melhorar a coerência de longo horizonte, o seguimento de instruções e as capacidades de codificação em sessões de codificação longas e interativas, mas também vem com mais uso de tokens. Para maximizar tanto o desempenho quanto a eficiência de tokens em produtos de codificação, use esforço xhigh ou high, adicione recursos autônomos como um modo automático e reduza o número de interações humanas exigidas de seus usuários.
Naturalmente, ao limitar o número de interações de usuário necessárias, é importante especificar a tarefa, a intenção e as restrições relevantes antecipadamente no primeiro turno humano. Fornecer descrições de tarefas bem especificadas, claras e precisas antecipadamente pode ajudar a maximizar a autonomia e a inteligência enquanto minimiza o uso extra de tokens após os turnos do usuário. Como Claude Opus 4.8 é mais autônomo do que modelos anteriores, esse padrão de uso ajuda a maximizar o desempenho. Em contraste, prompts ambíguos ou subespecificados transmitidos progressivamente ao longo de múltiplos turnos de usuário tendem a reduzir relativamente a eficiência de tokens e, às vezes, o desempenho.
Claude Opus 4.8 é significativamente melhor em encontrar bugs do que modelos anteriores, e tem tanto maior recall quanto maior precisão em avaliações internas. No entanto, se seu harness de revisão de código foi ajustado para um modelo anterior, você pode inicialmente ver um recall menor. Isso provavelmente é um efeito do harness, não uma regressão de capacidade. Quando um prompt de revisão diz coisas como "reporte apenas problemas de alta severidade", "seja conservador" ou "não seja detalhista", Claude Opus 4.8 pode seguir essa instrução mais fielmente do que modelos anteriores: ele pode investigar o código com a mesma profundidade, identificar os bugs e então não reportar descobertas que julga estarem abaixo do limiar declarado. Isso pode se manifestar como o modelo fazendo a mesma profundidade de investigação, mas convertendo menos investigações em descobertas reportadas, especialmente em bugs de menor severidade. A precisão tipicamente aumenta, mas o recall medido pode cair mesmo que a capacidade subjacente do modelo de encontrar bugs tenha melhorado.
Alguma linguagem de prompt recomendada:
Report every issue you find, including ones you are uncertain about or consider low-severity. Do not filter for importance or confidence at this stage - a separate verification step will do that. Your goal here is coverage: it is better to surface a finding that later gets filtered out than to silently drop a real bug. For each finding, include your confidence level and an estimated severity so a downstream filter can rank them.Este prompt pode ser usado sem ter uma segunda etapa real, mas mover a filtragem por confiança para fora da etapa de descoberta frequentemente ajuda. Se seu harness tem uma etapa separada de verificação, deduplicação ou classificação, diga explicitamente ao modelo que seu trabalho na etapa de descoberta é cobertura, e não filtragem.
Se você quiser que o modelo se autofiltre em uma única passagem, seja concreto sobre onde está o limiar em vez de usar termos qualitativos como "importante": por exemplo, "reporte quaisquer bugs que possam causar comportamento incorreto, uma falha de teste ou um resultado enganoso; omita apenas detalhes menores como preferências puras de estilo ou nomenclatura."
Itere nos prompts contra um subconjunto de suas avaliações ou casos de teste para validar ganhos de recall ou de pontuação F1.
A capacidade de uso de computador funciona em várias resoluções, até uma resolução máxima de 2576px / 3.75MP. Testes internos de uso de computador mostram que enviar imagens em 1080p fornece um bom equilíbrio entre desempenho e custo.
Para cargas de trabalho particularmente sensíveis a custo, 720p ou 1366×768 são opções de menor custo com forte desempenho. Realize seus próprios testes para encontrar as configurações ideais para seu caso de uso; experimentar com configurações de esforço também pode ajudar a ajustar o comportamento do modelo.
Was this page helpful?