claude plugin eval executa seu plugin em relação a um conjunto de casos de teste, pontua os resultados e, por padrão, executa cada caso novamente sem o plugin para que você possa ver o que ele contribui. claude plugin eval init pergunta como um bom resultado se parece, depois propõe casos de teste e as verificações que os pontuam, tenta a suite uma vez e escreve os arquivos. Cada execução e cada verificação que tem um segundo juiz de modelo a resposta é uma chamada de modelo real em sua conta.

Do diretório raiz do seu plugin, peça ao Claude para rascunhar a suite:
Quando Claude disser que a suite está pronta, saia da sessão que claude plugin eval init abriu e execute claude plugin eval . para pontuar cada caso. A tabela de resumo é impressa em seu terminal, e report.html sob evals/results/ tem o detalhe por execução.
No aplicativo Claude Code Desktop, você pode abrir qualquer painel em sua própria janela. Arraste o diff ou terminal para uma segunda tela enquanto Claude continua trabalhando na janela principal, depois encaixe o painel novamente quando terminar.
Outras vitórias
maxEffortLevel no nível superior ou por modelo sob modelSettings para limitar o nível de esforço em cada provedor, incluindo Amazon Bedrock, Agent Platform do Google Cloud e Microsoft Foundry; qualquer nível mais alto é executado no limite--plugin-dir para uma pasta de plugins para carregar cada subpasta imediata que tenha um manifestoCLAUDE_CODE_WEBFETCH_DEADLINE_MS para alterar o prazo, ou para 0 para remover o limite--json para claude plugin install, uninstall, update, enable ou disable para imprimir o resultado como um objeto JSON na última linha de stdout[Data Exfiltration]/ no meio de um prompt, agora você pode escolher entre uma lista de comandos correspondentes em vez de uma única sugestão. A lista abre conforme você digita em renderização em tela cheia. Uma skill de plugin também corresponde em seu nome sem o prefixo do pluginEsc ou Up, e o texto retorna à caixa de mensagem