claude plugin eval menjalankan plugin Anda terhadap serangkaian kasus uji, menilai hasilnya, dan secara default menjalankan setiap kasus lagi tanpa plugin sehingga Anda dapat melihat kontribusinya. claude plugin eval init menanyakan kepada Anda seperti apa hasil yang baik, kemudian mengusulkan kasus uji dan pemeriksaan yang menilainya, mencoba suite sekali, dan menulis file. Setiap run, dan setiap pemeriksaan yang memiliki model judge kedua untuk membalas, adalah panggilan model nyata di akun Anda.

Dari direktori root plugin Anda, biarkan Claude membuat draft suite:
Ketika Claude memberi tahu Anda bahwa suite siap, keluar dari sesi yang dibuka claude plugin eval init dan jalankan claude plugin eval . untuk menilai setiap kasus. Tabel ringkasan dicetak di terminal Anda, dan report.html di bawah evals/results/ memiliki detail per-run.
Di aplikasi Claude Code Desktop, Anda dapat mengeluarkan panel apa pun ke jendela terpisahnya sendiri. Seret diff atau terminal ke layar kedua sementara Claude terus bekerja di jendela utama, kemudian dock panel kembali ketika Anda selesai.
Kemenangan lainnya
maxEffortLevel di tingkat atas atau per model di bawah modelSettings untuk membatasi tingkat upaya pada setiap penyedia, termasuk Amazon Bedrock, Agent Platform Google Cloud, dan Microsoft Foundry; tingkat yang lebih tinggi berjalan pada batas--plugin-dir ke folder plugin untuk memuat setiap subfolder langsung yang memiliki manifestCLAUDE_CODE_WEBFETCH_DEADLINE_MS untuk mengubah deadline, atau ke 0 untuk menghapus batas--json ke claude plugin install, uninstall, update, enable, atau disable untuk mencetak hasil sebagai satu objek JSON pada baris terakhir stdout[Data Exfiltration]/ di tengah prompt, Anda sekarang dapat memilih dari daftar perintah yang cocok alih-alih saran tunggal. Daftar terbuka saat Anda mengetik dalam rendering fullscreen. Skill plugin juga cocok pada namanya tanpa awalan pluginEsc atau Up, dan teks kembali ke kotak pesan