claude plugin eval은 플러그인을 테스트 케이스 모음에 대해 실행하고, 결과를 채점하며, 기본적으로 플러그인 없이 각 케이스를 다시 실행하여 플러그인이 어떤 기여를 하는지 확인할 수 있습니다. claude plugin eval init은 좋은 결과가 무엇인지 묻고, 테스트 케이스와 이를 채점하는 검사를 제안하며, 모음을 한 번 시도하고 파일을 작성합니다. 모든 실행과 두 번째 모델 판사가 있는 모든 검사는 계정에서 실제 모델 호출입니다.

플러그인의 루트 디렉토리에서 Claude가 모음을 작성하도록 합니다:
claude plugin eval init이 열린 세션을 종료하고 Claude가 모음이 준비되었다고 알려주면 claude plugin eval .을 실행하여 모든 케이스를 채점합니다. 요약 테이블이 터미널에 인쇄되고, evals/results/ 아래의 report.html에는 실행별 세부 정보가 있습니다.
Claude Code Desktop 앱에서 모든 창을 자신의 윈도우로 팝아웃할 수 있습니다. diff 또는 터미널을 두 번째 화면으로 드래그하면서 Claude는 주 윈도우에서 계속 작업하고, 완료되면 창을 다시 도킹합니다.
기타 개선 사항
modelSettings 아래 모델별로 maxEffortLevel을 설정합니다. 더 높은 수준은 제한에서 실행됩니다—plugin-dir을 플러그인 폴더로 지정하여 매니페스트가 있는 각 직접 하위 폴더를 로드합니다CLAUDE_CODE_WEBFETCH_DEADLINE_MS를 설정하여 deadline을 변경하거나 0으로 설정하여 제한을 제거합니다claude plugin install, uninstall, update, enable 또는 disable에 —json을 전달하여 결과를 stdout의 마지막 라인에 하나의 JSON 객체로 인쇄합니다[Data Exfiltration]과 같이 일치한 규칙의 이름을 지정합니다/를 입력할 때, 이제 단일 제안 대신 일치하는 명령 목록에서 선택할 수 있습니다. 목록은 전체 화면 렌더링에서 입력할 때 열립니다. 플러그인 스킬도 플러그인 접두사 없이 이름과 일치합니다Esc 또는 Up을 누르면 텍스트가 메시지 상자로 반환됩니다