claude plugin eval запускает ваш плагин на наборе тестовых случаев, оценивает результаты и по умолчанию запускает каждый случай снова без плагина, чтобы вы могли увидеть, что он добавляет. claude plugin eval init спрашивает вас, как должен выглядеть хороший результат, затем предлагает тестовые случаи и проверки, которые их оценивают, пробует набор один раз и записывает файлы. Каждый запуск и каждая проверка, которая имеет второго судью модели для ответа, — это реальный вызов модели на вашем счёте.

Из корневого каталога вашего плагина попросите Claude составить набор:
Когда Claude скажет вам, что набор готов, выйдите из сеанса, который открыл claude plugin eval init, и запустите claude plugin eval . для оценки каждого случая. Таблица сводки выводится в ваш терминал, а report.html в evals/results/ содержит детали каждого запуска.
В приложении Claude Code Desktop вы можете вывести любую панель в отдельное окно. Перетащите diff или терминал на второй экран, пока Claude продолжает работать в главном окне, а затем закрепите панель обратно, когда закончите.
Другие улучшения
maxEffortLevel на верхнем уровне или для каждой модели в modelSettings, чтобы ограничить уровень усилий на каждом поставщике, включая Amazon Bedrock, Google Cloud’s Agent Platform и Microsoft Foundry; любой более высокий уровень работает на пределе--plugin-dir на папку плагинов, чтобы загрузить каждую непосредственную подпапку, которая имеет манифестCLAUDE_CODE_WEBFETCH_DEADLINE_MS для изменения срока или на 0 для удаления ограничения--json в claude plugin install, uninstall, update, enable или disable, чтобы вывести результат как один объект JSON в последней строке stdout[Data Exfiltration]/ в середине подсказки, вы теперь можете выбрать из списка соответствующих команд вместо одного предложения. Список открывается по мере ввода в полноэкранном режиме. Навык плагина также совпадает по его имени без префикса плагинаEsc или Up, и текст вернётся в поле сообщения