Тестируй скиллы Claude Code: 5 плагинов за час
Плагины Claude Code тестирование скиллы — теперь с Plugin Evals: 6 типов грейдеров, baseline без плагина и CI-гейт. Как настроить и зачем это твоим скиллам.

Я, Арина Михална, работаю с тестированием плагинов Claude Code скиллов — раньше это была чистая лотерея: написал скилл, потыкал руками, ну вроде работает. Anthropic добавила в Claude Code систему Plugin Evals, и теперь у меня есть нормальный инструмент для проверки скиллов: 6 типов грейдеров, baseline без плагина и CI-гейт, который не пустит сломанный скилл дальше.

Что такое Plugin Evals и зачем это твоим скиллам
Скилл в Claude Code — это, по сути, плагин: набор инструкций и контекста, который меняет поведение агента под конкретную задачу. Если ты работаешь с Claude Code Skills, то знаешь боль: скилл написал, на паре примеров проверил, закоммитил. А потом он тихо ломается при смене модели или добавлении нового контекста, и ты узнаёшь об этом уже в продакшне.
Plugin Evals решает именно это. Anthropic добавила в Claude Code систему тестирования плагинов, которая работает так: ты описываешь набор сценариев — входные данные плюс ожидаемый результат, — и система прогоняет их через модель с твоим скиллом и без него. Потом сравнивает. Потом говорит, стало лучше или хуже.
Я, Арина Михална, когда впервые увидела эту фичу в анонсе — первая мысль была «ну наконец-то». Потому что до этого единственный способ понять, работает ли скилл как надо, это сидеть и руками гонять кейсы. Это не масштабируется вообще.
Чем Plugin Evals отличается от просто «запустить несколько тестов»:
| Обычное тестирование вручную | Plugin Evals |
|---|---|
| Каждый раз делаешь руками | Автоматически при каждом изменении |
| Нет объективного критерия «лучше/хуже» | Есть baseline без плагина для сравнения |
| Результат субъективный | 6 типов грейдеров с измеримыми метриками |
| В CI никак не интегрируется | CI-гейт блокирует деградацию |
Короче, это не просто удобство. Это переход от «вроде работает» к «точно работает».
6 типов гре
Читайте также
Чек-лист: что у тебя теперь есть
- Понимаешь, что такое Plugin Evals и зачем это нужно при работе со скиллами
- Знаешь все 6 типов грейдеров и под какую задачу какой выбрать
- Понимаешь, как работает no-plugin baseline и почему без него тесты врут
- Умеешь встроить тестирование скиллов в CI-пайплайн
- Знаешь типичные ошибки при написании eval-сценариев и как их избежать
Частые вопросы
Что такое Plugin Evals в Claude Code?
Plugin Evals — система оценки скиллов (плагинов) прямо в Claude Code. Она запускает набор тестовых сценариев, сравнивает результаты с шестью типами грейдеров и показывает, работает ли твой скилл лучше или хуже базовой линии без плагина.
Сколько типов грейдеров в Plugin Evals?
Шесть типов грейдеров. Каждый проверяет свой аспект: от точного совпадения строк до оценки качества через LLM-судью.
Что такое no-plugin baseline в контексте тестирования скиллов?
Это контрольный прогон той же задачи без подключённого скилла. Сравнивая с baseline, ты видишь, насколько скилл реально улучшает результат, а не просто меняет поведение модели.
Как Plugin Evals встраивается в CI?
Anthropic добавила CI-гейт: тесты можно запускать в пайплайне автоматически. Если скилл деградировал по метрикам, пайплайн падает и в продакшн изменения не уходят.
Где почитать документацию по Claude Code и скиллам?
Официальная документация Claude Code — docs.anthropic.com/en/docs/claude-code. Там же раздел по скиллам и примеры конфигурации.
Следующий шаг
Собери свой сайт за вечер
Свой сайт на Claude за один вечер — и продавай такие же от 30 000 ₽. 8 уроков в записи, без кода и без дизайнера.
Хочу сайт за вечерИли просто следи
А.М. решает вопросы — 5 000+ подписчиков, разборы Claude каждый день.
Подписаться в Telegram

