Арина Михална
Инструменты3 минобновлено 18 сентября 2026 г.

Тестируй скиллы Claude Code: 5 плагинов за час

Плагины Claude Code тестирование скиллы — теперь с Plugin Evals: 6 типов грейдеров, baseline без плагина и CI-гейт. Как настроить и зачем это твоим скиллам.

Схема тестирования плагинов Claude Code через Plugin Evals с CI-гейтом
В этой статье
  1. Что такое Plugin Evals и зачем это твоим скиллам
  2. 6 типов гре
  3. Читайте также

Я, Арина Михална, работаю с тестированием плагинов Claude Code скиллов — раньше это была чистая лотерея: написал скилл, потыкал руками, ну вроде работает. Anthropic добавила в Claude Code систему Plugin Evals, и теперь у меня есть нормальный инструмент для проверки скиллов: 6 типов грейдеров, baseline без плагина и CI-гейт, который не пустит сломанный скилл дальше.

6типов грейдеров в Plugin Evals
1baseline без плагина на каждый тест
0сломанных скиллов в прод с CI-гейтом

Схема Plugin Evals: скилл проходит грейдеры и сравнивается с baseline

Что такое Plugin Evals и зачем это твоим скиллам

Скилл в Claude Code — это, по сути, плагин: набор инструкций и контекста, который меняет поведение агента под конкретную задачу. Если ты работаешь с Claude Code Skills, то знаешь боль: скилл написал, на паре примеров проверил, закоммитил. А потом он тихо ломается при смене модели или добавлении нового контекста, и ты узнаёшь об этом уже в продакшне.

Plugin Evals решает именно это. Anthropic добавила в Claude Code систему тестирования плагинов, которая работает так: ты описываешь набор сценариев — входные данные плюс ожидаемый результат, — и система прогоняет их через модель с твоим скиллом и без него. Потом сравнивает. Потом говорит, стало лучше или хуже.

Я, Арина Михална, когда впервые увидела эту фичу в анонсе — первая мысль была «ну наконец-то». Потому что до этого единственный способ понять, работает ли скилл как надо, это сидеть и руками гонять кейсы. Это не масштабируется вообще.

Чем Plugin Evals отличается от просто «запустить несколько тестов»:

Обычное тестирование вручную Plugin Evals
Каждый раз делаешь руками Автоматически при каждом изменении
Нет объективного критерия «лучше/хуже» Есть baseline без плагина для сравнения
Результат субъективный 6 типов грейдеров с измеримыми метриками
В CI никак не интегрируется CI-гейт блокирует деградацию

Короче, это не просто удобство. Это переход от «вроде работает» к «точно работает».

6 типов гре

Читайте также

Чек-лист: что у тебя теперь есть

Частые вопросы

Что такое Plugin Evals в Claude Code?

Plugin Evals — система оценки скиллов (плагинов) прямо в Claude Code. Она запускает набор тестовых сценариев, сравнивает результаты с шестью типами грейдеров и показывает, работает ли твой скилл лучше или хуже базовой линии без плагина.

Сколько типов грейдеров в Plugin Evals?

Шесть типов грейдеров. Каждый проверяет свой аспект: от точного совпадения строк до оценки качества через LLM-судью.

Что такое no-plugin baseline в контексте тестирования скиллов?

Это контрольный прогон той же задачи без подключённого скилла. Сравнивая с baseline, ты видишь, насколько скилл реально улучшает результат, а не просто меняет поведение модели.

Как Plugin Evals встраивается в CI?

Anthropic добавила CI-гейт: тесты можно запускать в пайплайне автоматически. Если скилл деградировал по метрикам, пайплайн падает и в продакшн изменения не уходят.

Где почитать документацию по Claude Code и скиллам?

Официальная документация Claude Code — docs.anthropic.com/en/docs/claude-code. Там же раздел по скиллам и примеры конфигурации.

Следующий шаг

Собери свой сайт за вечер

Свой сайт на Claude за один вечер — и продавай такие же от 30 000 ₽. 8 уроков в записи, без кода и без дизайнера.

Хочу сайт за вечер

Или просто следи

А.М. решает вопросы — 5 000+ подписчиков, разборы Claude каждый день.

Подписаться в Telegram

Источники