Skills для Claude Code и тестирование
Skills для Claude Code и тесты описывают, как в проекте принято тестировать: что считается достаточным покрытием, какие сценарии обязательны, как именуются кейсы и где проходит граница между юнит-тестом и интеграционным. Без этих правил модель пишет формально корректные тесты, которые проверяют не то, что ломается. Типичная проблема сгенерированных тестов — они закрепляют реализацию вместо поведения. Тест проверяет, что функция вызвала другую функцию, и падает при любом рефакторинге, ничего не сообщая о работоспособности. Правило «проверяем наблюдаемый результат, а не внутренние вызовы» — ровно то, что фиксируется в скилле. Вторая половина правил — про обязательные сценарии: пустой ввод, отказ внешнего сервиса, повторный запрос. Их модель пропускает не по неумению, а потому что о них не попросили.
Вторая частая задача — разбор упавшего прогона. В каскаде из сорока красных тестов настоящая причина обычно одна. Скилл описывает порядок разбора: найти первый упавший, отделить следствия, воспроизвести минимальным примером — и только потом чинить.
В подборке — скиллы для юнит-тестов, E2E-сценариев, работы с покрытием и разбора падений.
Скиллы в подборке
В подборке 353 скиллов, ниже перечислены 24 с наивысшей оценкой.
- TDD-цикл с контрольными точками и Git — workflow-patterns — это скилл для Claude Code, который реализует TDD-рабочий процесс Conductor с управлением контрольными точками фаз, коммитами Git и протоколом верификации качества. Скилл охватывает полный цикл red-green-refactor: написание падающих тестов, выполнение задач из plan.md трека, прохождение gates качества и фиксацию прогресса. Ключевые операции включают управление git-коммитами с содержательными notes, последовательное прохождение фаз, обновление plan.md сразу после завершения задачи и ожидание подтверждения на checkpoint-верификации. Детальная документация паттернов и разобранные примеры хранятся в `references/details.md`. Подходит командам, которым важны строгие quality assurance gates, контроль покрытия и воспроизводимый процесс разработки через автоматизированный workflow.
- Тестирование Temporal workflows на Python — temporal-python-testing — это скилл для Claude Code, который помогает тестировать Temporal workflows на Python с использованием pytest, time-skipping и стратегий мокирования. Скилл охватывает три уровня тестирования: unit-тесты с WorkflowEnvironment и time-skipping (многомесячные workflows выполняются за секунды), интеграционные тесты с мокированием activities для изоляции логики, и replay-тесты для валидации детерминизма перед деплоем. Ресурсы организованы по файлам — `resources/unit-testing.md`, `resources/integration-testing.md`, `resources/replay-testing.md`, `resources/local-setup.md` — и загружаются по мере необходимости. Подойдёт разработчикам, которым нужно наладить CI/CD-пайплайн для Temporal-приложений, достичь покрытия кода ≥80% или отладить сбои в тестах.
- Аудит доступности по стандарту WCAG 2.2 — wcag-audit-patterns — это скилл для Claude Code, который проводит аудиты доступности по стандарту WCAG 2.2 с автоматизированным тестированием, ручной проверкой и рекомендациями по устранению нарушений. Скилл охватывает принципы POUR (Perceivable, Operable, Understandable, Robust) и три уровня соответствия: A, AA и AAA. Внутри — классификация нарушений по критичности: от отсутствия alt-текста и недоступности элементов с клавиатуры до неверной иерархии заголовков и отсутствия атрибута языка. Подходит командам, которые готовятся к проверкам на соответствие ADA, Section 508 или VPAT, а также разработчикам, внедряющим доступные компоненты с нуля. Детальные шаблоны и разобранные примеры хранятся в файле `references/details.md`.
- Визуальная проверка UI по эталонным скриншотам — visual-verdict — это скилл для Claude Code, который сравнивает сгенерированные скриншоты UI с эталонными изображениями и возвращает строгий JSON-вердикт для управления следующей итерацией правок. Скилл принимает один или несколько reference_images, generated_screenshot и опциональный category_hint (например, dashboard или sns-feed), после чего выдаёт объект с полями score (0–100), verdict (pass / revise / fail), category_match, списками differences и suggestions, а также кратким reasoning. Порог прохождения — 90 баллов: пока score ниже, скилл требует продолжать редактирование и повторный запуск перед любой визуальной проверкой. При сложной диагностике расхождений pixel-diff-инструменты используются как вспомогательный слой, а найденные горячие точки конвертируются в конкретные пункты differences и suggestions. Подходит командам, которым нужна детерминированная автоматизированная проверка визуального соответствия макетам — вёрстка, дизайн-ревью, регрессионное тестирование UI.
- Тестирование с экранными читалками NVDA, JAWS и VoiceOver — screen-reader-testing — это скилл для Claude Code, который помогает тестировать веб-приложения с экранными читалками VoiceOver, NVDA и JAWS для проверки совместимости со вспомогательными технологиями. Скилл охватывает пять основных ридеров: NVDA (31% пользователей), JAWS (40%), VoiceOver для macOS/iOS (15%), TalkBack для Android (10%) и Narrator (4%) — с указанием рекомендуемых связок браузер/ОС и приоритетов тестового покрытия. Внутри собраны готовые чеклисты для проверки заголовков, форм, динамического контента, таблиц и ARIA-атрибутов, а также полные таблицы горячих клавиш для каждого ридера и типовые сценарии отладки с примерами исправления HTML. Подойдёт разработчикам и QA-инженерам, которым нужно обеспечить соответствие WCAG и реальную доступность интерфейса для незрячих пользователей.
- Тестирование смарт-контрактов на Solidity — web3-testing — это скилл для Claude Code, который обеспечивает комплексное тестирование смарт-контрактов на Solidity с использованием Hardhat и Foundry. Скилл покрывает юнит-тесты, интеграционные тесты, фаззинг для поиска граничных случаев, газ-оптимизацию и форкинг мейннета для реалистичных сценариев. В Hardhat-части используются hardhat-gas-reporter, solidity-coverage и @nomicfoundation/hardhat-toolbox, а Foundry-часть включает cheatcodes (vm.prank, vm.deal, vm.expectRevert) и fuzz-тесты с произвольными входными данными. Скилл также позволяет автоматизировать отчёты о покрытии кода и верифицировать контракты на Etherscan. Подходит разработчикам DeFi-протоколов и Web3-приложений, которым нужно выстроить надёжный тестовый стенд для блокчейн-кода.
- Автономный контроль качества кода — ultraqa — это скилл для Claude Code, который реализует автономный цикл контроля качества: запускает проверки, диагностирует сбои и применяет исправления до тех пор, пока заданная цель не будет достигнута. Поддерживаются режимы --tests, --build, --lint, --typecheck и --custom с произвольным паттерном успеха; флаг --interactive подключает субагента qa-tester для проверки CLI-сервисов. Каждый цикл из пяти максимально допустимых включает три шага: запуск команды, диагностику через субагента architect (модель Opus) и автоматическое исправление через executor (Sonnet). Если одна и та же ошибка повторяется трижды, скилл завершается досрочно с описанием корневой причины; состояние сессии хранится в .omc/ultraqa-state.json и удаляется при завершении. Подходит командам, которым нужно автоматически довести тесты, сборку или линтинг до зелёного статуса без ручного вмешательства в каждой итерации.
- Параллельная отладка методом конкурирующих гипотез — parallel-debugging — это скилл для Claude Code, который помогает отлаживать сложные проблемы методом анализа конкурирующих гипотез (ACH) с параллельным исследованием, сбором доказательств и арбитражем корневых причин. Скилл генерирует гипотезы по шести категориям отказов: логические ошибки, проблемы с данными, состоянием, интеграцией, ресурсами и окружением. Каждая гипотеза оценивается по доказательной базе с тремя уровнями уверенности и обязательными ссылками на файл и строку кода. Подходит для ситуаций, когда начальные попытки отладки не дали результата, баг затрагивает несколько модулей или нужно избежать confirmation bias при анализе первопричины. Протокол арбитража классифицирует результаты как подтверждённые, правдоподобные, опровергнутые или неопределённые, после чего определяет корневую причину и валидирует исправление по чеклисту.
- Многомерное ревью кода по нескольким критериям — multi-reviewer-patterns — это скилл для Claude Code, который координирует параллельные проверки кода по нескольким измерениям качества: безопасности, производительности, архитектуре, тестированию и доступности. Скилл определяет, какие измерения назначить под конкретный сценарий (например, для изменений API — Security, Performance, Architecture), дедуплицирует находки по правилу «один файл:строка — одна проблема», при конфликтующих оценках выбирает наибольшую severity, а при конфликтующих рекомендациях сохраняет обе с атрибуцией рецензента. На выходе формируется консолидированный отчёт с разбивкой по уровням Critical / High / Medium / Low и сводной таблицей по измерениям. Подходит командам, которым нужно унифицировать многомерное code review и получить структурированный список приоритетных исправлений.
- Верификация кода перед релизом — verify — это скилл для Claude Code, который превращает расплывчатые утверждения «должно работать» в конкретные доказательства, выполняя проверки до объявления задачи завершённой. Рабочий процесс включает четыре уровня верификации: сначала запуск существующих тестов, затем проверка типов и сборки, потом точечные командные проверки, и в последнюю очередь — ручная валидация с фиксацией наблюдаемых результатов. Скилл сообщает только то, что реально проверено: что прошло, что упало, а что осталось непроверенным — без приукрашивания. Подходит для валидации фич, исправлений и рефакторинга всем, кто хочет уверенности в качестве кода перед релизом или код-ревью.
- Валидация уязвимостей перед сабмитом в bug bounty — triage-validation — это скилл для Claude Code, который валидирует найденные уязвимости до написания отчёта, чтобы исключить N/A submissions и повысить acceptance rate в bug bounty программах. Внутри — 7-вопросный gate (8 с проверкой идентичности сессии), 4 последовательных pre-submission gate, список всегда-отклоняемых классов уязвимостей, таблица conditionally-valid находок с возможными цепочками, quick reference по CVSS 3.1 и 60-секундный чеклист перед сабмитом. Один неверный ответ на любой из вопросов означает немедленную остановку: скилл требует реального HTTP-запроса, подтверждённого impact и кросс-идентичного воспроизведения (проверка IDOR, privesc и auth bypass через несколько сессий из audit.jsonl). Подходит исследователям безопасности, которые хотят отсеивать слабые и out-of-scope findings на этапе триажа, а не после написания полного отчёта.
- Vellum — сквозное тестирование ассистента из терминала — cli-testing — это скилл для Claude Code, который позволяет тестировать Vellum assistant end-to-end прямо из терминала, без десктопного приложения или веб-интерфейса. Скилл охватывает полный жизненный цикл: запуск инстанса через `vellum hatch --remote docker --source .`, отправку сообщений командой `vellum message`, потоковое чтение ответов через `vellum events` и удаление инстанса командой `vellum retire`. Подходит для проверки поведения ассистента, воспроизведения багов и smoke-тестирования изменений без запуска macOS- или веб-клиентов. Поддерживает ключи нескольких LLM-провайдеров: Anthropic, OpenAI, Gemini, Fireworks, OpenRouter, MiniMax — CLI читает их прямо из переменных окружения.
- Библиотека пейлоадов для тестирования безопасности — security-arsenal — это скилл для Claude Code, который предоставляет готовую библиотеку пейлоадов, таблиц обхода и правил сабмита для тестирования безопасности веб-приложений. Внутри — пейлоады для XSS (базовые зонды, кража куки, обход CSP, DOM-источники и синки), SSRF (метаданные AWS/GCP/Azure, фингерпринт внутренних сервисов, IP-bypass через decimal/octal/hex/IPv6), SQL-инъекций (детекция, union-based, blind time-based, обход WAF), XXE, NoSQLi, command injection, SSTI, IDOR, path-traversal, HTTP smuggling, WebSocket и обхода MFA. Скилл также содержит список находок, которые всегда отклоняются на bug bounty, и таблицу условно-валидных уязвимостей с цепочками эксплуатации — чтобы понять, стоит ли репортить конкретный баг. Подходит пентестерам и участникам bug bounty программ, которым нужно быстро подобрать нужный пейлоад или проверить, является ли находка сабмитабельной.
- Валидация уязвимостей перед отправкой в bug bounty — triage-validation — это скилл для Claude Code, который валидирует найденные уязвимости до написания отчёта по bug bounty, чтобы исключить N/A и информационные дубли. Внутри: 7-Question Gate (вопросы задаются строго по порядку, один неверный ответ — находка закрывается), 4 последовательных pre-submission gate (Reality Check, Impact Validation, Deduplication Check и Identity Check), список always-rejected классов уязвимостей, таблица условно-валидных находок с требуемыми цепочками, quick reference по CVSS 3.1, severity decision guide и 60-секундный чеклист перед отправкой. Отдельный блок Q8 фиксирует, под какой сессией воспроизводится баг: без ответа на вопросы идентификации auth-related находка считается недоказанной. Скилл предназначен для исследователей безопасности и пентестеров, которым важно держать validity ratio высоким и не тратить время программы на заведомо отклоняемые репорты.
- Promptfoo — проверка промптов и защита ИИ-приложений — Promptfoo — это плагин для Claude Code, который помогает подключить модели и цели, написать наборы проверок и запустить сканирование на уязвимости для приложений на основе языковых моделей. Сам Promptfoo — консольная утилита и библиотека с открытым кодом под лицензией MIT: она тестирует промпты, агентов и RAG, сравнивает модели рядом (OpenAI, Anthropic, Azure, Bedrock, Ollama и другие) и проводит red teaming, то есть ищет слабые места вроде обхода защиты. Подойдёт, когда нужно проверить качество промптов перед релизом, сравнить, какая модель отвечает лучше, встроить проверки в CI/CD или просмотреть пулреквесты на проблемы безопасности, связанные с LLM. Проверки запускаются локально, промпты не покидают ваш компьютер. Установка самой утилиты: npm install -g promptfoo, затем promptfoo init --example getting-started; для большинства провайдеров нужен свой API-ключ. Команды promptfoo eval и promptfoo view запускают проверку и показывают результаты. Для разработчиков ИИ-агентов и чат-ботов.
- Тестирование и сравнение LLM через omniroute CLI — cli-eval — это скилл для Claude Code, который позволяет создавать и запускать наборы тестирования LLM-моделей, отслеживать прогресс бенчмарков в реальном времени и сравнивать их результаты прямо из командной строки через CLI-инструмент omniroute. Скилл охватывает полный цикл работы с eval-суитами: создание наборов с рубриками `exact-match`, `contains`, `llm-judge` или `regex`, запуск против конкретной модели (например, `omniroute eval suites run <suiteId> --model gpt-4o --watch`), просмотр scorecards с пополнительными результатами по каждому сэмплу. Для сравнения производительности нескольких моделей — Claude, GPT-4o, Gemini — один и тот же суит запускается в цикле, а полученные оценки сопоставляются. Интеграция с CI-пайплайнами реализована через проверку порогового значения score: если результат опускается ниже заданного уровня, сборка завершается с ошибкой. Подходит командам, которым нужно автоматизировать регрессионное тестирование языковых моделей и контролировать качество ответов при обновлениях.
- Отладка плагинов IntelliJ Platform — debugging — это скилл для Claude Code, который предоставляет техники и инструменты отладки для разработки на IntelliJ Platform. Скилл описывает работу с `idea.log`: форматы уровней логирования (`FINE` для debug, `INFO` для info), схему сокращения имён пакетов в категориях и готовые `grep`-паттерны для фильтрации записей по конкретному классу. Отдельный раздел посвящён методике end-to-end трассировки: пошаговому прохождению от точки входа (скрипт, команда, API) до исполнителя с проверкой каждого промежуточного слоя. Документация внутри скилла ссылается на Logger FAQ, руководство по расследованию зависаний IDE и Exception Analyzing FAQ. Подходит разработчикам плагинов и платформы, которым нужно диагностировать сбои, зависания или неожиданное поведение компонентов IntelliJ.
- Тестирование MPS-моделей и редактора — mps-tests — это скилл для Claude Code, который служит справочником по написанию и модификации тестов внутри MPS-моделей со стереотипом `@tests`. Охватывает четыре типа тест-кейсов: `NodesTestCase` (типизация, ограничения, области видимости, dataflow, вывод генератора), `EditorTestCase` (интенции, действия, клавиши, side-transforms, автодополнение), `MigrationTestCase` (скрипты миграции) и `BTestCase` (JUnit-тесты на Java/Kotlin без MPS-специфичных утверждений). Скилл описывает встроенные аннотации (`has error`, `has type`, `ScopesTest`), перекрёстные ссылки через метки `node<label>`, маркеры каретки и запуск тестов через MCP или непосредственно в MPS. Используется всякий раз, когда задача связана с созданием или исправлением тестов в модели с фасетом `tests`, либо с интерпретацией упавших тестов.
- Тестирование коннекторов GrokConnect через Maven — test-connectors — это скилл для Claude Code, который запускает Java/Maven тесты для проекта GrokConnect connectors. Поддерживаются три режима запуска: все тесты сразу (`all`), конкретный тестовый класс (`<ClassName>`) или отдельный метод (`<ClassName>#<method>`). Большинство тестов провайдеров — PostgreSQL, MySQL, MariaDB, MS SQL Server, Oracle, ClickHouse, MongoDB, Neo4j, Cassandra, DB2, Vertica, Snowflake, Redshift, Teradata и других — используют TestContainers и требуют запущенного Docker; unit-тесты (`SerializationTest`, `TableQueryTest`, `SqlAnnotatorTest` и ряд других) работают без него. Среди предустановленных требований — JDK 8, Maven 3+ и Docker. Скилл проверяет наличие Docker перед интеграционными тестами, выбирает нужную Maven-команду и выводит результаты — полезен разработчикам, тестирующим коннекторы к базам данных в составе GrokConnect.
- Мутации промптов для adversarial-тестирования — attack-mutator — это скилл для Claude Code, который генерирует вариации тестовых случаев и промптов для adversarial-тестирования с помощью семантических, кодировочных и визуальных мутаций. Поддерживает paraphrase, synonym_swap, formality_shift, perspective_shift, а также кодировочные техники: base64, ROT13, unicode-гомоглифы, zero-width-символы и leetspeak. Каждая мутация оценивается алгоритмом, учитывающим сохранение смысла, визуальное отличие и длину — и возвращается ранжированный список. Скилл вызывается командой /mutate с опциями --types и --best-of-n, работает с любой моделью, заданной в настройках Claude. Подходит для команд, которые тестируют обход фильтров, проверяют устойчивость систем к prompt-инъекциям и хотят максимизировать покрытие edge-кейсов.
- BigCode Evaluation Harness — бенчмаркинг моделей кодогенерации — bigcode-evaluation-harness — это скилл для Claude Code, который оценивает модели генерации кода по 15+ бенчмаркам, включая HumanEval (164 задачи), HumanEval+, MBPP, MBPP+ и MultiPL-E на 18 языках программирования, с метриками pass@k. Скилл основан на BigCode Evaluation Harness от BigCode Project и используется в leaderboard HuggingFace как отраслевой стандарт сравнения кодогенерирующих моделей. Поддерживаются квантизованные модели (4-bit), instruction-tuned модели с настройкой токенов, безопасное выполнение кода через Docker для MultiPL-E, а также сохранение генераций и результатов в JSON с показателями pass@1, pass@10, pass@100. Подходит командам ML-инженеров, которые сравнивают качество Code LLM, тестируют многоязычную поддержку или готовят модель к публикации на открытых leaderboard.
- NeMo Evaluator — оценка LLM на 100+ бенчмарках — nemo-evaluator — это скилл для Claude Code, который запускает оценку языковых моделей на 100+ бенчмарках из 18+ фреймворков, включая MMLU, HumanEval, GSM8K, GPQA Diamond и safety-тесты. Скилл использует enterprise-платформу NVIDIA NeMo Evaluator SDK с контейнерной архитектурой и поддерживает три бэкенда: локальный Docker, Slurm HPC и облако Lepton. Управление происходит через CLI-команды `nemo-evaluator-launcher run`, `status`, `ls`, `kill` и YAML-конфиги с Hydra; результаты экспортируются в MLflow. Подходит командам ML-инженеров, которым нужно воспроизводимо сравнивать несколько моделей или масштабировать тестирование на HPC-кластере с tensor- и data-параллелизмом.
- Автогенерация тестов для API — api-test-suite-builder — это скилл для Claude Code, который автоматически создаёт полные тестовые наборы для API, охватывая unit-тесты, интеграционные и end-to-end тесты. Он анализирует структуру вашего API и генерирует готовые тест-кейсы с покрытием граничных условий, ошибочных сценариев и штатных путей выполнения. Подходит разработчикам и QA-инженерам, которым нужно быстро выстроить автоматизированное тестирование без написания шаблонного кода вручную. Скилл ускоряет цикл разработки и снижает риск регрессий при изменениях в API.
- BrowserStack — кроссбраузерное тестирование с Playwright — browserstack — это скилл для Claude Code, который интегрирует платформу BrowserStack в рабочий процесс Playwright Pro для кроссбраузерного и кросс-девайс тестирования на реальных браузерах и мобильных устройствах. Скилл позволяет запускать автоматизированные тесты через BrowserStack, не меняя локальную инфраструктуру — всё выполняется на удалённых реальных устройствах платформы. Подходит QA-инженерам и разработчикам, которым нужно проверять совместимость веб-приложений в разных браузерах и на разных устройствах без ручного управления парком машин. Решает задачи автоматизации регрессионного тестирования, проверки UI на мобильных платформах и обеспечения стабильности релизов.
FAQ
Стоит ли доверять Claude написание тестов?
Тесты, написанные моделью, полезны как черновик и как страховка от пропущенных краевых случаев, но требуют проверки. Главный риск — тест, который проходит всегда: он создаёт ложное ощущение покрытия. Практичный приём — сначала убедиться, что тест падает на сломанном коде, и только потом принимать его.
Как заставить Claude писать тесты в стиле проекта?
Указать в скилле фреймворк, структуру файла, правила именования кейсов и два-три образцовых теста из репозитория. Образцы работают лучше описаний: модель воспроизводит показанный шаблон точнее, чем следует его словесному пересказу.
Все Skills для Claude Code