evaluate
Evaluate an AI workflow against representative cases and its permitted actions. Use for model, retrieval or agent evaluation; tests do not grant release authority.
Pinned to revision 4e9335ddcd3a, so it is the text this page describes rather than whatever the author pushed since.
Files
- skills/evaluate/SKILL.md
- skills/evaluate/.fde-generated.json
- skills/evaluate/agents/openai.yaml
- skills/evaluate/references/build.md
- skills/evaluate/references/debug.md
- skills/evaluate/references/eval-pack.md
- skills/evaluate/references/integrate.md
- skills/evaluate/references/qa.md
- skills/evaluate/references/review.md
- skills/evaluate/references/ship.md
- skills/evaluate/references/task-context.md
- skills/evaluate/references/verification.md
Every link opens the file at its source, pinned to the revision this page describes.