orq-evaluator-alignment
Align, calibrate, or improve an existing LLM-as-a-judge (orq evaluator) so its verdicts match human judgment — boolean, categorical, or numeric judges. Use when the user wants to "align my evaluator", "improve my eval", "my judge keeps changing its mind", "find ambiguous cases", or "annotate an evaluator" — i.e. they have an LLM judge that disagrees with human labels or is inconsistent. Measures judge self-consistency as one 0..1 instability score via repeated runs, groups the least reliable examples by what makes them hard and asks a few questions instead of making the user label every row, rewrites the judge prompt from those answers, and creates the new evaluator only after the human approves. If the evaluator ID isn't given, ask for it after triggering. Do NOT use to build an evaluator from scratch (use orq-build-evaluator) or to fix failures with prompt tweaks (use orq-optimize-prompt).
Pinned to revision 9634e1d956e4, so it is the text this page describes rather than whatever the author pushed since.
Pre-approved tools experimental
Experimental field. Support varies between clients, so this list is what the author declared, not what your client will enforce.
- Read
- Write
- Edit
- Grep
- Glob
- Bash(uv run:*)
- AskUserQuestion
Files
- skills/orq-evaluator-alignment/SKILL.md
- skills/orq-evaluator-alignment/.gitignore
- skills/orq-evaluator-alignment/README.md
- skills/orq-evaluator-alignment/annotation/annotate.html
- skills/orq-evaluator-alignment/config.toml
- skills/orq-evaluator-alignment/lib/__init__.py
- skills/orq-evaluator-alignment/lib/agreement.py
- skills/orq-evaluator-alignment/lib/content.py
- skills/orq-evaluator-alignment/lib/cost.py
- skills/orq-evaluator-alignment/lib/cross_model.py
- skills/orq-evaluator-alignment/lib/grey_zone.py
- skills/orq-evaluator-alignment/lib/instability.py
- skills/orq-evaluator-alignment/lib/judge.py
- skills/orq-evaluator-alignment/lib/model_backend.py
- skills/orq-evaluator-alignment/lib/orq_client.py
- skills/orq-evaluator-alignment/lib/runner.py
- skills/orq-evaluator-alignment/lib/seed.py
- skills/orq-evaluator-alignment/prompts/meta_prompt.md
- skills/orq-evaluator-alignment/prompts/po2.md
- skills/orq-evaluator-alignment/prompts/recommend_prompt.md
- skills/orq-evaluator-alignment/scripts/_bootstrap.py
- skills/orq-evaluator-alignment/scripts/aggregate.py
- skills/orq-evaluator-alignment/scripts/build_queue.py
- skills/orq-evaluator-alignment/scripts/create_eval.py
- skills/orq-evaluator-alignment/scripts/cross_model.py
- skills/orq-evaluator-alignment/scripts/dataset_inputs.py
- skills/orq-evaluator-alignment/scripts/estimate_cost.py
- skills/orq-evaluator-alignment/scripts/fetch_evaluator.py
- skills/orq-evaluator-alignment/scripts/fetch_traces.py
- skills/orq-evaluator-alignment/scripts/grey_zone.py
- skills/orq-evaluator-alignment/scripts/metrics.py
- skills/orq-evaluator-alignment/scripts/recommend.py
- skills/orq-evaluator-alignment/scripts/retest.py
- skills/orq-evaluator-alignment/scripts/rewrite_eval.py
- skills/orq-evaluator-alignment/scripts/seed_inputs.py
- skills/orq-evaluator-alignment/scripts/serve_annotation.py
- skills/orq-evaluator-alignment/scripts/stability.py
- skills/orq-evaluator-alignment/tests/config_fake.toml
- skills/orq-evaluator-alignment/tests/fixtures/evaluator.json
- skills/orq-evaluator-alignment/tests/fixtures/evaluator_categorical.json
- skills/orq-evaluator-alignment/tests/fixtures/evaluator_numeric.json
- skills/orq-evaluator-alignment/tests/fixtures/responses_api_trace.json
- skills/orq-evaluator-alignment/tests/fixtures/traces.jsonl
- skills/orq-evaluator-alignment/tests/requirements.txt
- skills/orq-evaluator-alignment/tests/test_agreement.py
- skills/orq-evaluator-alignment/tests/test_aligned_naming.py
- skills/orq-evaluator-alignment/tests/test_backend_selection.py
- skills/orq-evaluator-alignment/tests/test_build_queue.py
- skills/orq-evaluator-alignment/tests/test_build_queue_projection.py
- skills/orq-evaluator-alignment/tests/test_build_queue_seed.py
- skills/orq-evaluator-alignment/tests/test_correctness.py
- skills/orq-evaluator-alignment/tests/test_create_eval.py
- skills/orq-evaluator-alignment/tests/test_cross_model.py
- skills/orq-evaluator-alignment/tests/test_dataset_client.py
- skills/orq-evaluator-alignment/tests/test_fetch_traces.py
- skills/orq-evaluator-alignment/tests/test_fetch_types.py
- skills/orq-evaluator-alignment/tests/test_grey_zone.py
- skills/orq-evaluator-alignment/tests/test_grey_zone_cli.py
- skills/orq-evaluator-alignment/tests/test_instability.py
- skills/orq-evaluator-alignment/tests/test_judge_typed.py
- skills/orq-evaluator-alignment/tests/test_parse_verdict.py
- skills/orq-evaluator-alignment/tests/test_pipeline.py
- skills/orq-evaluator-alignment/tests/test_recommend.py
- skills/orq-evaluator-alignment/tests/test_retest.py
- skills/orq-evaluator-alignment/tests/test_rewrite.py
- skills/orq-evaluator-alignment/tests/test_script_deps.py
- skills/orq-evaluator-alignment/tests/test_seed.py
- skills/orq-evaluator-alignment/tests/test_serve_annotation.py
- skills/orq-evaluator-alignment/tests/test_traces_fingerprint.py
Every link opens the file at its source, pinned to the revision this page describes.