llm-data-preparation
Prepare and curate training data for LLM fine-tuning and alignment. Covers instruction dataset creation, data quality assessment, synthetic data generation with LLMs, data annotation workflows (Label Studio, Argilla, Prodigy), preference data collection for RLHF/DPO (chosen/rejected pairs), data deduplication and decontamination, data formatting (Alpaca, ShareGPT, chat templates), dataset balancing and filtering, data augmentation for NLP, PII removal from training data, copyright and licensing considerations, and dataset versioning. Use when preparing data for LLM fine-tuning, generating synthetic training data, setting up annotation pipelines, or curating preference datasets.
- Version
- 1.0
- License
- Apache-2.0
Pinned to revision 45cf0fa3c5e7, so it is the text this page describes rather than whatever the author pushed since.
Files
- skills/llm-data-preparation/SKILL.md
- skills/llm-data-preparation/references/REFERENCE.md
- skills/llm-data-preparation/scripts/curate_dataset.py
- skills/llm-data-preparation/scripts/generate_synthetic.py
Every link opens the file at its source, pinned to the revision this page describes.