multimodal-llm
Vision, audio, video generation, and multimodal LLM integration patterns. Use when processing images, transcribing audio, generating speech, generating AI video (Kling v3, Sora 2, Veo 3.1 std/lite/fast, Runway Gen-4.5 via gen4_turbo), or building multimodal AI pipelines.
- License
- MIT
- Compatibility
- Claude Code 2.1.220+.
Pinned to revision 1ff988bd66da, so it is the text this page describes rather than whatever the author pushed since.
Pre-approved tools experimental
Experimental field. Support varies between clients, so this list is what the author declared, not what your client will enforce.
- Read
- Glob
- Grep
- WebFetch
- WebSearch
Files
- skills/multimodal-llm/SKILL.md
- skills/multimodal-llm/rules/_sections.md
- skills/multimodal-llm/rules/_template.md
- skills/multimodal-llm/rules/audio-models.md
- skills/multimodal-llm/rules/audio-speech-to-text.md
- skills/multimodal-llm/rules/audio-text-to-speech.md
- skills/multimodal-llm/rules/video-generation-models.md
- skills/multimodal-llm/rules/video-generation-patterns.md
- skills/multimodal-llm/rules/video-multi-shot.md
- skills/multimodal-llm/rules/vision-document.md
- skills/multimodal-llm/rules/vision-image-analysis.md
- skills/multimodal-llm/rules/vision-models.md
- skills/multimodal-llm/test-cases.json
Every link opens the file at its source, pinned to the revision this page describes.