源码系统概览
文章正文
Stickman Video Director 是一个面向短视频创作者的 Codex Skill(技能包),它解决的是”好脚本不等于好视频”的问题。在使用者消耗视频生成额度之前,这个技能先替你完成导演层面的生产思考:钩子怎么设计、节奏怎么排、视觉隐喻用什么、镜头如何运动、场景之间怎样连贯。它以一个 Markdown 指令集的形式存在,配合你正在使用的 Codex 类编码 Agent,把一段文案或主题转化成一份经过确认的英文配音稿、一套以画面为先的导演计划,以及六条可直接投入 Gemini Omni Flash 生产的独立视频提示词。使用者再把这些提示词分别生成约 10 秒的片段,拼成一支约一分钟的火柴人动画成片。整个过程纯本地对话、无 API 或 MCP 依赖,是一个克制的提示词工程工具。
源码简介
仓库结构非常轻量:skills/directing-stickman-videos 是可安装的 Skill 主体,包含 SKILL.md 与参考模板;assets/readme 存放明暗两套主题的演示动图;tests 提供行为测试与评测清单;docs/superpowers 记录产品设计与实现计划。它没有任何服务端代码,也不调用外部接口,全部能力来自 Skill 指令对对话模型的引导。技能内置明确的审批检查点:在阶段 B 之前必须核准导演提案,鼓励在”便宜时改故事”;每条独立提示词内重复约束角色、线宽、调色板与配音,形成所谓”生产锁”以保证六段画面风格统一。项目以 MIT 协议开源,并提供英、简中、日、韩、葡五种语言的 README,国际化做得相当到位。
适用场景
这个技能包最适合需要高频产出短视频脚本与分镜的创作者。它面向 YouTube Shorts、TikTok、Instagram Reels 等平台的知识讲解、励志故事、教育短片与快节奏视觉随笔,把抽象想法快速翻译成有钩子、有节奏、有视觉隐喻的一分钟火柴人方案。对个人博主、教育工作者、产品解说者而言,它降低了”从文字到视频”的导演门槛;对团队,它提供了一套可复用、可评审、可迭代的导演工作流。需要注意它只产出提示词与导演计划,最终视频仍由 Gemini Omni Flash 等模型生成,本身不渲染画面。
功能亮点
第一,导演思维前置:在消耗生成额度前先完成钩子、节奏、隐喻与镜头规划,避免”生成了才发现有问题”。第二,强故事结构:把原始材料重写为尖锐开头加渐进解释加结尾呼应的形态,并给出 6 个场景提案,每个含镜头、转场、BGM 与 SFX。第三,生产锁保证一致:每条独立提示词内重复角色、线宽、调色板、配音等约束,使六段画面保持统一视觉语言。第四,双高对比主题:提供亮色(白底黑火柴人)与暗色(黑底白火柴人)两套,最多三个饱和强调色,并支持 9:16、16:9、1:1 比例重构而不仅是改标签。第五,来源保真:明确要求不编造未支持的事实、数据与引用,迭代友好,随时可回提案阶段重批。
技术架构与部署指南
| 维度 | 本套源码 | 同类通用方案 |
|---|---|---|
| 技术栈 | 前端:无前端界面,纯 Codex Skill 指令集 后端:Codex Skill(Markdown + YAML 定 |
依具体方案选型,需自行搭建与维护 |
| 部署方式 | 安装方式非常简单:克隆仓库后,把 skills/directing-stickman-videos 目录整体复制到所用编 | 多托管于第三方平台或订阅云服务 |
| 功能侧重 | 第一,导演思维前置:在消耗生成额度前先完成钩子、节奏、隐喻与镜头规划,避免”生成了才发现有问题”。 | 功能通用,定制深度有限 |
| 数据归属 | 数据自持,部署在自有服务器,不出站 | 数据通常留存于服务商侧 |
| 成本模式 | 获取后自主部署,无持续授权费用 | 通常按订阅或调用量计费 |
技术栈与运行环境
前端:无前端界面,纯 Codex Skill 指令集
后端:Codex Skill(Markdown + YAML 定义),无服务端代码
数据库:无
运行环境:支持 Codex Skill 的 AI 编程环境(Codex / Claude Code 等兼容 Agent)
其他依赖:需 Gemini Omni Flash 的访问权限以生成最终视频;无 API 或 MCP 依赖
安装与部署提示
安装方式非常简单:克隆仓库后,把 skills/directing-stickman-videos 目录整体复制到所用编码 Agent 的 skills 目录,重启 Agent 即可通过类似 $directing-stickman-videos 的指令调用。由于它只是指令集,无需安装任何依赖,也不配置环境变量。使用时在对话中给出主题或文案,按阶段核准导演提案,拿到六条提示词后,再到 Gemini Omni Flash 环境逐条生成约 10 秒片段并拼接。建议首次使用先跑 README 中的明暗主题演示,理解生产锁与格式感知的约束,再用于正式创作。
截图与演示说明
仓库用两段动图展示明暗两套主题的成片效果,下面依次列出。图一是亮色主题演示:白底黑火柴人配合高饱和强调色的动态效果:

。图二是暗色主题演示:黑底白火柴人配合高饱和强调色的动态效果:

。
常见问题
问:这个技能能直接生成视频吗?
不能。它只产出导演提案与六条 Gemini Omni Flash 提示词,最终视频需要你在 Gemini Omni Flash 中逐条生成约 10 秒片段后自行拼接。
问:需要配置 API 或密钥吗?
技能本身无任何 API 或 MCP 依赖,但生成最终视频需要你拥有 Gemini Omni Flash 的访问权限,这部分由对应的视频模型服务处理。
问:支持哪些平台比例?
支持 9:16、16:9、1:1 比例重构,技能会按平台重排舞台与文本位置,而不只是修改标签。
安全风险提示
特别提示:本源码未检测安全风险文件,下载后请务必进行安全审计,删除恶意代码后再部署使用!
下载说明
源码仅供学习研究、测试部署和二次开发参考,商用前请自行确认授权、版权和安全风险。本项目以 MIT 协议开源,可自由修改与再分发,但生成的视频依赖 Gemini Omni Flash 的服务条款与计费规则,使用前请自行核对。下载后建议先阅读多语言 README 与演示动图,在本地 Agent 环境安装技能并跑通一次明/暗主题示例,确认工作流符合预期再投入正式创作。
GitHub项目开源地址:https://github.com/kaomei/stickman-video-director