AI 视频“复刻”最有价值的部分,不是一条导出文件,而是一套可编辑的镜头结构、字幕规则、素材槽位和变量。换产品、人物、语言或 CTA 时,团队不必从零开始。
Hypit 是一个面向 Codex 与 Claude Code 等 Agent 的开源视频工作流项目。它可以把参考视频、模板或文字需求组织为可再次运行的视频工程。Hypit 本身免费使用;模型、配音、转写和托管服务按所选服务计费。

制作顺序应当是先理解结构,再制作可变组件,最后渲染和检查。使用自己拥有、获授权或可合法使用的参考与素材。保留的是叙事结构和生产方法,不是他人的人物、品牌、画面或音乐。
Hypit 到底做什么
Hypit 不是一个视频模型。它给 Agent 提供视频制作语言和工程结构,负责把下面几层串起来:
| 层 | Agent 要做的事 | 人工要决定的事 |
|---|---|---|
| 内容结构 | 分析 Hook、镜头、字幕、节奏 | 受众和唯一结论 |
| 视觉组件 | 组织人物、产品、B-roll、动效 | 素材可用性与替换范围 |
| 服务调用 | 使用图像、视频、配音、转写或本地渲染 | 账号、预算和质量档位 |
| 工程交付 | 保存可编辑、可重跑的工作流 | 谁审核、下次改什么 |
仓库明确说明,没有 Hypit 的席位费、单次渲染费或额外水印,但 Coding Agent 和模型服务有自己的费用。生成前让 Agent 列出准备调用的服务、每个镜头的候选次数和费用上限。
先写蓝图,别直接生成
把下面内容放入任务简报:
目标:制作一条 20 秒 9:16 产品短视频。
受众:了解痛点,但不了解产品的人。
唯一结论:产品能把一个耗时动作缩短到三步。
参考:只分析我有权使用的参考视频结构。
保留:前两秒问题句、镜头节奏、字幕层级、CTA 位置。
替换:人物、品牌、产品镜头、数据、音乐和旁白。
交付:成片、可编辑工程、镜头表、素材清单、费用记录。
验收:事实可追溯;字幕无错字;静音也能看懂;原品牌元素没有残留。
目标:制作一条 20 秒 9:16 产品短视频。
受众:了解痛点,但不了解产品的人。
唯一结论:产品能把一个耗时动作缩短到三步。
参考:只分析我有权使用的参考视频结构。
保留:前两秒问题句、镜头节奏、字幕层级、CTA 位置。
替换:人物、品牌、产品镜头、数据、音乐和旁白。
交付:成片、可编辑工程、镜头表、素材清单、费用记录。
验收:事实可追溯;字幕无错字;静音也能看懂;原品牌元素没有残留。
然后只要求蓝图,不调用生成服务:
请输出每个镜头的目的、台词、字幕重点和时长;
标出 Hook、证明、转折和 CTA;
区分结构与必须替换的素材;
列出需要我补充的品牌资产、事实依据和人员授权;
生成一份新的 20 秒镜头表。
请输出每个镜头的目的、台词、字幕重点和时长;
标出 Hook、证明、转折和 CTA;
区分结构与必须替换的素材;
列出需要我补充的品牌资产、事实依据和人员授权;
生成一份新的 20 秒镜头表。
先确认蓝图,能避免最贵的一轮返工。
安装后先做一个低成本样片
仓库提供安装命令:
npx skills add hypit-ai/hypit -g
npx skills add hypit-ai/hypit -g
安装后在 Agent 会话使用 Hypit Skill。第一版先用已有素材、代码渲染图形、字幕和基础动效。项目说明指出,不调用生成模型也能完成字幕、动效和代码视觉,因此适合先验证结构、节奏和信息密度。
首轮样片只检查四件事:前两秒是否清楚;字幕是否与语音和转场同步;静音时产品信息是否完整;结尾是否只保留一个行动。结构通过后,再把生成预算留给人物口播、关键产品镜头或难以拍摄的 B-roll。
把会变的东西做成变量
| 变量 | 不该改变的部分 | 发布前检查 |
|---|---|---|
| 产品和 SKU | Hook 的问题与证明逻辑 | 价格、库存、适用范围 |
| 主播与人物 | 机位、情绪曲线、字幕层级 | 肖像与声音使用权 |
| 语言 | 画面叙事与 CTA 位置 | 翻译、口型、字幕长度 |
| 市场 | 信息主次与品牌口吻 | 本地法规、货币与日期 |
| Hook | 事实依据与产品主张 | 是否夸大或断章取义 |
Hypit 可将字幕、画面和动效与文本绑定。台词变了,时间关系可以再计算;仍要人工完整播放,因为语言长度、数字读法和强调词会改变节奏。
预算、导出和发布验收
每个镜头都设候选次数。比如实拍加字幕为零次生成;人物口播最多三次;产品 B-roll 最多四次;代码动画不调用模型;超过次数就回到脚本或素材方案,不继续盲抽。草稿先用低成本设置确定构图,再渲染高质量版本。保存 prompt、模型、种子和素材版本,下一轮修改才能复现。
[ ] 参考、人物、音乐、品牌和素材都有可用权利或替换方案
[ ] 每条数字、价格和功能描述都有依据
[ ] 语音、逐词字幕和转场同步
[ ] 目标画幅的安全区没有裁掉关键信息
[ ] Logo、链接和 CTA 与当前活动一致
[ ] 工程、素材、字体、音轨和最终导出均已归档
[ ] 一人关闭声音检查,一人从事实和品牌角度检查
[ ] 参考、人物、音乐、品牌和素材都有可用权利或替换方案
[ ] 每条数字、价格和功能描述都有依据
[ ] 语音、逐词字幕和转场同步
[ ] 目标画幅的安全区没有裁掉关键信息
[ ] Logo、链接和 CTA 与当前活动一致
[ ] 工程、素材、字体、音轨和最终导出均已归档
[ ] 一人关闭声音检查,一人从事实和品牌角度检查
使用 ClaudeAPI 编排创作任务时,也应将素材来源、镜头变量、成本记录和发布验收保留在同一工作流中。
开工前先交出一份素材包,别让 Agent 猜
很多返工不是出在生成环节,而是输入散在聊天记录、表格和个人电脑里。开始前建立一个素材包:brief.md 写受众、唯一结论、时长、画幅和 CTA;claims.csv 写每条卖点的来源、可用措辞与禁用措辞;assets.csv 写素材来源、地区、人物、音乐和商标的使用限制。把“可进入工程的素材”和“只可借鉴节奏、镜头数量、信息层级的参考”分开登记。
| 镜头 | 时长 | 观众要知道什么 | 画面来源 | 生成上限 | 验收问题 |
|---|---|---|---|---|---|
| Hook | 0–2 秒 | 这是哪个麻烦 | 自制图形或已授权素材 | 0–2 次 | 静音时问题看得懂吗? |
| 场景 | 2–6 秒 | 麻烦发生在哪里 | 实拍或授权 B-roll | 0–3 次 | 人物和场景是否可用? |
| 机制 | 6–12 秒 | 产品怎么解决 | 产品录屏、动效 | 0–1 次 | 步骤和界面真实吗? |
| 证明 | 12–17 秒 | 为什么值得相信 | 已核验数据或案例 | 0–1 次 | 每个数字有来源吗? |
| 行动 | 17–20 秒 | 接下来做什么 | Logo、链接、CTA | 0 次 | CTA 是否只有一个? |
先让 Agent 输出镜头表,不调用任何生成服务:
根据 brief.md、claims.csv、assets.csv 建立 20 秒、9:16 的可编辑工程。
每个镜头写明时长、叙事目的、屏幕文字、素材文件、是否允许生成和候选次数上限。
无法在 claims.csv 或 assets.csv 找到依据的主张、数字和品牌元素,一律标记为【待补】。
保留变量:product_name、market、language、cta_url、voice_id、legal_line。
根据 brief.md、claims.csv、assets.csv 建立 20 秒、9:16 的可编辑工程。
每个镜头写明时长、叙事目的、屏幕文字、素材文件、是否允许生成和候选次数上限。
无法在 claims.csv 或 assets.csv 找到依据的主张、数字和品牌元素,一律标记为【待补】。
保留变量:product_name、market、language、cta_url、voice_id、legal_line。
给变量命名,才谈得上把一条片改成多条
锁住镜头顺序、字幕层级和 CTA 安全区;只把产品、市场、语言、链接和口播开放为变量。每一轮只改一类变量。不要在同一次导出里同时换人物、语言、产品和画幅,否则成片出问题时没有人能定位原因。
product_name: "示例产品"
market: "CN"
language: "zh-CN"
cta_url: "https://example.com"
voice_id: "approved-voice-01"
headline: "把手工整理压缩为三步"
proof_line: "数据待市场团队确认"
product_name: "示例产品"
market: "CN"
language: "zh-CN"
cta_url: "https://example.com"
voice_id: "approved-voice-01"
headline: "把手工整理压缩为三步"
proof_line: "数据待市场团队确认"
| 看到的问题 | 别这样处理 | 应该回到哪里修 |
|---|---|---|
| 开头好看但看不懂产品 | 连续抽更多视觉素材 | 重写前两秒的问题句 |
| 人物、产品和背景不一致 | 用更长提示词硬压 | 拆开并固定每层素材输入 |
| 字幕总挤出安全区 | 只改字号 | 删除同一镜头里的第二个观点 |
| 关键画面三次仍不满意 | 继续增加候选次数 | 改镜头目的,换录屏、实拍或图形方案 |
| 多语言版时长失控 | 逐字翻译 | 重写当地口播,再切镜头 |
发布前逐帧验收,而不是只看时间轴
[ ] 0–2 秒静音时能看出主题和受众
[ ] 每条功能、价格、日期和对比说法都有来源
[ ] 人物、产品、音乐、商标与素材的使用范围已确认
[ ] 字幕核对了数字、专有名词、断句、标点和读音
[ ] 竖版安全区没有被平台按钮或标题遮挡
[ ] 工程、素材包、导出文件和发布日期可以相互对应
[ ] 改版请求写镜头号和变量名,不写“整体再高级一点”
[ ] 0–2 秒静音时能看出主题和受众
[ ] 每条功能、价格、日期和对比说法都有来源
[ ] 人物、产品、音乐、商标与素材的使用范围已确认
[ ] 字幕核对了数字、专有名词、断句、标点和读音
[ ] 竖版安全区没有被平台按钮或标题遮挡
[ ] 工程、素材包、导出文件和发布日期可以相互对应
[ ] 改版请求写镜头号和变量名,不写“整体再高级一点”
Hypit 的价值不在于多出一条成片,而在于留下可复用的镜头结构、变量表和修改记录。下次换产品或市场,团队可以从这些资产开始。



