重大升级:安装一个 Skill,让 AI 在一杯咖啡时间内自动剪出成片,并保留可编辑工程
重大升级:安装一个 Skill,让 AI 在一杯咖啡时间内自动剪出成片,并保留可编辑工程
Timeline Studio v0.9.1 正式发布。只需要安装一个 Agent Skill,提供图片、视频、产品素材或者网站地址,AI 就能自动完成内容分析、脚本规划、配音、字幕、镜头剪辑和视觉引导,并同时交付最终视频与可继续修改的
.timeline工程。
GitHub 仓库:
https://github.com/MartinDelophy/ai-video-editor
Skill 安装页:
https://skills.sh/MartinDelophy/ai-video-editor
一、这次为什么是一次重大升级
Timeline Studio 最初是一个本地优先、直接运行在浏览器中的 AI 视频编辑器。
随着功能不断完善,我们逐渐发现:只在编辑器里增加 AI 配音、字幕、音乐、修复和跟踪能力还不够。
真正能够改变视频生产效率的,是让 Agent 理解用户需求、分析素材、规划镜头、操作编辑器、检查结果,并交付一个可以继续修改的工程。
因此,在 v0.9.1 中,我们重新设计了edit-timeline-studioAgent Skill。
现在,用户只需要描述最终想要的视频:
请把这个网站制作成一条英文介绍视频。 使用自然女声,专业可信但有活力,16:9,约 60 秒。 先体验网站的公开页面。如果关键功能需要登录, 请让我在浏览器中自行登录。 画面保持稳定,使用真实交互、关键帧放大、 下划线和准确框选突出重要功能。 最终输出成品视频和可继续修改的工程文件。接下来,可以暂时离开去喝一杯咖啡。
Agent 会自动完成第一次完整剪辑,并交付:
project-name.mp4 project-name.timelineMP4 可以直接发布,.timeline则可以重新导入 Timeline Studio 继续修改。
二、安装 Skill 即可使用
通过 skills.sh 安装:
npx skillsaddMartinDelophy/ai-video-editor\--skilledit-timeline-studio安装到 Codex:
gh skillinstallMartinDelophy/ai-video-editor\edit-timeline-studio\--agentcodex\--scopeuser\--pinv0.9.1安装到 Claude Code:
gh skillinstallMartinDelophy/ai-video-editor\edit-timeline-studio\--agentclaude-code\--scopeuser\--pinv0.9.1GitHub Copilot、Gemini CLI、Cursor 等支持 Agent Skills 的客户端,也可以从同一个 GitHub 仓库发现这套 Skill。
三、不是“一键套模板”,而是先理解内容
传统自动剪辑经常采用固定模板:
- 检测静音;
- 删除空白;
- 按固定时长切片;
- 套用统一转场;
- 生成字幕;
- 导出视频。
这种方式可以处理简单素材,但很难完成专业的产品宣传、教程或网站介绍。
Timeline Studio 的工作流首先会识别内容类别:
| 类型 | 需要优先保护的内容 |
|---|---|
| 人物口播 | 语义、表情、自然停顿和人物稳定性 |
| 教程演示 | 指令、操作与结果的对应关系 |
| 访谈对话 | 说话人身份、问答关系和真实语境 |
| Vlog/活动 | 事件发展、自然声和镜头变化 |
| 产品营销 | 产品身份、卖点证据、品牌和行动号召 |
| 叙事纪录 | 人物、因果关系和时空连续性 |
| 网站宣传 | 页面证据、真实交互、隐私和视觉引导 |
分类的目的不是选择一个模板,而是为不同内容应用不同的保护规则。
例如,教程中的“讲解—点击—结果”必须被视为一个整体;产品宣传不能因为 AI 生成的画面更漂亮,就改变包装文字、Logo、颜色或者产品结构。
四、图片和视频如何分析
对于图片,Agent 会检查:
- 人物、产品和主要视觉主体;
- Logo 与品牌关键元素;
- 可读文字;
- 图像清晰度;
- 分辨率;
- 裁切空间;
- 景深和分层条件;
- 是否适合直接使用、2.5D、图生视频或图生图处理。
对于视频,分析会组合:
- 镜头边界;
- 代表帧;
- OCR;
- 语音与字幕;
- 人物、产品和界面区域;
- 全局光流;
- 主体区域光流;
- 模糊、遮挡与失焦;
- 动作开始与结果出现的时间点。
光流只负责分析运动,不能单独证明一个区域的语义。
因此,系统会先判断“画面中的对象是什么”,再利用光流判断“它如何移动”。
这让 Agent 可以区分:
全局运动 → 相机移动或相机抖动 局部运动 → 人物、产品或界面内容移动 稳定区域 → 适合阅读、突出或停留 异常运动 → 模糊、遮挡或跟踪失败在进行跟踪和视觉增强之前,系统会优先处理不必要的全局抖动。
五、自动剪辑之前先生成决策记录
Agent 不会分析完成后立即修改时间线。
它会先构建一份剪辑决策记录:
{"category":"website-walkthrough-promo","goal":"product-introduction","targetDurationSeconds":60,"aspectRatio":"16:9","narrationLanguage":"en-US","voiceProfile":{"genderPresentation":"female","style":"professional-energetic"},"mustKeep":["product value","real interaction","visible result"],"mustAvoid":["private account information","unsupported product claims","camera shake","tracking drift"]}然后为素材中的重要时间范围记录:
- 保留;
- 删除;
- 缩短;
- 重排;
- 加速;
- 强调;
- 保护音频连续性;
- 保护字幕边界。
每个重要决定都会保留原因和置信度。
对于存在实质性歧义的问题,Agent 会向用户询问;对于能够直接从素材中观察到的内容,则不会重复提问。
六、网站宣传视频不再是截图轮播
网站宣传是本次升级重点优化的场景。
拿到一个网站地址后,Agent 不会只截取首页。
它会先构建页面和流程覆盖清单:
- 主页;
- 功能页面;
- 产品列表;
- 详情页面;
- 搜索与筛选;
- 关键操作流程;
- 登录后的产品界面;
- 外部链接;
- 具有真实外部影响的操作。
如果关键页面需要登录,Agent 会要求用户自行在浏览器中完成登录,而不会索要:
- 密码;
- 短信验证码;
- 一次性口令;
- Cookie;
- Token;
- 账户恢复信息。
如果用户不方便登录,Agent 只会基于公开页面继续制作,并把无法访问的能力标记为“未验证”。
在获得授权的页面范围内,Agent 可以通过脚本驱动真实浏览器完成:
- 平滑滚动;
- 鼠标移动;
- hover 状态;
- 标签切换;
- 搜索和筛选;
- 加载到结果的变化;
- 页面视频播放;
- 可逆的表单预览;
- 临时鼠标光环和焦点提示。
脚本不能提交订单、发布内容、发送消息、修改账户资料或者执行其他有外部影响的操作。
七、专业动效不等于“到处画矩形框”
我们在早期测试中发现,自动生成的网站视频很容易出现两个问题:
- 每个页面都使用矩形框;
- 画面始终在放大、缩小和移动。
这种视频虽然“有动效”,却不具备专业质感。
在新工作流中,Agent 会根据目标选择不同的视觉引导方式:
- 小而密集的界面:关键帧放大;
- 精确文字和数字:下划线或括线;
- 按钮、卡片和结果:准确框选;
- 需要保留上下文:聚光遮罩;
- 需要解释元素关系:引导线;
- 视频中的移动对象:光流辅助跟踪;
- 静态产品图片:景深或 2.5D 分层。
一个标准的解释镜头遵循:
建立上下文 ↓ 引导注意 ↓ 锁定目标 ↓ 静止阅读 ↓ 自然释放画面抵达目标后必须停稳,让观众有足够时间阅读。
我们明确拒绝:
- 无意义的持续缩放;
- 模拟手持画面;
- 微抖动;
- 弹性过冲;
- 框选漂移;
- 重复放大和缩小;
- 滚动和变焦同时发生;
- 为了展示效果而堆叠效果。
八、先生成自然配音,再决定画面时长
不少自动视频会先固定 60 秒画面,再把配音强行压缩到 60 秒。
这样很容易导致:
- 语速过快;
- 停顿消失;
- 字幕闪过;
- 品牌名发音错误;
- 画面重点与配音错位。
Timeline Studio 会先确认:
- 配音语言;
- 女性、男性或指定声音;
- 年龄感;
- 专业、可信、温暖、活力或沉稳等表达风格;
- 品牌名、网址、数字和专业词的读法;
- 字幕语言;
- 自然语速。
配音确认后,再根据每句话的实际长度和自然停顿安排画面。
如果文案超过目标时长,系统优先修改和压缩文案,而不是粗暴加速声音。
光标到达、框选锁定、下划线出现、关键帧放大和结果展示,也会同步到对应的语句。
九、.timelinev3:一条字幕对应一个音频文件
这是本次工程结构中非常重要的一项升级。
过去,一整段旁白可能只有一个音频文件,时间线中的多个句子只是引用不同时间范围。
这样虽然在界面上看起来已经分段,实际修改一句配音时仍然会影响完整音频。
最新的.timelinev3 会将句子级配音物理拆分:
caption-01 → voice-01.wav caption-02 → voice-02.wav caption-03 → voice-03.wav字幕通过audioClipId与音频片段一一对应。
归档结构类似:
project.timeline ├── project.json ├── media/ │ ├── visuals/ │ │ ├── 001-homepage.png │ │ └── 002-product.png │ └── audio/ │ ├── voice-001.wav │ ├── voice-002.wav │ ├── voice-003.wav │ └── music.wav重新打开工程后,用户可以:
- 替换其中一句配音;
- 调整一句话的开始时间;
- 修改音量和淡入淡出;
- 更新对应字幕;
- 删除其中一个句子;
- 重新生成局部声音;
- 保留其他已经确认的结果。
十、播放循环问题是如何解决的
在多媒体时间线中,如果使用当前视频元素的currentTime作为总时间线时钟,视频在片尾发生解码停顿时,播放头可能一直被限制在当前片段末尾。
用户看到的表现,就是视频在某一个片段中不断循环。
原来的关系接近:
Video currentTime ↓ Timeline playhead ↓ Other media现在改为:
Monotonic Timeline Clock ├── Video ├── Voiceover ├── Music ├── Captions └── Effects时间线成为单调递增的主时钟,视频和音频只作为跟随者。
核心逻辑可以概括为:
constwallClockTime=Math.min(timelineDuration,playbackStartTime+(now-playbackStartedAt)/1000);currentTimelineTime=wallClockTime;同时,片段区间从闭区间判断:
time>=start&&time<=start+duration调整为半开区间:
time>=start&&time<start+duration这样可以避免在两个相邻片段的公共边界上同时激活两段媒体。
十一、本地优先与 ModelScope 双线路模型交付
Timeline Studio 将多种 AI 能力放在浏览器中运行:
- 多语言 AI 配音;
- Whisper 自动字幕;
- Stable Audio AI 音乐;
- 人物与物体检测;
- 智能画面;
- 人像处理;
- AI 修复;
- 高清增强;
- 人声分离;
- 数字人相关能力。
模型采用按需下载和版本固定策略,并通过 Hugging Face 与 ModelScope 双线路交付。
对于国内网络环境,Timeline Studio 优先选择 ModelScope;当线路不可用时,再使用对应的 Hugging Face 镜像。
两家平台使用统一缓存身份:
ModelScope artifact │ ├── same revision ├── same checksum └── same cache identity │ Hugging Face artifact因此,切换模型来源不会让浏览器重复下载同一个模型。
运行流程如下:
用户第一次选择 AI 能力 ↓ 检查本地缓存 ↓ 检测模型线路 ↓ 下载缺失文件 ↓ 初始化浏览器推理 ↓ 后续任务直接复用这种本地优先架构带来的价值包括:
- 原始素材不需要为了基础编辑上传到后端;
- 模型下载后可以重复使用;
- 国内外网络环境可以使用不同镜像;
- 模型版本和许可证更加清晰;
- Agent 和人工编辑共享同一个项目状态;
- 导出结果更容易复现。
涉及人脸替换、数字人或其他深度合成能力时,使用者必须取得相关素材的合法授权,不得生成或传播违法、侵权、虚假或误导性内容,也不能将生成结果冒充为真实影像。
十二、命令层与浏览器层协同
Timeline Studio 的 Agent 自动化分为两条路径。
1. 版本化命令路径
对于命令层已经支持的操作,Agent 会先检查工程,再构建声明式编辑计划:
npmrun agent -- project.inspect /absolute/path/project.timelinenpmrun agent -- project.diff /absolute/path/edit-plan.jsonnpmrun agent -- project.run /absolute/path/edit-plan.jsonnpmrun agent -- project.inspect /absolute/path/project-v2.timeline其中:
project.inspect:读取工程摘要;track.inspect:检查具体轨道;clip.inspect:检查片段;transcript.inspect:检查字幕和配音关系;project.diff:进行不写文件的语义 dry run;project.run:执行通过验证的编辑计划;project.render:渲染当前支持的便携工程子集。
命令操作使用稳定 ID、修订号、操作 ID 和前置条件,支持事务和幂等控制。
2. 浏览器兼容路径
对于以下能力,Agent 会使用 Timeline Studio 编辑器:
- AI 配音;
- 自动字幕;
- 复杂效果;
- 网站交互;
- 实时预览;
- 尚未进入命令注册表的编辑操作;
- 富媒体最终导出。
Skill 会明确区分两条路径,不会把浏览器自动化描述成完全确定性的无头执行。
十三、一键成片之后如何快速修改
因为最终保留了.timeline工程,用户后续可以直接提出局部修改需求。
例如:
请打开这个工程。 将第二句英文配音替换为新的文案, 同时更新对应字幕。 把第三个镜头延长 1.5 秒, 其余已经确认的画面、配音和音乐保持不变。 重新导出视频。也可以继续调整:
- 单个镜头;
- 镜头顺序;
- 字幕内容;
- 字幕样式;
- 某一句配音;
- 背景音乐;
- 音量;
- 淡入淡出;
- 放大位置;
- 框选范围;
- 转场;
- 视频比例;
- 不同语言版本。
这让 Agent 的工作从“一次性生成”变成“持续协作”。
十四、我们如何定义任务完成
成功调用导出接口,并不代表视频已经完成。
Timeline Studio 会检查两类结果。
结构正确性
.timeline能否重新打开;- 媒体文件是否完整;
- 字幕与配音是否一一对应;
- 主画面是否可见;
- 第一帧能否正常渲染;
- 轨道时间是否正确;
- 轨道显隐和锁定状态是否恢复;
- 导出视频是否包含真实音频;
- 分辨率、时长和帧数是否正确;
- 播放是否可以连续跨越全部片段边界。
编辑质量
- 是否存在画面抖动;
- 跟踪是否漂移;
- 框选是否准确;
- 产品或人物身份是否被改变;
- 配音是否自然;
- 字幕是否有足够阅读时间;
- 强调效果是否与声音同步;
- 画面是否遮挡关键内容;
- 需要阅读时画面是否停稳;
- 是否堆叠了过多效果。
只有结构和质量都通过检查,任务才算完成。
十五、这次升级意味着什么
过去,AI 视频工具通常交付一个结果。
现在,Timeline Studio 希望交付一套可以持续工作的生产流程:
用户提出需求 ↓ Agent 理解素材与目标 ↓ Agent 自动完成第一次剪辑 ↓ 交付 MP4 + .timeline ↓ 用户提出局部修改 ↓ Agent 调整指定片段 ↓ 重新验证并导出用户不需要学习所有剪辑工具,也不需要每次从零生成。
第一次任务只需要一杯咖啡的时间,之后的修改则可以基于原工程快速完成。
结语
我们认为,AI 视频编辑下一阶段的竞争点,不只是生成模型能否做出漂亮画面。
真正重要的是:
- 能否理解素材;
- 能否保护事实和品牌;
- 能否规划清晰的叙事;
- 能否生成自然配音;
- 能否稳定、准确地引导观众;
- 能否交付可继续编辑的工程;
- 能否在用户修改需求时只调整必要部分。
Timeline Studio 想做的事情,可以概括为一句话:
安装一个 Skill,一杯咖啡的时间获得一条成品视频;保留一个可编辑工程,承接之后的每一次调整。
GitHub 仓库:
https://github.com/MartinDelophy/ai-video-editor
相关地址:
- Skill 安装:https://skills.sh/MartinDelophy/ai-video-editor
如果这个项目对你有帮助,欢迎 Star、提交 Issue,或者告诉我们你最希望交给 AI 自动完成的视频制作场景。
