Timeline‑Studio:基于Agent Skill,实现浏览器端AI智能体全自动剪辑
前言
市面上多数AI剪辑产品,本质是调用云端接口生成视频,AI只能拿到最终生成结果,无法真正操作编辑器UI界面。一旦碰到素材加载失败、弹窗、时间轴边界异常,自动化流程直接中断。
Timeline‑Studio是开源浏览器本地AI视频编辑器,全部推理跑在WebGPU+ONNX Runtime‑Web,素材不上传云端。项目自研一套Agent Skill标准化协议,让AI智能体可以像人一样,完成素材导入、轨道裁切、特效添加、AI模型调用、视频导出完整剪辑流程,同时还可用于产品自动化回归测试。
GitHub仓库:Timeline Studio
一、传统AI剪辑自动化的痛点
- 仅有接口调用,没有UI实操能力
只能调用后台能力,无法处理浏览器文件选择、弹窗、页面状态切换这类前端交互场景。 - 缺少约束与异常降级
遇到极短片段、渲染卡顿、资源加载失败直接崩溃,没有重试、回滚逻辑。AI不受约束,甚至会误改动工程配置。 - 缺少编辑器领域的操作规范
单纯依靠大模型提示词,每次剪辑行为不可控,输出结果波动巨大。
二、什么是本项目的 Agent Skill
Skill不是简单的Prompt提示词,是一套给AI智能体使用、强约束的剪辑操作规范集合。
项目内置核心技能包 edit‑timeline‑studio ,开发者执行一行命令即可挂载全部剪辑能力:
bash
npx skills add “https://github.com/MartinDelophy/ai-video-editor”
Skill内部定义整套行为契约:
- 原子动作定义:导入素材、分割片段、移动轨道片段、添加描边/滤镜特效、调用WebGPU本地AI模型、触发导出;
- 环境区分:区分开发环境、线上生产环境两套操作逻辑;
- 容错降级规则:素材解析失败、弹窗拦截、文件选择器唤起异常的处理逻辑;
- 边界约束:时间轴裁切边界、禁止随意修改本地缓存、短片段的处理规则。
工作流程:
- Agent接收自然语言指令,例如:“把采访素材剪辑成短视频,添加人物描边”;
- Agent读取Skill规范,拆解任务,输出结构化剪辑动作清单;
- 前端接收动作清单,逐条在浏览器编辑器执行;
- 将执行结果、报错信息回传给Agent,Agent判断继续执行或者终止任务。
三、浏览器环境下的工程难点
浏览器端运行Agent Skill,对比后端服务智能体有很多独特限制:
- WebGPU显存有限:AI模型推理、视频解码共享显存,Skill动作执行前后要做显存释放;
- 浏览器API不稳定:文件选择器、WebCodecs解码存在兼容性,Skill中必须内置重试降级;
- 页面状态不可控:页面休眠、Tab切后台会中断任务,Skill需要状态快照,支持任务恢复;
- 无头模式兼容:支持后台Headless运行Skill,不依赖可视化UI界面,用于批量剪辑与自动化测试。
四、Skill除了做剪辑,还能做什么
- 全自动批量剪辑:输入一批素材+自然语言需求,浏览器本地批量输出成片;
- 编辑器自动化测试:AI按照Skill规则反复操作时间轴,复现边界bug,做回归测试;
- 二次开发扩展:开发者可以新增自定义Skill动作,接入自己的AI特效模块。
五、总结
Timeline‑Studio的Agent Skill核心价值:把“人操作编辑器”的经验,固化成AI可以读懂、可以严格遵守的操作契约。
不依赖云端算力,全部流程在浏览器本地闭环,既实现AI自动剪辑,又利用智能体完成产品自测,为前端音视频编辑器的Agent落地提供一套可复用的实践方案。
项目地址:https://github.com/MartinDelophy/ai-video-editor
#WebGPU #AI剪辑 #Agent #Skill #ONNXRuntimeWeb #开源项目 #前端音视频
