重大升级:安装一个 Skill,让 AI 在一杯咖啡时间内自动剪出成片,并保留可编辑工程

重大升级:安装一个 Skill,让 AI 在一杯咖啡时间内自动剪出成片,并保留可编辑工程

Timeline Studio v0.9.1 正式发布。只需要安装一个 Agent Skill,提供图片、视频、产品素材或者网站地址,AI 就能自动完成内容分析、脚本规划、配音、字幕、镜头剪辑和视觉引导,并同时交付最终视频与可继续修改的 .timeline 工程。

GitHub 仓库:

https://github.com/MartinDelophy/ai-video-editor

Skill 安装页:

https://skills.sh/MartinDelophy/ai-video-editor

一、这次为什么是一次重大升级

Timeline Studio 最初是一个本地优先、直接运行在浏览器中的 AI 视频编辑器。

随着功能不断完善,我们逐渐发现:只在编辑器里增加 AI 配音、字幕、音乐、修复和跟踪能力还不够。

真正能够改变视频生产效率的,是让 Agent 理解用户需求、分析素材、规划镜头、操作编辑器、检查结果,并交付一个可以继续修改的工程。

因此,在 v0.9.1 中,我们重新设计了 edit-timeline-studio Agent Skill。

现在,用户只需要描述最终想要的视频:

请把这个网站制作成一条英文介绍视频。

使用自然女声,专业可信但有活力,16:9,约 60 秒。

先体验网站的公开页面。如果关键功能需要登录,
请让我在浏览器中自行登录。

画面保持稳定,使用真实交互、关键帧放大、
下划线和准确框选突出重要功能。

最终输出成品视频和可继续修改的工程文件。

接下来,可以暂时离开去喝一杯咖啡。

Agent 会自动完成第一次完整剪辑,并交付:

project-name.mp4
project-name.timeline

MP4 可以直接发布,.timeline 则可以重新导入 Timeline Studio 继续修改。

二、安装 Skill 即可使用

通过 skills.sh 安装:

npx skills add MartinDelophy/ai-video-editor \
  --skill edit-timeline-studio

安装到 Codex:

gh skill install MartinDelophy/ai-video-editor \
  edit-timeline-studio \
  --agent codex \
  --scope user \
  --pin v0.9.1

安装到 Claude Code:

gh skill install MartinDelophy/ai-video-editor \
  edit-timeline-studio \
  --agent claude-code \
  --scope user \
  --pin v0.9.1

GitHub Copilot、Gemini CLI、Cursor 等支持 Agent Skills 的客户端,也可以从同一个 GitHub 仓库发现这套 Skill。

三、不是“一键套模板”,而是先理解内容

传统自动剪辑经常采用固定模板:

  1. 检测静音;
  2. 删除空白;
  3. 按固定时长切片;
  4. 套用统一转场;
  5. 生成字幕;
  6. 导出视频。

这种方式可以处理简单素材,但很难完成专业的产品宣传、教程或网站介绍。

Timeline Studio 的工作流首先会识别内容类别:

类型需要优先保护的内容
人物口播语义、表情、自然停顿和人物稳定性
教程演示指令、操作与结果的对应关系
访谈对话说话人身份、问答关系和真实语境
Vlog/活动事件发展、自然声和镜头变化
产品营销产品身份、卖点证据、品牌和行动号召
叙事纪录人物、因果关系和时空连续性
网站宣传页面证据、真实交互、隐私和视觉引导

分类的目的不是选择一个模板,而是为不同内容应用不同的保护规则。

例如,教程中的“讲解—点击—结果”必须被视为一个整体;产品宣传不能因为 AI 生成的画面更漂亮,就改变包装文字、Logo、颜色或者产品结构。

四、图片和视频如何分析

对于图片,Agent 会检查:

  • 人物、产品和主要视觉主体;
  • Logo 与品牌关键元素;
  • 可读文字;
  • 图像清晰度;
  • 分辨率;
  • 裁切空间;
  • 景深和分层条件;
  • 是否适合直接使用、2.5D、图生视频或图生图处理。

对于视频,分析会组合:

  • 镜头边界;
  • 代表帧;
  • OCR;
  • 语音与字幕;
  • 人物、产品和界面区域;
  • 全局光流;
  • 主体区域光流;
  • 模糊、遮挡与失焦;
  • 动作开始与结果出现的时间点。

光流只负责分析运动,不能单独证明一个区域的语义。

因此,系统会先判断“画面中的对象是什么”,再利用光流判断“它如何移动”。

这让 Agent 可以区分:

全局运动 → 相机移动或相机抖动
局部运动 → 人物、产品或界面内容移动
稳定区域 → 适合阅读、突出或停留
异常运动 → 模糊、遮挡或跟踪失败

在进行跟踪和视觉增强之前,系统会优先处理不必要的全局抖动。

五、自动剪辑之前先生成决策记录

Agent 不会分析完成后立即修改时间线。

它会先构建一份剪辑决策记录:

{
  "category": "website-walkthrough-promo",
  "goal": "product-introduction",
  "targetDurationSeconds": 60,
  "aspectRatio": "16:9",
  "narrationLanguage": "en-US",
  "voiceProfile": {
    "genderPresentation": "female",
    "style": "professional-energetic"
  },
  "mustKeep": [
    "product value",
    "real interaction",
    "visible result"
  ],
  "mustAvoid": [
    "private account information",
    "unsupported product claims",
    "camera shake",
    "tracking drift"
  ]
}

然后为素材中的重要时间范围记录:

  • 保留;
  • 删除;
  • 缩短;
  • 重排;
  • 加速;
  • 强调;
  • 保护音频连续性;
  • 保护字幕边界。

每个重要决定都会保留原因和置信度。

对于存在实质性歧义的问题,Agent 会向用户询问;对于能够直接从素材中观察到的内容,则不会重复提问。

六、网站宣传视频不再是截图轮播

网站宣传是本次升级重点优化的场景。

拿到一个网站地址后,Agent 不会只截取首页。

它会先构建页面和流程覆盖清单:

  • 主页;
  • 功能页面;
  • 产品列表;
  • 详情页面;
  • 搜索与筛选;
  • 关键操作流程;
  • 登录后的产品界面;
  • 外部链接;
  • 具有真实外部影响的操作。

如果关键页面需要登录,Agent 会要求用户自行在浏览器中完成登录,而不会索要:

  • 密码;
  • 短信验证码;
  • 一次性口令;
  • Cookie;
  • Token;
  • 账户恢复信息。

如果用户不方便登录,Agent 只会基于公开页面继续制作,并把无法访问的能力标记为“未验证”。

在获得授权的页面范围内,Agent 可以通过脚本驱动真实浏览器完成:

  • 平滑滚动;
  • 鼠标移动;
  • hover 状态;
  • 标签切换;
  • 搜索和筛选;
  • 加载到结果的变化;
  • 页面视频播放;
  • 可逆的表单预览;
  • 临时鼠标光环和焦点提示。

脚本不能提交订单、发布内容、发送消息、修改账户资料或者执行其他有外部影响的操作。

七、专业动效不等于“到处画矩形框”

我们在早期测试中发现,自动生成的网站视频很容易出现两个问题:

  1. 每个页面都使用矩形框;
  2. 画面始终在放大、缩小和移动。

这种视频虽然“有动效”,却不具备专业质感。

在新工作流中,Agent 会根据目标选择不同的视觉引导方式:

  • 小而密集的界面:关键帧放大;
  • 精确文字和数字:下划线或括线;
  • 按钮、卡片和结果:准确框选;
  • 需要保留上下文:聚光遮罩;
  • 需要解释元素关系:引导线;
  • 视频中的移动对象:光流辅助跟踪;
  • 静态产品图片:景深或 2.5D 分层。

一个标准的解释镜头遵循:

建立上下文
    ↓
引导注意
    ↓
锁定目标
    ↓
静止阅读
    ↓
自然释放

画面抵达目标后必须停稳,让观众有足够时间阅读。

我们明确拒绝:

  • 无意义的持续缩放;
  • 模拟手持画面;
  • 微抖动;
  • 弹性过冲;
  • 框选漂移;
  • 重复放大和缩小;
  • 滚动和变焦同时发生;
  • 为了展示效果而堆叠效果。

八、先生成自然配音,再决定画面时长

不少自动视频会先固定 60 秒画面,再把配音强行压缩到 60 秒。

这样很容易导致:

  • 语速过快;
  • 停顿消失;
  • 字幕闪过;
  • 品牌名发音错误;
  • 画面重点与配音错位。

Timeline Studio 会先确认:

  • 配音语言;
  • 女性、男性或指定声音;
  • 年龄感;
  • 专业、可信、温暖、活力或沉稳等表达风格;
  • 品牌名、网址、数字和专业词的读法;
  • 字幕语言;
  • 自然语速。

配音确认后,再根据每句话的实际长度和自然停顿安排画面。

如果文案超过目标时长,系统优先修改和压缩文案,而不是粗暴加速声音。

光标到达、框选锁定、下划线出现、关键帧放大和结果展示,也会同步到对应的语句。

九、.timeline v3:一条字幕对应一个音频文件

这是本次工程结构中非常重要的一项升级。

过去,一整段旁白可能只有一个音频文件,时间线中的多个句子只是引用不同时间范围。

这样虽然在界面上看起来已经分段,实际修改一句配音时仍然会影响完整音频。

最新的 .timeline v3 会将句子级配音物理拆分:

caption-01 → voice-01.wav
caption-02 → voice-02.wav
caption-03 → voice-03.wav

字幕通过 audioClipId 与音频片段一一对应。

归档结构类似:

project.timeline
├── project.json
├── media/
│   ├── visuals/
│   │   ├── 001-homepage.png
│   │   └── 002-product.png
│   └── audio/
│       ├── voice-001.wav
│       ├── voice-002.wav
│       ├── voice-003.wav
│       └── music.wav

重新打开工程后,用户可以:

  • 替换其中一句配音;
  • 调整一句话的开始时间;
  • 修改音量和淡入淡出;
  • 更新对应字幕;
  • 删除其中一个句子;
  • 重新生成局部声音;
  • 保留其他已经确认的结果。

十、播放循环问题是如何解决的

在多媒体时间线中,如果使用当前视频元素的 currentTime 作为总时间线时钟,视频在片尾发生解码停顿时,播放头可能一直被限制在当前片段末尾。

用户看到的表现,就是视频在某一个片段中不断循环。

原来的关系接近:

Video currentTime
       ↓
Timeline playhead
       ↓
Other media

现在改为:

Monotonic Timeline Clock
       ├── Video
       ├── Voiceover
       ├── Music
       ├── Captions
       └── Effects

时间线成为单调递增的主时钟,视频和音频只作为跟随者。

核心逻辑可以概括为:

const wallClockTime = Math.min(
  timelineDuration,
  playbackStartTime + (now - playbackStartedAt) / 1000
);

currentTimelineTime = wallClockTime;

同时,片段区间从闭区间判断:

time >= start && time <= start + duration

调整为半开区间:

time >= start && time < start + duration

这样可以避免在两个相邻片段的公共边界上同时激活两段媒体。

十一、本地优先与 ModelScope 双线路模型交付

Timeline Studio 将多种 AI 能力放在浏览器中运行:

  • 多语言 AI 配音;
  • Whisper 自动字幕;
  • Stable Audio AI 音乐;
  • 人物与物体检测;
  • 智能画面;
  • 人像处理;
  • AI 修复;
  • 高清增强;
  • 人声分离;
  • 数字人相关能力。

模型采用按需下载和版本固定策略,并通过 Hugging Face 与 ModelScope 双线路交付。

对于国内网络环境,Timeline Studio 优先选择 ModelScope;当线路不可用时,再使用对应的 Hugging Face 镜像。

两家平台使用统一缓存身份:

ModelScope artifact
        │
        ├── same revision
        ├── same checksum
        └── same cache identity
        │
Hugging Face artifact

因此,切换模型来源不会让浏览器重复下载同一个模型。

运行流程如下:

用户第一次选择 AI 能力
        ↓
检查本地缓存
        ↓
检测模型线路
        ↓
下载缺失文件
        ↓
初始化浏览器推理
        ↓
后续任务直接复用

这种本地优先架构带来的价值包括:

  • 原始素材不需要为了基础编辑上传到后端;
  • 模型下载后可以重复使用;
  • 国内外网络环境可以使用不同镜像;
  • 模型版本和许可证更加清晰;
  • Agent 和人工编辑共享同一个项目状态;
  • 导出结果更容易复现。

涉及人脸替换、数字人或其他深度合成能力时,使用者必须取得相关素材的合法授权,不得生成或传播违法、侵权、虚假或误导性内容,也不能将生成结果冒充为真实影像。

十二、命令层与浏览器层协同

Timeline Studio 的 Agent 自动化分为两条路径。

1. 版本化命令路径

对于命令层已经支持的操作,Agent 会先检查工程,再构建声明式编辑计划:

npm run agent -- project.inspect /absolute/path/project.timeline
npm run agent -- project.diff /absolute/path/edit-plan.json
npm run agent -- project.run /absolute/path/edit-plan.json
npm run agent -- project.inspect /absolute/path/project-v2.timeline

其中:

  • project.inspect:读取工程摘要;
  • track.inspect:检查具体轨道;
  • clip.inspect:检查片段;
  • transcript.inspect:检查字幕和配音关系;
  • project.diff:进行不写文件的语义 dry run;
  • project.run:执行通过验证的编辑计划;
  • project.render:渲染当前支持的便携工程子集。

命令操作使用稳定 ID、修订号、操作 ID 和前置条件,支持事务和幂等控制。

2. 浏览器兼容路径

对于以下能力,Agent 会使用 Timeline Studio 编辑器:

  • AI 配音;
  • 自动字幕;
  • 复杂效果;
  • 网站交互;
  • 实时预览;
  • 尚未进入命令注册表的编辑操作;
  • 富媒体最终导出。

Skill 会明确区分两条路径,不会把浏览器自动化描述成完全确定性的无头执行。

十三、一键成片之后如何快速修改

因为最终保留了 .timeline 工程,用户后续可以直接提出局部修改需求。

例如:

请打开这个工程。

将第二句英文配音替换为新的文案,
同时更新对应字幕。

把第三个镜头延长 1.5 秒,
其余已经确认的画面、配音和音乐保持不变。

重新导出视频。

也可以继续调整:

  • 单个镜头;
  • 镜头顺序;
  • 字幕内容;
  • 字幕样式;
  • 某一句配音;
  • 背景音乐;
  • 音量;
  • 淡入淡出;
  • 放大位置;
  • 框选范围;
  • 转场;
  • 视频比例;
  • 不同语言版本。

这让 Agent 的工作从“一次性生成”变成“持续协作”。

十四、我们如何定义任务完成

成功调用导出接口,并不代表视频已经完成。

Timeline Studio 会检查两类结果。

结构正确性

  • .timeline 能否重新打开;
  • 媒体文件是否完整;
  • 字幕与配音是否一一对应;
  • 主画面是否可见;
  • 第一帧能否正常渲染;
  • 轨道时间是否正确;
  • 轨道显隐和锁定状态是否恢复;
  • 导出视频是否包含真实音频;
  • 分辨率、时长和帧数是否正确;
  • 播放是否可以连续跨越全部片段边界。

编辑质量

  • 是否存在画面抖动;
  • 跟踪是否漂移;
  • 框选是否准确;
  • 产品或人物身份是否被改变;
  • 配音是否自然;
  • 字幕是否有足够阅读时间;
  • 强调效果是否与声音同步;
  • 画面是否遮挡关键内容;
  • 需要阅读时画面是否停稳;
  • 是否堆叠了过多效果。

只有结构和质量都通过检查,任务才算完成。

十五、这次升级意味着什么

过去,AI 视频工具通常交付一个结果。

现在,Timeline Studio 希望交付一套可以持续工作的生产流程:

用户提出需求
      ↓
Agent 理解素材与目标
      ↓
Agent 自动完成第一次剪辑
      ↓
交付 MP4 + .timeline
      ↓
用户提出局部修改
      ↓
Agent 调整指定片段
      ↓
重新验证并导出

用户不需要学习所有剪辑工具,也不需要每次从零生成。

第一次任务只需要一杯咖啡的时间,之后的修改则可以基于原工程快速完成。

结语

我们认为,AI 视频编辑下一阶段的竞争点,不只是生成模型能否做出漂亮画面。

真正重要的是:

  • 能否理解素材;
  • 能否保护事实和品牌;
  • 能否规划清晰的叙事;
  • 能否生成自然配音;
  • 能否稳定、准确地引导观众;
  • 能否交付可继续编辑的工程;
  • 能否在用户修改需求时只调整必要部分。

Timeline Studio 想做的事情,可以概括为一句话:

安装一个 Skill,一杯咖啡的时间获得一条成品视频;保留一个可编辑工程,承接之后的每一次调整。

GitHub 仓库:

https://github.com/MartinDelophy/ai-video-editor

相关地址:

如果这个项目对你有帮助,欢迎 Star、提交 Issue,或者告诉我们你最希望交给 AI 自动完成的视频制作场景。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值