ffmpeg-skill:让编程 Agent 能本地调用 FFmpeg 剪视频的开源工具包
ffmpeg-skill 是什么
ffmpeg-skill 是一个开源的 Agent Skill,专为能写代码的 AI 助手(比如 Claude Code、Cursor 或早期 Codex)设计。它的目标很明确:让这些编程 Agent 能像专业剪辑师一样,在用户的本地机器上调用 FFmpeg 处理视频,而不需要把文件上传到云端或调用付费 API。
这个工具包内置了 28 个结构化的命令行工具,覆盖了从视频分析、剪辑、音频处理、字幕烧录到最终交付质检的完整链路。更重要的是,它强制 Agent 遵循一套固定的四步工作流:先探测(probe)素材参数,再编辑(edit),接着检查(check),最后验证(validate)。这套流程避免了 AI 盲目猜测参数导致的翻车操作。
所有处理都在用户自己的电脑上完成,依赖的是本地已安装的 FFmpeg。这意味着零网络传输、零 API 费用,也更保护隐私。项目作者实测了 72 个真实的剪辑任务,全部一次性通过。安装也极其简单,只要在终端里运行 npx ffmpeg-skill,就能自动集成到支持的编程 Agent 中。
核心功能拆解
ffmpeg-skill 的 28 个工具被分成了五大类,每类解决视频处理中的一个关键环节。
分析与探测
在动手剪之前,得先搞清楚素材是什么样。probe 工具会读取视频的元数据,包括时长、帧率(甚至能识别可变帧率 VFR)、分辨率、HDR 格式、音轨数量等。这些信息是后续所有操作的基础。
scenes 则更进一步,它能自动检测场景切换点。比如一段两小时的会议录像,它可以标出每次镜头切换或画面内容突变的时间戳,为生成高光片段提供依据。
为了让 AI “亲眼”看到画面效果,look 工具会生成联络表截图(contact sheet),把视频的关键帧按网格排列成一张图。这样 Agent 就能通过图像判断是否出现了黑屏、模糊或构图问题。
最后,doctor 用于环境自检。它会扫描本机 FFmpeg 的编解码器、滤镜和协议支持情况,确认所有需要的功能都可用。如果缺了某个组件(比如 xfade 转场滤镜),它会明确告诉你该装什么。
剪辑与重组
真正的剪辑操作从这里开始。cut 支持无损剪切——它优先使用 stream copy 模式,只裁剪指定时间段,不重新编码视频流,因此速度极快且画质无损。
join 负责把多段视频拼接起来。它不仅支持简单的顺序连接,还能应用 xfade 滤镜实现淡入淡出、滑动等转场效果。
对于播客或访谈类内容,silence 特别实用。它能自动识别并删除低于阈值的静音段,一键生成跳剪(jump cut)视频,把几小时的内容压缩成几分钟精华。
fit 解决了竖屏适配的痛点。你可以让它把横屏视频智能拉伸、裁剪或加黑边,以完美填充 9:16 的手机屏幕,同时尽量保留主体内容。
此外还有 stabilize(防抖)、reverse(倒放)等基础但高频的功能。
音频优化
视频的听感同样重要。audio 工具集成了降噪、动态压缩、限幅和噪声门限,能一站式清理人声录音中的杂音并提升清晰度。
sync 专门处理音画不同步的问题。它会分析音轨和视频的时间戳,自动校正因设备漂移导致的偏差。
最专业的可能是 loudness。它严格按照 EBU R128 国际标准,将音频响度标准化到 -14 LUFS,确保视频在 YouTube、TikTok 等平台播放时音量一致,不会忽大忽小。
画面增强与图形
caption 可以把 SRT 或 ASS 字幕文件直接烧录进视频,也支持卡拉 OK 式的逐字高亮歌词。
overlay 用于添加水印或做绿幕合成(chroma key),适合品牌露出或虚拟背景替换。
graphics 能动态生成字幕条(lower third)、进度条、章节标记等图形元素,并叠加到视频上。
color 处理色彩相关操作,比如将 HDR 视频转换为 SDR 兼容格式,或者应用 LUT 文件进行专业调色。
交付与工程化
处理完还不算完,得确保成品符合平台要求。export 内置了 YouTube、Instagram Reels、TikTok 等主流平台的导出预设,一键生成合规文件。
check 则是对输出文件做自动质检。它会根据平台规格(如分辨率、码率、音频通道数)给出 PASS/WARN/FAIL 评级,并生成详细的 HTML 报告。
对于复杂项目,render 可以读取 project.json 工程文件,按定义的步骤批量执行整个剪辑流程。
batch 支持对多个输入文件并行处理,并带有缓存机制——如果某个文件已经处理过且源文件未变,就直接跳过,节省时间。
最后,multicam 能自动对齐多机位素材的时间轴,并根据音频相似度或手动标记点进行智能切换合成,适合会议、演出等多角度录制的场景。
如何上手使用
安装非常简单。打开终端,确保已安装 Node.js 和 FFmpeg,然后运行:
npx ffmpeg-skill这条命令会自动下载 skill 并注册到本地 Agent 环境中。接着建议先运行环境检查:
npx ffmpeg-skill doctor如果提示缺少某些 FFmpeg 组件(比如 libx264、libfdk_aac 或 xfade 滤镜),按提示用 Homebrew(macOS)、apt(Linux)或 Chocolatey(Windows)安装即可。
之后,你就可以在 Claude Code 或 Cursor 的对话框里用自然语言描述需求了。例如:“把 interview.mp4 里所有静音超过 1 秒的部分删掉,统一响度到 -14 LUFS,最后导出成 TikTok 竖屏格式。”
Agent 会先调用 probe 分析文件,再用 silence 剪辑,接着 loudness 调整音频,最后用 export 按 TikTok 预设输出。过程中任何画面改动都会触发 look 生成截图供 AI 自检,确保没有意外裁剪或黑屏。
为什么选择 ffmpeg-skill
相比其他 AI 视频工具,ffmpeg-skill 有几个明显优势:
- 纯本地运行:所有处理都在你的机器上完成,文件不出本地,没有隐私泄露风险,也不产生 API 费用。
- 无损优先:像剪切、拼接这类操作,默认使用 stream copy,避免不必要的重编码,既保画质又省时间。
- 工作流固化:强制“探测→编辑→检查→验证”流程,大幅降低 AI 因信息不足而犯错的概率。
- 视觉验收机制:AI 不再只靠元数据判断,而是通过
look生成的截图“看”画面,更接近人类剪辑师的工作方式。 - 工程化支持:通过
project.json和batch,可以管理复杂项目并批量处理,适合课程录制、会议后制等重复性高的场景。 - 安全设计:默认只读原文件,输出新文件;危险操作(如覆盖原片)会被拒绝,除非显式授权。
与竞品的差异
目前市面上另一个较知名的类似工具是 claude-code-video-toolkit。两者定位不同:
claude-code-video-toolkit 是一个全栈视频生产套件,除了剪辑,还集成了 AI 生成视频、图像、语音等功能,架构上采用多 skill 插件模式,部分处理依赖云端 GPU(如 Modal 或 RunPod)。
而 ffmpeg-skill 更专注——它不做内容生成,只做本地剪辑执行。它把 FFmpeg 的能力封装成 28 个契约清晰的工具,每个都有明确的输入输出 schema,便于与 MCP(Model Context Protocol)等系统集成,不会因为版本更新导致接口漂移。
在剪辑深度上,ffmpeg-skill 对无损处理、响度标准、平台质检等专业细节投入更多。比如它的 check 工具能精确判断一个 MP4 是否符合 YouTube 的 H.264 profile 要求,而竞品更多依赖人工审核节点(scene-review)。
实际应用场景
- 播客自动精剪:把几小时的 Zoom 录音交给 Agent,自动删静音、跳气口、统一响度,一小时粗剪几分钟搞定。
- 长视频拆条分发:将 YouTube 长视频自动切成多个 60 秒高光片段,烧录字幕、转 9:16 竖屏,分别按 TikTok、Reels、Shorts 预设导出,实现矩阵分发。
- 课程批量后制:处理一周的网课录像:多机位切换、音画对齐、降噪、加字幕条和进度条,批量渲染并附带 HTML 质检报告。
- Vlog 快速出片:对 Agent 说“把今天 GoPro 拍的滑雪素材剪成 3 分钟 vlog”,它会自动探测各片段参数、防抖、按场景挑高光、配乐导出。

这些场景的共同点是:任务明确、流程重复、对效率要求高。ffmpeg-skill 正是为这类需求而生——把专业视频处理的能力,通过编程 Agent 的自然语言接口,交到普通用户手中。