1. 素材丢进去就能出片,video-use 到底解决了什么
如果你剪过访谈、口播或者旅行 vlog,大概都经历过这种循环:把十几段素材拖进时间线,逐条听有没有“嗯、啊、那个”,剪掉前后多余的空白,再手动对齐字幕,最后调色加转场。单条视频可能就要一两个小时,而内容本身其实没什么变化,纯粹是重复劳动。
video-use 这个 OpenClaw Skill 想干的事情很直接:你把素材丢进一个文件夹,用一句话说清楚要剪成什么样,它自己完成切片、拼接、配音、字幕和导出。它支持访谈、蒙太奇、教程、旅行 vlog 等常见类型,核心能力包括剪掉语气词、去掉语义音频前后的空白、调整片段色调、给音频加淡出、生成可自定义字幕,还能对渲染结果做自我评估再改进。更实用的一点是,它会把剪辑过程的上下文持久化存储,任务中断后可以从断点继续,不用从头再来。
它适合谁?适合手里有大量素材、但不想把时间耗在重复操作上的内容创作者,也适合想跑通一条自动化剪辑链路的开发者。这篇会从 Skill 配置骨架讲到可复制参数,再演示一次从素材到成片的完整验证动作,目标是让你照做就能跑通。
2. 为什么 video-use 的成本能压下来
大多数模型处理视频的方式是逐帧理解画面,token 消耗非常高,一条几分钟的视频成本就很难扛。video-use 换了个思路:它不“看”视频,而是先通过 ElevenLabs Scribe 把视频里的音频转成文本,输出到文件,再让模型去理解文本内容,从而知道这段素材在讲什么。同时它会按需对素材抽帧,作为辅助信息提供给模型。
这个设计的好处是,模型做的是它最擅长的事——理解文本,而不是硬啃像素。所以整体成本会低很多,效果也不差。理解了这个原理,后面的配置和排障就顺了:音频转录质量直接决定剪辑质量,ffmpeg 负责所有切片拼接和导出,ElevenLabs 负责配音和转录。
3. 前置准备:TaoToken 与依赖环境
在动手之前,先把两件事准备好:模型调用通道和本地依赖。
模型调用这边我用的是 TaoToken,它提供统一的 API 入口,兼容常见的对话与编码模型调用方式,适合拿来驱动 video-use 里的理解与生成环节。官网地址是 https://taotoken.net/?utm_source=taotoken_aicg_blog_end&utm_medium=csdn&utm_campaign=rewrite&utm_content= ,API 入口是 https://taotoken.net/api 。你需要先去控制台创建一个 API Key,后面配置里会用到。
本地依赖主要是 ffmpeg 和 ElevenLabs 的 API Key。ffmpeg 负责切片、拼接、转码、加字幕,是整个链路的执行引擎;ElevenLabs 负责音频转录和配音生成。这两样缺一不可。
3.1 安装 ffmpeg
Windows 下可以用 winget 或直接下载压缩包解压后加入 PATH:
winget install Gyan.FFmpegmacOS 用 Homebrew:
brew install ffmpegLinux 用 apt:
sudo apt update && sudo apt install -y ffmpeg装完验证一下:
ffmpeg -version能打印出版本号就说明可用了。
3.2 获取 ElevenLabs API Key
进入 ElevenLabs 官网,注册登录后,在左侧菜单栏找到最下方的“开发者”,切到“API 密钥”这个 Tab,点击“创建密钥”按钮,把生成的 Key 复制保存好。这个 Key 在安装 Skill 时会被要求粘贴,后面转录和配音都会用到。
3.3 准备 TaoToken API Key
进入 TaoToken 控制台,创建一个 API Key。如果你后面要跑长期编码或 Agent 任务,可以顺带了解一下 Coding Plan,入口在 https://taotoken.net/coding-plan?utm_source=taotoken_aicg_blog_end&utm_medium=csdn&utm_campaign=rewrite 。创建好的 Key 先放好,配置环节会写进环境变量。
4. 安装 video-use Skill 与配置骨架
video-use 支持在 OpenClaw、Hermes、WorkBuddy、QClaw 等环境里使用,安装方式有两种:让助手自动安装,或者自己手动装。推荐第一种,省事。
4.1 自动安装
把下面这段命令直接丢给你的助手,它会自己去读安装说明并完成配置:
Set up https://github.com/browser-use/video-use for me. Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.执行过程中它会让你粘贴 ElevenLabs API Key,粘贴后继续,等它提示 ready 就装好了。这里有个细节值得注意:命令里明确要求它读完 SKILL.md 和 helpers/ 目录,因为真正的剪辑脚本都在 helpers/ 里,不读的话后面调用容易出问题。
4.2 手动配置骨架
如果你想自己控制配置,可以参考下面这个骨架。核心是把模型通道、转录服务和 ffmpeg 路径都写清楚:
# video-use 配置骨架 skill: video-use model: provider: taotoken base_url: https://taotoken.net/api api_key: ${TAOTOKEN_API_KEY} model: gpt-4o-mini # 用于理解转录文本与生成剪辑方案 transcribe: provider: elevenlabs api_key: ${ELEVENLABS_API_KEY} model: scribe ffmpeg: path: ffmpeg output: resolution: 1920x1080 fps: 30 format: mp4 editing: remove_fillers: true # 剪掉嗯、啊、呵等语气词 trim_silence: true # 去掉语义音频前后空白 audio_fade_out: 30 # 音频淡出秒数 color_boost: true # 片段色调增强 subtitle: true # 生成字幕 transition: cross_dissolve # 转场类型把${TAOTOKEN_API_KEY}和${ELEVENLABS_API_KEY}换成你实际的 Key,或者写成环境变量引用。参数说明如下:
| 参数 | 作用 | 建议值 |
|---|---|---|
| remove_fillers | 剪掉语气词 | true |
| trim_silence | 去空白 | true |
| audio_fade_out | 音频淡出 | 30 |
| color_boost | 色调增强 | true |
| transition | 转场 | cross_dissolve |
| resolution | 输出分辨率 | 1920x1080 |
配置写好后,把素材放进一个文件夹,比如D:\coze\video-use\demo,然后给助手下发任务即可。
5. 验证请求:从素材到成片的完整动作
配置好之后,跑一次完整验证。我准备了几段电影片段素材,放在D:\coze\video-use\肖申克的救赎目录下,然后给助手下发任务:
我的视频素材位于 D:\coze\video-use\肖申克的救赎 这个目录下面,视频的内容是《肖申克的救赎》电影里面的一些片段,我希望你可以以瑞德(Red)的口吻讲述安迪(Andy)在肖申克监狱中的故事,把素材剪辑成一段视频。下发后,video-use 的执行链路是这样的:
第一步,扫描文件夹,分析每段素材的时长和内容摘要。这一步它调用 ElevenLabs Scribe 把音频转成文本,再让模型读文本,所以你能看到它输出的摘要其实是基于台词的。
第二步,输出剪辑方案,包括整体结构、风格、片段顺序。它会问你确认分辨率、总时长、是否需要字幕等信息。这一步别跳过,确认清楚能少返工。
第三步,确认后开始剪辑。ffmpeg 按方案切片、拼接、加转场、混音,最后渲染导出。成片默认落在素材目录下的edit\preview.mp4。
我这次渲染出来的第一版,转场有点突兀,过渡不自然。于是让它调整转场,它给片段之间加入了交叉溶解,音频也做了交叉淡入淡出,再看就顺多了。这个迭代过程本身就是 video-use 的自我评估改进能力在起作用。
如果你想单独验证 ffmpeg 链路是否通,可以手动跑一条命令测试切片:
ffmpeg -i input.mp4 -ss 00:00:10 -to 00:00:25 -c copy clip_01.mp4能正常切出片段,说明 ffmpeg 环境没问题,剩下的交给 Skill 就行。
6. 本篇常见错排查
跑这条链路时,最容易卡在几个地方,我按出现频率排一下。
ffmpeg 找不到或版本过低。报错通常是ffmpeg: command not found或者某些滤镜不支持。先跑ffmpeg -version确认,版本建议 5.0 以上。Windows 下如果装了但助手找不到,检查 PATH 是否生效,必要时在配置里写 ffmpeg 的绝对路径。
ElevenLabs Key 无效或额度不足。转录阶段直接失败,报 401 或 429。去开发者面板确认 Key 是否被禁用,以及当月额度是否用完。转录是整条链路的第一步,这里挂了后面全停。
素材音频质量差导致转录错乱。video-use 靠转录文本理解内容,如果素材底噪大、多人重叠说话,转录出来的文本会很乱,剪辑方案自然不准。建议先用 ffmpeg 做一次降噪再入库:
ffmpeg -i raw.mp4 -af "afftdn=nf=-25" clean.mp4转场生硬。默认转场可能不适合所有素材,尤其是节奏差异大的片段。在配置里把transition改成cross_dissolve,并适当加长重叠时长,观感会自然很多。
任务中断后重跑。video-use 会持久化剪辑上下文,中断后重新下发同一任务,它会从断点继续,不用重新转录。如果发现它从头开始,检查素材目录和输出目录是否被改动过。
模型调用报错。如果用的是 TaoToken 通道,确认 base_url 写的是https://taotoken.net/api,Key 没有多余空格。需要排查接入问题时,可以去 API Keys 页面重新生成一个 Key 对比测试,接入文档在 https://taotoken.net/doc?utm_source=taotoken_aicg_blog_end&utm_medium=csdn&utm_campaign=rewrite 有详细说明。
7. 按场景选对入口,把链路跑顺
这条链路跑通之后,你会发现它真正的价值不在于“自动”,而在于把模型放在它擅长的地方——读文本、做决策,把重复的像素操作交给 ffmpeg。素材丢进去,确认一下方案,坐等成片,中间省掉的是大量机械操作。
如果你主要是在排障和接入阶段,建议先把 API Keys 和接入文档过一遍,入口分别是 https://taotoken.net/api-keys?utm_source=taotoken_aicg_blog_end&utm_medium=csdn&utm_campaign=rewrite 和 https://taotoken.net/doc?utm_source=taotoken_aicg_blog_end&utm_medium=csdn&utm_campaign=rewrite 。想先验证模型对话效果,可以去模型对话页面试一条请求:https://taotoken.net/chat?utm_source=taotoken_aicg_blog_end&utm_medium=csdn&utm_campaign=rewrite 。如果你打算把这类剪辑任务做成长期跑的编码或 Agent 流程,Coding Plan 会更合适:https://taotoken.net/coding-plan?utm_source=taotoken_aicg_blog_end&utm_medium=csdn&utm_campaign=rewrite 。
最后留一个我踩过的坑:第一次跑的时候我没确认分辨率就让它开剪,结果导出的是竖屏,素材全是横屏,画面两边大黑边。后来养成习惯,方案确认那一步一定把分辨率、时长、字幕三项看清楚再点继续,能省一次重渲染。