claude-real-video安装教程:macOS/Linux/Windows三大平台5分钟从零配置,ffmpeg与Whisper一次搞定
【免费下载链接】claude-real-videoLet Claude (or any LLM) actually watch a video — scene-aware, deduplicated frames + transcript, from a URL or local file. Runs locally, MIT.项目地址: https://gitcode.com/gh_mirrors/cl/claude-real-video
claude-real-video(命令名crv)是一个 MIT 开源的本地视频分析工具,能让 Claude 或任何 LLM真正"看"视频:它用场景感知的方式抽取关键帧、去重、并用 Whisper 做语音转写,全程在你自己的机器上运行。本文是一份从零开始、覆盖 macOS / Linux / Windows 三大平台的完整安装教程,核心就两步——装好ffmpeg,再pip install带Whisper扩展的 claude-real-video,5 分钟即可完成配置。
一、claude-real-video 是什么?为什么需要它
把 YouTube 链接丢给 ChatGPT,它读到的只是字幕文本,而不是画面;Claude 甚至无法直接接收视频文件。多数"让 LLM 看视频"的方案采用固定间隔抽帧(每秒 1 帧),快切镜头会漏掉,静态录屏又会塞满上下文。
claude-real-video 的做法不同:
| 方案 | claude-real-video | |
|---|---|---|
| 抽帧方式 | 固定间隔(每秒 N 帧) | 场景变化检测+ 密度保底 |
| 重复镜头 | 每次重复都会发送 | 滑动窗口去重,每个镜头只发一次 |
| 音频 | 常被忽略 | 本地 Whisper 转写(自动检测语言) |
| 运行位置 | 常常上传到云端 | 完全本地运行,你决定把什么交给 LLM |
装好之后,一条命令就能把视频变成 AI 能读的证据包:
crv "https://www.youtube.com/watch?v=..." # 输出:crv-out/frames/*.jpg + frames.json(每帧时间戳)+ transcript.txt + MANIFEST.txt二、安装前置条件:Python 与 ffmpeg 一键配置
1. 确认 Python 版本 ≥ 3.10
python --version # 或 python3 --versionclaude-real-video 要求 Python 3.10+(见 pyproject.toml 中的requires-python声明)。版本过低请先升级 Python 或使用 pyenv 等版本管理器。
2. 三大平台 ffmpeg 一键安装步骤
ffmpeg / ffprobe 用于抽帧和提取音频,无法通过 pip 安装,需要单独装一次。三大平台对应命令如下:
| 平台 | 一键安装命令 |
|---|---|
| 🍎 macOS | brew install ffmpeg |
| 🐧 Linux | sudo apt install ffmpeg(或用你发行版对应的包管理器) |
| 🪟 Windows | winget install Gyan.FFmpeg,或choco install ffmpeg |
💡 Windows 用户如果选择下载压缩包的方式,记得把其中的
bin\文件夹加入系统PATH,否则 pip 装好后仍会报找不到 ffmpeg。
安装后验证是否进入PATH:
ffmpeg -version能打印出版本号就说明成功了。
三、pip 安装 claude-real-video 并配置 Whisper
打开终端执行:
pip install "claude-real-video[whisper]" # 推荐:抽帧 + 去重 + 语音转写如果只需要抽帧和去重、不需要语音识别,可以只装核心包:
pip install claude-real-video⚠️ 注意:pip 的扩展(extras)不会自动安装,漏掉[whisper]就意味着没有语音转写(自带字幕的视频除外,会直接用现成字幕)。
安装完成后你会获得这些命令:crv(主命令)、crv-web(本地网页版,免终端)、crv-ask(跨视频搜索记忆)、crv-mcp(MCP 服务器),定义都在 pyproject.toml 的[project.scripts]段中。
四、验证安装成功:3 条检查命令
ffmpeg -version # 检查 ffmpeg 是否在 PATH 中 crv --help # 检查主命令可用及全部参数 python -m claude_real_video --help # crv 的别名写法,等效三条命令都能正常输出,说明环境已完全就绪,可以进入第一次实战。
五、第一次运行:把视频变成 AI 能读的证据包
用本地文件试跑一条命令:
crv lecture.mp4 -o out --lang zh运行结束后,out/目录里会出现模型需要的全部内容:
frames/:去重后的关键帧(每帧都带源视频时间戳,可引用如frame_012 @ 00:03:41)frames.json:帧 → 时间戳映射transcript.txt/transcript.json:带时间戳的转写文本MANIFEST.txt:给模型看的"阅读说明书"
把这些文件和几帧关键图丢给 Claude / ChatGPT / Gemini,即可提问。想先看看模型将看到什么,加--viewer生成一个本地viewer.html,双击即可打开,无需联网。
同一 58 秒视频:固定 1fps 抽帧得到 58 张图,claude-real-video 只保留26 张真正有变化的,还能用--grid拼成九宫格供模型阅读连续动作,效果类似下面这张 NASA 发射视频的抽帧结果:
看看 --grid 输出长什么样
--grid会把保留的帧拼成 3×3 联系表,模型读到的是"序列"而不是零散静帧:
六、可选进阶配置:faster-whisper 与 Apple Silicon 加速
更快的转写:[fast]扩展
pip install 'claude-real-video[fast]'装上后 crv 自动切换到 faster-whisper——同样的模型和输出,速度快数倍,并由 Silero VAD 把关,纯音乐/静音音频会得到诚实的"无语音"标注,而不是 Whisper 经典的"幻觉字幕"。
Mac 用户专属:[mlx]扩展(M1–M4 GPU 转写)
pip install 'claude-real-video[mlx]'借助 mlx-whisper 在 Apple Silicon GPU 上跑 Whisper:一段 21 分钟的演讲,faster-whisper 约需 6 分钟,M4 上约 1 分钟。若 mlx 不可用会自动回退到 faster-whisper,再回退到 CLI,无需额外配置。
其他按需扩展:pip install "claude-real-video[speakers]"(说话人分离)、pip install 'claude-real-video[mcp]'(MCP 服务器)。
七、常见安装问题快速排查
| 症状 | 原因与解决 |
|---|---|
ffmpeg: command not found | ffmpeg 未安装或不在 PATH。按第二节重新安装;Windows 记得把bin\加入 PATH |
| 有画面但没有转写 | 未安装[whisper]扩展,重新执行pip install "claude-real-video[whisper]" |
| 转写太慢 | 加装[fast](全平台)或[mlx](Apple Silicon) |
| 输出目录报"拒绝写入" | 同一输出目录已有另一个视频的分析结果,属于防混淆保护;换目录或加--overwrite |
更多参数细节(--scene、--max-frames、--adaptive、--text-anchors等)可查阅项目根目录的 README.md,命令行实现位于 src/claude_real_video/cli.py。
八、相关项目文件导航
- 完整文档与参数表:README.md
- 依赖与命令定义:pyproject.toml
- CLI 入口源码:src/claude_real_video/cli.py
- Agent 技能说明(Claude Code / Cursor 等 50+ 宿主):skills/claude-real-video-for-agents/SKILL.md
- 技能一键安装脚本:install-skill.sh
装到这一步,你的 AI 已经具备了"看视频"的能力——下一条crv命令,就是它的第一眼。
【免费下载链接】claude-real-videoLet Claude (or any LLM) actually watch a video — scene-aware, deduplicated frames + transcript, from a URL or local file. Runs locally, MIT.项目地址: https://gitcode.com/gh_mirrors/cl/claude-real-video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考