☰
输入一个主题,3 分钟拿到成片:Pixelle-Video 实操上手
2026/9/26 16:37:29 网站建设 项目流程

输入一个主题,3 分钟拿到成片:Pixelle-Video 实操上手

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

想做短视频,但写不出文案、剪不动视频、也不会录音?Pixelle-Video 就是一个 AI 短视频制作引擎:你只需要给一个主题,文案撰写、AI 配图、语音解说、配乐合成全部自动完成,几分钟后得到一条能直接发布的竖屏视频,还能把旁白换成你自己的声音(声音克隆)。这篇文章按真实创作路径走:第一次跑通 → 调出你想要的风格 → 翻车了怎么修。

第一次跑通:5 步拿到第一条成片

界面长这样:左边填内容,中间配语音和视觉,右边点「生成视频」。整个流程背后是一条固定的流水线,先把这张流程图看一遍,后面每一步操作你都能对上号:

第一步,把项目跑起来。Windows 用户直接下载官方整合包,解压后双击start.bat,浏览器自动打开http://localhost:8501,零环境配置。其他系统执行:

git clone https://link.gitcode.com/i/7775af9c0257ead4bb1cb9dcddb04860 cd Pixelle-Video uv run streamlit run web/app.py

uv是一个比 pip 更快的 Python 包管理器,它会自动装好所有依赖;另外系统里需要装ffmpeg(音视频处理工具,macOS 用brew install ffmpeg,Ubuntu 用apt install ffmpeg)。

第二步,配置 LLM。展开「⚙️ 系统配置」面板,从下拉菜单选一个大模型(通义千问、GPT-4o、DeepSeek 都行,也有本地免费的 Ollama),填入 API Key,保存。LLM(大语言模型)就是那个"帮你写文案的 AI",是整个流程里唯一必填的配置。

第三步,输入主题。左侧「📝 内容输入」选「AI 生成内容」,输入一个主题,比如"为什么要养成阅读习惯",分镜数量保持默认 5 个。如果你已经有现成文案,也可以切到「固定文案内容」直接粘贴,跳过 AI 写稿。

第四步,语音和视觉保持默认。TTS(Text-to-Speech,文字转语音的工作)选默认的 Edge-TTS 即可,它免费且无需本地环境;图像生成工作流和模板也都用默认值。

第五步,点「🎬 生成视频」。界面会实时显示进度:"生成文案 → 生成配图 → 合成语音 → 合成视频",一条 5 分镜的视频大约 2-5 分钟跑完,完成后自动播放,文件落在output/文件夹。

跑通第一条之后,你可能会觉得"能出片了,但这画面不是我想要的"。别急,下面三个旋钮就是为这事准备的。

调出想要的风格:模板、提示词前缀、生图工作流

视频好不好看,由两层东西决定:画面布局(模板)和配图长相(AI 生图)。这两层是独立的,可以分开调。

模板控制布局。打开 模板目录 就能看到全部预置模板,文件名本身说明了类型:image_*.html用 AI 生成的图片做背景,video_*.html用 AI 生成的动态视频做背景,static_*.html则是纯文字样式、完全不依赖 AI 生图。界面里按尺寸分组显示——竖屏 1080x1920(发抖音、快手)、横屏 1920x1080(发 B 站、YouTube)、方形 1080x1080(发小红书)各有一组。比如这套电影感的横屏模板,黑底白图加居中构图,配知识科普类内容就很对味:

提示词前缀控制配图风格。这是最容易出效果的一个旋钮:在「🎨 视觉设置」的"提示词前缀"里填一段英文风格描述,它会拼在每个分镜的生图提示词前面,统一锁定画风。比如填Minimalist black-and-white illustration, clean lines, simple style,出来的配图就是这种水墨极简风:

不想试错?点「预览风格」可以先单独出一张图看看效果,满意了再生成整条视频,能省不少等待时间。

生图工作流控制"谁来画"。默认走的是 FLUX 模型(image_flux.json)。如果你会 ComfyUI,可以把自己的工作流 JSON 丢进 工作流目录,下拉菜单会自动扫出来供选择;也支持直连 DashScope、OpenAI、Seedream 等云端生图 API,换引擎不用改任何别的配置。

风格调顺了,下一个让人出戏的问题通常就来了:旁白一听就是"AI 腔"。想让配音变成你自己的声音?往下看。

上传 20 秒音频,让 AI 用你的声音念稿

默认 Edge-TTS 快且免费,但音色是固定的,念多了总有点机器味。Pixelle-Video 的 TTS 也是工作流机制:系统自动扫描workflows/目录下所有tts_前缀的 JSON,界面上就能切换。

想要"自己的声音",分三步:

  1. 语音设置里把 TTS 工作流切到支持声音克隆的方案,比如 Index-TTS(tts_index2.json);
  2. 上传一段参考音频(MP3/WAV/FLAC 都行),建议 10-30 秒、人声清晰、没有背景音乐——参考音频的质量基本决定了克隆的上限;
  3. 点「预览语音」,输入几句测试文本先试听,音色对了再生成正片。

注意 Edge-TTS 本身不支持声音克隆,选了它上传参考音频也不会生效,这是新手最容易疑惑的一点。此外 TTS 工作流也支持多语言音色,做英文或其他语言的口播视频时同样可以走这套流程。

跑顺之后你可能会开始批量出片,也可能会在某一天突然"翻车"。下面这几个坑基本覆盖了绝大多数报错场景。

翻车了怎么修:三个最常见的坑

坑一:TTS 合成失败。这是新手遇到频率最高的问题,先别慌——默认的 Edge-TTS 走的是网络在线服务,网络波动就容易失败。最稳的解法是切到走本地 ComfyUI 合成的工作流(下拉菜单里选tts_前缀、由 ComfyUI 执行的那几个),稳定性明显更好。切之前确认 ComfyUI 服务在跑(默认http://127.0.0.1:8188),并点过「测试连接」。

坑二:生成太慢。5 分镜要等半天,可以按这个顺序排查:先把分镜数从 10 砍到 5(耗时几乎线性下降);生图如果走的是云端 RunningHub,换成本地 ComfyUI 通常更快;LLM 换响应更快的模型。5 分镜在配置正常时应落在 2-5 分钟内。

坑三:声音或画面不对劲。文案跑题,换一个 LLM 模型重跑,不同模型的写作风格差异很大;配图风格不对,优先改提示词前缀而不是换模型;克隆音色不达标,换一段更干净的参考音频再试。

以上问题如果都没对上,翻 故障排查手册 按错误提示对号入座,或者直接看 官方文档 里更细的配置说明。


现在就可以试:打开 Web 界面,在文本框里输入"为什么要养成阅读习惯",其他全部默认,点「生成视频」——三分钟后你会拿到第一条自己"做"出来的 AI 短视频。

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询