输入一个主题就拿到成片:Pixelle-Video 全自动短视频生成实践
2026/9/13 1:10:46 网站建设 项目流程

输入一个主题就拿到成片:Pixelle-Video 全自动短视频生成实践

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

Pixelle-Video 是一个 AI 全自动短视频引擎:输入一个主题,它自动完成文案撰写、AI 配图、TTS 语音合成、背景音乐和成片拼接,不用打开剪辑软件就能拿到可发布的短视频。

最快上手:3 条命令打开本地 Web 界面

视频拼接依赖 ffmpeg,先装一下:macOS 执行brew install ffmpeg,Ubuntu 执行sudo apt install ffmpeg。然后:

git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.py

浏览器会自动打开 http://localhost:8501,是一个三栏界面:左侧输入内容,中间配置语音和视觉,右侧是生成按钮和视频预览区。Windows 用户也可以直接下载官方整合包,双击start.bat即可,不需要装 Python 和 uv。

首次使用要展开「⚙️ 系统配置」面板:填一个 LLM 的 API Key(通义千问、GPT、DeepSeek 等预设会自动填好 base_url),再配置图像生成服务(本地 ComfyUI 或 RunningHub 云端),保存后才能开始生成。

核心功能:每条流水线都能单独替换

从主题到成片:文案、配图、语音一条链跑完

它能做什么:输入主题后,LLM 自动写解说词并拆成 5 个分镜(可改),每个分镜配一张 AI 生成插图,再经 TTS 合成语音,最后拼成视频。适合不想写脚本、只想快速出内容的人。实现上是一条「文案生成 → 配图规划 → 逐帧处理 → 视频合成」的模块化流水线,代码在pixelle_video/pipelines/,每个环节都可以单独换。

30 多种 HTML 模板,三种尺寸各取所需

它能做什么:用模板决定画面版式。templates/目录按尺寸分三组:1080x1920 竖屏、1920x1080 横屏、1080x1080 方形,文件名分三类:static_(纯文字、不需要 AI 生图)、image_(AI 图做背景)、video_(AI 视频做背景)。适合按投放平台选版式:竖屏给短视频平台,横屏给 B 站,方形给社交分发。界面里点「预览模板」可以先看效果再选用,会写 HTML 的人也能往templates/里加自己的模板。

语音可试听可克隆:从 Edge-TTS 到 Index-TTS

它能做什么:下拉选择 TTS 工作流(系统自动扫描workflows/目录,内置 Edge-TTS、Index-TTS 等),再选音色——中文有晓晓、云希,英文有 Aria、Jenny 等,音色列表定义在pixelle_video/tts_voices.py。上传一段参考音频还能做声音克隆,先试听再用。适合做固定人设的系列号,或想用本人声音口播的人。

ComfyUI、RunningHub、直连 API 三条路任选

它能做什么:图像生成、视频生成、素材分析这几项能力都是可插拔的。可以走本地 ComfyUI 工作流(workflows/selfhost/),可以走 RunningHub 云端工作流(workflows/runninghub/),也可以直连厂商 API(DashScope、OpenAI、Kling 等,客户端代码在pixelle_video/services/api_services/),在界面下拉框里切换即可。适合硬件条件和预算不同的人:本地显卡走自部署是零成本,云端则完全不用搭环境。

扩展流水线:数字人口播、图生视频、动作迁移

它能做什么:除了标准「主题到成片」,界面还提供几条专用流水线(web/pipelines/):上传人物照片做数字人口播,上传图片做图生视频,上传参考视频做动作迁移,上传自己的照片和视频让 AI 分析后生成脚本(自定义素材)。适合已经有素材、只缺「素材到成片」这一步的创作者。

完整用例:一个主题生成 5 分镜竖屏视频

以官方文档里的默认示例主题走一遍完整流程:

  1. 输入内容:左侧「内容输入」选「AI 生成内容」模式,输入「为什么要养成阅读习惯」,场景数保持默认 5 个分镜。
  2. 系统配置:LLM 预设里选一个模型并填 Key;图像生成选工作流(云端选 RunningHub,本地选 ComfyUI)。
  3. 语音:保持默认 Edge-TTS,选一个中文女声,点「预览语音」先试听,不满意就换音色。
  4. 视觉:选竖屏 1080x1920 的 AI 配图模板(如image_default),图像尺寸默认 1024x1024。
  5. 点「🎬 生成视频」:右侧实时显示进度——生成文案、逐分镜生成插图(会显示「分镜 3/5 - 生成插图」这类提示)、合成语音、合成视频。

2~5 分钟后,成片自动在右侧播放,附带时长、文件大小、分镜数信息;视频文件保存在output/文件夹,界面上的「历史」页会记录过往生成任务。效果不满意时有四个明确的调优点:换 LLM 改文案风格、改提示词前缀改配图风格、换 TTS 工作流或参考音频改语音、换模板改版式。

新手最容易卡住的 4 个问题

必须装 ComfyUI 吗?不一定。选static_纯文本模板时只需要 LLM 和 TTS,本地零生图环境也能出片;想要 AI 配图又不想自建,就选 RunningHub 云端工作流,填个 API Key 即可。

一次生成多少钱、多久?3~5 个分镜的视频通常 2~5 分钟。费用上有明确梯度:Ollama 本地 LLM + 本地 ComfyUI 是 0 元;通义千问 + 本地 ComfyUI 约 0.01~0.05 元/条;全云端方案最贵但完全不用本地环境。

报错了从哪查?高频卡点只有两个:LLM API 调用失败(检查 Key 和网络)和 ComfyUI 连不上(在配置面板点「测试连接」)。完整排查步骤在docs/zh/troubleshooting.md

配置文件放哪?把根目录的config.example.yaml复制为config.yaml再填,里面有 LLM 的 base_url 和 api_key、ComfyUI 地址、默认模板等;文件含密钥,仓库里明确提醒不要提交。这些配置也可以在 Web 界面里全部完成。

它适合谁

  • 自媒体和个人创作者:用「主题 + 模板 + 固定音色」批量产出口播类短视频,把写稿和剪辑时间省下来。
  • 企业内容团队:通过直连 API 和 FastAPI 服务(api/目录)接入内部系统做批量生产,所有语言版本共用同一套视觉模板。
  • 本地 GPU 用户:Ollama + ComfyUI 全本地部署,整条链路零成本,适合先跑通流程再谈规模化。

一句话总结:Pixelle-Video 把「文案、生图、配音、配乐、剪辑」五步收进一个按钮,你只负责选主题和风格。下一步:打开docs/zh/getting-started/quick-start.md看完整配置流程,用上面的示例主题生成你的第一条视频。

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询