一句话做出完整短视频:Pixelle-Video 全自动视频生成从入门到出片指南
2026/9/15 21:53:36 网站建设 项目流程

一句话做出完整短视频:Pixelle-Video 全自动视频生成从入门到出片指南

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

Pixelle-Video 是一个 AI 全自动短视频引擎:你只输入一句主题(比如"为什么建议每天读书 20 分钟"),它会自动写解说词、为每个分镜生成配图、合成语音、铺上背景音乐,最后剪出一条可以直接发布的成片。整个过程不需要剪辑软件,也不需要任何剪辑经验,跑在本地浏览器里,几分钟就能出片。

先跑起来:从零启动 Pixelle-Video 的最快路径

前置准备

源码启动只需要两个工具:

  • uv:Python 包管理器,负责自动安装项目依赖
  • ffmpeg:视频合成必需,macOS 用brew install ffmpeg,Ubuntu/Debian 用apt install ffmpeg

装完后用下面命令拉取项目:

git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video

两种启动方式

  • Windows 一键整合包:从项目 Releases 下载整合包并解压,双击start_web.bat,依赖全部内置,不用装 Python 和 ffmpeg。
  • macOS / Linux 源码启动:在项目根目录执行./start_web.sh,它会自动装好依赖并启动 Web 服务。

浏览器会自动打开http://localhost:8501,这就是全部操作界面。

界面是经典的三栏结构:左侧输入内容、中间配置语音和画面、右侧看进度和成片。

首次必做:在系统配置面板填两件事

第一次使用时,展开顶部的「⚙️ 系统配置」面板,只需要配齐两块内容:

  1. 大语言模型(LLM):负责写文案。面板里内置了通义千问、GPT-4o、DeepSeek、Ollama 等预设,选中后会自动填好地址和模型名,你只需粘贴 API Key。没有 API Key 也没关系,选 Ollama 走本地模型即可。
  2. 画面生成来源:三选一——
    • 本地已部署 ComfyUI:填地址(默认http://127.0.0.1:8188),点「测试连接」确认可用;
    • 用云端 RunningHub:只填 API Key,无需自己的显卡;
    • 直连模型 API(DashScope、OpenAI、可灵等):在「API 媒体模型」里填对应供应商的密钥。

填完点「保存配置」,配置会写入根目录的config.yaml(可参照 config.example.yaml 的结构)。

它凭什么一句话就能出片:一条可替换的生成链路

整个生成过程被拆成一段清晰的生产线:

文案生成 → 配图规划 → 逐帧处理 → 视频合成。每个环节背后都是一个独立的"原子能力",可以单独更换:文案换 LLM 模型,配图换图像工作流,配音换 TTS 工作流,互不牵连。你在界面上能看到实时进度(例如"分镜 3/5 - 生成插图"),成片自动保存到output/目录。按官方文档的口径,一个 3-5 个分镜的视频大约需要 2-5 分钟,主要看分镜数量和网络情况。

选对模板,画面就成功了一半

模板是 HTML 文件,按分辨率放在 templates/ 目录下,文件名前缀直接说明画面类型:

  • static_*.html:纯文字静态模板,不需要任何图像服务,适合快速起步或低成本场景;
  • image_*.html:用 AI 生成的图片做背景,最常用的类型;
  • video_*.html:用 AI 生成的动态视频做背景,表现力更强。

三种尺寸对应不同平台:竖屏 1080x1920(抖音、快手、小红书)、横屏 1920x1080(B站、YouTube)、方形 1080x1080(Instagram、朋友圈)。

几个典型选题和模板的对应关系,可以直接抄:

内容方向建议尺寸建议模板
书籍解读、知识科普横屏 1920x1080image_book.html
电影感叙事、副业/商业话题横屏 1920x1080image_film.html
书单号、全屏展示横屏 1920x1080image_full.html
治愈、情感、心灵成长竖屏 1080x1920image_healing.html
极简金句、社交平台分享方形 1080x1080image_minimal_framed.html

除了选模板,还有两个直接控制"观感"的旋钮:

  • 提示词前缀(Prompt Prefix):一段英文风格描述,统一控制所有配图的画风,比如指定极简线条、胶片质感,改这一句就能整体换风格。
  • 声音克隆:在语音设置里上传一段参考音频(MP3/WAV/FLAC),配合支持克隆的 TTS 工作流(如 Index-TTS),成片就能用接近你本人的音色来旁白;支持的音色清单在 pixelle_video/tts_voices.py 里。

另外别忘了 BGM:可选无背景音乐、内置预置曲目,或把自己的 MP3/WAV 丢进 bgm/ 目录供选择。

把成片调成自己的风格:改模板和换工作流

改模板:每个模板就是一个带 CSS 的 HTML 文件,支持{{ title }}{{ text }}{{ image }}三个变量。从templates/里挑一个最接近的复制一份,改字体、配色、版式,存回对应尺寸目录,就能在 Web 界面的下拉框里直接选到。完整的开发规范见 docs/zh/user-guide/templates.md。

换生成工作流:图像、视频、TTS 的每一种能力都对应 workflows/ 下的一个 JSON 文件,分selfhost/(本地 ComfyUI)和runninghub/(云端)两组,另有api/直连供应商的选项。在 ComfyUI 里调好流程、导出 JSON、放进这个目录,界面就会自动扫描出来供你选用——这意味着"哪一环不满意就只换哪一环"。

生成成本怎么控制:从 0 元到按次计费

三档方案按预算任选,也可以混搭:

  • 完全免费:LLM 用本地 Ollama + 图像用本地 ComfyUI + 语音用免费的 Edge-TTS,全程 0 元,代价是需要一张能跑得动的显卡。
  • 按次计费:LLM 用通义千问(文档给出的量级是单个 3 段视频约 0.01-0.05 元)+ 图像走 RunningHub 云端,适合没有显卡的机器。
  • 混合:日常选题用免费方案跑量,重要的片子换更强的模型和云端服务。

一个省成本的小技巧:先用static_纯文字模板把选题和文案跑通,确认脚本质量没问题,再切到image_模板生成配图——文字模板不消耗任何图像算力,也不依赖 ComfyUI。

遇到问题时按这个顺序排查

  • ComfyUI 连不上:确认服务已启动 → 核对地址 → 在配置面板点「测试连接」。
  • LLM 调用失败:先查 API Key 是否正确,再看网络;界面会显示具体报错。
  • 生成失败:重启服务能解决一部分偶发问题;仍不行就翻终端日志,错误信息里通常能定位到卡在哪个环节。
  • 成片效果不满意:四个变量按顺序试——换 LLM 模型(文案风格不同)、改提示词前缀(配图画风不同)、换 TTS 工作流或上传参考音频(音色不同)、换模板(版式不同)。

更完整的问答在 docs/zh/faq.md 和 docs/zh/troubleshooting.md。

新手路线建议

如果你只想花十分钟体验一次,最短路径是:本地装好 Ollama → 启动 Web 界面 → 填 LLM 配置 → 内容输入选「AI 生成内容」填一个主题 → 模板挑一个static_纯文字款 → 点「生成视频」。先零成本拿到一条成片,再逐步升级图像、声音和模板,每一步升级解决一个你不满意的点,比一开始就配齐全家桶更容易坚持下来。

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询