☰
Pixelle-Video:输入一个主题即可自动成片的 AI 短视频引擎实战指南
2026/10/5 17:15:55 网站建设 项目流程

Pixelle-Video:输入一个主题即可自动成片的 AI 短视频引擎实战指南

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

Pixelle-Video 是一个开源的 AI 全自动短视频引擎:只要输入一个主题,它就能自动完成文案撰写、AI 配图/视频生成、语音合成、背景音乐添加与最终合成,全程零剪辑门槛。本篇指南将围绕项目英文主文档 README_EN.md 展开,完整讲解视频生成流水线、Windows 一键包与源码两种安装方式、Web 三栏界面的每一项配置,并结合 config.example.yaml 与pixelle_video/config/下的源码实现,帮助你在几分钟内跑通"主题 → 成片"的完整链路。

项目概述:一句话输入,全链路自动成片

Pixelle-Video 的核心理念是全自动:只需输入一个topic(主题),系统会自动完成五件事:

  • ✍️ 撰写视频文案(AI Smart Copywriting)
  • 🎨 生成 AI 配图/视频(AI Generated Images / Videos)
  • 🗣️ 合成语音解说(AI Generated Voice,支持 Edge-TTS、Index-TTS 等)
  • 🎵 添加背景音乐(BGM)
  • 🎬 一键合成视频

其功能亮点可以概括为以下几个方面:

  • 全自动生成:输入主题,自动生成完整视频,无需任何剪辑经验;
  • AI 智能文案:基于主题智能创作解说词,无需自己写脚本;
  • AI 生成配图:每一句文案都会配上对应的 AI 插图;
  • AI 生成视频:支持 WAN 2.1 等视频生成模型创建动态内容;
  • 直连模型 API:可直接调用 DashScope、OpenAI、Seedream、Seedance、Kling 等图像/视频生成服务;
  • AI 生成语音:支持 Edge-TTS、Index-TTS 等主流 TTS 方案;
  • 背景音乐:支持内置或自定义 BGM;
  • 视觉风格:内置多套模板,可按尺寸与风格自由选择;
  • 灵活尺寸:支持竖屏、横屏、方形等多种画幅;
  • 多种 AI 模型:支持 GPT、通义千问(Qwen)、DeepSeek、Ollama 等 LLM;
  • 原子能力灵活组合:图像、视频、TTS、VLM 等能力可通过 ComfyUI / RunningHub 工作流或直连 API 模型按需替换。

视频生成流水线:文案 → 配图 → 逐帧 → 合成

Pixelle-Video 采用模块化设计,从输入文本到最终视频输出,整个流程为:

Script Generation(文案生成)→ Image Planning(配图规划)→ Frame-by-Frame Processing(逐帧处理)→ Video Composition(视频合成)

每一个环节都支持灵活定制:可以选择不同的 AI 模型、音频引擎、视觉风格,满足个性化创作需求。从源码结构看,这一设计在pixelle_video/pipelines/中体现为多个可替换的流水线实现(base.py 定义基类,standard.py、linear.py、asset_based.py、custom.py 提供不同变体),Web 端则通过插件式注册机制在 web/pipelines/init.py 中自动注册标准(Standard)、素材驱动(Asset-Based)、数字人(Digital Human)、图生视频(I2V)、动作迁移(Action Transfer)五类流水线 UI。

快速开始:两种安装方式

方式一:Windows 一键整合包(推荐 Windows 用户)

无需安装 Python、uv 或 ffmpeg,开箱即用。步骤为:

  1. 下载最新的 Windows All-in-One Package 并解压;
  2. 双击运行start.bat启动 Web 界面;
  3. 浏览器自动打开http://localhost:8501;
  4. 在「⚙️ System Configuration」中配置 LLM API 与图像生成服务;
  5. 开始生成视频。

整合包已包含全部依赖,首次使用只需配置 API 密钥。配套说明可见 packaging/windows/README.md 与启动脚本 packaging/windows/templates/start.bat。

方式二:从源码安装(macOS / Linux 或需要自定义的用户)

前置依赖:uv 与 ffmpeg

需要先安装 Python 包管理器uv与视频处理工具ffmpeg:

  • uv:请参考 uv 官方安装指南,安装后在终端运行uv --version验证;
  • ffmpeg:macOS 用brew install ffmpeg;Ubuntu/Debian 用sudo apt update && sudo apt install ffmpeg;Windows 则从 ffmpeg 官网下载解压后,将bin目录加入系统环境变量 PATH。安装后运行ffmpeg -version验证。
启动 Web 界面

克隆仓库并启动:

git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video.git cd Pixelle-Video # 使用 uv 运行(推荐,会自动安装依赖) uv run streamlit run web/app.py

浏览器会自动打开http://localhost:8501。从源码结构看,Web 入口 web/app.py 使用 Streamlit 的st.navigation定义了「Home」与「History」两个页面,其中 Home 页(web/pages/1_🎬_Home.py)通过 Tab 形式展示所有已注册流水线,默认加载「标准流水线」的三栏布局(见 web/pipelines/standard.py)。

首次配置三要素

首次使用时展开「⚙️ System Configuration」面板,填写:

  • LLM 配置:选择 AI 模型(如 Qwen、GPT 等)并填入 API Key;
  • ComfyUI / RunningHub 配置:如需通过工作流生成图片、视频或语音,配置本地 ComfyUI 地址或 RunningHub API Key;
  • API 媒体模型配置:如需直连图像/视频模型,配置 DashScope、OpenAI、ARK、Kling 等供应商的 API Key、Base URL 与代理选项。

配置完成后点击「Save Configuration」,即可开始生成视频。

Web 界面三栏布局实战详解

打开 Web 界面后,会看到三栏布局,左栏负责内容输入与 BGM,中栏负责语音与视觉风格,右栏负责生成与预览。

⚙️ 系统配置(首次必填)

1. LLM 配置(大语言模型)

用于生成视频文案。支持两种方式:

  • 快速选择预设:从下拉菜单选择预设模型(Qwen、GPT-4o、DeepSeek 等),选择后base_url与model自动填充,点击「🔑 Get API Key」可跳转注册获取密钥;
  • 手动配置:自行填写 API Key、Base URL(API 地址)与 Model(模型名称)。

在配置层,LLMConfig模型(pixelle_video/config/schema.py)即由api_key、base_url、model三个字段构成;config.example.yaml 中给出的主流预设如下,全部兼容 OpenAI SDK 协议:

预设base_urlmodel
Qwen Maxhttps://dashscope.aliyuncs.com/compatible-mode/v1qwen-max
OpenAI GPT-4ohttps://api.openai.com/v1gpt-4o
DeepSeekhttps://api.deepseek.comdeepseek-chat
Ollama(本地)http://localhost:11434/v1llama3.2

LLM 是否配置完成,由 pixelle_video/config/schema.py 中的is_llm_configured()/validate_required()判断——三者均非空才算就绪,这也是整个系统唯一被视为"必需"的配置项。

2. ComfyUI / RunningHub 配置

用于通过 ComfyUI 工作流生成视频配图、视频片段或语音:

  • 本地部署(推荐):填写 ComfyUI URL(默认http://127.0.0.1:8188),点击「Test Connection」确认服务可用;
  • 云端部署:填写 RunningHub API Key,即可调用云端图像/视频生成服务。

对应的ComfyUIConfig(pixelle_video/config/schema.py)还包含comfyui_api_key(可选,用于平台鉴权)、runninghub_concurrent_limit(RunningHub 并发执行上限,1–10,默认 1)、runninghub_instance_type(可设为'plus'以调用 48G 显存机器)等字段。注意 Docker 环境下需使用host.docker.internal:8188(Mac/Windows)或宿主机 IP(Linux)访问本地 ComfyUI。

3. API 媒体模型配置

用于不依赖 ComfyUI/RunningHub,直接调用模型供应商的图像、视频或素材分析能力。支持的供应商包括:

  • OpenAI / GPT Image:GPT 图像生成模型;
  • DashScope / Wan / HappyHorse:通义万相图像与视频生成;
  • Volcengine ARK / Seedream / Seedance:字节 Seedream 图像与 Seedance 视频生成;
  • Kling AI:可灵视频生成。

可配置项包括:

  • API Key / Access Key / Secret Key:供应商鉴权信息;
  • Base URL:模型服务地址,WebUI 会预填官方默认值;
  • 本地代理:如http://127.0.0.1:9090;
  • 启用代理:每个供应商可独立选择是否走本地代理;
  • 打印模型请求参数:调试选项,会在终端打印发送给模型的 prompt、模型名与输入文件路径。

在配置结构中,APIProvidersConfig(pixelle_video/config/schema.py)统一管理common(全局调试与代理)、openai、dashscope、deepseek、gemini、ark(API Key 型)以及kling(Access/Secret Key 型)等供应商;config.example.yaml 中已预置各供应商官方默认 base_url,如 DashScopehttps://dashscope.aliyuncs.com/api/v1、ARKhttps://ark.cn-beijing.volces.com/api/v3、Klinghttps://api-beijing.klingai.com。

💡 如果只使用 ComfyUI 或 RunningHub,可以不填写 API 媒体模型配置;如果选择api/...工作流,则必须先配置对应供应商的密钥。

📝 内容输入(左侧栏)

  • 生成模式:
    • AI Generated Content:输入主题,AI 自动创作文案,适合快速出片,例如输入 "Why develop a reading habit";
    • Fixed Script Content:直接输入完整文案,跳过 AI 创作,适合已有现成脚本的场景。
  • 背景音乐(BGM):
    • 无 BGM:纯人声解说;
    • 内置音乐:选择预置音乐(如 default.mp3);
    • 自定义音乐:将 MP3/WAV 等音乐文件放入仓库的 bgm/ 文件夹;
    • 点击「Preview BGM」可直接试听。

🎤 语音设置(中间栏)

  • TTS 工作流:从下拉菜单选择 TTS 工作流(支持 Edge-TTS、Index-TTS 等),系统会自动扫描 workflows/ 文件夹中的 TTS 工作流(如 selfhost/tts_edge.json、runninghub/tts_index2.json);熟悉 ComfyUI 的用户可以自定义 TTS 工作流;
  • 参考音频(可选):上传参考音频(支持 MP3/WAV/FLAC 等)用于声音克隆,适用于支持克隆的 TTS 工作流(如 Index-TTS),上传后可试听;
  • 预览功能:输入测试文本,点击「Preview Voice」即可试听效果,也支持结合参考音频预览。

🎨 视觉设置(中间栏)

图像生成

决定 AI 生成配图的风格:

  • ComfyUI 工作流:从下拉菜单选择图像生成工作流,支持本地(selfhost)与云端(RunningHub)工作流,也支持api/...直连图像模型工作流(需先配置供应商密钥),默认使用image_flux.json(对应 workflows/runninghub/image_flux.json);可自行放置工作流到 workflows/ 文件夹;
  • 图像尺寸:设置生成图像的宽高(像素),默认 1024×1024,注意不同模型对尺寸限制不同;
  • 提示词前缀(Prompt Prefix):控制整体图像风格(需为英文),例如 "Minimalist black-and-white matchstick figure style illustration, clean lines, simple sketch style",可点击「Preview Style」测试效果。
视频模板

决定视频画面的布局与设计。模板命名规范如下:

  • static_*.html:静态模板(无需 AI 生成媒体,纯文字样式);
  • image_*.html:图片模板(以 AI 生成的图片作为背景);
  • video_*.html:视频模板(以 AI 生成的视频作为背景)。

模板按下拉菜单选择,并按尺寸分组显示(竖屏/横屏/方形),支持「Preview Template」自定义参数预览;熟悉 HTML 的用户可在 templates/ 文件夹创建自己的模板。模板目录按分辨率组织,例如竖屏1080x1920/(image_default.html、image_modern.html、image_elegant.html、static_default.html、video_default.html 等)、方形1080x1080/(image_minimal_framed.html)、横屏1920x1080/(image_book.html、image_film.html、image_full.html 等)。以下是仓库中模板预览图的实际效果:

配置层面,模板的默认值由TemplateConfig(pixelle_video/config/schema.py)的default_template字段指定,默认指向1080x1920/default.html;ConfigManager 在加载配置时还会调用resolve_template_path校验模板路径是否存在,缺失时给出告警并回退。

API 视频生成

当选择动态视频模板或扩展工作流时,可通过直连 API 视频模型生成片段:

  • 支持 DashScope Wan / HappyHorse、Kling、Seedance 等视频模型;
  • 按模型能力动态显示分辨率、画幅比例、时长、水印、原生音频等参数;
  • 支持网络下载重试,以及内容审核失败后的「提示词中性化」重试;
  • 在「自定义素材(Custom Media)」工作流中,API 视频片段会尽量匹配旁白音频时长,并利用相邻片段信息提升画面连贯性。

🎬 生成视频(右侧栏)

  • 生成按钮:配置完成后点击「🎬 Generate Video」,实时显示进度(生成文案 → 生成配图 → 合成语音 → 合成视频);
  • 进度显示:实时展示当前步骤,例如 "Frame 3/5 - Generating Image";
  • 视频预览:生成完成后自动播放,显示视频时长、文件大小、分镜数等信息,视频文件保存在output/文件夹。

配置文件 config.yaml 深度解析

WebUI 的「保存配置」会写入项目的config.yaml(默认位置),仓库提供了完整的示例 config.example.yaml(使用前复制为config.yaml并填写,切勿提交到 Git)。完整配置结构如下:

project_name: Pixelle-Video # ==================== LLM Configuration ==================== # 支持任何 OpenAI SDK 兼容 API llm: api_key: "" base_url: "" model: "" # ==================== Direct API Provider Configuration ==================== # 可选:不使用 ComfyUI 工作流,直接调用供应商生成图像/视频/VLM api_providers: common: print_model_input: false local_proxy: "" openai: api_key: "" base_url: "https://api.openai.com/v1" use_proxy: false dashscope: api_key: "" base_url: "https://dashscope.aliyuncs.com/api/v1" use_proxy: false ark: api_key: "" base_url: "https://ark.cn-beijing.volces.com/api/v3" use_proxy: false kling: base_url: "https://api-beijing.klingai.com" access_key: "" secret_key: "" use_proxy: false # ==================== ComfyUI Configuration ==================== comfyui: comfyui_url: http://127.0.0.1:8188 # 本地 ComfyUI 地址(selfhost 工作流必需) comfyui_api_key: "" # ComfyUI API Key(可选) runninghub_api_key: "" # RunningHub API Key(runninghub 工作流必需) runninghub_concurrent_limit: 1 # RunningHub 并发上限(1-10,普通会员默认 1) tts: default_workflow: selfhost/tts_edge.json image: default_workflow: runninghub/image_flux.json # 推荐,无需本地环境 prompt_prefix: "Minimalist black-and-white matchstick figure style illustration, clean lines, simple sketch style" video: default_workflow: runninghub/video_wan2.1_fusionx.json prompt_prefix: "Minimalist black-and-white matchstick figure style illustration, clean lines, simple sketch style" # ==================== Template Configuration ==================== template: default_template: "1080x1920/image_default.html"

几个关键点:

  • image.default_workflow与video.default_workflow均可选 runninghub 或 selfhost 版本,例如 workflows/runninghub/video_wan2.1_fusionx.json 对应云端、workflows/selfhost/video_wan2.1_fusionx.json 对应本地 ComfyUI;
  • prompt_prefix会作为统一风格前缀附加到每一条图像/视频生成提示词上,是控制整体画面风格的关键参数;
  • 配置的加载、校验、保存由三层实现完成:loader.py 负责 YAML 的读写(load_config_dict/save_config_dict,文件不存在时回退默认配置),schema.py 用 Pydantic 定义全部字段默认值与取值范围(如并发上限 1–10、语音速度 0.5–2.0),manager.py 以单例模式提供统一的get/update(深度合并)/save/reload访问,其中set_llm_config还会通过normalize_openai_base_url对 Base URL 做规范化处理。

常见问题与成本方案

Q:第一次使用需要多久?A:生成时长取决于视频分镜数量、网络状况和 AI 推理速度,通常几分钟内即可完成。

Q:视频效果不满意怎么办?A:可以尝试:1)更换 LLM 模型(不同模型文案风格不同);2)调整图像尺寸与提示词前缀(改变配图风格);3)更换 TTS 工作流或上传参考音频(改变语音效果);4)尝试不同的视频模板和尺寸。

Q:费用大概多少?A:本项目完全支持免费运行,官方提供三档成本方案:

  • 完全免费方案:LLM 使用本地 Ollama + ComfyUI 本地部署 = 0 元;
  • 推荐方案:LLM 使用通义千问(成本极低、性价比高)+ ComfyUI 本地部署;
  • 云端方案:LLM 使用 OpenAI + 图像使用 RunningHub(费用较高但无需本地环境)。

选择建议:本地有显卡优先选完全免费方案,否则推荐通义千问方案。FAQ 的具体问答内容也已内置在 Web 侧边栏(见 web/components/faq.py)。

结语

Pixelle-Video 将"写文案、生图、配音、加 BGM、合成"这条完整链路封装成一次输入、一键生成,同时通过 ComfyUI/RunningHub 工作流与直连 API 双通道,把图像、视频、TTS、VLM 等能力做成了可自由组合的"原子能力"。无论你是想用本地显卡跑零成本方案,还是依赖云端 API 快速出片,都可以按照本文的配置路径在 config.example.yaml 与 Web 界面中完成设置。更深入的架构说明可继续阅读 docs/en/getting-started/configuration.md 与 docs/en/development/architecture.md,模板与工作流细节则分别对应 docs/en/user-guide/templates.md 与 workflows/ 目录。本项目基于 Apache 2.0 协议开源,详见 LICENSE。

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询