Open-Sora-Plan 文本生成视频实战指南:如何用一句话生成第一个视频
【免费下载链接】Open-Sora-PlanThis project aim to reproduce Sora (Open AI T2V model), we wish the open source community contribute to this project.项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora-Plan
Open-Sora-Plan 是一个开源的文本生成视频(text-to-video)项目,用一句文字描述就能生成短视频。单张 24GB 显存显卡可运行 v1.3 模型生成 93 帧 480p 视频,适合想运行或微调开源视频生成模型的开发者与 AI 爱好者。
先看效果:三步生成第一个视频
从 0 到一段可播放的视频分三步:克隆仓库并安装依赖;按 README.md 中 Resource 表下载 v1.3 的模型权重(扩散模型与 WF-VAE 各一份);运行下面的生成命令。官方示例脚本用 8 卡并行,单卡可先跑 29 帧、256×256 的小规格验证环境。
# 29帧短视频,先用小规格验证环境 python -m opensora.sample.sample \ --model_path ./weights/opensora_v1_3 --version v1_3 \ --ae WFVAEModel_D8_4x8x8 --ae_path ./weights/wfvae \ --num_frames 29 --height 256 --width 256 \ --text_prompt "A cat drinking milk" \ --fps 16 --guidance_scale 7.5 --num_sampling_steps 50 \ --save_img_path ./output三个常见使用场景:文生视频、提示词精炼、图生视频
这一节说明仓库里实际能做什么。三个典型场景,每个都按"输入什么、得到什么、适合什么场合"来讲。
文本生成视频:一句话快速预览镜头
- 输入:一句画面描述。建议用英文,仓库自带示例提示词库 examples/sora.txt,每行一条。
- 得到:29~93 帧的短视频(16~18fps 下约 2~6 秒),分辨率按权重规格选择,如 480p、640p。
- 适合场合:创意验证、分镜素材预览、演示展示。
- 不想敲命令的话,仓库自带 Gradio 网页控制台 opensora/serve/:页面上输入提示词、拖动滑条调整帧数、引导尺度与采样步数,结果直接在浏览器里播放。
提示词精炼:把短句扩写成完整描述
- 输入:一句话的简单描述,训练数据包含中文样本。
- 得到:补全了主体、动作、场景(可选镜头语言、光影、氛围)的完整提示词。
- 适合场合:原描述太简略、生成结果主体漂移时,先精炼再交给扩散模型。
- 实现是一个基于 LLaMA 3.1 的 LoRA 小模型,用 32555 条精炼样本对训练,训练与推理流程见 docs/Prompt_Refiner.md 和 opensora/models/prompt_refiner/。
图生视频:让一张静图动起来
- 输入:一张首帧图片;v1.2/v1.3 的 i2v 权重还支持指定起始帧和结束帧。
- 得到:以该图为开场的短视频。
- 适合场合:分镜动画化、产品静图预览。
- 对应权重见 README 的 Resource 表(带
_i2v后缀的条目),控制台有独立的 i2v 脚本 opensora/serve/gradio_web_server_i2v.py。
安装与运行:环境要求与最小命令集
这一节把硬件、软件和容易踩的坑一次说清,照着做就能跑起来。
| 项目 | 要求或说明 |
|---|---|
| 操作系统 | Linux(官方脚本在 Linux 上验证) |
| Python | ≥3.8,依赖版本已固定(如 torch 2.1.0),建议按 pyproject.toml 装 |
| GPU | v1.3 官方数据:24GB 显存可跑 93 帧 480p;分辨率与帧数越低,显存占用越小 |
| NPU | v1.5 权重仅支持昇腾 910 系列 + MindSpeed-MM 框架,GPU 用户建议先用 v1.3 |
| 磁盘 | 各版本权重均为 GB 级,按要下载的版本预留空间 |
最小命令集:
git clone https://gitcode.com/GitHub_Trending/op/Open-Sora-Plan cd Open-Sora-Plan pip install -e .注意事项:
- 帧数需满足 4n+1(1、29、45、61、77、93……),宽高需为 32 的倍数,否则输入不被模型接受。
- 上文生成命令节选自官方脚本 scripts/text_condition/gpu/sample_t2v_v1_3.sh,未列出的参数(文本编码器路径、采样方法等)以该脚本为准。
- 仓库不含模型权重,需单独下载;版本与权重的对应关系见 README 的 Resource 表。
深入使用:批量生成、参数调优与训练入口
前面跑通单条视频后,进阶内容主要围绕三件事:批量、调参、再训练。
- 批量生成:
--text_prompt支持传入文本文件,每行一条提示词,一次任务产出多条视频,适合成批制作素材。 - 参数调优:
guidance_scale控制视频对提示词的跟随程度,num_sampling_steps影响质量与耗时,seed与num_samples_per_prompt用于固定随机性、对比多次结果。 - 多卡与训练:官方脚本用 torchrun 起 8 卡推理;想自己训练或微调,入口在 opensora/train/,涵盖 VAE 与扩散模型,scripts/accelerate_configs/ 提供 DDP 与 DeepSpeed ZeRO2/ZeRO3 的现成配置。
它是怎么工作的:压缩与去噪的两级流水线
不用理解全部细节,记住两件事即可。
第一,生成是一条三级流水线。文本编码器先把句子翻译成语义向量;DiT 扩散模型在潜空间里逐步"去噪",类似给一张模糊图片反复擦雾;最后 VAE 把潜表征解码成可见画面。命令里的--model_path和--ae_path分别指向前两级和后一级的权重。
第二,WF-VAE 负责高倍压缩。它把视频在时间×高×宽三个方向上按 8×8×8 压缩,相当于给行李箱抽真空:扩散模型只需在紧凑的潜空间里做精细工作,计算量大幅下降。WF-VAE 引入小波分析让压缩更保真,同等压缩率下 PSNR(峰值信噪比,衡量还原质量的指标)高于部分开源项目使用的 VAE。仓库里的 examples/rec_video.py 可以拿一段现成视频做"压缩—还原"往返测试,直观检验还原效果。
Open-Sora-Plan 适合想运行、微调或研究开源文本生成视频模型的开发者与 AI 爱好者。版本更新、权重下载和相关论文入口都在仓库 README 中,建议以 README 作为跟进项目的主入口。
【免费下载链接】Open-Sora-PlanThis project aim to reproduce Sora (Open AI T2V model), we wish the open source community contribute to this project.项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora-Plan
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考