Kairos推理参数详解:T2V、I2V、TI2V三种视频生成模式配置指南
【免费下载链接】kairosOfficial code for world model Kairos项目地址: https://gitcode.com/gh_mirrors/ka/kairos
Kairos是一款 4B 参数的跨本体世界模型,支持文生视频(T2V)、图生视频(I2V)、文图生视频(TI2V)三种推理模式。本文带你快速看懂推理 JSON 参数(分辨率、帧数、cfg_scale 等),并通过示例文件完成一次完整的视频生成实战。
一、三种生成模式怎么选?
Kairos 的推理模式不是通过命令行开关指定的,而是由 JSON 配置中prompt与input_image两个字段共同决定:
| 模式 | prompt | input_image | 适用场景 |
|---|---|---|---|
| T2V文生视频 | 文本提示词 | 空字符串"" | 纯文本创意生成 |
| I2V图生视频 | 空字符串"" | 图片路径 | 让静态图片"动起来" |
| TI2V文图生视频 | 文本提示词 | 图片路径 | 首帧图 + 文本引导,运动更可控 |
💡 小技巧:TI2V 模式下,推理脚本会自动在提示词前拼接"high-quality video, realistic motion, single continuous shot..."前缀来增强运动质量,见 examples/inference.py。
官方提供的输入首帧示例图:
二、JSON 配置参数速查表
所有示例 JSON 都放在 examples/ 目录下,核心参数如下:
| 参数 | 示例值 | 说明 |
|---|---|---|
prompt | 描述性文本 | 正向提示词,T2V/TI2V 必填 |
input_image | assets/waterfall.jpg | 首帧图路径,I2V/TI2V 必填 |
negative_prompt | low quality... | 负向提示词,抑制低质画面 |
seed | 0 | 随机种子,固定后结果可复现 |
height/width | 480/640 | 输出分辨率,480P 或 720P |
num_frames | 81 | 视频帧数,按 16 fps 输出约 5 秒 |
cfg_scale | 5 | 提示词引导强度,越大越贴合文本 |
tiled | true | 启用分块 VAE 解码,降低显存峰值 |
use_prompt_rewriter | false | 是否用 Qwen 重写提示词 |
output_dir | output/t2v | 输出目录,结果保存为output.mp4 |
⚠️分辨率要与模型匹配:蒸馏版模型(
kairos-sensenova-robot-4B-480P-distilled)专为 480P 优化,请用example_*_480P.json;720P 请使用example_*.json系列,详见 docs/QUICKSTART.md。
三、三种模式 JSON 示例实战
3.1 T2V:纯文本生成视频
以 examples/example_t2v_480P.json 为例,关键差异只有两点:prompt填完整场景描述、input_image留空:
{ "prompt": "A grand natural scene unfolds ... the turbulent pool below.", "input_image": "", "negative_prompt": "bright tones, overexposed, static, low quality ...", "seed": 0, "tiled": true, "height": 480, "width": 640, "num_frames": 81, "cfg_scale": 5, "use_prompt_rewriter": false, "output_dir": "output/t2v" }3.2 I2V:让首帧图"活"起来
参考 examples/example_i2v_480P.json:prompt置空,input_image指向瀑布图。模型会自动理解图像内容并预测合理的后续运动,无需文字引导。
3.3 TI2V:文本 + 首帧双重控制
参考 examples/example_ti2v_480P.json:同时提供prompt与input_image。官方还给出了机器人场景示例 examples/example_ti2v_480P_robot_1.json,提示词仅一句:
"prompt": "The robotic arm sweeps a green cloth across the wooden surface.", "input_image": "assets/robots/robot_1.jpg"生成效果参考:
四、模型与 Config 文件配对
运行推理需要两个输入:JSON 配置 + Python 模型配置,配对规则如下:
| 模型 | 模型配置文件 | JSON 示例 |
|---|---|---|
kairos-sensenova-robot-4B-480P-distilled | kairos/configs/kairos_4b_config_DMD.py | example_*_480P.json |
| 其他 Kairos 4B 模型 | kairos/configs/kairos_4b_config.py | example_*.json(720P) |
Kairos3.1-4B-robot-480P | kairos/configs/kairos_4b_video_only_config.py | example_ti2v_480P_robot_*.json |
五、一键运行推理命令
单卡推理只需一条命令(examples/inference.sh 内部通过 torchrun 启动):
# T2V 文生视频 bash examples/inference.sh examples/example_t2v_480P.json kairos/configs/kairos_4b_config_DMD.py # I2V 图生视频 bash examples/inference.sh examples/example_i2v_480P.json kairos/configs/kairos_4b_config_DMD.py # TI2V 文图生视频 bash examples/inference.sh examples/example_ti2v_480P.json kairos/configs/kairos_4b_config_DMD.py多卡加速可使用 examples/multi_gpu_inference.sh,追加 GPU 数量参数即可:
bash examples/multi_gpu_inference.sh examples/example_ti2v_480P.json kairos/configs/kairos_4b_config_DMD.py 4💡 多卡需在模型配置中开启
use_seq_parallel、use_tp_in_self_attn等并行开关,否则只有一张卡真正参与计算;CFG-parallel 模式仅支持 4/8 卡。
六、参数调优小贴士
- 🎯 想复现实验:固定
seed,再微调prompt对比差异; - 🎬 想要更长视频:调大
num_frames(如 121 帧 ≈ 7.5 秒),显存占用会上升,tiled保持true; - ✨ 画面更贴合文本:适当调高
cfg_scale(如 6~8),过高易出现过饱和; - ⚡ 显存吃紧:保持 480P 分辨率,并在配置中启用
vram_management_enabled = True做显存卸载,或开启 TeaCache 缓存加速; - 📝 提示词太短效果一般:把
use_prompt_rewriter设为true,由 Qwen 视觉模型自动扩写提示词(T2V 时建议同时提供input_image帮助理解)。
掌握以上参数后,你可以自由组合分辨率、帧数与三种模式,快速产出高质量的世界模型视频。
【免费下载链接】kairosOfficial code for world model Kairos项目地址: https://gitcode.com/gh_mirrors/ka/kairos
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考