NVIDIA Cosmos 版本发布节奏与模型资产演进指南(v0.1 → v1.0)
2026/9/15 13:25:34 网站建设 项目流程

NVIDIA Cosmos 版本发布节奏与模型资产演进指南(v0.1 → v1.0)

【免费下载链接】cosmosNVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.项目地址: https://gitcode.com/GitHub_Trending/cosmos7/cosmos

NVIDIA Cosmos 是一个面向 Physical AI 开发者、以"世界基础模型(World Foundation Model, WFM)"为核心的开源平台,涵盖预训练模型、推理脚本与基于 NeMo Framework 的后训练脚本。本文以仓库根目录 RELEASE.md 定义的版本发布节奏为主线,完整梳理 v0.1 与 v1.0 两个版本各自发布的模型资产、能力定位与仓库内对应的推理/后训练入口,并结合 release_notes/v1p0.md、release_notes/v0p1.md 与模型模块源码,帮助开发者快速理解"哪个版本发布了什么、对应哪个模型、如何在本仓库中跑起来",为后续选型与二次开发建立清晰的版本心智地图。

版本发布节奏总览

RELEASE.md 用一张发布节奏表定义了 Cosmos 平台当前的版本演进,本文档是理解整个仓库模型资产组织的"版本索引":

VersionDescriptionDate
v1.0Initial diffusion and autoregressive WFMs release2025-01-06
v0.1Initial tokenizer release2024-11-06

从发布节奏可以看出 Cosmos 平台的两阶段演进路径:

  • v0.1(2024-11-06):首发布局"底层视觉基础组件",即图像/视频神经 Tokenizer 套件,为后续 WFM 提供高效的连续/离散视觉表示;
  • v1.0(2025-01-06):在 Tokenizer 基础上发布完整的扩散(Diffusion)与自回归(Autoregressive)世界基础模型(WFM),覆盖 Text2World、Video2World 两大生成范式。

v1.0 之后,仓库仍在持续迭代,release_notes/v1p0.md 记录了 2025 年 1 月的三次演进:01/06 初始发布、01/09 通过 NeMo 支持通用后训练(General Post-Training)、01/27 稳定性与安全性改进(Stability and safety improvements)。需要特别说明的是,RELEASE.md 表格中 v1.0 一行的链接实际指向 v0.1 的发布说明(release_notes/v0p1.md),属于原表格的链接笔误,v1.0 的正式发布说明位于 release_notes/v1p0.md,下文以仓库实际文件为准展开。

v0.1:图像/视频 Tokenizer 首发

v0.1 是 Cosmos 平台的首次发布,核心交付物是Cosmos Tokenizer 套件——一套图像与视频神经 Tokenizer,将视觉内容编码为连续潜变量(continuous latents)或离散 token(discrete tokens),供大自回归 Transformer 与扩散生成器使用。其实现位于 cosmos1/models/tokenizer/README.md,网络定义在 cosmos1/models/tokenizer/networks,模块实现在 cosmos1/models/tokenizer/modules。

发布的 10 个 Tokenizer 模型

v0.1 共发布 10 个 Tokenizer 模型,按"连续(C)/离散(D)"与"图像(I)/视频(V)"两个维度正交组合:

| Item | Model name | Description | |--|------------|----------| | 1 | Cosmos-0.1-Tokenizer-CI8x8 | Continuous image tokenizer,8x8 空间压缩比 | | 2 | Cosmos-0.1-Tokenizer-CI16x16 | Continuous image tokenizer,16x16 空间压缩比 | | 3 | Cosmos-0.1-Tokenizer-DI8x8 | Discrete image tokenizer,8x8 空间压缩比 | | 4 | Cosmos-0.1-Tokenizer-DI16x16 | Discrete image tokenizer,16x16 空间压缩比 | | 5 | Cosmos-0.1-Tokenizer-CV4x8x8 | Continuous video tokenizer,4x8x8 压缩比 | | 6 | Cosmos-0.1-Tokenizer-CV8x8x8 | Continuous video tokenizer,8x8x8 压缩比 | | 7 | Cosmos-0.1-Tokenizer-CV8x16x16 | Continuous video tokenizer,8x16x16 压缩比 | | 8 | Cosmos-0.1-Tokenizer-DV4x8x8 | Discrete video tokenizer,4x8x8 压缩比 | | 9 | Cosmos-0.1-Tokenizer-DV8x8x8 | Discrete video tokenizer,8x8x8 压缩比 | | 10 | Cosmos-0.1-Tokenizer-DV8x16x16 | Discrete video tokenizer,8x16x16 压缩比 |

从源码结构看,Tokenizer 同时支持空间压缩 8x/16x 与时间压缩 4x/8x,最高可实现 2048x(=8x16x16)的总压缩比。其中图像 Tokenizer 的网络定义见 cosmos1/models/tokenizer/networks/continuous_image.py 与 discrete_image.py,视频 Tokenizer 见 continuous_video.py 与 discrete_video.py。发布说明中 v0.1 表格的"Try it out"链接存在格式错误(嵌套链接),实际可用的仓库内推理入口见下文。

v0.1 模型的仓库内使用入口

v0.1 发布的 Tokenizer 在 cosmos1/models/tokenizer/inference 提供了 CLI 与库两种调用方式:

  • CLI 自编码重建(图像与视频均可,同一命令通过--checkpoint_enc/--checkpoint_dec指定 JIT 权重即可切换连续/离散):
# 图像自编码(CI8x8,8x8 压缩比) model_name="Cosmos-0.1-Tokenizer-CI8x8" python3 -m cosmos1.models.tokenizer.inference.image_cli \ --image_pattern 'cosmos1/models/tokenizer/test_data/image.png' \ --checkpoint_enc checkpoints/${model_name}/encoder.jit \ --checkpoint_dec checkpoints/${model_name}/decoder.jit # 视频自编码(DV4x8x8,4x8x8 压缩比) model_name="Cosmos-0.1-Tokenizer-DV4x8x8" python3 -m cosmos1.models.tokenizer.inference.video_cli \ --video_pattern 'cosmos1/models/tokenizer/test_data/video.mp4' \ --checkpoint_enc checkpoints/${model_name}/encoder.jit \ --checkpoint_dec checkpoints/${model_name}/decoder.jit

未指定--output_dir时,重建结果默认输出到cosmos1/models/tokenizer/test_data/reconstructions/

  • Python 库调用(以 video_lib.py 的CausalVideoTokenizer为例):连续编码输入(1, 3, 9, 512, 512)的张量得到形状(1, 16, 3, 64, 64)的潜变量(16 为潜变量通道数);离散编码得到形状(1, 3, 64, 64)、取值范围[1..64K]的整数索引,以及形状(1, 6, 3, 64, 64)的量化前连续潜变量(6 为 FSQ 层数)。

  • 原生 PyTorch 模式:追加--mode=torch可从网络定义直接实例化模型,例如--tokenizer_type=DI --spatial_compression=8对应 DI8x8,--tokenizer_type=CV --temporal_compression=8 --spatial_compression=8对应 CV8x8x8,权重仍从 JIT 文件中提取。

v0.1 到 v1.0 的 Tokenizer 演进

v0.1 发布的 Tokenizer 套件延续到了 v1.0:在 v1.0 发布时,Cosmos-1.0-Tokenizer-CV8x8x8(连续视频 Tokenizer)与Cosmos-1.0-Tokenizer-DV8x16x16(离散视频 Tokenizer)成为 WFM 推理链路的标准组件——扩散 WFM 依赖 CV8x8x8 将视频映射到连续潜空间,自回归 WFM 依赖 DV8x16x16 将视频离散化为 token 序列。这一"Tokenizer 先行、WFM 随后"的发布策略,体现了 Cosmos 平台对底层视觉表示基础设施的重视。

v1.0:扩散与自回归世界基础模型首发

v1.0 是 Cosmos 平台的核心版本,随 Cosmos paper 一同发布,共带来13 个模型,覆盖扩散 WFM、自回归 WFM、Tokenizer、Prompt Upsampler、Diffusion Decoder 与安全护栏(Guardrail)六大类资产,并同步在仓库中提供推理脚本。

发布的 13 个模型清单

| Item | Model name | Description | |--|------------|----------| | 1 | Cosmos-1.0-Diffusion-7B-Text2World | 文本生成视觉世界 | | 2 | Cosmos-1.0-Diffusion-14B-Text2World | 文本生成视觉世界 | | 3 | Cosmos-1.0-Diffusion-7B-Video2World | 视频+文本生成未来视觉世界 | | 4 | Cosmos-1.0-Diffusion-14B-Video2World | 视频+文本生成未来视觉世界 | | 5 | Cosmos-1.0-Autoregressive-4B | 未来视觉世界生成(Base) | | 6 | Cosmos-1.0-Autoregressive-12B | 未来视觉世界生成(Base) | | 7 | Cosmos-1.0-Autoregressive-5B-Video2World | 视频+文本生成未来视觉世界 | | 8 | Cosmos-1.0-Autoregressive-13B-Video2World | 视频+文本生成未来视觉世界 | | 9 | Cosmos-1.0-Tokenizer-CV8x8x8 | 连续视频 Tokenizer,8x8x8 压缩比 | | 10 | Cosmos-1.0-Tokenizer-DV8x16x16 | 离散视频 Tokenizer,8x16x16 压缩比 | | 11 | Cosmos-1.0-PromptUpsampler-12B-Text2World | Text2World 提示词上采样器 | | 12 | Cosmos-1.0-Diffusion-7B-Decoder-DV8x16x16ToCV8x8x8 | 扩散解码器,用于增强自回归 WFM 输出 | | 13 | Cosmos-1.0-Guardrail | 安全护栏(pre-Guard + post-Guard),内嵌于推理脚本 |

扩散 WFM:Text2World 与 Video2World

扩散 WFM 的完整使用文档见 cosmos1/models/diffusion/README.md,推理入口为 text2world.py 与 video2world.py,网络实现在 cosmos1/models/diffusion/networks。模型均基于 DiT(Diffusion Transformer)架构,7B 与 14B 两个规格共享同一套推理管线,仅权重规模不同。

模型下载:仓库提供了参数化下载脚本 cosmos1/scripts/download_diffusion.py,通过--model_sizes(7B/14B)与--model_types(Text2World/Video2World)组合选择模型;脚本默认额外拉取Cosmos-1.0-GuardrailCosmos-1.0-Tokenizer-CV8x8x8,若含 Text2World 还会拉取Cosmos-1.0-Prompt-Upsampler-12B-Text2World,若含 Video2World 则会调用 convert_pixtral_ckpt.py 转换 Pixtral-12B 作为视频提示词上采样器。例如:

PYTHONPATH=$(pwd) python cosmos1/scripts/download_diffusion.py --model_sizes 7B 14B --model_types Text2World Video2World

下载后checkpoints/目录下会按模型名组织model.ptconfig.json,并附带Cosmos-1.0-Tokenizer-CV8x8x8(encoder.jit/decoder.jit/mean_std.pt)、Cosmos-1.0-Prompt-Upsampler-12B-Text2WorldPixtral-12BCosmos-1.0-Guardrail(含 aegis、blocklist、face_blur_filter、video_content_safety_filter 四类护栏)。

单条生成(Text2World 7B):

PROMPT="A sleek, humanoid robot stands in a vast warehouse filled with neatly stacked cardboard boxes on industrial shelves. ..." PYTHONPATH=$(pwd) python cosmos1/models/diffusion/inference/text2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Text2World \ --prompt "$PROMPT" \ --offload_prompt_upsampler \ --video_save_name Cosmos-1.0-Diffusion-7B-Text2World

批处理生成:通过--batch_input_path指向 JSONL 文件。Text2World 每行需含"prompt"字段;Video2World 每行需含"visual_input"字段;若关闭提示词上采样器(--disable_prompt_upsampler),则每行需同时包含"prompt""visual_input"。仓库内置示例见 text2world.jsonl、video2world_ps.jsonl 与 video2world_wo_ps.jsonl。

核心参数(默认值取自 text2world.py 的 argparse 定义):

参数说明默认值
--checkpoint_dir模型权重根目录"checkpoints"
--tokenizer_dirTokenizer 权重目录"Cosmos-1.0-Tokenizer-CV8x8x8"
--num_steps扩散采样步数35
--guidanceCFG 引导系数7.0
--num_video_frames生成帧数121
--height/--width输出分辨率704 / 1280
--fps帧率24
--seed随机种子1
--negative_prompt负向提示词"The video captures a series of frames showing ugly scenes..."
--offload_*依次卸载 prompt upsampler / guardrail / T5 编码器 / tokenizer / DiTFalse

扩散 WFM 支持 1:1(960x960)、4:3(960x704)、3:4(704x960)、16:9(1280x704)、9:16(704x1280)等多分辨率与 12~40 fps 的帧率范围,当前版本固定生成 121 帧;Video2World 额外支持--input_image_or_video_path--num_input_frames(1 或 9)。显存受限(如 RTX 3090/4090 24GB)时推荐全部开启 offload 策略;cosmos1/models/diffusion/README.md 中给出了逐级卸载策略对应的峰值显存参考(7B 全量卸载约 24.4 GB、14B 约 39.0 GB)。

自回归 WFM:Base 与 Video2World

自回归 WFM 的完整使用文档见 cosmos1/models/autoregressive/README.md,推理入口为 base.py 与 video2world.py。Base(4B/12B)支持以图像或视频作为输入生成后续帧;Video2World(5B/13B)额外接收文本提示。两类模型均支持将输入扩展至 33 帧——从单张图像生成 32 帧,或从 9 帧视频生成 24 帧。

模型下载:cosmos1/scripts/download_autoregressive.py 通过--model_sizes(4B/5B/12B/13B)选择模型,并始终附带Cosmos-1.0-GuardrailCosmos-1.0-Diffusion-7B-Decoder-DV8x16x16ToCV8x8x8Cosmos-1.0-Tokenizer-CV8x8x8Cosmos-1.0-Tokenizer-DV8x16x16

PYTHONPATH=$(pwd) python cosmos1/scripts/download_autoregressive.py --model_sizes 4B 5B 12B 13B

单条生成(Base 12B,视频输入):

CUDA_VISIBLE_DEVICES=0 PYTHONPATH=$(pwd) python cosmos1/models/autoregressive/inference/base.py \ --input_type=video \ --input_image_or_video_path=cosmos1/models/autoregressive/assets/v1p0/input.mp4 \ --video_save_name=Cosmos-1.0-Autoregressive-12B \ --ar_model_dir=Cosmos-1.0-Autoregressive-12B \ --top_p=0.9 \ --temperature=1.0

关键参数--input_type在 Base 中取video/image,在 Video2World 中取text_and_video/text_and_image--top_p--temperature已针对各模型调优(4B 用 top_p=0.8、12B 用 0.9、5B 用 0.7、13B 用 0.8,temperature 均为 1.0),建议直接使用命令示例中的取值;--disable_diffusion_decoder可回退到离散 Tokenizer 直接解码,默认使用扩散解码器(Cosmos-1.0-Diffusion-7B-Decoder-DV8x16x16ToCV8x8x8)增强输出画质。注意自回归模型固定工作于 1024x640 分辨率,输入不匹配时会被自动缩放与裁剪。

发布说明同时给出了自回归模型在 100 条 Physical AI 测试视频上的失败率参考(定义为出现严重畸变,如突然出现大物体或退化为单色画面):Video2World 13B 在视频输入下失败率为 0%,Base 4B 在图像输入下为 15%;静态帧与轻微物体畸变不计入失败。该数据来自官方发布说明,实际表现可能随系统与输入变化。

Prompt Upsampler 与 Guardrail

v1.0 的 13 个模型中包含两个重要的"辅助模型":

  • Prompt Upsampler(Cosmos-1.0-Prompt-Upsampler-12B-Text2World / Pixtral-12B):Text2World 场景下基于微调后的 Mistral 模型将简短提示词扩写为详细描述;Video2World 场景下基于 Pixtral 模型从输入图像/视频生成详细描述。默认启用,可通过--disable_prompt_upsampler关闭;Text2World 下提示词超过--word_limit_to_skip_upsampler(默认 250 词)时会自动跳过上采样以提升鲁棒性。实现见 prompt_upsampler。
  • Guardrail(Cosmos-1.0-Guardrail):内嵌于所有推理脚本且不可关闭,包含 pre-Guard 与 post-Guard,实现见 cosmos1/models/guardrail(aegis 文本护栏、blocklist 词表、face_blur_filter 人脸模糊、video_content_safety_filter 视频内容安全)。当前版本不允许生成人脸,人脸会被护栏自动模糊。

v1.0 之后的演进

v1.0 发布说明 记录了三次里程碑提交:01/06 随论文发布 13 个模型与推理脚本;01/09 通过 NeMo Framework 支持通用后训练(对应 POST_TRAINING.md);01/27 完成稳定性与安全性改进。这意味着 v1.0 交付的不仅是推理能力,还打通了"预训练 → 后训练 → 再推理"的完整闭环。

版本演进对应的实操能力:安装、推理与后训练

环境安装

无论使用哪个版本,环境搭建均遵循 INSTALL.md:需安装 NVIDIA Container Toolkit,然后基于仓库根目录 Dockerfile 构建镜像并运行容器:

git clone https://gitcode.com/GitHub_Trending/cosmos7/cosmos cd cosmos docker build -t cosmos . docker run -d --name cosmos_container --gpus all --ipc=host -it -v $(pwd):/workspace cosmos docker attach cosmos_container

v1.0 后训练能力(NeMo Framework)

v1.0 发布说明 表明通用后训练自 01/09 起获得支持。POST_TRAINING.md 规划了六类后训练任务:通用后训练(General Post-Training)、指令控制(Instruction Control)、动作控制(Action Control)、相机控制(Camera Control)、多视角生成(Multi-View Generation)及其带车辆轨迹控制的变体。当前版本仅开放通用后训练,支持矩阵如下:

Post-training TaskDiffusion WFMAutoregressive WFM
通用后训练SupportedSupported
指令控制Coming soonComing soon
动作控制Coming soonComing soon
相机控制Coming soonComing soon
多视角生成Coming soonComing soon
多视角生成(带轨迹控制)Coming soonComing soon
  • 扩散 WFM 后训练(diffusion/nemo/post_training/README.md):支持 7B/14B 的 Text2World 与 Video2World,推荐 H100/A100-80GB 8 卡。流程为"准备 MP4 视频数据集 → prepare_dataset.py 预处理(按 121 帧切块、编码 T5 文本嵌入与 3D 视频 token)→ torchrun 启动 general.py(Text2World)或 video2world.py(Video2World)",训练采用 FSDP + 张量并行,14B 额外启用激活检查点。关键配置项包括--factory(如cosmos_diffusion_7b_text2world_finetune)、data.pathoptim.config.lr(默认 1e-6)、trainer.max_steps(默认 1000)。
  • 自回归 WFM 后训练(autoregressive/nemo/post_training/README.md):4B/5B 需 2~4 卡、12B/13B 需 8 卡。Base 模型(4B/12B)使用 prepare_dataset.py 生成 Megatron CoreIndexedDataset(.bin/.idx),Video2World 模型(5B/13B)使用 video2world_prepare_dataset.py 预计算文本与视频嵌入;训练入口分别为 general.py 与 video2world_finetuning.py,关键参数包括--data_path--model_path--tensor_model_parallel_size--max_steps--lr(常用起点 5e-5)等。

版本选型建议

结合两份发布说明与仓库实现,可按如下思路选型:

  • 需要通用视觉编码/重建能力:选用 v0.1 的 Tokenizer 套件(CI/DI/CV/DV 四系 10 个模型),CLI 入口见 tokenizer/inference;
  • 需要文本生成视频:选用 v1.0 扩散 WFM(7B/14B Text2World),入口 text2world.py;
  • 需要以图像/视频为条件生成未来帧:扩散路线用 7B/14B Video2World(video2world.py),自回归路线用 Base 4B/12B 或 Video2World 5B/13B(base.py、video2world.py);
  • 需要针对特定机器人/工厂等场景定制生成分布:以 v1.0 模型为基础,按 POST_TRAINING.md 的通用后训练流程基于 NeMo Framework 微调。

许可证说明

仓库的源码部分遵循 Apache 2.0 许可,预训练模型遵循 NVIDIA Open Model License(允许商业使用,NVIDIA 不主张对模型输出内容的拥有权);项目运行时会下载并安装第三方开源软件,使用前需审阅相关开源项目的许可条款。此外,仓库会要求通过 Hugging Face 登录并申请相应模型访问权限,例如 Video2World 的提示词上采样依赖对 Pixtral-12B 的访问授权,详见 cosmos1/models/diffusion/README.md 的下载步骤。

【免费下载链接】cosmosNVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.项目地址: https://gitcode.com/GitHub_Trending/cosmos7/cosmos

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询