☰
HY-World 2.0 全景图生成实战:HY-Pano 2.0双后端从单图到360°全景完整教程
2026/10/2 4:57:13 网站建设 项目流程

HY-World 2.0 全景图生成实战:HY-Pano 2.0双后端从单图到360°全景完整教程

【免费下载链接】HY-World-2.0HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds项目地址: https://gitcode.com/gh_mirrors/hy/HY-World-2.0

HY-World 2.0是腾讯开源的多模态 3D 世界模型,其中的HY-Pano 2.0全景生成模块只需一张普通照片或一段文字描述,就能合成360° 等距柱状全景图——这正是把"一张图"升级为"可漫游 3D 世界"的第一步。本教程将带你快速上手 HY-Pano 2.0 的HunyuanImage-3与Qwen-Image-Edit双后端:环境安装、命令行参数、加速技巧一次讲清,零基础也能跑通第一张全景图 🎯

1. 全景图生成在 HY-World 2.0 中处于什么位置?

HY-World 2.0 的"世界生成"流水线共四个阶段,HY-Pano 2.0 全景生成(Stage 1)负责把文本/单视图图像扩展为 360° 全景,后续阶段再基于全景做轨迹规划、世界扩展与 3DGS 重建:

💡 一张全景图 = 世界的"种子"。生成质量直接决定后续 3D 世界的上限,所以值得先把这一步调好。

2. 环境准备:3 步搭建 HY-Pano 2.0 运行环境

全景生成代码位于 hyworld2/panogen/ 目录,依赖较轻,推荐 CUDA 12.8 + Python 3.10。

第 1 步:获取代码

git clone https://gitcode.com/gh_mirrors/hy/HY-World-2.0 cd HY-World-2.0

第 2 步:创建独立 conda 环境

conda create -n hyworld2-pano python=3.10 conda activate hyworld2-pano

第 3 步:安装 PyTorch 与依赖

pip install torch==2.7.1 torchvision==0.22.1 torchaudio==2.7.1 --index-url https://download.pytorch.org/whl/cu118 pip install -r hyworld2/panogen/requirements.txt

核心依赖清单(diffusers、transformers、tokenizers 等)见 requirements.txt。若想进一步提速(最高 3 倍推理加速),可按其中注释安装flashinfer-python。

模型权重会在首次运行时自动下载(约 80B 参数的 HY-Pano-2,或仅 425M 的 Qwen LoRA),无需手动搬运。

3. 双后端怎么选?一张表看懂 HY-Pano 2.0

HY-Pano 2.0 提供两种后端,各有分工:

对比项HunyuanImage-3 后端Qwen-Image-Edit 后端
入口文件pipeline.pypipeline_with_qwen_image.py
模型规模~80B(完整推理流程)基座 + ~425M LoRA(轻量)
特色能力思维链重描述(think_recaption),推理质量上限更高基于 diffusers,显存占用低、部署简单
适用场景追求最高全景质量消费级显卡 / 快速出图

选型建议:显存充裕(80GB+)选后端一,出图质量最佳;显存有限(24GB 左右)或想快速验证效果,选后端二。

4. 后端一实战:HunyuanImage-3 生成 360° 全景图

4.1 最简命令,一条跑通

cd hyworld2/panogen python pipeline.py --image input.png

默认输出<输入文件名>_panorama.png,即一张 1952×960 的等距柱状全景图。

4.2 指定 prompt、种子与输出路径

python pipeline.py --image input.png \ --prompt "Expand this image to a 360-degree equirectangular panorama. Maintain realistic style." \ --save output_panorama.png
  • --prompt:引导全景扩展的风格与内容,默认值即"扩展为 360° 等距柱状全景";
  • --seed 42 --reproduce:固定随机种子并锁定全部 RNG,保证结果可复现。

4.3 调节推理步数与任务类型

python pipeline.py --image input.png \ --diff-infer-steps 50 --bot-task think_recaption --use-system-prompt en_unified
  • --diff-infer-steps:扩散步数,默认 50,增大可提升细节但更慢;
  • --bot-task:任务模式,think_recaption会先"思考"再重写提示词,质量最高;
  • --use-system-prompt:系统提示词模板(en_unified/en_recaption/custom等)。

4.4 开启 Taylor Cache 加速采样

批量生成时推荐开启泰勒缓存,在质量损失很小的情况下显著提速:

python pipeline.py --image input.png \ --use-taylor-cache --taylor-cache-interval 5 --taylor-cache-order 2

生成的全景图效果参考(2:1 等距柱状投影):

该示例来自 examples/worldgen/case000/panorama.png,更高规格(3840×1920)可参考 examples/worldgen/case001/panorama.png。

5. 后端二实战:Qwen-Image-Edit 轻量快速出图

5.1 基础用法

cd hyworld2/panogen python pipeline_with_qwen_image.py --image input.png

基座模型与 HY-Pano LoRA 均会自动下载,加载后即可出图。

5.2 指定 prompt、种子与输出路径

python pipeline_with_qwen_image.py --image input.png \ --prompt "A sunny outdoor scene." --seed 42 --save output_panorama.png

5.3 关键参数说明

  • --num-inference-steps:去噪步数,默认 40;
  • --true-cfg-scale:真 CFG 引导强度,默认 7.5,调大后画面更贴合 prompt;
  • --height / --width:输出尺寸,默认 960×1952(标准 2:1 全景比例);
  • --blend-width:左右边缘融合宽度,默认 32 像素,保证全景左右无缝拼接;
  • --lora-path / --lora-subfolder:指向本地 LoRA 权重时手动指定,默认自动下载官方 LoRA。

6. 常用参数速查表

参数后端一后端二说明
--image✅✅输入图像路径(必填)
--prompt✅✅全景扩展引导词
--seed+--reproduce✅✅固定种子复现结果
--save✅✅指定输出路径
--height / --width✅✅输出分辨率,默认 960×1952
--diff-infer-steps✅--num-inference-steps扩散/去噪步数
--use-taylor-cache✅—泰勒缓存加速
--negative-prompt—✅负向提示词
--attn-impl✅—sdpa或flash_attention_2

完整参数与 Python API 写法(如HunyuanPanoPipeline.from_pretrained('tencent/HY-World-2.0'))请查阅官方中文文档:hyworld2/panogen/README_zh_CN.md。

7. 常见问题排查

  • 首次运行很慢:属于正常现象,正在自动下载模型权重,之后会走本地缓存。
  • 全景图左右边缘有接缝:调大--blend-width(如 64)可加强边缘融合。
  • 显存不足 OOM:优先换用后端二(Qwen-Image-Edit);后端一可安装 FlashInfer 后通过--moe-impl flashinfer降低开销。
  • 结果不可复现:务必同时传--seed和--reproduce,仅传 seed 不锁定全部 RNG。
  • 输出想更高分辨率:修改--width 3840 --height 1920,显存越大越好。

8. 全景图生成之后:接入世界生成流水线

跑通 HY-Pano 2.0 只是开始——生成的全景图可以直接作为 hyworld2/worldgen/ 世界生成流水线的输入:先由 WorldNav 规划相机轨迹(traj_generate.py),再经 WorldStereo 2.0 世界扩展与 3DGS 训练,最终得到可交互的 3D 世界。完整流程文档见 hyworld2/worldgen/README.md。

🎉 到这里,你就掌握了 HY-World 2.0 全景图生成的全部要点:选对后端、跑通命令、调好参数。从一张照片到 360° 全景世界,只差一条命令的距离!

【免费下载链接】HY-World-2.0HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds项目地址: https://gitcode.com/gh_mirrors/hy/HY-World-2.0

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询