HY-World 2.0 全景图生成实战:HY-Pano 2.0双后端从单图到360°全景完整教程
【免费下载链接】HY-World-2.0HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds项目地址: https://gitcode.com/gh_mirrors/hy/HY-World-2.0
HY-World 2.0是腾讯开源的多模态 3D 世界模型,其中的HY-Pano 2.0全景生成模块只需一张普通照片或一段文字描述,就能合成360° 等距柱状全景图——这正是把"一张图"升级为"可漫游 3D 世界"的第一步。本教程将带你快速上手 HY-Pano 2.0 的HunyuanImage-3与Qwen-Image-Edit双后端:环境安装、命令行参数、加速技巧一次讲清,零基础也能跑通第一张全景图 🎯
1. 全景图生成在 HY-World 2.0 中处于什么位置?
HY-World 2.0 的"世界生成"流水线共四个阶段,HY-Pano 2.0 全景生成(Stage 1)负责把文本/单视图图像扩展为 360° 全景,后续阶段再基于全景做轨迹规划、世界扩展与 3DGS 重建:
💡 一张全景图 = 世界的"种子"。生成质量直接决定后续 3D 世界的上限,所以值得先把这一步调好。
2. 环境准备:3 步搭建 HY-Pano 2.0 运行环境
全景生成代码位于 hyworld2/panogen/ 目录,依赖较轻,推荐 CUDA 12.8 + Python 3.10。
第 1 步:获取代码
git clone https://gitcode.com/gh_mirrors/hy/HY-World-2.0 cd HY-World-2.0第 2 步:创建独立 conda 环境
conda create -n hyworld2-pano python=3.10 conda activate hyworld2-pano第 3 步:安装 PyTorch 与依赖
pip install torch==2.7.1 torchvision==0.22.1 torchaudio==2.7.1 --index-url https://download.pytorch.org/whl/cu118 pip install -r hyworld2/panogen/requirements.txt核心依赖清单(diffusers、transformers、tokenizers 等)见 requirements.txt。若想进一步提速(最高 3 倍推理加速),可按其中注释安装flashinfer-python。
模型权重会在首次运行时自动下载(约 80B 参数的 HY-Pano-2,或仅 425M 的 Qwen LoRA),无需手动搬运。
3. 双后端怎么选?一张表看懂 HY-Pano 2.0
HY-Pano 2.0 提供两种后端,各有分工:
| 对比项 | HunyuanImage-3 后端 | Qwen-Image-Edit 后端 |
|---|---|---|
| 入口文件 | pipeline.py | pipeline_with_qwen_image.py |
| 模型规模 | ~80B(完整推理流程) | 基座 + ~425M LoRA(轻量) |
| 特色能力 | 思维链重描述(think_recaption),推理质量上限更高 | 基于 diffusers,显存占用低、部署简单 |
| 适用场景 | 追求最高全景质量 | 消费级显卡 / 快速出图 |
选型建议:显存充裕(80GB+)选后端一,出图质量最佳;显存有限(24GB 左右)或想快速验证效果,选后端二。
4. 后端一实战:HunyuanImage-3 生成 360° 全景图
4.1 最简命令,一条跑通
cd hyworld2/panogen python pipeline.py --image input.png默认输出<输入文件名>_panorama.png,即一张 1952×960 的等距柱状全景图。
4.2 指定 prompt、种子与输出路径
python pipeline.py --image input.png \ --prompt "Expand this image to a 360-degree equirectangular panorama. Maintain realistic style." \ --save output_panorama.png--prompt:引导全景扩展的风格与内容,默认值即"扩展为 360° 等距柱状全景";--seed 42 --reproduce:固定随机种子并锁定全部 RNG,保证结果可复现。
4.3 调节推理步数与任务类型
python pipeline.py --image input.png \ --diff-infer-steps 50 --bot-task think_recaption --use-system-prompt en_unified--diff-infer-steps:扩散步数,默认 50,增大可提升细节但更慢;--bot-task:任务模式,think_recaption会先"思考"再重写提示词,质量最高;--use-system-prompt:系统提示词模板(en_unified/en_recaption/custom等)。
4.4 开启 Taylor Cache 加速采样
批量生成时推荐开启泰勒缓存,在质量损失很小的情况下显著提速:
python pipeline.py --image input.png \ --use-taylor-cache --taylor-cache-interval 5 --taylor-cache-order 2生成的全景图效果参考(2:1 等距柱状投影):
该示例来自 examples/worldgen/case000/panorama.png,更高规格(3840×1920)可参考 examples/worldgen/case001/panorama.png。
5. 后端二实战:Qwen-Image-Edit 轻量快速出图
5.1 基础用法
cd hyworld2/panogen python pipeline_with_qwen_image.py --image input.png基座模型与 HY-Pano LoRA 均会自动下载,加载后即可出图。
5.2 指定 prompt、种子与输出路径
python pipeline_with_qwen_image.py --image input.png \ --prompt "A sunny outdoor scene." --seed 42 --save output_panorama.png5.3 关键参数说明
--num-inference-steps:去噪步数,默认 40;--true-cfg-scale:真 CFG 引导强度,默认 7.5,调大后画面更贴合 prompt;--height / --width:输出尺寸,默认 960×1952(标准 2:1 全景比例);--blend-width:左右边缘融合宽度,默认 32 像素,保证全景左右无缝拼接;--lora-path / --lora-subfolder:指向本地 LoRA 权重时手动指定,默认自动下载官方 LoRA。
6. 常用参数速查表
| 参数 | 后端一 | 后端二 | 说明 |
|---|---|---|---|
--image | ✅ | ✅ | 输入图像路径(必填) |
--prompt | ✅ | ✅ | 全景扩展引导词 |
--seed+--reproduce | ✅ | ✅ | 固定种子复现结果 |
--save | ✅ | ✅ | 指定输出路径 |
--height / --width | ✅ | ✅ | 输出分辨率,默认 960×1952 |
--diff-infer-steps | ✅ | --num-inference-steps | 扩散/去噪步数 |
--use-taylor-cache | ✅ | — | 泰勒缓存加速 |
--negative-prompt | — | ✅ | 负向提示词 |
--attn-impl | ✅ | — | sdpa或flash_attention_2 |
完整参数与 Python API 写法(如HunyuanPanoPipeline.from_pretrained('tencent/HY-World-2.0'))请查阅官方中文文档:hyworld2/panogen/README_zh_CN.md。
7. 常见问题排查
- 首次运行很慢:属于正常现象,正在自动下载模型权重,之后会走本地缓存。
- 全景图左右边缘有接缝:调大
--blend-width(如 64)可加强边缘融合。 - 显存不足 OOM:优先换用后端二(Qwen-Image-Edit);后端一可安装 FlashInfer 后通过
--moe-impl flashinfer降低开销。 - 结果不可复现:务必同时传
--seed和--reproduce,仅传 seed 不锁定全部 RNG。 - 输出想更高分辨率:修改
--width 3840 --height 1920,显存越大越好。
8. 全景图生成之后:接入世界生成流水线
跑通 HY-Pano 2.0 只是开始——生成的全景图可以直接作为 hyworld2/worldgen/ 世界生成流水线的输入:先由 WorldNav 规划相机轨迹(traj_generate.py),再经 WorldStereo 2.0 世界扩展与 3DGS 训练,最终得到可交互的 3D 世界。完整流程文档见 hyworld2/worldgen/README.md。
🎉 到这里,你就掌握了 HY-World 2.0 全景图生成的全部要点:选对后端、跑通命令、调好参数。从一张照片到 360° 全景世界,只差一条命令的距离!
【免费下载链接】HY-World-2.0HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds项目地址: https://gitcode.com/gh_mirrors/hy/HY-World-2.0
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考