FusionCompute 8.0.0国产虚拟化平台部署核心原理与实战指南
2026/9/19 5:28:34 网站建设 项目流程

1. 这不是“装个虚拟化平台”那么简单:FusionCompute 8.0.0到底在解决什么问题?

FusionCompute 8.0.0不是一套拿来就用的桌面软件,它是一套面向中大型企业数据中心的、全栈自主可控的服务器虚拟化平台。你看到的“CNA”和“VRM”,表面是两个安装包,背后其实是整套虚拟化基础设施的“肌肉”与“大脑”——CNA(Computing Node Agent)是直接跑在物理服务器上的计算节点代理,负责接管CPU、内存、网卡、存储控制器,把一台裸金属服务器变成可被统一调度的计算资源池;VRM(Virtual Resource Manager)则是集中式管理平台,它不处理具体业务负载,但要管住所有CNA节点的生命周期、网络拓扑、存储映射、高可用策略、备份快照、权限审计,甚至要对接上层云管平台或运维系统。很多人第一次部署时以为只是“装个管理界面”,结果在CNA注册失败、存储无法识别、心跳网络不通这些环节卡住三天,根本原因是没理解8.0.0版本对底层硬件兼容性、网络平面隔离、证书体系和安全加固的硬性要求。这个版本最大的变化在于全面转向基于OpenStack Nova+Libvirt+QEMU/KVM的深度定制架构,同时强化了国产化适配能力——比如对鲲鹏920、飞腾D2000等ARM架构处理器的支持不再是“实验性”,而是进入生产就绪状态;对麒麟V10、统信UOS等操作系统的驱动集成度更高,不再需要手动编译内核模块。所以,这不是一次简单的版本升级,而是一次从x86生态向多架构融合演进的实战分水岭。如果你正准备为一个30台物理服务器规模的数据中心做虚拟化底座选型,或者要承接政务云二期扩容项目,又或者正在做信创替代方案的技术验证,那么FusionCompute 8.0.0的部署过程,就是你真正摸清国产虚拟化平台“筋骨”的第一课。它不教你怎么点鼠标,而是逼你搞懂:为什么一块Intel X710网卡在CNA上必须绑定DPDK驱动才能启用SR-IOV?为什么VRM的HA集群必须用三节点奇数部署?为什么存储多路径配置里,华为OceanStor和浪潮AS13000的ALUA策略写法完全不同?这些问题的答案,不在安装手册第一页,而在你第一次敲下virsh list --all命令看到空列表时的排查日志里。

2. 整体架构设计与部署思路拆解:为什么必须“先VRM后CNA”,且不能跳过离线校验?

2.1 部署不是线性流水线,而是三层依赖闭环

很多新手会把部署理解成“先装VRM,再装CNA,最后加主机”,这在8.0.0里是危险的。真实逻辑是一个三层闭环依赖结构:

  • 最底层:硬件与固件层
    必须完成BIOS/UEFI设置(开启VT-x/AMD-V、关闭Secure Boot、设置Serial Port重定向)、RAID卡缓存策略(Write Back + BBU/Flash Back-up)、网卡固件升级(尤其 Mellanox CX4/CX5 系列需升至最新OFED兼容版本)。这一层出问题,后续所有步骤都是空中楼阁。我见过最典型的案例:某客户用戴尔R740部署,RAID卡缓存设为Write Through,导致CNA安装过程中磁盘I/O超时直接中断,重装三次才发现是固件策略问题。

  • 中间层:网络与证书层
    VRM自身需要三个独立网络平面:管理平面(用于Web登录和API调用)、存储平面(用于CNA与共享存储通信)、心跳平面(用于VRM HA节点间状态同步)。这三个平面必须物理隔离或通过VLAN严格划分,不能复用。更重要的是,8.0.0默认启用双向TLS认证——VRM生成的CA证书不仅要签发给自身Web服务,还要签发给每一个CNA节点的agent服务。这意味着,你不能在VRM未初始化完成前就去装CNA,因为CNA安装脚本会尝试连接VRM获取证书,而此时VRM还没生成根CA。

  • 最上层:资源编排层
    CNA注册到VRM后,并非自动加入资源池。你需要手动创建集群、配置DVS(分布式虚拟交换机)、绑定存储资源(iSCSI Target IQN、FC WWPN、NAS NFS路径)、设置主机主备关系。这个阶段才是真正的“资源建模”,它决定了后续虚拟机的网络连通性、存储性能SLA、故障迁移路径。跳过这步直接建VM,等于在没画图纸的情况下盖楼。

所以,“先VRM后CNA”不是顺序建议,而是架构强制约束。VRM必须先完成初始化、生成CA、配置好网络平面、启动HA服务,才能对外提供CNA注册入口。而所谓“离线校验”,指的是在正式安装前,用华为提供的fc_check_tool工具包对目标服务器做全量预检:检查CPU是否支持KVM、内存是否满足最小256GB(VRM单节点)、网卡是否在HCL(Hardware Compatibility List)清单内、磁盘是否支持TRIM(SSD场景)、NTP源是否可达。这个工具会输出一份HTML报告,明确标出“Blocker”(阻断项)、“Warning”(警告项)、“Info”(提示项)。我实测过,一次完整的离线校验平均耗时18分钟,但它能帮你避开80%以上的安装失败。曾有个项目,客户跳过这步,直接装VRM,结果在第三步“初始化数据库”时卡死,日志显示PostgreSQL无法绑定IPv6地址——而fc_check_tool早在“网络配置”项里就标红提示:“检测到IPv6未禁用,可能导致服务绑定异常”。

2.2 为什么VRM必须用三节点部署?双节点不是更省成本吗?

官方文档写“VRM支持单节点、双节点、三节点部署”,但生产环境只推荐三节点。原因不在“高可用”这么简单,而在于8.0.0的Quorum机制设计:

  • VRM HA集群采用Paxos共识算法,要求多数派(quorum)节点在线才能提供服务。三节点集群,允许1个节点故障;双节点集群,只要1个节点宕机,剩余1个节点无法形成多数派,整个VRM服务不可用——这比单节点更危险,因为单节点挂了你知道它挂了,而双节点挂了一个,你可能还在徒劳地刷新Web页面。

  • 更关键的是,VRM的“仲裁服务”(Arbiter)在8.0.0里已取消,全部逻辑内置在VRM节点中。这意味着双节点没有第三方仲裁者,只能靠心跳探测,而心跳网络一旦出现瞬时抖动(比如交换机STP收敛),两个节点会互相认为对方失联,触发“脑裂”(Split-Brain),各自宣称自己是主节点,导致CNA注册混乱、存储锁冲突、虚拟机状态错乱。

  • 实测数据:我们在实验室模拟双节点心跳丢包率0.5%的场景,持续10分钟,触发脑裂的概率高达67%;而三节点在同样条件下,仅1个节点短暂失联,其余两节点仍能维持quorum,服务无感知。

所以,三节点不是“锦上添花”,而是8.0.0架构下的安全基线。你可以用三台低配服务器(如2U机架式,32GB内存,2×1TB SATA SSD),但绝不能为了省一台机器而用双节点。这是血泪教训换来的经验:某金融客户初期用双节点VRM,上线三个月后因核心交换机固件BUG导致心跳丢包,VRM服务中断47分钟,期间所有虚拟机无法热迁移、无法创建新实例、备份任务全部失败,最终触发SLA赔付。

2.3 CNA部署为何必须用“裸金属ISO”而非“操作系统+Agent”模式?

8.0.0彻底废弃了旧版的“在CentOS上安装CNA Agent”的方式,强制使用华为定制的CNA ISO镜像进行裸机安装。这不是为了“控制生态”,而是由底层技术演进决定的:

  • 新版CNA基于openEuler 22.03 LTS SP2深度定制,内核版本为5.10.0-60.18.0.50.oe2203sp2.x86_64,集成了华为自研的hwsdk驱动框架。这个框架能直接接管网卡DPDK、GPU vGPU、NVMe-oF、RoCEv2等硬件加速能力,而通用Linux发行版的内核无法原生支持这些专有驱动。

  • CNA ISO包含一个精简的、只含必要组件的运行时环境(约1.2GB),启动后自动执行cna_init脚本,完成:① 网络自动发现与绑定(根据VRM下发的配置);② 存储多路径初始化(自动识别HBA卡、iSCSI initiator、NVMe over Fabrics);③ KVM模块加载与libvirt服务启动;④ 与VRM建立mTLS连接并注册。

  • 如果强行在现有OS上安装Agent,你会遇到:modprobe: ERROR: could not insert 'kvm_intel': Operation not permitted(内核模块签名不匹配)、virsh list返回空但systemctl status libvirtd显示active,实际是因为hwsdk驱动未加载,KVM无法接管CPU——这些错误在ISO模式下根本不会出现,因为整个系统就是为虚拟化而生。

因此,“裸金属ISO”不是倒退,而是回归本质:虚拟化平台的第一层,必须是“为虚拟化而生”的操作系统,而不是“能跑虚拟化软件”的通用系统。这就像不能用家用轿车的底盘去改装F1赛车——结构决定上限。

3. 核心细节解析与实操要点:从VRM初始化到CNA注册的12个关键动作

3.1 VRM三节点部署:不是“装三次”,而是“一次集群化部署”

VRM安装不是分别在三台机器上运行三次install.sh。正确流程是:

  1. 在第一台服务器(规划为主节点)上挂载ISO,启动进入安装界面;

  2. 选择“VRM Management Node”,输入初始密码、时区、NTP服务器地址;

  3. 关键动作一:网络配置必须一次性填全三个平面

    • 管理平面:填写该节点的管理IP、子网掩码、网关(如192.168.10.10/24, 192.168.10.1);
    • 存储平面:填写该节点的存储IP(如192.168.20.10/24),注意:此IP必须与CNA的存储平面在同一网段,且不能与管理平面IP冲突;
    • 心跳平面:填写该节点的心跳IP(如192.168.30.10/24),此网段必须独占,严禁与其他业务混用;

    提示:三个平面的网关只需在管理平面填写,存储和心跳平面不设网关。若填错,VRM初始化会卡在“网络服务启动”阶段,日志位于/var/log/fusionsphere/vrm/vrm-install.log,搜索Failed to start network service即可定位。

  4. 关键动作二:HA配置必须同步指定三节点信息
    在“High Availability Configuration”页,勾选“Enable HA”,然后点击“Add Node”,依次输入另外两台服务器的管理IP、root密码、SSH端口(默认22)。系统会自动通过SSH连接验证,并生成集群配置文件/etc/vrm/ha_cluster.conf。这里最容易犯的错是:只填了IP,没填root密码,导致添加节点失败,但界面只提示“Connection failed”,不告诉你具体原因。

  5. 关键动作三:证书CN(Common Name)必须统一且可解析
    在“Certificate Configuration”页,输入VRM集群的统一域名,如vrm-cluster.example.com。这个域名必须能在所有CNA节点上通过nslookupdig解析到三台VRM节点的管理IP(即配置DNS A记录或hosts文件)。如果填了vrm1.local,而CNA节点hosts里没映射,CNA注册时会报错SSL certificate verify failed: unable to get local issuer certificate

完成上述三步后,点击“Install”,系统将自动在三台机器上分发配置、同步证书、启动服务。整个过程约25分钟,期间不要重启任何节点。安装完成后,用浏览器访问https://vrm-cluster.example.com:8080(注意是8080端口,不是443),输入初始账号admin和你设置的密码,即可进入VRM Web界面。

3.2 CNA安装:ISO启动后的“静默模式”与手动干预时机

CNA ISO启动后,会进入一个蓝底白字的文本界面,显示进度条。它默认采用“静默安装模式”,无需人工交互,但有几个关键节点你必须盯住:

  • 阶段1:硬件探测(约3分钟)
    屏幕左上角显示Detecting hardware...,此时会扫描所有PCI设备。如果看到No network card foundStorage controller not supported,说明该服务器不在HCL清单内,立即按Ctrl+Alt+F2切到shell,执行lspci | grep -i ethernet确认网卡型号,再查华为官网HCL文档。常见坑:某些OEM网卡(如联想ThinkSystem SR650的Broadcom NetXtreme BCM57416)虽是Broadcom芯片,但固件版本不匹配,需单独下载华为定制驱动包注入ISO。

  • 阶段2:网络自动绑定(约2分钟)
    显示Configuring network interfaces...,系统会尝试DHCP获取IP。但生产环境严禁用DHCP!必须提前在VRM Web界面的“主机”→“添加主机”页,填好该CNA的管理IP、子网掩码、网关、DNS,以及存储IP、心跳IP(如果启用HA)。CNA安装程序会从VRM拉取这些配置,自动写入/etc/sysconfig/network-scripts/ifcfg-*。如果此处失败,屏幕会停在Failed to configure network,此时按Ctrl+Alt+F2,手动编辑/etc/sysconfig/network-scripts/ifcfg-eth0,填入正确参数,再执行ifup eth0,然后按Ctrl+Alt+F1切回安装界面,它会自动继续。

  • 阶段3:VRM注册与证书获取(约5分钟)
    显示Registering with VRM...,这是最关键的一步。CNA会尝试用HTTPS连接VRM的https://vrm-cluster.example.com:8080,下载CA证书并生成本地证书签名请求(CSR),再上传给VRM签发。如果失败,错误信息会显示在屏幕底部,如Connection refused(VRM服务未启)、Name or service not known(DNS解析失败)、SSL handshake failed(时间不同步,证书有效期校验失败)。此时必须检查:① CNA节点NTP是否指向同一源;②ping vrm-cluster.example.com是否通;③openssl s_client -connect vrm-cluster.example.com:8080 -servername vrm-cluster.example.com是否能拿到证书链。

安装成功后,系统自动重启,进入CNA运行时界面,显示CNA is running. Press Ctrl+Alt+F1 to switch to console.此时,登录VRM Web界面,在“主机”页应能看到该CNA状态为“未纳管”,点击“纳管”,输入CNA的root密码,状态变为“运行中”,才算真正完成。

3.3 存储资源纳管:不是“连上就行”,而是“策略匹配”

CNA注册成功后,下一步是纳管存储。8.0.0支持FC、iSCSI、NAS、FusionStorage Block四种类型,但配置逻辑完全不同:

  • FC存储:需在CNA节点上用fcinfo -p确认HBA卡WWPN已注册到SAN交换机,然后在VRM界面“存储”→“添加存储”中,选择“FC SAN”,输入存储阵列的WWNN(不是WWPN),VRM会自动扫描LUN。关键点:必须确保CNA的/etc/multipath.confdevices段已预置该阵列的vendor/product ID,否则多路径无法聚合。华为OceanStor默认ID是"HUAWEI",浪潮AS13000是"INSPUR",填错会导致一个LUN识别出多个路径,I/O乱序。

  • iSCSI存储:需先在CNA上用iscsiadm -m discovery -t st -p <target_ip>发现Target,再用iscsiadm -m node -T <iqn> -p <target_ip> --login登录。但在VRM里,只需填Target IP和IQN,VRM会下发指令让CNA自动完成。注意:iSCSI的CHAP认证必须在VRM里提前配置用户名密码,不能在CNA侧单独设。

  • NAS存储(NFS):最简单,填NFS服务器IP、共享路径(如192.168.40.100:/vol/data)、挂载选项(推荐nfsvers=4.1,rsize=1048576,wsize=1048576,hard,intr,timeo=600,retrans=2),VRM会自动在CNA上执行mount -t nfs4。但要注意:NFS服务器必须开启rpcbind服务,且防火墙放行111/tcp, 2049/tcp端口。

  • FusionStorage Block:这是华为自研分布式块存储,需单独部署FSM(FusionStorage Manager)节点,再在VRM里添加FSM的管理IP。它不走传统存储协议,而是通过RDMA或TCP直连CNA的dsware服务,性能最高,但部署复杂度也最高。

无论哪种类型,纳管后必须点击“扫描存储资源”,VRM才会把LUN/NFS目录映射为“数据存储”,供后续创建虚拟机使用。漏掉这步,新建虚拟机时会找不到存储位置。

3.4 DVS(分布式虚拟交换机)配置:网络平面的“隐形骨架”

DVS是CNA间网络互通的基石,它不是传统交换机,而是一个跨物理节点的逻辑网络控制器。配置DVS有四个必填项:

  • 上行链路(Uplink):绑定CNA的物理网卡。例如,CNA有4个10G网口,eth0/eth1用于管理平面,eth2/eth3用于存储平面,则DVS的Uplink必须选eth2和eth3,并启用LACP聚合(模式为802.3ad)。如果只绑一个口,存储流量无法负载均衡。

  • 端口组(Port Group):定义虚拟机的网络属性。创建名为vlan100的端口组,VLAN ID填100,然后在“高级设置”里勾选“启用IP/MAC地址绑定”,防止ARP欺骗。这是安全基线,必须开。

  • 分布式端口(DPort):每个虚拟机网卡都连接到一个DPort。DPort的“流量 shaping”策略要设合理:入方向限速设为0(不限),出方向限速设为1000Mbps(防广播风暴),突发大小设为2MB。

  • VLAN Trunk:如果CNA物理交换机端口是Trunk模式,允许多个VLAN通过,则DVS的Uplink必须启用“VLAN Trunk”,并在端口组里指定VLAN ID。否则虚拟机无法获取对应VLAN的IP。

配置完DVS,必须在每台CNA节点上执行ovs-vsctl show验证OVS桥是否创建成功,ovs-ofctl dump-flows br-int查看流表是否生效。我见过最隐蔽的故障:DVS配置正确,但CNA物理交换机的Trunk端口没放行对应VLAN,导致虚拟机ping不通网关,查了一整天网络,最后发现是交换机配置漏了一行switchport trunk allowed vlan add 100

4. 实操过程与核心环节实现:从零开始的完整部署记录(含参数计算与现场日志)

4.1 环境准备清单与参数计算(以3节点VRM+5台CNA为例)

项目规格要求计算依据实际选用
VRM节点(×3)CPU:8核以上;内存:32GB;系统盘:2×480GB SATA SSD RAID1;数据盘:2×2TB SAS RAID10VRM数据库(PostgreSQL)+Redis+ZooKeeper内存占用约22GB;RAID10提供冗余与IOPS保障华为RH2288H V5,Intel Xeon Silver 4210(10核20线程),64GB DDR4,4×480GB SSD RAID1+2×2TB SAS RAID10
CNA节点(×5)CPU:16核以上;内存:128GB;系统盘:2×480GB NVMe SSD RAID1;数据盘:4×1.92TB NVMe SSD RAID0每台CNA承载约20台虚拟机,每VM平均8GB内存;NVMe RAID0提供5GB/s顺序读写,满足高IO虚拟机需求浪潮NF5280M5,Intel Xeon Gold 5218(16核32线程),256GB DDR4,4×480GB NVMe RAID1+4×1.92TB NVMe RAID0
管理网络带宽:1Gbps;延迟:<1ms;可用IP:≥10个(3VRM+5CNA+2预留)VRM Web管理、API调用、告警推送带宽占用<100Mbps华为S5735-L24P,VLAN 10,网段192.168.10.0/24
存储网络带宽:10Gbps(推荐25G);延迟:<0.5ms;MTU:9000CNA与存储阵列间I/O吞吐,单VM峰值IOPS 5000,5台并发需25Gbps华为CE6857F-48S6CQ,VLAN 20,网段192.168.20.0/24,启用Jumbo Frame
心跳网络带宽:1Gbps;延迟:<0.2ms;专用物理链路VRM HA节点间状态同步,数据量小但实时性要求极高专用双绞线直连,VLAN 30,网段192.168.30.0/24

注意:VRM数据盘RAID10的容量计算:2×2TB = 4TB原始容量,RAID10可用容量=4TB/2=2TB。但VRM日志、备份、快照默认占用空间上限为1.5TB,所以2TB刚好够用。如果选RAID5,可用容量=3TB,但写惩罚高,IOPS下降40%,不推荐。

4.2 VRM初始化全过程日志截取与解读

安装完成后,首先进入VRM Web界面,首次登录会强制重置密码。然后执行初始化向导:

  • 步骤1:设置时区与NTP
    选择“Asia/Shanghai”,NTP服务器填ntp1.aliyun.com。保存后,后台执行:

    timedatectl set-timezone Asia/Shanghai systemctl enable chronyd && systemctl start chronyd chronyc sources -v # 验证NTP源状态

    日志关键行:[INFO] NTP service started successfully. Sync status: Active

  • 步骤2:配置存储
    选择“本地存储”(用于VRM自身数据库),路径填/dev/sdb1(即2TB SAS RAID10分区)。系统自动格式化为XFS,并挂载到/opt/vrm/data
    日志关键行:[INFO] Format /dev/sdb1 as xfs filesystem. Mount point: /opt/vrm/data

  • 步骤3:创建管理员用户
    输入新admin密码,系统生成密钥对,私钥存于/etc/vrm/keys/admin_key.pem
    日志关键行:[INFO] Generate RSA key pair for admin user. Key length: 2048 bits

  • 步骤4:初始化数据库
    此步耗时最长(约8分钟),执行/opt/vrm/bin/init_db.sh,创建PostgreSQL库vrmdb,导入schema。
    日志关键行:[INFO] Start initializing database... [SUCCESS] Database initialized.

    若失败,看/var/log/fusionsphere/vrm/db-init.log,常见错误FATAL: could not create shared memory segment: Cannot allocate memory,原因是/dev/shm大小不足,需在/etc/fstab中增加none /dev/shm tmpfs defaults,size=4g 0 0mount -o remount /dev/shm

完成初始化,VRM首页显示“系统健康状态:正常”,三个节点状态均为绿色。

4.3 CNA纳管与集群创建实录

登录VRM,进入“主机”→“添加主机”:

  • 输入CNA管理IP:192.168.10.101
  • 主机名:cna-node01
  • 操作系统类型:FusionCompute CNA 8.0.0
  • root密码:******
  • 存储IP:192.168.20.101
  • 心跳IP:192.168.30.101

点击“确定”,VRM后台执行:

# 在CNA节点上远程执行 ssh root@192.168.10.101 "vrm-agent-register --vrm-ip 192.168.10.10 --vrm-port 8080 --cert-path /etc/vrm/cert/ca.crt"

约2分钟后,主机列表出现cna-node01,状态为“未纳管”。点击“纳管”,输入CNA root密码,状态变“运行中”,日志显示:

[INFO] Host cna-node01 registered successfully. Agent version: 8.0.0.12345 [INFO] Host cna-node01 joined cluster default-cluster.

接着,创建集群:

  • 集群名称:prod-cluster
  • DRS(动态资源调度):启用,阈值设为“中”(CPU利用率>70%触发迁移)
  • HA(高可用):启用,主机故障响应设为“重启虚拟机”
  • 存储策略:选择已纳管的FC SAN存储“oceanstor-lun01”

将5台CNA全部纳管并加入该集群。此时,集群概览页显示“主机数:5,运行中虚拟机:0,资源使用率:0%”。

4.4 创建首个虚拟机:验证全流程打通

在“虚拟机”→“创建虚拟机”:

  • 名称:test-vm01
  • 所属集群:prod-cluster
  • 操作系统:CentOS 7.9
  • CPU:4核
  • 内存:8GB
  • 系统盘:100GB,存储:oceanstor-lun01
  • 网络:连接到DVS端口组vlan100
  • 密码:******

点击“确定”,VRM后台调用CNA的libvirt API:

virsh define /var/lib/libvirt/images/test-vm01.xml virsh start test-vm01

约90秒后,虚拟机状态变“运行中”。登录VRM控制台,打开test-vm01的VNC窗口,看到CentOS启动画面,输入root密码,执行ip a,确认获取到192.168.100.10/24(vlan100网段)IP,ping 192.168.100.1(网关)通,ping www.baidu.com通。至此,从VRM安装、CNA纳管、存储配置、网络打通到虚拟机创建,全流程验证成功。

5. 常见问题与排查技巧实录:那些手册里不会写的“踩坑现场”

5.1 CNA注册失败:90%的问题出在“时间”和“证书”

现象日志线索根本原因解决方案
Registration failed: SSL certificate verify failed/var/log/vrm/agent.logssl.SSLCertVerificationErrorCNA与VRM时间差>5分钟,导致证书有效期校验失败在CNA执行chronyd -q -s强制同步NTP,或date -s "2024-06-15 14:30:00"手动校时
Registration failed: Connection refusednetstat -tlnp | grep :8080无输出VRM服务未启动,或防火墙拦截systemctl status vrm-server查状态;firewall-cmd --list-ports看8080是否开放;systemctl start vrm-server启动服务
Registration failed: Name or service not knownnslookup vrm-cluster.example.com返回NXDOMAINDNS未配置,或hosts文件未添加映射编辑/etc/hosts,添加192.168.10.10 vrm-cluster.example.com
Registration failed: No route to hostping 192.168.10.10不通CNA管理网卡未UP,或交换机端口downip link show eth0看状态;ip link set eth0 up启用;检查交换机show interface

实操心得:每次CNA注册前,务必在CNA上执行三连查:date(时间)、nslookup vrm-cluster.example.com(DNS)、curl -k https://vrm-cluster.example.com:8080(连通性)。这三步通了,注册成功率99%。

5.2 虚拟机无法启动:不是资源不够,而是“NUMA亲和性”没配

现象:创建虚拟机后状态一直是“暂停”,日志显示failed to start domain: internal error: libvirt library is not available
排查:virsh list --all看到test-vm01状态为paused,执行virsh resume test-vm01报错cannot set cpu affinity for domain
原因:CNA节点开启了NUMA,而虚拟机XML里<numatune>未配置,libvirt无法自动绑定CPU和内存到同一NUMA节点。
解决方案:在VRM创建虚拟机时,高级设置里勾选“启用NUMA亲和性”,或手动编辑虚拟机配置:

<numatune> <memory mode='strict' nodeset='0'/> <memnode cellid='0' mode='strict' nodeset='0'/> </numatune>

注意:nodeset='0'表示绑定到NUMA节点0,需先用numactl --hardware查CNA的NUMA拓扑。我遇到过客户用双路CPU服务器,没配NUMA,结果虚拟机随机分配到跨NUMA节点的CPU和内存,性能下降30%。

5.3 存储I/O慢:别急着换硬盘,先看“多路径策略”

现象:虚拟机磁盘I/O延迟>100ms,iostat -x 1显示%util接近100%,但存储阵列前端端口IOPS正常。
排查:multipath -ll显示路径状态为failedghost
原因:多路径策略设为round-robin,但存储阵列不支持,应设为group_by_prio(优先级组)或queue-length(队列长度)。
解决方案:编辑/etc/multipath.conf,在defaults段添加:

defaults { user_friendly_names "yes" find_multipaths "yes" path_grouping_policy "group_by_prio" prio "alua" }

然后systemctl restart multipathd

实操心得:华为OceanStor必须用alua优先级,浪潮AS13000用ontap,NetApp用ontap,Dell EMC用emc。填错策略,多路径形同虚设。

5.4 DVS网络不通:八成是“MTU不一致”

现象:同一DVS下的虚拟机能ping通,但跨CNA的虚拟机ping不通,tcpdump抓包显示ICMP echo request发出,但无reply。
排查:ovs-vsctl get Interface eth0 mtu_request返回1500,而存储网络交换机MTU设为9000。
原因:DVS上行链路MTU小于物理网络MTU,大包被丢弃。
解决方案:在VRM DVS配置页,“上行链路”→“编辑”→“高级设置”,将MTU设为9000,保存后所有CNA自动同步。

提示:修改MTU后,必须重启CNA上的openvswitch服务:systemctl restart openvswitch,否则不生效。

5.5 VRM Web界面打不开:不是端口问题,而是“证书链不完整”

现象:浏览器访问https://vrm-cluster.example.com:8080提示“您的连接不是私密连接”,点击“高级”→“继续前往”,页面空白。
排查:curl -vk https://vrm-cluster.example.com:8080返回SSL certificate problem: unable to get local issuer certificate
原因:VRM

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询