1. 集群状态监控 :
# 查看集群整体状态
crm status
# 或更详细的视图
crm_mon -1
# 查看所有资源状态
crm resource status
注:所有资源是否都在预期的节点上运行( Master / Slave );是否有失败的监控操作( FAILED );节点是否在线。
2. HANA系统复制状态监控 :
# 在任一节点执行
sudo -i -u <sid>adm
python /usr/sap/<SID>/HDB<instance>/exe/python_support/systemReplicationStatus.py
检查输出中 STATUS 是否为 ACTIVE , REPLICATION_MODE 是否正确, REPLICATION_STATUS 是否为 RUNNING ,以及 FULL SYNC STATUS 是否显示为已完成。任何 ERROR 或 INITIALIZING 状态都需要立即排查。
3. 操作系统与存储层监控 :
• 内存与交换空间 :HANA是内存数据库,任何交换活动( si/so )都会导致性能骤降。使用 vmstat 1 和 free -h 持续观察。
• 多路径状态 :定期检查 multipath -ll ,确保所有存储路径是 active/ready 状态,没有 failed/faulty 的路径。
• 网络心跳 :使用 corosync-cfgtool -s 检查Corosync环状态,确保所有配置的链路都正常。