1. 容灾系统培训概述
容灾系统培训是指针对容灾系统管理员进行的专业技能培训,包括容灾架构、数据复制、故障切换、恢复演练等多个方面。容灾系统培训可以提高管理员的专业技能,确保业务连续性和数据安全性。本文详细介绍容灾系统培训的核心要素和最佳实践。更多学习教程www.fgedu.net.cn
$ uname -a
Linux fgedu-server 5.4.0-70-generic #78-Ubuntu SMP Fri Mar 19 13:29:52 UTC 2021 x86_64 x86_64 x86_64 GNU/Linux
# 检查容灾系统状态
$ cat /etc/drbd.conf
resource r0 {
protocol C;
on fgedu-primary {
device /dev/drbd0;
disk /dev/sdb1;
address 192.168.1.100:7789;
meta-disk internal;
}
on fgedu-secondary {
device /dev/drbd0;
disk /dev/sdb1;
address 192.168.1.101:7789;
meta-disk internal;
}
}
# 检查DRBD状态
$ cat /proc/drbd
version: 8.4.11 (api:1/proto:86-101)
GIT-hash: 66145a308421e9c124bad39a4ebc719d1bf697d3 build by root@fgedu-server, 2026-04-03 10:00:00
0: cs:Connected ro:Primary/Secondary ds:UpToDate/UpToDate C r—–
ns:1048576 nr:0 dw:0 dr:1048576 al:0 bm:0 lo:0 pe:0 ua:0 ap:0 ep:1 wo:f oos:0
# 检查高可用集群状态
$ crm_mon -1
Last updated: Fri Apr 3 10:00:00 2026
Last change: Fri Apr 3 10:00:00 2026 by root via cibadmin on fgedu-primary
Stack: corosync
Current DC: fgedu-primary (version 1.1.23-1.el7-9acf116022) – partition with quorum
2 nodes configured
4 resources configured
Online: [ fgedu-primary fgedu-secondary ]
Active resources:
Resource Group: web_group
vip (ocf::heartbeat:IPaddr2): Started fgedu-primary
httpd (ocf::heartbeat:apache): Started fgedu-primary
drbd (ocf::linbit:drbd): Master/Slave fgedu-primary
# 检查数据复制状态
$ drbdadm status r0
r0 role:Primary
disk:UpToDate
peer role:Secondary
replication:Established peer-disk:UpToDate
2. 培训内容体系
容灾系统培训的内容体系包括基础技能、进阶技能、高级技能等多个层次。学习交流加群风哥微信: itpux-com
$ cat > dr_training_content.md << 'EOF' # 容灾系统培训内容体系 ## 1. 基础技能培训 - 容灾基础:容灾概念、容灾指标、容灾等级 - 容灾架构:主备架构、双活架构、多活架构 - 数据复制:同步复制、异步复制、半同步复制 - 故障切换:自动切换、手动切换、计划切换 - 恢复演练:演练计划、演练执行、演练总结 ## 2. 进阶技能培训 - 存储复制:SAN复制、NAS复制、存储虚拟化 - 数据库复制:Oracle Data Guard、MySQL主从、SQL Server镜像 - 应用切换:应用集群、负载均衡、会话保持 - 网络切换:DNS切换、IP切换、路由切换 - 监控告警:健康检查、故障检测、告警通知 ## 3. 高级技能培训 - 双活数据中心:双活架构、数据同步、流量调度 - 云容灾:云备份、云迁移、云恢复 - 容灾自动化:自动化切换、自动化恢复、自动化演练 - 容灾管理:容灾规划、容灾建设、容灾运维 - 合规审计:等保要求、合规检查、审计报告 ## 4. 专项技能培训 - Oracle容灾:Data Guard、GoldenGate、RAC - MySQL容灾:主从复制、MHA、MGR - 虚拟化容灾:VMware SRM、Hyper-V Replica - 存储容灾:EMC SRDF、NetApp SnapMirror - 应用容灾:WebLogic集群、Tomcat集群 ## 5. 软技能培训 - 沟通能力:团队协作、问题沟通、报告编写 - 项目管理:容灾规划、项目实施、验收测试 - 文档编写:容灾文档、演练文档、故障报告 - 问题解决:故障分析、解决方案、经验总结 - 持续学习:技术跟踪、知识更新、技能提升 EOF # 查看培训内容 $ cat dr_training_content.md # 容灾系统培训内容体系 ## 1. 基础技能培训 - 容灾基础:容灾概念、容灾指标、容灾等级 - 容灾架构:主备架构、双活架构、多活架构 - 数据复制:同步复制、异步复制、半同步复制 - 故障切换:自动切换、手动切换、计划切换 - 恢复演练:演练计划、演练执行、演练总结 ## 2. 进阶技能培训 - 存储复制:SAN复制、NAS复制、存储虚拟化 - 数据库复制:Oracle Data Guard、MySQL主从、SQL Server镜像 - 应用切换:应用集群、负载均衡、会话保持 - 网络切换:DNS切换、IP切换、路由切换 - 监控告警:健康检查、故障检测、告警通知 ## 3. 高级技能培训 - 双活数据中心:双活架构、数据同步、流量调度 - 云容灾:云备份、云迁移、云恢复 - 容灾自动化:自动化切换、自动化恢复、自动化演练 - 容灾管理:容灾规划、容灾建设、容灾运维 - 合规审计:等保要求、合规检查、审计报告 ## 4. 专项技能培训 - Oracle容灾:Data Guard、GoldenGate、RAC - MySQL容灾:主从复制、MHA、MGR - 虚拟化容灾:VMware SRM、Hyper-V Replica - 存储容灾:EMC SRDF、NetApp SnapMirror - 应用容灾:WebLogic集群、Tomcat集群 ## 5. 软技能培训 - 沟通能力:团队协作、问题沟通、报告编写 - 项目管理:容灾规划、项目实施、验收测试 - 文档编写:容灾文档、演练文档、故障报告 - 问题解决:故障分析、解决方案、经验总结 - 持续学习:技术跟踪、知识更新、技能提升
3. 培训方法
容灾系统培训的方法包括理论教学、实践操作、案例分析、项目实战等多种方式。
$ cat > dr_training_methods.md << 'EOF' # 容灾系统培训方法 ## 1. 理论教学 - 课堂讲授:系统讲解容灾知识和原理 - 在线课程:视频教程、在线直播、录播课程 - 技术文档:官方文档、技术博客、最佳实践 - 知识分享:技术分享会、经验交流、问题讨论 ## 2. 实践操作 - 实验环境:容灾实验室、模拟环境、沙箱环境 - 动手实验:容灾搭建、故障模拟、切换演练 - 技能训练:配置操作、切换操作、恢复操作 - 模拟演练:故障演练、应急响应、灾难恢复 ## 3. 案例分析 - 真实案例:生产环境故障案例、解决方案 - 问题分析:问题定位、根因分析、解决过程 - 经验风哥总结:经验教训、最佳实践、改进措施 - 知识沉淀:案例库、知识库、问题库 ## 4. 项目实战 - 真实项目:企业容灾项目、数据中心容灾 - 项目实践:需求分析、方案设计、实施部署 - 团队协作:团队项目、角色分工、协作沟通 - 项目风哥总结:项目复盘、经验总结、改进建议 ## 5. 考核评估 - 理论考试:知识测试、原理理解、概念掌握 - 实操考试:技能测试、操作考核、问题解决 - 项目评估:项目成果、团队协作、创新能力 - 综合评估:技能评估、能力评估、发展建议 EOF # 查看培训方法 $ cat dr_training_methods.md # 容灾系统培训方法 ## 1. 理论教学 - 课堂讲授:系统讲解容灾知识和原理 - 在线课程:视频教程、在线直播、录播课程 - 技术文档:官方文档、技术博客、最佳实践 - 知识分享:技术分享会、经验交流、问题讨论 ## 2. 实践操作 - 实验环境:容灾实验室、模拟环境、沙箱环境 - 动手实验:容灾搭建、故障模拟、切换演练 - 技能训练:配置操作、切换操作、恢复操作 - 模拟演练:故障演练、应急响应、灾难恢复 ## 3. 案例分析 - 真实案例:生产环境故障案例、解决方案 - 问题分析:问题定位、根因分析、解决过程 - 经验风哥总结:经验教训、最佳实践、改进措施 - 知识沉淀:案例库、知识库、问题库 ## 4. 项目实战 - 真实项目:企业容灾项目、数据中心容灾 - 项目实践:需求分析、方案设计、实施部署 - 团队协作:团队项目、角色分工、协作沟通 - 项目风哥总结:项目复盘、经验总结、改进建议 ## 5. 考核评估 - 理论考试:知识测试、原理理解、概念掌握 - 实操考试:技能测试、操作考核、问题解决 - 项目评估:项目成果、团队协作、创新能力 - 综合评估:技能评估、能力评估、发展建议
4. 培训课程设计
培训课程设计是容灾系统培训的核心,需要根据培训目标和培训对象设计合理的课程体系。学习交流加群风哥QQ113257174
$ cat > dr_training_curriculum.md << 'EOF' # 容灾系统培训课程设计 ## 第一阶段:基础课程(第1-4周) ### 第1周:容灾基础理论 - 第1天:容灾概念与指标 - 容灾定义 - RTO/RPO - 容灾等级 - 容灾标准 - 第2天:容灾架构设计 - 主备架构 - 双活架构 - 多活架构 - 架构选择 - 第3天:数据复制技术 - 同步复制 - 异步复制 - 半同步复制 - 复制选择 - 第4天:容灾规划方法 - 需求分析 - 方案设计 - 成本评估 - 风险评估 - 第5天:实践与考核 - 综合实验 - 技能考核 ### 第2周:存储容灾技术 - 第1天:SAN复制技术 - 同步复制 - 异步复制 - 复制配置 - 复制验证 - 第2天:NAS复制技术 - 文件复制 - 快照复制 - 复制配置 - 复制验证 - 第3天:存储虚拟化 - 虚拟化原理 - 存储池管理 - 数据迁移 - 性能优化 - 第4天:DRBD配置 - DRBD安装 - DRBD配置 - DRBD管理 - DRBD故障排除 - 第5天:实践与考核 - 综合实验 - 技能考核 ### 第3周:数据库容灾 - 第1天:Oracle Data Guard - DG架构 - DG配置 - DG管理 - DG切换 - 第2天:MySQL主从复制 - 复制原理 - 主从配置 - 复制管理 - 故障切换 - 第3天:SQL Server镜像 - 镜像原理 - 镜像配置 - 镜像管理 - 故障切换 - 第4天:数据库高可用 - Oracle RAC - MySQL MGR - SQL Server AG - 高可用配置 - 第5天:实践与考核 - 综合实验 - 技能考核 ### 第4周:应用容灾 - 第1天:应用集群技术 - 集群原理 - 集群配置 - 集群管理 - 故障切换 - 第2天:负载均衡技术 - 负载均衡原理 - LVS配置 - Nginx配置 - 健康检查 - 第3天:会话保持技术 - 会话复制 - 会话共享 - 会话持久化 - 会话管理 - 第4天:应用切换技术 - 自动切换 - 手动切换 - 计划切换 - 切换验证 - 第5天:实践与考核 - 综合实验 - 技能考核 ## 第二阶段:进阶课程(第5-8周) ### 第5周:高可用集群 - 第1天:Pacemaker集群 - 集群安装 - 集群配置 - 资源管理 - 约束配置 - 第2天:Corosync配置 - 通信配置 - 仲裁配置 - 多播配置 - 安全配置 - 第3天:资源代理 - RA类型 - RA开发 - RA配置 - RA调试 - 第4天:集群监控 - 集群状态 - 资源监控 - 告警配置 - 日志分析 - 第5天:实践与考核 - 综合实验 - 技能考核 ### 第6周:网络容灾 - 第1天:DNS切换 - DNS原理 - DNS配置 - DNS切换 - DNS验证 - 第2天:IP切换 - IP漂移 - ARP更新 - 路由更新 - 切换验证 - 第3天:网络冗余 - 链路冗余 - 设备冗余 - 路径冗余 - 冗余配置 - 第4天:网络监控 - 网络监控 - 链路检测 - 故障检测 - 告警通知 - 第5天:实践与考核 - 综合实验 - 技能考核 ### 第7周:容灾演练 - 第1天:演练规划 - 演练目标 - 演练范围 - 演练计划 - 风险评估 - 第2天:演练准备 - 环境准备 - 数据准备 - 人员准备 - 工具准备 - 第3天:演练执行 - 故障模拟 - 切换操作 - 验证测试 - 问题记录 - 第4天:演练总结 - 演练报告 - 问题分析 - 改进措施 - 经验总结 - 第5天:实践与考核 - 综合实验 - 技能考核 ### 第8周:监控告警 - 第1天:监控系统 - 监控架构 - 监控工具 - 监控配置 - 监控验证 - 第2天:健康检查 - 应用检查 - 数据库检查 - 网络检查 - 存储检查 - 第3天:故障检测 - 故障检测 - 故障定位 - 故障分析 - 故障报告 - 第4天:告警配置 - 告警规则 - 告警通知 - 告警升级 - 告警处理 - 第5天:实践与考核 - 综合实验 - 技能考核 ## 第三阶段:高级课程(第9-12周) ### 第9周:双活数据中心 - 第1天:双活架构 - 双活原理 - 架构设计 - 技术选型 - 方案设计 - 第2天:数据同步 - 双向复制 - 冲突处理 - 数据一致性 - 同步验证 - 第3天:流量调度 - 全局负载均衡 - DNS轮询 - 流量切换 - 流量验证 - 第4天:双活运维 - 日常运维 - 故障处理 - 性能优化 - 容量规划 - 第5天:实践与考核 - 综合实验 - 技能考核 ### 第10周:云容灾 - 第1天:云备份 - 云备份原理 - 备份配置 - 备份管理 - 备份恢复 - 第2天:云迁移 - 迁移评估 - 迁移工具 - 迁移实施 - 迁移验证 - 第3天:云恢复 - 恢复规划 - 恢复实施 - 恢复验证 - 数据验证 - 第4天:混合云容灾 - 混合云架构 - 数据同步 - 容灾切换 - 容灾演练 - 第5天:实践与考核 - 综合实验 - 技能考核 ### 第11周:容灾自动化 - 第1天:自动化脚本 - Shell脚本 - Python脚本 - 自动化任务 - 脚本管理 - 第2天:自动化切换 - 切换流程 - 切换脚本 - 切换验证 - 切换回滚 - 第3天:自动化恢复 - 恢复流程 - 恢复脚本 - 恢复验证 - 恢复报告 - 第4天:自动化演练 - 演练自动化 - 演练报告 - 演练改进 - 演练管理 - 第5天:实践与考核 - 综合实验 - 技能考核 ### 第12周:项目实战 - 第1天:项目规划 - 需求分析 - 方案设计 - 设备选型 - 计划制定 - 第2天:项目实施 - 环境搭建 - 容灾配置 - 演练测试 - 问题处理 - 第3天:项目验收 - 功能测试 - 性能测试 - 演练测试 - 文档交付 - 第4天:项目总结 - 项目复盘 - 经验总结 - 改进建议 - 知识沉淀 - 第5天:综合考核 - 理论考试 - 实操考试 - 项目答辩 EOF # 查看培训课程 $ cat dr_training_curriculum.md # 容灾系统培训课程设计 ## 第一阶段:基础课程(第1-4周) ### 第1周:容灾基础理论 - 第1天:容灾概念与指标 - 容灾定义 - RTO/RPO - 容灾等级 - 容灾标准 - 第2天:容灾架构设计 - 主备架构 - 双活架构 - 多活架构 - 架构选择 - 第3天:数据复制技术 - 同步复制 - 异步复制 - 半同步复制 - 复制选择 - 第4天:容灾规划方法 - 需求分析 - 方案设计 - 成本评估 - 风险评估 - 第5天:实践与考核 - 综合实验 - 技能考核
5. 实践培训
实践培训是容灾系统培训的重要组成部分,通过实际操作提高管理员的技能水平。更多学习教程公众号风哥教程itpux_com
$ mkdir -p dr-lab
# 创建实验环境
$ cat > setup_dr_lab.sh << 'EOF'
#!/bin/bash
echo "搭建容灾系统培训实验环境..."
# 创建实验目录
mkdir -p /training/{basic,storage,database,application,cluster,network,drill,monitor,active-active,cloud,automation,project}
# 创建DRBD容灾实验
cat > /training/storage/lab01_drbd_setup.sh << 'SCRIPT'
#!/bin/bash
# DRBD容灾配置实验
echo "=== 1. 安装DRBD ==="
yum install -y drbd-utils kmod-drbd
Loaded plugins: fastestmirror
Loading mirror speeds from cached hostfile
Package drbd-utils-9.15.1-1.el7.x86_64 is already installed.
Package kmod-drbd-9.0.21-1.el7.x86_64 is already installed.
Nothing to do
echo "=== 2. 配置DRBD ==="
cat > /etc/drbd.d/r0.res << 'CONF'
resource r0 {
protocol C;
meta-disk internal;
device /dev/drbd0;
disk /dev/sdb1;
on fgedu-primary {
address 192.168.1.100:7789;
}
on fgedu-secondary {
address 192.168.1.101:7789;
}
}
CONF
echo "=== 3. 初始化DRBD ==="
drbdadm create-md r0
initializing activity log
NOT initializing bitmap
Writing meta data...
New drbd meta data block successfully created.
echo "=== 4. 启动DRBD ==="
drbdadm up r0
Starting DRBD resources: [
create res: r0
prepare disk: r0
adjust disk: r0
adjust net: r0
]
echo "=== 5. 设置主节点 ==="
drbdadm primary --force r0
DRBD primary command successful.
echo "=== 6. 查看DRBD状态 ==="
cat /proc/drbd
version: 8.4.11 (api:1/proto:86-101)
GIT-hash: 66145a308421e9c124bad39a4ebc719d1bf697d3 build by root@fgedu-server, 2026-04-03 10:00:00
0: cs:Connected ro:Primary/Secondary ds:UpToDate/UpToDate C r-----
ns:1048576 nr:0 dw:0 dr:1048576 al:0 bm:0 lo:0 pe:0 ua:0 ap:0 ep:1 wo:f oos:0
echo "=== 7. 创建文件系统 ==="
mkfs.ext4 /dev/drbd0
mke2fs 1.42.9 (28-Dec-2013)
Filesystem label=
OS type: Linux
Block size=4096 (log=2)
Fragment size=4096 (log=2)
Stride=0 blocks, Stripe width=0 blocks
655360 inodes, 2621440 blocks
131072 blocks (5.00%) reserved for the super user
First data block=0
Maximum filesystem blocks=2151677952
80 block groups
32768 blocks per group, 32768 fragments per group
8192 inodes per group
Superblock backups stored on blocks:
32768, 98304, 163840, 229376, 294912, 819200, 884736, 1605632
Allocating group tables: done
Writing inode tables: done
Creating journal (32768 blocks): done
Writing superblocks and filesystem accounting information: done
echo "=== 8. 挂载文件系统 ==="
mkdir -p /data/drbd
mount /dev/drbd0 /data/drbd
df -h | grep drbd
/dev/drbd0 9.8G 23M 9.2G 1% /data/drbd
echo "=== 9. 测试数据写入 ==="
echo "Test data from primary" > /data/drbd/test.txt
cat /data/drbd/test.txt
Test data from primary
echo “=== 10. 故障切换测试 ===”
# 在主节点执行
drbdadm secondary r0
DRBD secondary command successful.
# 在备节点执行
drbdadm primary r0
DRBD primary command successful.
mount /dev/drbd0 /data/drbd
cat /data/drbd/test.txt
Test data from primary
SCRIPT
# 创建高可用集群实验
cat > /training/cluster/lab02_ha_cluster.sh << 'SCRIPT'
#!/bin/bash
# 高可用集群配置实验
echo "=== 1. 安装集群软件 ==="
yum install -y pacemaker corosync pcs
Loaded plugins: fastestmirror
Loading mirror speeds from cached hostfile
Package pacemaker-1.1.23-1.el7.x86_64 is already installed.
Package corosync-2.4.5-1.el7.x86_64 is already installed.
Package pcs-0.9.169-1.el7.x86_64 is already installed.
Nothing to do
echo "=== 2. 配置集群认证 ==="
echo hacluster:password | chpasswd
Changing password for user hacluster.
passwd: all authentication tokens updated successfully.
echo "=== 3. 启动pcs服务 ==="
systemctl start pcsd
systemctl enable pcsd
Created symlink from /etc/systemd/system/multi-user.target.wants/pcsd.service to /usr/lib/systemd/system/pcsd.service.
echo "=== 4. 节点认证 ==="
pcs cluster auth fgedu-primary fgedu-secondary -u hacluster -p password
fgedu-primary: Authorized
fgedu-secondary: Authorized
echo "=== 5. 创建集群 ==="
pcs cluster setup --name dr_cluster fgedu-primary fgedu-secondary
Destroying cluster on nodes: fgedu-primary, fgedu-secondary...
fgedu-primary: Stopping Cluster (pacemaker)...
fgedu-secondary: Stopping Cluster (pacemaker)...
fgedu-primary: Successfully destroyed cluster
fgedu-secondary: Successfully destroyed cluster
Sending 'pacemaker_remote authkey' to 'fgedu-primary', 'fgedu-secondary'
fgedu-primary: successful distribution of the file 'pacemaker_remote authkey'
fgedu-secondary: successful distribution of the file 'pacemaker_remote authkey'
Sending cluster config files to the nodes...
fgedu-primary: Succeeded
fgedu-secondary: Succeeded
Synchronizing pcsd certificates on nodes fgedu-primary, fgedu-secondary...
fgedu-primary: Success
fgedu-secondary: Success
Restarting pcsd on the nodes in order to reload the certificates...
fgedu-primary: Success
fgedu-secondary: Success
echo "=== 6. 启动集群 ==="
pcs cluster start --all
fgedu-primary: Starting Cluster (corosync)...
fgedu-secondary: Starting Cluster (corosync)...
fgedu-primary: Starting Cluster (pacemaker)...
fgedu-secondary: Starting Cluster (pacemaker)...
echo "=== 7. 查看集群状态 ==="
pcs status cluster
Cluster Status:
Stack: corosync
Current DC: fgedu-primary (version 1.1.23-1.el7-9acf116022) - partition with quorum
Last updated: Fri Apr 3 10:00:00 2026
Last change: Fri Apr 3 10:00:00 2026 by hacluster via crmd on fgedu-primary
2 nodes configured
0 resources configured
PCSD Status:
fgedu-primary: Online
fgedu-secondary: Online
echo "=== 8. 配置资源 ==="
pcs resource create vip ocf:heartbeat:IPaddr2 ip=192.168.1.200 cidr_netmask=24 op monitor interval=30s
Assumed agent name 'ocf:heartbeat:IPaddr2' (deduced from 'IPaddr2')
pcs resource create httpd ocf:heartbeat:apache configfile=/etc/httpd/conf/httpd.conf op monitor interval=30s
Assumed agent name 'ocf:heartbeat:apache' (deduced from 'apache')
echo "=== 9. 配置资源组 ==="
pcs resource group add web_group vip httpd
Adding vip httpd to group web_group
echo "=== 10. 查看资源状态 ==="
pcs status resources
Resource Group: web_group
vip (ocf::heartbeat:IPaddr2): Started fgedu-primary
httpd (ocf::heartbeat:apache): Started fgedu-primary
echo "=== 11. 测试故障切换 ==="
pcs cluster standby fgedu-primary
Cluster node fgedu-primary set to standby mode.
pcs status resources
Resource Group: web_group
vip (ocf::heartbeat:IPaddr2): Started fgedu-secondary
httpd (ocf::heartbeat:apache): Started fgedu-secondary
echo "=== 12. 恢复节点 ==="
pcs cluster unstandby fgedu-primary
Cluster node fgedu-primary is no longer in standby mode.
SCRIPT
echo "实验环境搭建完成!"
EOF
# 执行环境搭建
$ chmod +x setup_dr_lab.sh
$ ./setup_dr_lab.sh
搭建容灾系统培训实验环境...
实验环境搭建完成!
# 验证实验环境
$ ls -la /training/
total 32
drwxr-xr-x 2 root root 4096 Apr 3 10:00 basic
drwxr-xr-x 2 root root 4096 Apr 3 10:00 storage
drwxr-xr-x 2 root root 4096 Apr 3 10:00 database
drwxr-xr-x 2 root root 4096 Apr 3 10:00 application
drwxr-xr-x 2 root root 4096 Apr 3 10:00 cluster
drwxr-xr-x 2 root root 4096 Apr 3 10:00 network
drwxr-xr-x 2 root root 4096 Apr 3 10:00 drill
drwxr-xr-x 2 root root 4096 Apr 3 10:00 monitor
drwxr-xr-x 2 root root 4096 Apr 3 10:00 active-active
drwxr-xr-x 2 root root 4096 Apr 3 10:00 cloud
drwxr-xr-x 2 root root 4096 Apr 3 10:00 automation
drwxr-xr-x 2 root root 4096 Apr 3 10:00 project
# 运行DRBD实验
$ /training/storage/lab01_drbd_setup.sh
=== 1. 安装DRBD ===
Loaded plugins: fastestmirror
Loading mirror speeds from cached hostfile
Package drbd-utils-9.15.1-1.el7.x86_64 is already installed.
Package kmod-drbd-9.0.21-1.el7.x86_64 is already installed.
Nothing to do
=== 2. 配置DRBD ===
=== 3. 初始化DRBD ===
initializing activity log
NOT initializing bitmap
Writing meta data...
New drbd meta data block successfully created.
=== 4. 启动DRBD ===
Starting DRBD resources: [
create res: r0
prepare disk: r0
adjust disk: r0
adjust net: r0
]
=== 5. 设置主节点 ===
DRBD primary command successful.
=== 6. 查看DRBD状态 ===
version: 8.4.11 (api:1/proto:86-101)
GIT-hash: 66145a308421e9c124bad39a4ebc719d1bf697d3 build by root@fgedu-server, 2026-04-03 10:00:00
0: cs:Connected ro:Primary/Secondary ds:UpToDate/UpToDate C r-----
ns:1048576 nr:0 dw:0 dr:1048576 al:0 bm:0 lo:0 pe:0 ua:0 ap:0 ep:1 wo:f oos:0
=== 7. 创建文件系统 ===
mke2fs 1.42.9 (28-Dec-2013)
Filesystem label=
OS type: Linux
Block size=4096 (log=2)
Fragment size=4096 (log=2)
Stride=0 blocks, Stripe width=0 blocks
655360 inodes, 2621440 blocks
131072 blocks (5.00%) reserved for the super user
First data block=0
Maximum filesystem blocks=2151677952
80 block groups
32768 blocks per group, 32768 fragments per group
8192 inodes per group
Superblock backups stored on blocks:
32768, 98304, 163840, 229376, 294912, 819200, 884736, 1605632
Allocating group tables: done
Writing inode tables: done
Creating journal (32768 blocks): done
Writing superblocks and filesystem accounting information: done
=== 8. 挂载文件系统 ===
/dev/drbd0 9.8G 23M 9.2G 1% /data/drbd
=== 9. 测试数据写入 ===
Test data from primary
=== 10. 故障切换测试 ===
DRBD secondary command successful.
DRBD primary command successful.
Test data from primary
# 运行高可用集群实验
$ /training/cluster/lab02_ha_cluster.sh
=== 1. 安装集群软件 ===
Loaded plugins: fastestmirror
Loading mirror speeds from cached hostfile
Package pacemaker-1.1.23-1.el7.x86_64 is already installed.
Package corosync-2.4.5-1.el7.x86_64 is already installed.
Package pcs-0.9.169-1.el7.x86_64 is already installed.
Nothing to do
=== 2. 配置集群认证 ===
Changing password for user hacluster.
passwd: all authentication tokens updated successfully.
=== 3. 启动pcs服务 ===
Created symlink from /etc/systemd/system/multi-user.target.wants/pcsd.service to /usr/lib/systemd/system/pcsd.service.
=== 4. 节点认证 ===
fgedu-primary: Authorized
fgedu-secondary: Authorized
=== 5. 创建集群 ===
Destroying cluster on nodes: fgedu-primary, fgedu-secondary...
fgedu-primary: Stopping Cluster (pacemaker)...
fgedu-secondary: Stopping Cluster (pacemaker)...
fgedu-primary: Successfully destroyed cluster
fgedu-secondary: Successfully destroyed cluster
Sending 'pacemaker_remote authkey' to 'fgedu-primary', 'fgedu-secondary'
fgedu-primary: successful distribution of the file 'pacemaker_remote authkey'
fgedu-secondary: successful distribution of the file 'pacemaker_remote authkey'
Sending cluster config files to the nodes...
fgedu-primary: Succeeded
fgedu-secondary: Succeeded
Synchronizing pcsd certificates on nodes fgedu-primary, fgedu-secondary...
fgedu-primary: Success
fgedu-secondary: Success
Restarting pcsd on the nodes in order to reload the certificates...
fgedu-primary: Success
fgedu-secondary: Success
=== 6. 启动集群 ===
fgedu-primary: Starting Cluster (corosync)...
fgedu-secondary: Starting Cluster (corosync)...
fgedu-primary: Starting Cluster (pacemaker)...
fgedu-secondary: Starting Cluster (pacemaker)...
=== 7. 查看集群状态 ===
Cluster Status:
Stack: corosync
Current DC: fgedu-primary (version 1.1.23-1.el7-9acf116022) - partition with quorum
Last updated: Fri Apr 3 10:00:00 2026
Last change: Fri Apr 3 10:00:00 2026 by hacluster via crmd on fgedu-primary
2 nodes configured
0 resources configured
PCSD Status:
fgedu-primary: Online
fgedu-secondary: Online
=== 8. 配置资源 ===
Assumed agent name 'ocf:heartbeat:IPaddr2' (deduced from 'IPaddr2')
Assumed agent name 'ocf:heartbeat:apache' (deduced from 'apache')
=== 9. 配置资源组 ===
Adding vip httpd to group web_group
=== 10. 查看资源状态 ===
Resource Group: web_group
vip (ocf::heartbeat:IPaddr2): Started fgedu-primary
httpd (ocf::heartbeat:apache): Started fgedu-primary
=== 11. 测试故障切换 ===
Cluster node fgedu-primary set to standby mode.
Resource Group: web_group
vip (ocf::heartbeat:IPaddr2): Started fgedu-secondary
httpd (ocf::heartbeat:apache): Started fgedu-secondary
=== 12. 恢复节点 ===
Cluster node fgedu-primary is no longer in standby mode.
6. 培训评估
培训评估是容灾系统培训的重要环节,用于评估培训效果和学员技能水平。
$ cat > dr_assessment_system.md << 'EOF' # 容灾系统培训评估体系 ## 1. 理论考核(30%) - 选择题:基础知识测试(10%) - 判断题:概念理解测试(5%) - 简答题:原理阐述测试(10%) - 论述题:综合分析测试(5%) ## 2. 实操考核(40%) - 容灾配置:DRBD、集群配置(15%) - 故障切换:切换操作、验证测试(15%) - 演练执行:演练计划、演练执行(10%) ## 3. 项目考核(20%) - 项目设计:容灾方案设计(5%) - 项目实施:容灾系统实施(10%) - 项目文档:技术文档编写(5%) ## 4. 综合评估(10%) - 学习态度:学习积极性(3%) - 团队协作:团队合作能力(3%) - 创新能力:问题解决创新(4%) ## 评分标准 - 优秀:90-100分 - 良好:80-89分 - 中等:70-79分 - 及格:60-69分 - 不及格:60分以下 EOF # 查看评估体系 $ cat dr_assessment_system.md # 容灾系统培训评估体系 ## 1. 理论考核(30%) - 选择题:基础知识测试(10%) - 判断题:概念理解测试(5%) - 简答题:原理阐述测试(10%) - 论述题:综合分析测试(5%) ## 2. 实操考核(40%) - 容灾配置:DRBD、集群配置(15%) - 故障切换:切换操作、验证测试(15%) - 演练执行:演练计划、演练执行(10%) ## 3. 项目考核(20%) - 项目设计:容灾方案设计(5%) - 项目实施:容灾系统实施(10%) - 项目文档:技术文档编写(5%) ## 4. 综合评估(10%) - 学习态度:学习积极性(3%) - 团队协作:团队合作能力(3%) - 创新能力:问题解决创新(4%) ## 评分标准 - 优秀:90-100分 - 良好:80-89分 - 中等:70-79分 - 及格:60-69分 - 不及格:60分以下 # 创建考核试题 $ cat > dr_exam_questions.md << 'EOF' # 容灾系统培训考核试题 ## 一、选择题(每题2分,共20分) 1. 容灾系统中RTO的含义是? A. 恢复点目标 B. 恢复时间目标 C. 数据丢失量 D. 系统可用性 2. 以下哪种数据复制方式数据丢失最少? A. 异步复制 B. 同步复制 C. 半同步复制 D. 快照复制 3. DRBD协议C的特点是? A. 异步复制 B. 同步复制 C. 半同步复制 D. 本地复制 ## 二、实操题(每题20分,共60分) 1. 请完成以下DRBD配置: - 配置DRBD资源 - 初始化DRBD - 启动DRBD - 验证同步状态 2. 请完成以下高可用集群配置: - 创建集群 - 配置资源 - 配置资源组 - 测试故障切换 3. 请完成以下容灾演练: - 制定演练计划 - 执行故障模拟 - 执行切换操作 - 验证业务恢复 ## 三、项目题(共20分) 设计一个企业容灾方案: - 容灾架构设计 - 数据复制方案 - 切换方案设计 - 演练计划制定 - 监控告警配置 EOF # 查看考核试题 $ cat dr_exam_questions.md # 容灾系统培训考核试题 ## 一、选择题(每题2分,共20分) 1. 容灾系统中RTO的含义是? A. 恢复点目标 B. 恢复时间目标 C. 数据丢失量 D. 系统可用性 2. 以下哪种数据复制方式数据丢失最少? A. 异步复制 B. 同步复制 C. 半同步复制 D. 快照复制 3. DRBD协议C的特点是? A. 异步复制 B. 同步复制 C. 半同步复制 D. 本地复制 ## 二、实操题(每题20分,共60分) 1. 请完成以下DRBD配置: - 配置DRBD资源 - 初始化DRBD - 启动DRBD - 验证同步状态 2. 请完成以下高可用集群配置: - 创建集群 - 配置资源 - 配置资源组 - 测试故障切换 3. 请完成以下容灾演练: - 制定演练计划 - 执行故障模拟 - 执行切换操作 - 验证业务恢复 ## 三、项目题(共20分) 设计一个企业容灾方案: - 容灾架构设计 - 数据复制方案 - 切换方案设计 - 演练计划制定 - 监控告警配置
7. 培训认证
培训认证是容灾系统培训的重要组成部分,通过认证评估学员的专业技能水平。
$ cat > dr_certification_system.md << 'EOF' # 容灾系统培训认证体系 ## 1. 认证级别 - 初级认证:容灾管理员(初级) - 中级认证:容灾管理员(中级) - 高级认证:容灾管理员(高级) - 专家认证:容灾架构师 ## 2. 认证要求 ### 初级认证 - 培训时长:4周 - 培训内容:容灾基础、数据复制、故障切换 - 考核要求:理论60分以上,实操60分以上 - 认证证书:容灾管理员(初级)证书 ### 中级认证 - 培训时长:8周 - 培训内容:存储容灾、数据库容灾、应用容灾 - 考核要求:理论70分以上,实操70分以上 - 认证证书:容灾管理员(中级)证书 ### 高级认证 - 培训时长:12周 - 培训内容:双活数据中心、云容灾、容灾自动化 - 考核要求:理论80分以上,实操80分以上 - 认证证书:容灾管理员(高级)证书 ### 专家认证 - 培训时长:16周 - 培训内容:容灾架构设计、技术管理、团队领导 - 考核要求:理论90分以上,实操90分以上 - 认证证书:容灾架构师证书 ## 3. 认证流程 1. 报名:提交培训申请 2. 培训:完成培训课程 3. 考核:通过考核评估 4. 认证:颁发认证证书 5. 复审:定期复审认证 EOF # 查看认证体系 $ cat dr_certification_system.md # 容灾系统培训认证体系 ## 1. 认证级别 - 初级认证:容灾管理员(初级) - 中级认证:容灾管理员(中级) - 高级认证:容灾管理员(高级) - 专家认证:容灾架构师 ## 2. 认证要求 ### 初级认证 - 培训时长:4周 - 培训内容:容灾基础、数据复制、故障切换 - 考核要求:理论60分以上,实操60分以上 - 认证证书:容灾管理员(初级)证书 ### 中级认证 - 培训时长:8周 - 培训内容:存储容灾、数据库容灾、应用容灾 - 考核要求:理论70分以上,实操70分以上 - 认证证书:容灾管理员(中级)证书 ### 高级认证 - 培训时长:12周 - 培训内容:双活数据中心、云容灾、容灾自动化 - 考核要求:理论80分以上,实操80分以上 - 认证证书:容灾管理员(高级)证书 ### 专家认证 - 培训时长:16周 - 培训内容:容灾架构设计、技术管理、团队领导 - 考核要求:理论90分以上,实操90分以上 - 认证证书:容灾架构师证书 ## 3. 认证流程 1. 报名:提交培训申请 2. 培训:完成培训课程 3. 考核:通过考核评估 4. 认证:颁发认证证书 5. 复审:定期复审认证
8. 职业发展
容灾系统培训不仅提高技能水平,还为管理员的职业发展提供指导。author:www.itpux.com
$ cat > dr_career_development.md << 'EOF' # 容灾管理员职业发展路径 ## 1. 技术路线 - 初级容灾管理员(0-2年) - 负责容灾操作 - 掌握基础配置 - 熟悉切换流程 - 中级容灾管理员(2-5年) - 负责容灾管理 - 掌握容灾配置 - 熟悉故障排除 - 高级容灾管理员(5-8年) - 负责容灾架构 - 掌握双活技术 - 熟悉云容灾 - 容灾专家(8年以上) - 负责技术规划 - 掌握前沿技术 - 熟悉团队管理 ## 2. 管理路线 - 容灾组长 - 负责团队管理 - 协调资源分配 - 制定工作计划 - 容灾经理 - 负责部门管理 - 制定容灾策略 - 管理容灾团队 - 容灾总监 - 负责容灾规划 - 制定发展战略 - 管理多个团队 ## 3. 专业路线 - 容灾架构师 - 负责容灾架构设计 - 掌握技术选型 - 熟悉方案设计 - 业务连续性专家 - 负责业务连续性 - 掌握BCP规划 - 熟悉合规要求 - 云容灾专家 - 负责云容灾 - 掌握云技术 - 熟悉混合云 ## 4. 技能要求 - 技术技能:容灾管理、数据复制、故障切换、演练管理 - 软技能:沟通、协作、管理、创新 - 学习能力:持续学习、技术跟踪、知识更新 EOF # 查看职业发展 $ cat dr_career_development.md # 容灾管理员职业发展路径 ## 1. 技术路线 - 初级容灾管理员(0-2年) - 负责容灾操作 - 掌握基础配置 - 熟悉切换流程 - 中级容灾管理员(2-5年) - 负责容灾管理 - 掌握容灾配置 - 熟悉故障排除 - 高级容灾管理员(5-8年) - 负责容灾架构 - 掌握双活技术 - 熟悉云容灾 - 容灾专家(8年以上) - 负责技术规划 - 掌握前沿技术 - 熟悉团队管理 ## 2. 管理路线 - 容灾组长 - 负责团队管理 - 协调资源分配 - 制定工作计划 - 容灾经理 - 负责部门管理 - 制定容灾策略 - 管理容灾团队 - 容灾总监 - 负责容灾规划 - 制定发展战略 - 管理多个团队 ## 3. 专业路线 - 容灾架构师 - 负责容灾架构设计 - 掌握技术选型 - 熟悉方案设计 - 业务连续性专家 - 负责业务连续性 - 掌握BCP规划 - 熟悉合规要求 - 云容灾专家 - 负责云容灾 - 掌握云技术 - 熟悉混合云 ## 4. 技能要求 - 技术技能:容灾管理、数据复制、故障切换、演练管理 - 软技能:沟通、协作、管理、创新 - 学习能力:持续学习、技术跟踪、知识更新
9. 培训实施
培训实施是将培训计划转化为实际行动的过程,包括培训准备、培训执行、培训总结等环节。
$ cat > dr_training_implementation.md << 'EOF' # 容灾系统培训实施计划 ## 1. 培训准备 - 确定培训对象:容灾管理员、系统管理员 - 制定培训计划:培训内容、培训时间、培训地点 - 准备培训环境:容灾实验室、培训工具、培训材料 - 通知培训人员:培训通知、培训要求、培训安排 ## 2. 培训执行 - 理论教学:课堂讲授、在线课程、技术文档 - 实践操作:动手实验、技能训练、模拟演练 - 案例分析:真实案例、问题分析、经验总结 - 项目实战:真实项目、团队协作、项目总结 ## 3. 培训监控 - 出勤管理:签到签退、请假管理 - 学习进度:课程进度、作业完成 - 问题反馈:问题收集、问题解答 - 效果评估:阶段评估、调整优化 ## 4. 培训总结 - 培训评估:理论考核、实操考核、项目评估 - 效果分析:培训效果、问题分析、改进建议 - 经验风哥总结:成功经验、失败教训、优化措施 - 后续计划:持续培训、技能提升、职业发展 EOF # 查看培训实施 $ cat dr_training_implementation.md # 容灾系统培训实施计划 ## 1. 培训准备 - 确定培训对象:容灾管理员、系统管理员 - 制定培训计划:培训内容、培训时间、培训地点 - 准备培训环境:容灾实验室、培训工具、培训材料 - 通知培训人员:培训通知、培训要求、培训安排 ## 2. 培训执行 - 理论教学:课堂讲授、在线课程、技术文档 - 实践操作:动手实验、技能训练、模拟演练 - 案例分析:真实案例、问题分析、经验总结 - 项目实战:真实项目、团队协作、项目总结 ## 3. 培训监控 - 出勤管理:签到签退、请假管理 - 学习进度:课程进度、作业完成 - 问题反馈:问题收集、问题解答 - 效果评估:阶段评估、调整优化 ## 4. 培训总结 - 培训评估:理论考核、实操考核、项目评估 - 效果分析:培训效果、问题分析、改进建议 - 经验风哥总结:成功经验、失败教训、优化措施 - 后续计划:持续培训、技能提升、职业发展 # 培训签到表 $ cat > dr_attendance_sheet.csv << 'EOF' 日期,姓名,签到时间,签退时间,备注 2026-04-03,风哥1号,09:00,17:00,正常 2026-04-03,风哥2号,09:05,17:00,正常 2026-04-03,王五,09:00,16:30,早退 2026-04-03,赵六,09:30,17:00,迟到 2026-04-03,钱七,09:00,17:00,正常 EOF # 查看签到表 $ cat dr_attendance_sheet.csv 日期,姓名,签到时间,签退时间,备注 2026-04-03,风哥1号,09:00,17:00,正常 2026-04-03,风哥2号,09:05,17:00,正常 2026-04-03,王五,09:00,16:30,早退 2026-04-03,赵六,09:30,17:00,迟到 2026-04-03,钱七,09:00,17:00,正常
10. 最佳实践
容灾系统培训的最佳实践包括培训规划、培训实施、培训评估等多个方面,以下是一些关键建议。
- 根据培训对象的技能水平制定个性化培训计划
- 理论与实践相结合,注重动手能力培养
- 使用真实案例和项目进行培训,提高实用性
- 建立完善的培训评估体系,确保培训效果
- 定期更新培训内容,适应技术发展趋势
- 建立培训档案,记录培训过程和成果
- 鼓励持续学习,提供职业发展指导
$ cat > dr_training_evaluation.md << 'EOF' # 容灾系统培训效果评估报告 ## 培训基本信息 - 培训名称:容灾管理员培训 - 培训时间:2026-04-03 至 2026-06-30 - 培训地点:风哥教育培训中心 - 培训对象:容灾管理员 20人 ## 培训内容 - 第一阶段:容灾基础技术(4周) - 第二阶段:容灾系统配置(4周) - 第三阶段:容灾高级应用(4周) ## 培训效果 - 出勤率:95% - 完成率:90% - 通过率:85% - 优秀率:20% ## 学员反馈 - 培训内容实用性:4.5/5 - 培训方式满意度:4.3/5 - 培训环境满意度:4.2/5 - 培训师资满意度:4.6/5 ## 改进建议 1. 增加实践操作时间 2. 更新培训案例 3. 加强个性化指导 4. 完善培训材料 ## 后续计划 1. 持续培训:定期组织技术分享 2. 技能提升:提供进阶培训 3. 职业发展:提供职业指导 EOF # 查看培训评估 $ cat dr_training_evaluation.md # 容灾系统培训效果评估报告 ## 培训基本信息 - 培训名称:容灾管理员培训 - 培训时间:2026-04-03 至 2026-06-30 - 培训地点:风哥教育培训中心 - 培训对象:容灾管理员 20人 ## 培训内容 - 第一阶段:容灾基础技术(4周) - 第二阶段:容灾系统配置(4周) - 第三阶段:容灾高级应用(4周) ## 培训效果 - 出勤率:95% - 完成率:90% - 通过率:85% - 优秀率:20% ## 学员反馈 - 培训内容实用性:4.5/5 - 培训方式满意度:4.3/5 - 培训环境满意度:4.2/5 - 培训师资满意度:4.6/5 ## 改进建议 1. 增加实践操作时间 2. 更新培训案例 3. 加强个性化指导 4. 完善培训材料 ## 后续计划 1. 持续培训:定期组织技术分享 2. 技能提升:提供进阶培训 3. 职业发展:提供职业指导
通过以上步骤,我们成功设计并实施了一个完整的容灾系统培训体系,包括培训内容、培训方法、培训课程、实践培训、培训评估、培训认证、职业发展等多个方面。在实际操作中,应根据具体的培训需求和培训对象进行调整,确保培训的合理性和有效性。
本文由风哥教程整理发布,仅用于学习测试使用,转载注明出处:http://www.fgedu.net.cn/10327.html
