很多企业做备份只有一个动作:设好计划任务,看着它每天跑完就把心放下。等到真出事,才发现备份本身也需要被恢复。东莞一家电子制造企业遇到的正是这种情况。
客户的 ERP 跑在一台用了七年多的服务器上,数据库文件放在两块 SAS 盘做的 RAID1 上。某天早上开机后阵列卡报警,系统起不来,数据库自然也不可用。IT 主管把服务器型号、阵列卡与盘序整理给我们,我们先做了远程初判,同时提醒他们立即确认备份可用性。
坏消息就在这里。备份用的是一台闲置服务器改造的备份机,每周一次全备、每天一次增量,看上去任务正常。可实际上备份机两个月前掉过一块盘,管理员只是把报警关掉了;越积越大的备份文件又撑满了存储池,最后几次任务的日志显示失败,没有人复查。
这类情况不能只靠一条路。第一条线是备份集:把备份服务器上剩余的硬盘全部镜像,重建文件系统元数据,从损坏的备份文件里提取内部数据块,修复备份集的目录与索引结构,逐份校验完整性,把能还原的备份按时间顺序理出来。第二条线是原盘:对 RAID1 的两块盘分别镜像,绕开坏道提取数据库文件与日志文件,把最新的业务数据补齐出来。
两条线的结果拼在一起,账套、应收应付、库存和订单数据都回到了故障发生的前一天,损失缩小到一天的业务记录。客户事后说,如果只盯着备份这一条路,结果会难看很多。
一是只验证任务成功,不验证数据能还原。备份文件的完整性要在独立环境里实际还原一次才算数。二是备份和原数据放在同一套存储、同一间机房,一次故障一起丢。三是备份介质本身有寿命,磁带、老硬盘、老备份机都需要定期检查,不能放着不管。四是加密备份没有留存密钥或口令,能还原却打不开。
还有一点容易被忽略:备份文件损坏后,普通还原流程往往直接报错退出,但损坏的备份集内部仍有大量可用数据块,需要按块提取和索引重建才能取出。这类操作不能在生产备份机上反复尝试,否则会把仅存的结构覆盖掉。
备份集校验失败、还原报错、备份服务器阵列掉线、备份介质无法读取,或者主存储与备份同时出问题,都属于需要专业处理的场景。此时保存现场比反复尝试更重要:不要重新初始化备份池,不要格式化备份介质,不要用新的备份任务覆盖旧文件。
深圳市补天时代科技有限公司专注数据恢复二十余年,累计恢复硬盘2万个、服务器及存储3000台,除硬盘与阵列恢复外,也承接备份集损坏、备份介质读取失败等疑难情况,恢复流程按规范执行、可追溯。先打 0755-83775551 做免费检测判断,地址:深圳市福田区华强北深南中路2070号电子科技大厦A座35楼。