云备份:AWS 事件给你的企业上了一课
如果你公司的系统明天突然消失,你能说出多久之后才能重新开始卖货吗?我认识的大多数老板都会回答:"没事,都在云上。"问题恰恰就在这里。云备份只有在有人认真规划过的时候,才能真正起到保护作用。
这周就来了一个非常直接的提醒。全球最大的云服务商 AWS 承认,部分存放在中东机房里的数据已经无法恢复。这些机房遭到了伊朗的袭击。没错,这家几乎就是"可靠云服务"代名词的公司,明明白白地说了:有些数据再也回不来了。
你大概没有在迪拜放服务器。但这个教训适用于任何依赖在线系统运转的企业。也就是说,几乎所有企业。
用大白话说说 AWS 发生了什么
云其实不是云。它是一栋楼。一栋装满电脑的楼,有供电、有空调、有线缆,还有人在里面工作。当这栋楼被导弹击中、着火或者被水淹,里面的数据就会面临风险。
AWS 把它的机房划分成不同的"区域"。每个区域里有几个物理上相互隔开的数据中心。这样做就是为了让一个地方出问题时,不会拖垮全部。大多数情况下,这套机制运作得很好。
关键在于,这种保护是有上限的。如果客户只把数据存在一个区域,而整个区域都受到了影响,那就没有什么魔法可言。服务商再优秀,也可能没地方调出副本。
接下来就是合同里很少有人会读的那部分。
云服务商到底负责什么?
所有大型服务商都采用一种叫"责任共担"的模式。翻译一下就是:他们负责基础设施,你负责自己的数据。
实际上大概是这样分工的:
- 服务商保证机房有电,服务器正常运转,没有人能未经授权进入。
- 你来保证数据在别的地方有副本,密码是安全的,出了问题有人知道怎么恢复。
当你订阅一个 SaaS,比如 CRM、ERP 或者电商平台,逻辑也差不多。软件公司负责系统本身。但如果某个员工不小心删掉了 3000 个客户,或者供应商倒闭了,"我的数据去哪了?"这个问题就得你自己来回答。
我见过一家小公司,用了 4 年的预约系统,最后才发现它只保留最近 7 天的备份。一次导入出错,两个星期都没人发现。等发现的时候,那份完好的副本早就被覆盖了。
怎样做真正管用的云备份
你不需要变成基础设施专家。你需要的是方法。行业里最有名的是 3-2-1 原则,简单到一张餐巾纸就能写下:
- 3 份副本:重要数据保留原件,再加两份。
- 2 种不同的存储方式:比如系统本身,加上一个独立的存储服务。
- 1 份放在主要地点之外:放在另一个区域、另一个服务商,或者另一个国家。
AWS 这次的事件,恰恰就是那个"1"出了问题。把所有东西都放在一个区域的人,就只能干瞪眼。
对中小企业来说,这件事可以落得很具体。想象一家使用在线病历系统的诊所。一个合理的方案可以是:
- 主系统,团队日常在上面工作。
- 每天晚上自动导出一次,存到另一家服务商的存储里。
- 每周一份副本,放在另一个地理区域,只有一两个人有权限访问。
这些都不需要全职的 IT 团队。自动化做好了,它就能自己运行。哪份副本出了问题,还会通过 WhatsApp 或邮件提醒你。
你的公司能停摆多久?
在挑选工具之前,先回答两个问题。它们有专业名称,但意思其实很接地气。
**你能接受丢掉多少数据?**如果备份一天只跑一次,而问题出在下午 5 点,你就会丢掉一整天的工作。对一家每天有 200 个订单的网店来说,这可能是一场灾难。对一个每周只更新一次表格的办公室来说,也许没什么影响。
**你能承受停机多久?**一个小时?一天?一周?每个答案都会改变方案的成本。几分钟内恢复,代价很高。两天内恢复,便宜得多。
没有放之四海而皆准的正确答案。只有适合你现金流的正确答案。真正的错误,是从来没问过这个问题,然后在最糟糕的那一天才知道答案。
算一笔简单的账会有帮助。拿一天的平均营业额,乘以你停摆的天数。如果你的公司每天营业额是 8000 雷亚尔,系统要停 5 天,那就是 4 万雷亚尔的损失。这还没算上那些走了就不再回来的客户。相比之下,每个月花几十雷亚尔买额外的存储,显得很便宜。
没人测试过的备份
这里是我在这个话题上最强烈的观点:大多数自以为有备份的公司,其实只有一个文件。而文件并不等于恢复计划。
从来没恢复过的备份,不算备份。那只是信仰。
我什么情况都见过。几个月来一直在备份错误文件夹的。压缩包设了密码,却没人记得密码的。导出的数据只有客户姓名,没有电话,也没有历史记录的。在这些案例里,公司都"有备份"。直到真正需要它的那一天。
测试并不需要很复杂。每个季度,让团队里的某个人拿一份副本,在一个独立的环境里试着恢复。能打开吗?数据完整吗?花了多长时间?全部记下来。如果失败了,那很好:你是在平静的一天发现的,而不是在某个一团乱麻的周一。
这就像灭火器。墙上挂着一个,却从来没人看过有效期,那也没用。(如果你读完这篇文章就去检查办公室的灭火器,我不会笑你。)
今天就能做的 15 分钟检查清单
如果你想从这篇文章里带走一点实用的东西,就抽点时间回答下面几个问题:
- 哪 3 个系统一旦停了,公司就转不动了?(通常是:销售、财务和客服。)
- 每个系统的数据存在哪里?哪家服务商,哪个区域?
- 在那个地方之外有副本吗?多久备份一次?
- 公司里谁知道怎么恢复这份副本?这个人还在公司吗?
- 上一次有人测试是什么时候?
只要有一个答案是"不知道",就值得好好聊一聊。不是因为恐慌,而是因为管理。
当然,AWS 这次是极端情况。对大多数巴西企业来说,战争并不是日常风险。但同样的逻辑也适用于洪水、勒索软件攻击、供应商关门,或者一个权限过大的实习生。事件不同,问题始终一样:如果所有东西都没了,你要从哪里找回来?
我做的正是这块中间地带的工作:把企业已经在用的系统串起来,搭建自动化流程,负责备份、核对,并在出现异常时发出提醒。不需要一整个 IT 团队。如果你想知道这套东西放在你的业务里会是什么样子,来多了解一下我的工作吧。
LinkedIn 摘要
AWS 承认,有些客户数据再也找不回来了。 全球最大的云服务商,机房在中东遭到袭击。那些把所有数据只放在一个区域的客户,已经没有地方可以调出副本了。 这个教训适用于任何企业:云服务商负责基础设施,但你的数据要由你自己负责。 3-2-1 原则:3 份副本,2 种存储方式,1 份放在主要地点之外。 从来没恢复过的备份,不算备份。那只是信仰。 如果明天所有东西都消失了,你知道该从哪里找回来吗?如果不知道,我们值得聊一聊。 #数据备份 #云计算 #信息安全 #风险管理 #自动化