我一直在研究MTTF,MTBF,MTBR和MTBF,在我们的生产环境中运行的HP Gen9服务器。
我问题的根源,应该是担心还是不担心。
我似乎无法获得任何好的数据,因为每个服务器都有一个混合硬件。
在我的上一家公司,我们运营了大约2000台戴尔服务器r210 r410 r710,我可以说,平均每天有大约5台服务器出现某种故障。因此,大约0.25%的服务器很难使用,需要更换一个部件才能再次使用。
我上一家公司的一切都是在HA对中设置的,即N+2基础设施,因此不会对生产产生影响。我们能够更换服务器并继续前进
在我目前的办公室,我们运行9台服务器(HP Gen9,56 VM的Hyper-V),我们手头上没有很多替换部件,而且数据中心也没有管理,所以如果有东西死了,我们必须驾驶大约45分钟才能更换任何东西。
我的首席技术官和IT经理似乎都很担心,他们去年有大约2.5天的停机时间,我一直在猜测我们需要集群服务器,但他们认为没有必要。
这里是错的还是对的?不知道该怎么做。
我知道如果CTO出了什么事,这不是我的责任。这是一个非常小的公司,只有首席技术官,IT经理,我(开发行动)和一个服务台的人。
总的来说,在运行生产环境方面的经验是非常有限的,很多事情的设置方式我会称之为非常初级,我的CTO和IT经理在我到达之前都不太了解集群。他们在一个项目的中间设置没有HA的DR,这是我的预感,但失败了。
发布于 2018-01-12 23:52:23
不要担心MTTF,MTBF,MTBR和MTBF的数字。为什么这些会适用于你的环境的具体情况呢?
服务器有内部冗余,在生产中可以非常稳定。但这取决于您的环境、磁盘阵列/组成、磁盘类型、RAM数量、CPU配置、热特性、电源等等。
使用某种形式的高可用性可以减少停机的可能性,并在发生故障时为您提供一个转移工作负载的位置。
也许从独立到集群的增量成本很高,以至于没有商业意义?也许2.5天的停机时间(~99.3%的可用性)对您的操作来说已经足够了。你应该把重点放在场外保护和好的备份上。今天,您所有的HP Gen9系统都在制造商的保修范围内,所以您确实可以使用部件。如果你有RAID,多余的电源/风扇和稳定的电源,你已经覆盖了最关键的领域。
从财务角度考虑这一点,并概述风险、相关成本,并试图为您想要的东西提供一个令人信服的业务案例。
https://serverfault.com/questions/892005
复制相似问题