运维SLA怎么定?别拍脑袋,用这三个标尺
不少企业在选择运维托管服务商时,盯着SLA条款里那个99.9%还是99.99%的数字反复谈判,却很少有人去追问这个可用率到底怎么算出来的。同样是99.9%,计算口径不同,实际服务质量可能天差地别。
标尺一:可用率的计算分母是什么
最常见的算法是:可用率=(总时间-不可用时间)/总时间×100%。但这里面的猫腻在于"不可用时间"怎么认定。有些服务商只把服务器完全宕机的时间算作不可用,应用层卡顿、响应超时这些状态都不算。结果就是用户体验已经很差了,SLA指标还漂亮得很。
更合理的计算方式是以业务可用性为准:当核心接口的响应时间超过约定阈值(比如2秒)或错误率超过约定比例(比如1%)时,就算不可用。这需要双方约定监控方式、采样频率和判定规则,写在合同附件里。
标尺二:计划内维护算不算停机
大部分SLA条款会把计划内维护排除在不可用时间之外,这本身合理。但有的服务商利用这个口子,每月安排十几个小时的"计划维护窗口",实际影响了业务却不算违约。建议在合同里约定:计划维护必须提前72小时通知,每月计划维护总时长不超过X小时,超出部分计入不可用时间。如果业务有明确的服务时段(比如早八点到晚十二点),可以约定非服务时段的维护不影响SLA。
标尺三:达不到SLA怎么赔
赔偿条款是SLA的牙齿,没有赔偿的SLA就是一张废纸。常见的赔偿方式是按月费的百分比返还:达不到月度SLA扣减10%月费,连续两个月达不到扣减20%,连续三个月达不到客户可解约。关键是要有明确的索赔流程:谁发起索赔、多长时间内响应、赔偿金额怎么计算、以什么形式返还(抵扣下月费用还是现金退款)。
除了经济赔偿,还应该约定故障告知义务:故障发生后多少分钟内通知客户、每隔多久同步进展、故障结束后多长时间内提供书面报告。这些细节决定了故障发生时客户的体验和知情权。
SLA不是签完就束之高阁的文件。建议每季度做一次SLA执行情况回顾,核对实际可用率、故障响应时间、赔偿执行情况,和服务商一起复盘改进。合同写得好不如执行盯得紧,运维质量是谈出来也是管出来的。把这三把标尺拿去衡量你现有的或者正在谈的运维托管合同,该补的条款趁早补上。
相关阅读
混合云运维怎么做:自建和云端的边界管理
混合云兼顾了安全合规和弹性扩展,但两边环境的差异给运维带来了新挑战。本文对比两种常见的混合云运维模式,分析各自适用场景和决策建议。
网站日志安全审计:该记录什么、保留多久、怎么分析
网站日志是安全事件追溯的核心依据,但很多企业的日志记录要么太粗要么太杂。本文从网站安全防护角度,讲解安全审计日志的记录范围、留存周期、分析方法和工具选型,帮助企业建立有效的日志审计体系。
SSL证书续期后浏览器还是显示不安全怎么办
明明已经续费并部署了新的SSL证书,浏览器地址栏却还是显示“不安全“警告,这是很多运维人员遇到过的头疼问题。本文梳理证书续期后仍然报错的五个常见原因,逐一给出排查步骤和解决方法,帮你快速定位问题并恢复HTTPS正常状态。