所有系统运行正常
网络状态
过去十二个月所有地点的可用性为 99.987%,服务等级协议 (SLA) 为 99.9%。以下每起事件都会发布根因分析以及其后所做的改进,包括那些完全由我们造成的事件。
回答
Incognito VPS has recorded 99.987% uptime across all locations over the last twelve months against a 99.9% SLA. The full incident history is published with root causes and remediation, including the worst outage in the company's history.
90 days · one bar per day 运行正常 降级 故障
§01 6 published
故障记录
包括那些让我们难堪的事件。没有事件日志的可用性数字只是营销数字。
- 已自动应用 SLA 积分
上游传输抖动
Bucharest 22m
- 影响
- OTP-1 的 30% 流量间歇性丢包持续 22 分钟。
- 原因
- 一家传输提供商维护窗口超时,BGP 重新收敛振荡。
- 变更措施
- 在 OTP-1 增加了第三个传输提供商,并降低了 BGP 抑制阈值。
-
海底电缆中断
Panama City 1h 36m
- 影响
- PTY-1 至欧洲的延迟升至 280 毫秒,持续 96 分钟;无数据包丢失。
- 原因
- 第三方海底电缆故障迫使流量改经迈阿密的更长路径。
- 变更措施
- 我方无操作。记录此处是因为即使没有服务中断,延迟劣化也属于事件。
- 已自动应用 SLA 积分
虚拟机管理程序内核崩溃
Amsterdam 14m
- 影响
- 一台主机上的 38 个 VPS 实例意外重启。
- 原因
- 6.11 NVMe 驱动程序中的内核错误在特定 IO 模式下触发。
- 变更措施
- 全网回滚至 6.10 LTS,经四周浸泡测试后分阶段升级至 6.12。
-
存储阵列降级
Zürich no customer impact
- 影响
- 无客户影响。同一 RAID-10 阵列中两块硬盘在一小时内发生故障。
- 原因
- 硬盘批次不良。阵列因故障发生在不同镜像对中而幸免——运气,而非设计。
- 变更措施
- 所有位置的整个批次已主动更换。硬盘采购现刻意混合不同制造批次。
- 已自动应用 SLA 积分
公用事业故障及发电机转换失败
Sofia 47m
- 影响
- SOF-1 完全中断 47 分钟。
- 原因
- 公用电源故障且自动转换开关未启动。UPS 承载负载 11 分钟后耗尽。
- 变更措施
- 转换开关现每月满负荷测试,而非每季度空载测试。第二台发电机已投入使用。
- 已自动应用 SLA 积分
核心交换机线卡故障
Amsterdam 3h 12m
- 影响
- AMS-3 的 40% 无法访问,持续 3 小时 12 分钟。
- 原因
- 线卡故障,备件存放在另一个设施。
- 变更措施
- 每个机箱的备件现存放于每个地点现场。这是我们历史上最严重的中断,也是该政策的缘由。
积分自动发放
在一个日历月内可用性低于 99.9% 时,我们会在五个工作日内将补偿计入您的余额。您无需主动通知、申请或要求。需要申请才能获得的补偿通常是大多数客户永远无法获得的,而这种设计往往正是其目的所在。
99.50–99.89%
10%
99.00–99.49%
25%
95.00–98.99%
50%
Below 95%
100%