Telstra断网真相公布!竟因一次软件更新失误,赔偿通道将开启
据报道,早在全国网络断网事故发生六个月前,Telstra就收到风险预警,却未安装可规避故障的修复补丁。
Telstra坦承自身管控机制存在严重缺陷。此前一次无书面记录的设备设计变更,叠加一项始终未部署的软件更新,致使全网服务器时钟被重置回2006年,进而引发连锁式全国网络瘫痪,这也是该公司十年来最严重的网络故障。

近日,Telstra首席执行官Vicki Brady、首席财务官Michael Ackland及一众高管出席参议院听证会,对外披露此次大规模网络崩溃的确切诱因。
本次故障造成轨道交通系统停运、电子支付全面中断,超600人无法拨通000紧急求救电话。
Telstra向听证会提交书面材料还原事故全过程:7月8日周三凌晨3点38分,技术人员更换三台网络时间协议服务器中的一台故障机箱后恢复供电,故障就此爆发。
企业早收到设备失效预警
Brady表示,设备供应商Scientific Devices曾向Telstra发出提示,本次引发全网瘫痪的核心设备存在故障隐患。
她在参议院听证会上说明,其中一台服役15年的服务器内置GPS模块,本应安装配套软件更新。
“当时工作人员根据现有设备设计逻辑判断,本次更新无关紧要,现有设备的运行模式不会触发该类故障。”
但Brady承认,若当时按时完成软件更新,本次断网事故本可以避免。

类似千年虫的低级失误
墨尔本Exhibition Street交换机房的服务器重启后读取到错误日期。在随后数小时内,2006年的错误时间戳传遍整个网络,各类服务器用于设备接入验证的身份认证证书全部失效。
语音通话、移动数据、电子刷卡终端、各类智能设备接连断连,紧急求救电话服务也同步受影响。Brady向听证会透露,这台故障设备更换成本约3万澳元,相关失效风险早在事发半年前就已告知企业。
Telstra表示,位于悉尼、珀斯的同型号配套服务器并未出现和墨尔本设备一致的故障,强调设备冗余机制本身不存在缺陷。
企业在材料中写道:“本次故障根源并非硬件本身、冗余设备配置或网络架构设计问题。三台服务器均按照设计标准正常运行,真正拖垮全网的是错误时间数据在依赖时间校验信任机制的系统中大范围扩散。”
故障相关设计变更未留存记录
本次事故的诱因是一项此前为修复旧故障而做出的设备设计调整,该变更未留下任何书面存档,运维人员完全不清楚设备重启后会出现时间错乱问题。
本可阻止时钟重置故障的软件更新也始终未落地安装。
Telstra表示:“此类情况完全无法接受。如果常规维护作业就能引发全国范围断网,足以证明我们的管控流程存在重大漏洞。”
事发初期刻意淡化事故影响
故障发生后,Telstra迅速对外安抚用户,称实际影响小于表面观感。周三上午10点03分,也就是故障处置6个多小时后,Telstra对外表示“目前近九成通话与数据业务已恢复正常”,建议用户断线后重新尝试拨打。
但完整修复耗时远超出预期。依托Telstra移动网络的000求救电话直至7月9日周四上午10点38分才稳定运行;无线网络语音通话、合作客户的残留故障,直到7月11日周六下午2点30分才全部清除,距离首次故障报警已过去三天多。
数百通紧急求救电话拨打失败
Telstra统计,故障期间总计58835通000求救电话里,有604通拨打失败,近99%的求助电话可正常接通。
在604通失败来电中,335名来电者后续确认自身并无危险,102人称救援人员已抵达现场;23起求助转接至其他应急渠道;144名失联求助者信息移交各州领地警方处理;另有172人切换至Optus或TPG网络成功拨通000。
通信部长收到企业通报
故障当日早上6点44分,企业通过短信向联邦通信部长Anika Wells办公室通报情况,6点49分、7点02分又两次跟进联络。Wells此前曾批评Telstra,企业早在6点30分就线上发布故障公告,却延后向她报备。
全国宽带网络NBN固网用户未受波及,除Telstra及其批发合作商以外的其他运营商客户业务均正常运行。由Telstra负责运维的000呼叫平台本身并未对接故障服务器。
用户索赔渠道说明
澳大利亚通信与媒体管理局已针对本次事故启动调查。Telstra聘请外部独立专家开展事故复盘,同时将依据紧急呼叫相关法规提交法定事故报告,并上线专属页面,供个人用户与企业客户提交投诉、申请经营损失赔偿。



+61
+86
+886
+852
+853
+64
