Der Ausfall: The Movie

Samstag war was los in Gütersloh. Bzw. lange Zeit nichts, netztechnisch …

Im Nachgang finde ich das ja witzig; zwischen 10 und 15 Uhr, als noch nicht klar war, was genau los war und die Gerüchte auch schon ins Kraut schossen, war ich weniger gelassen ;-)

Was war passiert? Am morgen gegen 9:30 krachte es augenscheinlich irgendwo am Rechenzentrum »An der Autobahn«, welches von arvato betrieben wird. Etwa eine Stunde später merkte ich beim Besuch des heimischen Terminals, daß irgendwas nicht koscher ist: »Write failed: Broken pipe« in ziemlich allen ssh-Fenstern, sowohl zu den Freifunk-Servern als auch zu meinen eigenen — WTF?! Der Tunnel ins RZ war auch zusammengebrochen — und damit auch die Tunnel zwischen meinen verschiedenen Kisten :-( (Ein weiterer Punkt auf der Ewigen ToDo-Liste *seufz*)

Relativ schnell wurde klar, nachdem das Routing ins RZ weder über Telekom noch Vodafone funktionierte und vom Server bei Hetzner als auch bei OVH nicht nur meine Systeme, sondern auch SPON und maxdome, die ebenfalls im Gütersloher RZ logieren, unerreichbar waren, daß hier ein externes Problem vorliegt. Ungewöhnlich, denn eigentlich ist jenes RZ gut ausgebaut und die Netzwerker bei sowohl Telefónica als auch Plusserver sind sehr erfahren — auch, was SPOFs, Single-Points-of-Failure, angeht. TDe hat (AFAIK redundante) Verbindungen nach mindestens Hamburg, Düsseldorf und Frankfurt, was könnte da den gesamten Standort unerreichbar machen?!

Nun, die Presseschau ergibt ziemlich übereinstimmend: »Bei dem Vorfall wurden technische Geräte so sehr beschädigt, dass sie nicht mehr in Betrieb genommen werden konnten, sondern ausgetauscht werden mussten.«

Nun sind das keine AVM Fritzbox 7270, die man ggf. im MediaMarkt noch schnell kaufen könnte; da sind 10 Gigabit-Interfaces aufwärts am Start, da werden »Dark Fibers« mit mehreren »Farben« (Wellenlängen) genutzt, der Krempel ist teuer und davon stellt man sich nicht mal ein System in den Keller, sondern schließt Supportverträge. Einen Totalausfall — nunja; das ist im Zweifel die Ausnahme von der Regel, wo parallel Techniker und Logistiker für die Lösungsfindung und Juristen für die spätere Abrechnung des Vorfalls an den Start gebracht werden.
Und auch die Router dürften nicht auf dem Grabbeltisch zu haben sein; da hat man zwar Ersatzteile vor Ort, aber einen Totalausfall plant keiner vorab. Wirtschaftlicher ist da der verlängerte Ausfall und nachfolgende Kompensationszahlungen, auch auf Seiten des Servicepartners …

Nota bena: Ich weiß nicht, was konkret los war. Was ich aber weiß ist, daß gegen 15 Uhr die Freifunk-Server in Gütersloh wieder erreichbar waren, und zwar über eine direkte Host-Europe-Anbindung, nicht, wie vormals, ›hinter‹ Telefónica:

root@carrot:~# traceroute 192.251.226.254
traceroute to 192.251.226.254 (192.251.226.254), 30 hops max, 60 byte packets
 1  static.161.67.9.5.clients.your-server.de (5.9.67.161)  3.013 ms  3.080 ms  3.114 ms
 2  hos-tr3-juniper4.rz16.hetzner.de (213.239.233.65)  0.203 ms  0.225 ms hos-tr4-juniper4.rz16.hetzner.de (213.239.233.97)  0.177 ms
 3  core21.hetzner.de (213.239.245.105)  0.216 ms core22.hetzner.de (213.239.245.145)  0.191 ms core21.hetzner.de (213.239.245.105)  0.235 ms
 4  core4.hetzner.de (213.239.245.14)  4.807 ms  4.830 ms core4.hetzner.de (213.239.245.18)  4.784 ms
 5  juniper4.ffm.hetzner.de (213.239.245.1)  5.021 ms  4.919 ms  4.929 ms
 6  ce-0-4-0-0.r03.frnkge03.de.bb.gin.ntt.net (213.198.72.229)  5.403 ms  6.696 ms  6.654 ms
 7  ae-21.r02.frnkge03.de.bb.gin.ntt.net (129.250.6.84)  5.306 ms  5.304 ms  5.549 ms
 8  ffm-b12-link.telia.net (213.248.72.9)  5.550 ms  5.713 ms  5.520 ms
 9  ffm-bb1-link.telia.net (62.115.140.6)  5.715 ms ffm-bb2-link.telia.net (62.115.142.70)  5.736 ms ffm-bb2-link.telia.net (62.115.140.24)  16.488 ms
10  koln-b1-link.telia.net (80.91.247.247)  9.159 ms koln-b1-link.telia.net (213.155.134.87)  9.198 ms koln-b1-link.telia.net (80.91.247.247)  9.189 ms
11  * * *
12  xe-2-0-0.cr-mira.gut1.he-core.de (80.237.129.18)  10.840 ms  10.945 ms  10.838 ms
13  80.237.129.50 (80.237.129.50)  10.941 ms  10.951 ms  10.887 ms
14  195.71.109.220 (195.71.109.220)  10.911 ms  10.833 ms  11.017 ms
15  217.188.63.196 (217.188.63.196)  11.024 ms  11.117 ms  11.171 ms
16  librarian.uu.org (192.251.226.254)  11.270 ms  11.267 ms  11.313 ms

Analog waren auch Adressen von spiegel.de oder maxdome.de wieder aus anderen Netzen erreichbar. Später am Abend war dann Normalität wiederhergestellt:

root@carrot:~# tcptraceroute 192.251.226.254
traceroute to 192.251.226.254 (192.251.226.254), 30 hops max, 60 byte packets
 1  static.161.67.9.5.clients.your-server.de (5.9.67.161)  0.964 ms  1.042 ms  1.076 ms
 2  hos-tr4-juniper4.rz16.hetzner.de (213.239.233.97)  0.163 ms hos-tr2-juniper3.rz16.hetzner.de (213.239.230.33)  0.171 ms hos-tr3-juniper4.rz16.hetzner.de (213.239.233.65)  0.163 ms
 3  core22.hetzner.de (213.239.245.145)  0.179 ms  0.164 ms  0.189 ms
 4  core4.hetzner.de (213.239.245.18)  4.790 ms core4.hetzner.de (213.239.245.14)  4.819 ms  4.842 ms
 5  juniper4.ffm.hetzner.de (213.239.245.1)  4.889 ms  4.862 ms  4.901 ms
 6  xmws-frnk-de16.nw.telefonica.de (80.81.193.89)  9.205 ms  9.155 ms xmws-frnk-de17.nw.telefonica.de (80.81.192.89)  9.128 ms
 7  hundredgige0-5-0-1.06.xmwc.99.fra.de.net.telefonica.de (62.53.2.58)  15.121 ms hundredgige0-6-0-1.05.xmwc.99.fra.de.net.telefonica.de (62.53.12.110)  15.090 ms hundredgige0-5-0-1.06.xmwc.99.fra.de.net.telefonica.de (62.53.2.58)  15.098 ms
 8  ae10-0.0001.corx.02.fra.de.net.telefonica.de (62.53.26.3)  15.043 ms ae11-0.0001.corx.01.fra.de.net.telefonica.de (62.53.26.1)  14.774 ms ae10-0.0001.corx.01.fra.de.net.telefonica.de (62.53.25.255)  14.756 ms
 9  ae0-0.0001.corx.01.gut.de.net.telefonica.de (62.53.20.60)  14.637 ms ae0-0.0002.corx.01.gut.de.net.telefonica.de (62.53.6.232)  14.770 ms ae0-0.0001.corx.01.gut.de.net.telefonica.de (62.53.20.60)  14.578 ms
10  tengige0-1-0-1.03.xmwc.99.gut.de.net.telefonica.de (62.53.7.113)  15.267 ms tengige0-1-0-2.04.xmwc.99.gut.de.net.telefonica.de (62.53.7.119)  15.243 ms tengige0-1-0-1.04.xmwc.99.gut.de.net.telefonica.de (62.53.7.115)  14.853 ms
11  xe-0-0-2-0.31.xmws.99.gut.de.net.telefonica.de (62.53.17.193)  38.760 ms  36.500 ms  36.546 ms
12  195.71.9.2 (195.71.9.2)  14.333 ms  14.322 ms  14.218 ms
13  80.237.129.50 (80.237.129.50)  14.396 ms  14.415 ms  14.359 ms
14  195.71.109.220 (195.71.109.220)  14.455 ms  14.433 ms  14.555 ms
15  217.188.63.196 (217.188.63.196)  15.325 ms  15.296 ms  14.485 ms
16  librarian.uu.org (192.251.226.254)   14.742 ms  14.736 ms  14.863 ms

Ich bin nach wie vor skeptisch, was die angeblichen DDOS-Attacken angeht; es fühlt und schmeckt einfach nach einem dieser alle ca. 10 Jahre auftretenden »Gotcha!«-Ausfälle, wo a) die geplante Redundanz einen, aber so richtig, ins Knie <censored> und dabei b) noch ein zweites Problem die Kacke hysterisch zum Ventilator schaufelt.

Einen großflächigen Stromausfall kann ich jedenfalls nicht bestätigen:

 15:04:34 up 1401 days,  4:22,  1 user,  load average: 0.89, 0.43, 0.23

Wohl aber Nachholbedarf beim (Konfigurationen) sichern und patchen meines Systems … *duck*