Samstag war was los in Gütersloh. Bzw. lange Zeit nichts, netztechnisch …
Im Nachgang finde ich das ja witzig; zwischen 10 und 15 Uhr, als noch nicht klar war, was genau los war und die Gerüchte auch schon ins Kraut schossen, war ich weniger gelassen ;-)
Was war passiert? Am morgen gegen 9:30 krachte es augenscheinlich irgendwo am Rechenzentrum »An der Autobahn«, welches von arvato betrieben wird. Etwa eine Stunde später merkte ich beim Besuch des heimischen Terminals, daß irgendwas nicht koscher ist: »Write failed: Broken pipe« in ziemlich allen ssh-Fenstern, sowohl zu den Freifunk-Servern als auch zu meinen eigenen — WTF?! Der Tunnel ins RZ war auch zusammengebrochen — und damit auch die Tunnel zwischen meinen verschiedenen Kisten :-( (Ein weiterer Punkt auf der Ewigen ToDo-Liste *seufz*)
Relativ schnell wurde klar, nachdem das Routing ins RZ weder über Telekom noch Vodafone funktionierte und vom Server bei Hetzner als auch bei OVH nicht nur meine Systeme, sondern auch SPON und maxdome, die ebenfalls im Gütersloher RZ logieren, unerreichbar waren, daß hier ein externes Problem vorliegt. Ungewöhnlich, denn eigentlich ist jenes RZ gut ausgebaut und die Netzwerker bei sowohl Telefónica als auch Plusserver sind sehr erfahren — auch, was SPOFs, Single-Points-of-Failure, angeht. TDe hat (AFAIK redundante) Verbindungen nach mindestens Hamburg, Düsseldorf und Frankfurt, was könnte da den gesamten Standort unerreichbar machen?!
Nun, die Presseschau ergibt ziemlich übereinstimmend: »Bei dem Vorfall wurden technische Geräte so sehr beschädigt, dass sie nicht mehr in Betrieb genommen werden konnten, sondern ausgetauscht werden mussten.«
Nun sind das keine AVM Fritzbox 7270, die man ggf. im MediaMarkt noch schnell kaufen könnte; da sind 10 Gigabit-Interfaces aufwärts am Start, da werden »Dark Fibers« mit mehreren »Farben« (Wellenlängen) genutzt, der Krempel ist teuer und davon stellt man sich nicht mal ein System in den Keller, sondern schließt Supportverträge. Einen Totalausfall — nunja; das ist im Zweifel die Ausnahme von der Regel, wo parallel Techniker und Logistiker für die Lösungsfindung und Juristen für die spätere Abrechnung des Vorfalls an den Start gebracht werden.
Und auch die Router dürften nicht auf dem Grabbeltisch zu haben sein; da hat man zwar Ersatzteile vor Ort, aber einen Totalausfall plant keiner vorab. Wirtschaftlicher ist da der verlängerte Ausfall und nachfolgende Kompensationszahlungen, auch auf Seiten des Servicepartners …
Nota bena: Ich weiß nicht, was konkret los war. Was ich aber weiß ist, daß gegen 15 Uhr die Freifunk-Server in Gütersloh wieder erreichbar waren, und zwar über eine direkte Host-Europe-Anbindung, nicht, wie vormals, ›hinter‹ Telefónica:
root@carrot:~# traceroute 192.251.226.254 traceroute to 192.251.226.254 (192.251.226.254), 30 hops max, 60 byte packets 1 static.161.67.9.5.clients.your-server.de (5.9.67.161) 3.013 ms 3.080 ms 3.114 ms 2 hos-tr3-juniper4.rz16.hetzner.de (213.239.233.65) 0.203 ms 0.225 ms hos-tr4-juniper4.rz16.hetzner.de (213.239.233.97) 0.177 ms 3 core21.hetzner.de (213.239.245.105) 0.216 ms core22.hetzner.de (213.239.245.145) 0.191 ms core21.hetzner.de (213.239.245.105) 0.235 ms 4 core4.hetzner.de (213.239.245.14) 4.807 ms 4.830 ms core4.hetzner.de (213.239.245.18) 4.784 ms 5 juniper4.ffm.hetzner.de (213.239.245.1) 5.021 ms 4.919 ms 4.929 ms 6 ce-0-4-0-0.r03.frnkge03.de.bb.gin.ntt.net (213.198.72.229) 5.403 ms 6.696 ms 6.654 ms 7 ae-21.r02.frnkge03.de.bb.gin.ntt.net (129.250.6.84) 5.306 ms 5.304 ms 5.549 ms 8 ffm-b12-link.telia.net (213.248.72.9) 5.550 ms 5.713 ms 5.520 ms 9 ffm-bb1-link.telia.net (62.115.140.6) 5.715 ms ffm-bb2-link.telia.net (62.115.142.70) 5.736 ms ffm-bb2-link.telia.net (62.115.140.24) 16.488 ms 10 koln-b1-link.telia.net (80.91.247.247) 9.159 ms koln-b1-link.telia.net (213.155.134.87) 9.198 ms koln-b1-link.telia.net (80.91.247.247) 9.189 ms 11 * * * 12 xe-2-0-0.cr-mira.gut1.he-core.de (80.237.129.18) 10.840 ms 10.945 ms 10.838 ms 13 80.237.129.50 (80.237.129.50) 10.941 ms 10.951 ms 10.887 ms 14 195.71.109.220 (195.71.109.220) 10.911 ms 10.833 ms 11.017 ms 15 217.188.63.196 (217.188.63.196) 11.024 ms 11.117 ms 11.171 ms 16 librarian.uu.org (192.251.226.254) 11.270 ms 11.267 ms 11.313 ms
Analog waren auch Adressen von spiegel.de oder maxdome.de wieder aus anderen Netzen erreichbar. Später am Abend war dann Normalität wiederhergestellt:
root@carrot:~# tcptraceroute 192.251.226.254 traceroute to 192.251.226.254 (192.251.226.254), 30 hops max, 60 byte packets 1 static.161.67.9.5.clients.your-server.de (5.9.67.161) 0.964 ms 1.042 ms 1.076 ms 2 hos-tr4-juniper4.rz16.hetzner.de (213.239.233.97) 0.163 ms hos-tr2-juniper3.rz16.hetzner.de (213.239.230.33) 0.171 ms hos-tr3-juniper4.rz16.hetzner.de (213.239.233.65) 0.163 ms 3 core22.hetzner.de (213.239.245.145) 0.179 ms 0.164 ms 0.189 ms 4 core4.hetzner.de (213.239.245.18) 4.790 ms core4.hetzner.de (213.239.245.14) 4.819 ms 4.842 ms 5 juniper4.ffm.hetzner.de (213.239.245.1) 4.889 ms 4.862 ms 4.901 ms 6 xmws-frnk-de16.nw.telefonica.de (80.81.193.89) 9.205 ms 9.155 ms xmws-frnk-de17.nw.telefonica.de (80.81.192.89) 9.128 ms 7 hundredgige0-5-0-1.06.xmwc.99.fra.de.net.telefonica.de (62.53.2.58) 15.121 ms hundredgige0-6-0-1.05.xmwc.99.fra.de.net.telefonica.de (62.53.12.110) 15.090 ms hundredgige0-5-0-1.06.xmwc.99.fra.de.net.telefonica.de (62.53.2.58) 15.098 ms 8 ae10-0.0001.corx.02.fra.de.net.telefonica.de (62.53.26.3) 15.043 ms ae11-0.0001.corx.01.fra.de.net.telefonica.de (62.53.26.1) 14.774 ms ae10-0.0001.corx.01.fra.de.net.telefonica.de (62.53.25.255) 14.756 ms 9 ae0-0.0001.corx.01.gut.de.net.telefonica.de (62.53.20.60) 14.637 ms ae0-0.0002.corx.01.gut.de.net.telefonica.de (62.53.6.232) 14.770 ms ae0-0.0001.corx.01.gut.de.net.telefonica.de (62.53.20.60) 14.578 ms 10 tengige0-1-0-1.03.xmwc.99.gut.de.net.telefonica.de (62.53.7.113) 15.267 ms tengige0-1-0-2.04.xmwc.99.gut.de.net.telefonica.de (62.53.7.119) 15.243 ms tengige0-1-0-1.04.xmwc.99.gut.de.net.telefonica.de (62.53.7.115) 14.853 ms 11 xe-0-0-2-0.31.xmws.99.gut.de.net.telefonica.de (62.53.17.193) 38.760 ms 36.500 ms 36.546 ms 12 195.71.9.2 (195.71.9.2) 14.333 ms 14.322 ms 14.218 ms 13 80.237.129.50 (80.237.129.50) 14.396 ms 14.415 ms 14.359 ms 14 195.71.109.220 (195.71.109.220) 14.455 ms 14.433 ms 14.555 ms 15 217.188.63.196 (217.188.63.196) 15.325 ms 15.296 ms 14.485 ms 16 librarian.uu.org (192.251.226.254)14.742 ms 14.736 ms 14.863 ms
Ich bin nach wie vor skeptisch, was die angeblichen DDOS-Attacken angeht; es fühlt und schmeckt einfach nach einem dieser alle ca. 10 Jahre auftretenden »Gotcha!«-Ausfälle, wo a) die geplante Redundanz einen, aber so richtig, ins Knie <censored> und dabei b) noch ein zweites Problem die Kacke hysterisch zum Ventilator schaufelt.
Einen großflächigen Stromausfall kann ich jedenfalls nicht bestätigen:
15:04:34 up 1401 days, 4:22, 1 user, load average: 0.89, 0.43, 0.23
Wohl aber Nachholbedarf beim (Konfigurationen) sichern und patchen meines Systems … *duck*
