„Wir haben zwei gespiegelte Rechenzentren. Uns kann nichts passieren.“ Diesen Satz höre ich in Gesprächen über Betriebskontinuität erstaunlich oft. Er beschreibt eine echte Leistung der IT und beantwortet trotzdem die falsche Frage.
Hochverfügbarkeit ist kein Notfallplan
Redundante Rechenzentren schützen gut vor einem defekten Netzteil oder einem ausgefallenen Server. Gegen einen logischen Angriff helfen sie wenig. Verschlüsselt eine Schadsoftware das primäre System, schreibt die Spiegelung den Schaden in kürzester Zeit auch auf das zweite. Am Ende stehen zwei Rechenzentren still.
Betriebskontinuität beginnt dort, wo die Hochverfügbarkeit endet: bei der Frage, wie das Unternehmen weiterarbeitet, wenn die IT nicht da ist, und wie es geordnet wieder anläuft.
Drei Zahlen, die die Geschäftsleitung kennen sollte
Der BSI-Standard 200-4 und die ISO 22301 arbeiten mit wenigen Kennzahlen. Sie klingen technisch, sind aber Geschäftsentscheidungen.
MTPD, die maximal tolerierbare Ausfallzeit. Ab wann wird ein Ausfall existenzgefährdend? Durch Vertragsstrafen, verlorene Kunden, verdorbene Rohstoffe, Schäden an Anlagen oder behördliche Auflagen. Diese Grenze kennt nur das Geschäft, nicht die IT.
RTO, die Wiederanlaufzeit. Bis wann muss ein Prozess wieder laufen? Sie muss kürzer sein als die tolerierbare Ausfallzeit. Wird sie ohne diese Grenze festgelegt, ist sie ein Wunschwert.
RPO, der tolerierbare Datenverlust. Wie alt darf der letzte Datenstand sein, auf den man zurückgreift? In der Chargenproduktion kann schon ein kurzer Verlust bedeuten, dass eine ganze Charge nicht freigegeben werden kann.
Werden diese Werte in der IT geschätzt, entstehen Pläne, die technisch sauber sind und am Geschäft vorbeigehen. Werden sie in einer Auswirkungsanalyse mit den Verantwortlichen der Prozesse festgelegt, werden sie zu Entscheidungen, die die Geschäftsleitung tragen kann.
Der Plan muss dort funktionieren, wo es passiert
„Wenn die Produktion steht, hilft kein 200-Seiten-Handbuch. Dann zählt nur, ob die Mannschaft ohne Computer noch einen Behälter füllen kann.“
Ein Notfallhandbuch, das als Datei auf einem Netzlaufwerk liegt, ist im Ernstfall oft nicht erreichbar. Gerade dann, wenn es gebraucht wird. In der Produktion kommt hinzu: Der Schichtleiter muss in Minuten handeln, nicht nach dem Studium eines umfangreichen Dokuments.
Bewährt haben sich deshalb kurze, gedruckte Anweisungen dort, wo sie gebraucht werden: Welche Anlage wie sicher anhalten, wie auf Handbetrieb umstellen, wie die Dokumentation ohne Systeme weiterführen, wen informieren. Der ausführliche Plan bleibt wichtig, aber die erste Stunde entscheidet sich an der Anlage.
Ein ungeübter Plan ist eine Annahme
Ob ein Plan funktioniert, zeigt erst die Übung. Eine moderierte Übung von einem halben Tag mit Geschäftsleitung, Produktion und IT bringt regelmäßig ans Licht, was in keinem Dokument steht: Wer entscheidet tatsächlich? Wer ist erreichbar, wenn die üblichen Kanäle ausfallen? Welche Abhängigkeit zwischen Produktion, IT und ERP hatte niemand auf dem Schirm?
Was daraus folgt
- Ausfalltoleranzen festlegen. Für die kritischen Prozesse, gemeinsam mit den Verantwortlichen, als Entscheidung der Geschäftsleitung dokumentiert.
- Abhängigkeiten aufnehmen. Zwischen Produktion, IT, ERP und Dienstleistern. Hier liegen die Überraschungen.
- Wiederanlauf planen und üben. Kurze Anweisungen für die erste Stunde, ein Plan für den geordneten Wiederanlauf, eine Übung, die ihn prüft.
Der BSI-Standard 200-4 erlaubt dabei einen gestuften Einstieg. Man muss nicht mit einem vollständigen Managementsystem beginnen, um handlungsfähig zu werden. Entscheidend ist, dass im Ernstfall jemand zu einem Plan greift, statt zu telefonieren.