Blog
Når systemerne hænger sammen, skal beredskabet også gøre det
Moderne IT er mere forbundet end nogensinde før. Cloud, SaaS, cybersikkerhed, observability og AI skaber nye muligheder, men også nye afhængigheder. Når en kritisk hændelse rammer, er udfordringen at skabe ét fælles billede af situationen hurtigt nok til at træffe de rigtige belsutninger.
Klokken er 07.42. Alle har information, men ingen har det samlede billede
Kundeservice ringer først:
“Tre kunder kan ikke komme ind i systemet. Hvad skal jeg sige til dem”
Ni minutter senere ringer produktionschefen. Produktionslinjen har stået stille i 20 minutter, og medearbejderne star ved båndene og venter.
Klokken 08.05 kommer spørgsmålet fra virksomhedens direktør:
“Er det et angreb? Og skal vi indberette det?”
Tre opkald. Tre forskellige dele af forretningen. Men grundlæggende det samme behov:
Hvad sker der, hvor alvorligt er det, og hvad gør vi nu?
Svaret ligger fordelt mellem forskellige teams, værktøjer og leverandører på tværs af organisationen.
IT-miljøet og dets kontekst har ændret sig. Har jeres driftmodel også?
Når telefonen ringer kl 07.42 så kan NOC godt se, at services er nede, men kender endnu ikke årsagen. SOC kan se, at alarmen går, men kan ikke fastslå omfanget. Observability-teamet kan se usædvanlig adfærd, men mangler konteksten til at forklare, hvad den betyder.
Alle har information og alle udfører deres del af arbejdet. Men ingen har nødvendigvis det samlede operationelle billede over situationen. Derfor går værdifuld tid med at ringe mellem teams, sammenligne data, afklare ansvar og nå til neighed om den næste beslutning, fremfor at løse hændelsen.
I praksis bliver organisationen selv det integrerede led.
Moderne IT-miljøer er skabt gennem mange fornuftige beslutninger og nye teknologier giver nye muligheder. Men tilsammen skaber cloud, SaaS-løsninger, specialiserede leverandører og automatisering et komplekst landskab af systemer, data og afhængigheder.
Udfordringen med dét bliver, at forbinde dem hurtigt nok, når noget går galt.
En hændelse respekterer nemlig ikke organisationens opdeling. Det, der først ligner et netværksproblem, kan samtidig være et sikkerhedsprpblem, et produktionsproblem, et kundeproblem og et ledelsesproblem.
Alligevel bliver hændelsen ofte håndteret gennem separate funktioner med forskellige data, processer og eksaleringsveje.
Derfor kan vi nu adressere fragmenteringen i et Resilience Operations Center.
Hvad er et Resilience Operations Center?
Et Resilience Operations Center, vi kalder det ROC, er en driftsmodel, der forbinder NOC, SOC, observability og incident response omkring ét fælles operationelt situationsbillede og én koordineret indsats.
ROC erstatter altså ikke specialisterne. Det kræver heller ikke, at de bliver generalister. De enkelte teams bevarer deres faglige ekspertise og ansvar. Så vi centraliserer ikke ekspertisen, men forbinder dem.
Det sker gennem tre grundprincipper:
- Ét kontaktpunkt. Organisationelle signaler, sikkerhedsdata og observability forbindes, så teams arbejder ud fra det same billed af hændelsen.
- Én integreret process. Klare roller, beslutningsrettigheder og arbejdsgange gør det muligt for teams at arbejde parallelt frem for at vente på sekventielle overleveringer.
- Et mere sammenhængende værktøjslandskab. ROC handler om at forbinde og konsolidere dem dér, hvor det reducerer kompleksiteten og styrker beslutningsgrundlaget.
Teknologien forbinder signalerne. Driftsmodellen forbinder responsen.
Tilbage til kl. 07.42
Med ROC bliver signalerne fra NOC, SOC og observability ikke behandlet som separate problemer. De samles i ét operationelt situationsbillede.
Kundernes adgangsproblemer og produktionsstoppet kan dermed identificeres som forskelige symptomer på den same hændelse.
Samtidig kan organisationen hurtigere bevæge sig fra tekniske obervationer til de beslutninger, forretningen har brug for:
- Hvilke kritiske services er påvirket?
- Hvem er berørt?
- Hvad skal først inddæmmes, beskyttes og genetableres?
- Skal incident response aktiveres?
- Er der indberetningspligt?
- Hvad skal kommunikeres til kunder, medarbejdere og ledelse?
I stedet for forskellige svar fra forskellige teams kan kundeservice, produktionschefen og direktøren få en koordineret opdatering:
Hvad er situationen? Hvordan påvirker det forretningen? Hvilke handlinger er prioriteret? Og hvad sker der nu?
Det er de same specialister, de same systemer og den same hændelse.
Det, der har ændret sig, er måden, organisationen arbejder sammen på.
Robusthed handler ikke om at forhindre alt
Operationel robusthed betyder ikke, at alle driftforstyrrelser kan undgås. ROC reducerer den tid, der bruges på at forbinde information, koordinere teams og beslutte, hvordan organisationen skal reagere. Målet er at skabe et bedre beslutningsgrundlag, når kontrollen bliver udfordret.
Når data, beslutninger og handlinger bliver forbundet gennem hele forløbet, får organisationen et stærkere grundlag for documentation, ledelsesrapportering og løbende forbedringer.
Hvor opstod der ventetid? Var rollerne tydelige? Blev de afgørende signaler opdaget hurtigt nok? Hvilke afhængigheder kendte organisationen ikke på forhånd?
Hvis informationen ligger spredt mellem systemer og teams, bliver det vanskeligt at rekonstruere det samlede forløb. Dermed risikerer organisationen bade at miste tid under hændelsen og vigtig læring bagefter.
For den næste hændelse vil sandsynligvis ikke ligne den forrige. Så sammenhæng på tværs er ekstra afgørende.
Start med én kritisk service
Vejen mod større operational robusthed behøver ikke begynde med et omfattende transformationsprogram. Start med én kritisk forretningsservice og stil tre spørgsmål:
- Ved vi, hvilke teams, systemer og leverandører der understøtter den?
- Kan vi hurtigt kombinere de operationelle, sikkerhedsmæssige og forretningsmæssige perspektiver, hvis servicen bliver forstyrret?
- Er det tydeligt, hvem der koordinerer indsatsen og kommunikerer med forretningen?
Hvis svarene er uklare, har I allerede fundet et konkret sted at begynde. Fremtidens stærkeste beredskab bliver defineret af, hvem der hurtigt kan skabe mening og sammenhæng i værktøjerne.
For teknologien kan skabe sammenhæng, men organisationen er måske ikke fulgt med.
Astrid Koue Bruun
Sales Specialist, Conscia Denmark
Om forfatteren
Relateret