Calogero Bonasia

Dopo il ripristino: che cosa abbiamo risolto?

Quando un servizio torna operativo dopo un’interruzione, abbiamo ottenuto un risultato preciso: le persone possono riprendere il lavoro.

Se l’intervento ha aggirato il guasto attraverso una soluzione temporanea, rimane da capire quali condizioni lo abbiano provocato e quanto sia probabile che si ripresenti. Credo che questa distinzione, abbastanza chiara sul piano tecnico, diventi più difficile da mantenere quando dobbiamo decidere a che cosa dedicare il tempo delle persone.

Durante un incidente la priorità è comprensibile. Occorre contenere l’impatto, ripristinare il servizio e informare chi ne dipende. L’urgenza rende evidente il motivo per cui altre attività devono aspettare.

Dopo il ripristino, invece, l’analisi delle cause entra in competizione con le consegne già previste, le richieste accumulate e gli altri interventi. Il problema può rimanere aperto anche quando, per gli utenti, l’interruzione è finita.

Mi concentro soprattutto sui problemi che si ripetono come quello frequente in tante organizzazioni dell'errore nell’elaborazione dei dati che viene corretto manualmente ogni settimana. Per esempio quell'applicazione che torna operativa dopo il riavvio del server. Una consegna richiede sempre l’intervento della stessa persona, perché è l'unica che ricorda o conosce un certo passaggio necessario.

Sono situazioni diverse, accomunate dalla disponibilità di una risposta che permette di proseguire. Proprio perché quella risposta funziona, possiamo continuare a usarla a lungo senza affrontare il problema sottostante.

La competenza di chi interviene ha un valore concreto. Permette di limitare il danno e di lavorare anche in condizioni difficili.

Mi sembra però che il buon esito dell’intervento possa favorire una conclusione più ampia di quanto i fatti consentano: se siamo riusciti a ripristinare il servizio, allora disponiamo di un’organizzazione adeguata.

Per valutare questa affermazione, dobbiamo considerare anche le condizioni del ripristino, il costo sostenuto e la fattibilità di replicare lo stesso risultato in assenza della persona.

Il titolo di uno studio di Nelson Repenning e John Sterman, pubblicato nel 2001, esprime con nettezza la difficoltà di riconoscere il lavoro preventivo: nessuno riceve riconoscimento per aver risolto problemi che non si sono mai verificati.1

Un intervento urgente produce effetti visibili in tempi brevi.

Per la prevenzione, invece, valutare l’impatto di una modifica richiede un confronto temporale e una ricostruzione più precisa delle condizioni operative. Anche l’assenza di incidenti non è sempre indicativa: potrebbe essere dovuta all’efficacia dell’intervento, a un carico di lavoro ridotto o a circostanze favorevoli.

Proprio per questo penso che gli indicatori scelti per valutare il servizio influenzino anche le priorità. Il tempo di ripristino ci dice quanto rapidamente siamo riusciti a ristabilire l’operatività.

Per valutare l’efficacia delle misure preventive, servono ulteriori informazioni, come la frequenza degli incidenti legati allo stesso problema, le azioni correttive ancora da implementare, l’uso di soluzioni temporanee e l’impegno necessario per mantenerle. La lettura congiunta può rivelare una situazione altrimenti difficile da individuare: interveniamo più tempestivamente, mentre il lavoro necessario per garantire la continuità del servizio continua ad aumentare.

Anche il numero degli incidenti, considerato isolatamente, richiede un'interpretazione ponderata. Una crescita delle segnalazioni può derivare da un peggioramento del servizio oppure da una registrazione più completa.

Una riduzione può indicare un miglioramento effettivo, ma potrebbe anche essere dovuta a una diminuzione dell’utilizzo. Prima di interpretare il dato, è fondamentale capire cosa è cambiato nel periodo considerato. Ritengo che questa capacità di interpretazione sia parte integrante del lavoro di chi gestisce il servizio, tanto quanto la raccolta dei dati stessi.

C’è poi un costo che può facilmente sfuggire nelle attività quotidiane. Ogni intervento urgente interrompe un lavoro in corso, richiede di ricostruire il contesto e può far slittare verifiche, manutenzioni o affiancamenti. Se gli incidenti si ripetono, alcune di queste attività vengono rinviate più volte.

Di conseguenza, le persone impegnate nei ripristini hanno meno tempo per gli interventi che potrebbero ridurre la frequenza degli incidenti. Si può arrivare a una situazione in cui tutto il tempo disponibile è dedicato a mantenere il livello di servizio attuale.

copertina-27-firmata

Da questo punto di vista, anche il tema dell’invisibile mi sembra più concreto. Chi esegue una correzione manuale ne conosce la frequenza. Chi viene interrotto sa quale attività ha dovuto sospendere. Il collega che riceve tutte le richieste di chiarimento conosce la dipendenza che si è creata. Sono informazioni già presenti nell’esperienza delle persone, che possono rimanere escluse dalla valutazione complessiva se registriamo soltanto l’esito dell’intervento.

La possibilità di discutere di una fragilità dipende anche dai rapporti di lavoro. Se segnalare una vulnerabilità può far pensare che si cerchi una scusa, una persona potrebbe preferire risolvere il problema ancora una volta da sola.

Il servizio riprende a funzionare, ma la difficoltà tecnica rimane ancora poco documentata. In questo contesto, la fiducia è operativamente importante perché permette di individuare un limite prima che porti a un’interruzione più grave. Per dare valore alla fiducia, è essenziale che le segnalazioni vengano esaminate e che vengano prese decisioni.

In questi casi, è fondamentale pianificare il periodo successivo al ripristino.

Occorre ricostruire l’accaduto, esaminare le condizioni tecniche e organizzative e stabilire le azioni da intraprendere, soprattutto se l’impatto o la ricorrenza lo giustificano.

L’analisi può rivelare diversi fattori che hanno contribuito all’incidente, come difetti applicativi, controlli inadeguati, informazioni incomplete o responsabilità poco chiare. Anche se si individua una spiegazione plausibile, è necessario verificarla ulteriormente. Infine, l’attuazione di una modifica richiede un controllo successivo per garantirne l’efficacia.

Naturalmente questo lavoro compete con altre esigenze legittime. Una correzione può avere costi elevati, richiedere un fermo o introdurre rischi ulteriori. Continuare temporaneamente con una soluzione alternativa può essere una scelta ragionevole. Mi interessa però che sia una scelta riconoscibile, con un responsabile, una valutazione delle conseguenze e condizioni definite per riesaminarla. Il rinvio ripetuto per mancanza di tempo lascia questi elementi incerti.

A mio parere, la responsabilità organizzativa si valuta anche dalla possibilità offerta alle persone di portare a termine questo percorso. Chiedere di indagare le cause, senza modificare carichi di lavoro e scadenze, equivale a sovraccaricare chi è già impegnato con gli interventi.

È necessario stabilire le priorità e allocare le risorse in modo adeguato. In caso contrario, la prevenzione continuerà a essere sacrificata sull’altare di ogni nuova emergenza.

Quando valuto la capacità di un gruppo di gestire un servizio, vorrei poter monitorare sia il ripristino ottenuto che le modifiche apportate in seguito.

Il primo ci permette di riprendere le attività, mentre il secondo indica se l’esperienza ha generato un apprendimento applicabile.

Se, dopo diversi mesi, lo stesso problema richiede ancora lo stesso intervento, dovremmo essere in grado di ricostruire le decisioni che ci hanno portato a mantenerlo.

  1. Nelson P. Repenning e John D. Sterman, “Nobody Ever Gets Credit for Fixing Problems That Never Happened: Creating and Sustaining Process Improvement”, California Management Review, 43(4), 2001, pp. 64–88. Il passaggio nel testo è una traduzione del titolo. DOI: 10.2307/41166101.↩

#intelligenza organizzativa #processi aziendali #project management