Imparare a riconoscere il segnale
Dalle immagini radioastronomiche al lavoro organizzativo: quali differenze distinguere per comprendere e decidere
In un'immagine radioastronomica, due regioni luminose separate possono appartenere alla stessa sorgente. La distanza apparente fra le macchie, da sola, non basta a stabilire quanti oggetti stiamo osservando. Queste immagini sono ricostruite a partire da misure delle onde radio provenienti dal cielo, e il loro aspetto dipende dallo strumento, dalla frequenza osservata, dalla sensibilità e dai trattamenti applicati ai dati. Per associare le componenti di una sorgente e individuare la galassia alla quale appartengono occorre interpretarne la disposizione, ricorrendo anche a osservazioni nell'infrarosso.
Il progetto Radio Galaxy Zoo ha coinvolto una comunità di partecipanti in questo lavoro, raccogliendone i giudizi e valutandone l'accordo per costruire un catalogo. (Wong et al., 2025) Riconoscere ciò che compare nell'immagine richiede, dunque, una conoscenza delle condizioni che l'hanno prodotta.
Leggendo uno studio di Erica Lastufka e colleghi dell'Università di Ginevra, mi sono soffermato su una questione che riguarda anche il mio lavoro sui processi e sui sistemi digitali: quali differenze deve saper distinguere uno strumento perché le sue risposte siano utili? (Lastufka et al., 2026)
Gli autori hanno studiato sistemi di apprendimento automatico capaci di elaborare immagini radioastronomiche e hanno verificato quanto la procedura di addestramento influisse sulla successiva classificazione delle sorgenti. Il loro esperimento mi ha offerto l'occasione per tornare sull'idea del radiotelescopio organizzativo che ho sviluppato nei miei scritti.
Il passaggio fra i due ambiti richiede cautela: la classificazione delle immagini astronomiche fornisce risultati sul compito studiato. La riflessione sul governo del lavoro che ne ricavo è mia e va sostenuta con argomenti e verifiche propri.
Conviene chiarire anzitutto che cosa sia, in questo caso, un modello. È un insieme di operazioni matematiche, eseguite da un programma, che trasforma i valori dell'immagine in una sequenza di numeri. Questa sequenza, chiamata «rappresentazione», può essere usata da un altro componente del sistema per assegnare l'immagine a una categoria.
Durante l'addestramento vengono modificati i parametri, ossia i valori numerici che regolano le operazioni del modello. I parametri appartengono al meccanismo di elaborazione; la rappresentazione è il risultato che quel meccanismo produce per ciascuna immagine. La distinzione serve a capire il problema affrontato dai ricercatori: ottenere rappresentazioni utili con un numero relativamente contenuto di parametri.
Per addestrare un sistema a classificare immagini si possono fornire esempi accompagnati dalla categoria corretta: questa immagine appartiene al tipo A, quest'altra al tipo B. La categoria associata all'esempio viene chiamata «etichetta». Preparare una raccolta di questo genere richiede un lavoro di classificazione, che in ambito scientifico può essere oneroso.
Gli autori hanno perciò sperimentato una prima fase nella quale il modello ha elaborato immagini senza utilizzare categorie già assegnate. In questa fase, detta «preaddestramento», la procedura ha sfruttato versioni trasformate della stessa immagine per costruire rappresentazioni coerenti fra loro.
È questo il significato dell'apprendimento «autosupervisionato»: il criterio di confronto viene ricavato dai dati stessi secondo regole stabilite dai ricercatori. Le categorie sono state utilizzate nelle prove successive, per insegnare al sistema a classificare le sorgenti e per valutarne le risposte.
La scelta aveva una ragione pratica. Un modello già addestrato su grandi raccolte di immagini può essere adattato a un compito scientifico, ma il suo impiego richiede risorse di calcolo e memoria. Gli autori hanno verificato se l'addestramento diretto su immagini radioastronomiche consentisse di ottenere risultati comparabili con modelli dotati di meno parametri.
Per il confronto principale hanno usato ViT-Tiny, un'architettura, cioè una struttura di calcolo, con circa 5,7 milioni di parametri. Hanno confrontato tre metodi di apprendimento, SimCLR, BYOL e LeJEPA, applicati alla stessa architettura. Hanno inoltre provato LeJEPA con EfficientNet-B0, un'architettura diversa con circa 5,2 milioni di parametri.
Fra i termini di confronto hanno incluso EUPE-ViT-Small, con circa ventidue milioni di parametri, già addestrato attraverso procedure più generali. Il numero dei parametri permette di confrontare le dimensioni dei modelli, mentre i costi effettivi dipendono anche dalla loro struttura e dalle condizioni d'impiego.
Per il preaddestramento i ricercatori hanno usato ventimila immagini del campione RGZ20k, ricavate da osservazioni del Very Large Array, un sistema di antenne per la radioastronomia. Si trattava di immagini già ricostruite e sottoposte a trattamenti preliminari: fra questi, l'azzeramento dei pixel con valori inferiori a una soglia destinata a ridurre il rumore. Molte sorgenti del campione risultavano inoltre «non risolte», espressione che indica l'impossibilità di distinguerne la struttura interna nell'immagine disponibile.
Questi particolari contano perché delimitano ciò da cui il modello ha potuto imparare. La preparazione dei dati aveva già conservato alcune informazioni e ne aveva attenuate altre, prima che cominciasse l'addestramento.
LeJEPA, il metodo proposto da Randall Balestriero e Yann LeCun, combina due esigenze. (Balestriero e LeCun, 2025) La prima è ottenere rappresentazioni coerenti da versioni trasformate della stessa immagine. La seconda è impedire che tale coerenza venga raggiunta producendo sempre la medesima sequenza di valori, qualunque sia l'immagine ricevuta.

Un archivista che assegnasse a ogni documento la stessa voce di catalogo sarebbe impeccabilmente uniforme e del tutto inutile per la ricerca. Nel linguaggio tecnico, un esito analogo prende il nome di «collasso delle rappresentazioni». LeJEPA impiega un vincolo statistico, denominato SIGReg, che regola la distribuzione delle rappresentazioni per contrastare questo esito. Evitare il collasso consente di conservare differenze fra le immagini. Occorrono poi prove successive per stabilire quali siano utili alla classificazione.
Nell'esperimento radioastronomico, per ogni immagine gli autori hanno generato due ritagli più ampi e otto più circoscritti, chiamati rispettivamente viste globali e locali.
Hanno applicato anche sfocature, variazioni di colore e ribaltamenti orizzontali, precisando che queste trasformazioni non erano necessariamente le più adatte ai dati utilizzati. Il particolare mi sembra rilevante: chiedere rappresentazioni simili di immagini trasformate equivale a stabilire che certe variazioni debbano incidere poco sul risultato.
Un ritaglio può lasciare riconoscibile la struttura utile oppure escluderne una parte decisiva. L'adeguatezza della trasformazione dipende quindi da ciò che si vuole riconoscere. Anche in assenza di categorie fornite durante il preaddestramento, le scelte dei ricercatori hanno orientato il comportamento del modello.
Gli autori hanno valutato i risultati su tre raccolte di immagini già classificate, RGZ, FIRST e MiraBest, mediante due prove distinte. Nella prima hanno mantenuto invariati i parametri del modello e hanno addestrato soltanto un classificatore lineare, un componente che usa combinazioni dei valori della rappresentazione per assegnare una categoria.
Hanno così verificato quanto fossero già utilizzabili le rappresentazioni ottenute. Nella seconda hanno adattato anche i parametri del modello, usando esempi accompagnati dalla categoria corretta.
Questa procedura, chiamata fine-tuning completo, ha misurato le prestazioni dopo un ulteriore apprendimento. La distinzione è sostanziale: un sistema può diventare efficace grazie all'adattamento successivo pur partendo da rappresentazioni meno utili quando il modello rimane invariato.

Per confrontare le risposte, gli autori hanno usato il macro-F1, un indicatore compreso fra zero e uno, dove valori più alti corrispondono a risultati migliori. Il punteggio combina due aspetti: quanto sono affidabili le assegnazioni a una categoria e quanti degli esempi che appartengono a quella categoria vengono riconosciuti. Il calcolo attribuisce lo stesso peso alle diverse classi, evitando che quelle più numerose prevalgano nel punteggio complessivo.
Dopo l'adattamento completo, LeJEPA con ViT-Tiny ha ottenuto 0,72 su RGZ, 0,77 su FIRST e 0,96 su MiraBest. Il modello di confronto EUPE-ViT-Small ha ottenuto, rispettivamente, 0,71, 0,74 e 0,93. Si tratta di punteggi di classificazione: 0,96 non equivale automaticamente al 96 per cento di immagini classificate correttamente.
Gli autori hanno ripetuto le prove con tre diverse impostazioni della casualità del calcolo e hanno riportato la variazione dei risultati. Questi dati richiedono prudenza nell'interpretare gli scarti fra i modelli come superiorità statisticamente accertate. (Lastufka et al., tabella 3)
La prova con il modello invariato ha restituito un quadro diverso. Su MiraBest, il classificatore lineare basato sulle rappresentazioni di LeJEPA ViT-Tiny ha ottenuto 0,84, mentre quello basato su EUPE-ViT-Small ha raggiunto 0,92. Anche EfficientNet-B0, addestrato con LeJEPA, ha ottenuto in questa prova un risultato elevato, pari a 0,93. Leggo questi numeri come un invito a precisare sempre le condizioni di un confronto.
L'efficacia dopo l'adattamento e l'utilità delle rappresentazioni prima di quell'adattamento sono proprietà differenti. Il risultato sostiene una possibilità circoscritta: per i compiti esaminati, un addestramento su dati pertinenti e con un metodo adeguato ha permesso di raggiungere buone prestazioni con meno parametri del modello di confronto.
Anche l'attribuzione del vantaggio a una causa precisa richiede attenzione. Nel confronto fra SimCLR, BYOL e LeJEPA gli autori hanno usato la stessa architettura, ma hanno variato il numero delle versioni generate per ciascuna immagine e alcune impostazioni dell'addestramento. A mio giudizio, per attribuire l'intero vantaggio al solo criterio con cui il modello apprende occorrerebbero ulteriori esperimenti capaci di isolare questi fattori.
Le raccolte radioastronomiche avevano inoltre origini e trattamenti in parte comuni, e FIRST comprendeva immagini presenti anche in MiraBest. Le tre prove hanno quindi esplorato condizioni meno eterogenee di quanto il semplice numero delle raccolte possa suggerire. La sovrapposizione fra raccolte di valutazione, di per sé, non dimostra che immagini usate per addestrare un classificatore siano ricomparse fra quelle impiegate per verificarlo.
I ricercatori hanno esaminato anche quanto differissero, nel loro insieme, le rappresentazioni ottenute dalle diverse raccolte. Se immagini provenienti da raccolte affini producono rappresentazioni con distribuzioni simili, il modello potrebbe aver attenuato differenze legate alla provenienza dei dati.
Gli autori hanno interpretato in questa direzione parte dei risultati di LeJEPA. La somiglianza richiede però un controllo ulteriore: rappresentazioni che hanno perso troppe informazioni possono assomigliarsi proprio perché distinguono poco. Nel preprint è stato segnalato un collasso parziale per EUPE-ViT-Tiny, il modello di confronto con circa sei milioni di parametri. Ritengo quindi che la vicinanza statistica fra le rappresentazioni, da sola, sia insufficiente a stabilire che il modello abbia mantenuto tutte le proprietà fisiche desiderate. L'utilità su osservazioni ottenute con strumenti, frequenze e condizioni differenti richiede verifiche ulteriori.

Da questa lettura ricavo una considerazione più generale. Per riconoscere qualcosa occorre poter trascurare alcune variazioni: un sistema che reagisse a ogni cambiamento come se avesse davanti un oggetto diverso sarebbe poco utile. Occorre però verificare che, nel trascurarle, renda distinguibili le differenze necessarie al compito.
La buona classificazione di esempi appartenenti a categorie note documenta una capacità precisa. Non prova, da sola, la capacità di riconoscere una categoria assente dagli esempi, un fenomeno raro o un cambiamento nelle condizioni di osservazione. Il problema che mi interessa è rendere esplicito il rapporto fra ciò che il sistema permette di distinguere e ciò che gli è stato insegnato a considerare equivalente.
Nel lavoro organizzativo, questo rapporto riguarda chi deve spiegare un ritardo, valutare una richiesta sopravvenuta o decidere come impiegare il tempo delle persone. In Cartografie delle zone d'ombra ho chiamato «radiotelescopio organizzativo» uno strumento capace di rendere osservabili fenomeni che le registrazioni ordinarie lasciano nascosti. (Bonasia, 2026, cap. 10)
Nei saggi sui flussi di lavoro ho sviluppato cinque criteri: individuare il segnale utile, distinguerlo dal rumore, adattare lo strumento al contesto, scegliere il grado di dettaglio necessario e rendere interpretabili i dati. (Bonasia, saggi sui workflow) Lo studio radioastronomico mi porta ora a precisare il primo criterio: chi progetta lo strumento deve poter spiegare quali differenze intende conservare e quali conseguenze comporta rinunciare alle altre.
Nel libro ho raccontato un caso professionale in cui la distinzione fra lavoro pianificato e modifiche richieste durante l'esecuzione ha reso riconoscibile una componente del carico di lavoro prima confusa con le altre. Riprendo quel caso per il meccanismo che permette di osservare.
Quando attività di origine diversa ricevono la stessa categoria, il sistema può sommarle correttamente e tuttavia impedire di rispondere alla domanda per la quale la loro origine è decisiva. Il totale conserva il proprio valore contabile. Per spiegare uno scostamento dal piano, discutere le richieste sopravvenute o attribuire responsabilità servono distinzioni ulteriori.
Consideriamo un esempio ipotetico. Un gruppo registra ogni intervento sul software sotto la voce «attività completata». Alcuni interventi realizzano funzionalità concordate, altri correggono difetti, altri ancora rispondono a modifiche richieste dopo l'avvio. Il rapporto mensile può sommare ore e attività concluse senza un solo errore aritmetico.
Da quei totali, però, il responsabile del progetto non può stabilire quanto lavoro aggiuntivo sia derivato da nuove richieste e quanto dalla necessità di rifare parti già eseguite. Il conto torna, mentre la spiegazione del conto rimane incerta. La registrazione ha trattato come equivalenti eventi che richiederebbero decisioni diverse.

Un modello automatico addestrato soltanto su quei dati aggregati incontra lo stesso limite informativo. Può formulare ipotesi utilizzando altri indizi, quando siano disponibili, ma tali ipotesi richiedono riscontri indipendenti. Una risposta plausibile non ricostituisce la documentazione dell'origine degli interventi. Aumentare il numero dei parametri non restituisce la traccia di una richiesta che nessuno ha registrato.
Per questo, quando considero l'adozione di un sistema di analisi, ritengo necessario esaminare anzitutto quali informazioni siano state raccolte, che cosa significhino le categorie utilizzate e quali documenti consentano di controllare le conclusioni.
Questo ragionamento mi induce a precisare anche l'espressione «rumore operativo» impiegata nei miei testi precedenti. Avevo raccolto sotto quella formula attese, sincronizzazioni e adattamenti necessari a far procedere il lavoro. Occorre distinguere il costo di queste attività dal valore delle informazioni che se ne possono ricavare.
Un'attesa può essere un tempo da ridurre e, contemporaneamente, una traccia essenziale per comprendere dove il processo si interrompe. Un adattamento può consumare risorse e rivelare un'incompatibilità fra la procedura e le condizioni effettive di esecuzione. Eliminare l'attesa e cancellarne la registrazione produrrebbero conseguenze molto diverse.
Per chi deve ricostruire le cause di un ritardo, le attese possono costituire il segnale principale. Per chi deve verificare che una consegna sia avvenuta, può bastare una sintesi, purché siano consultabili i passaggi che la giustificano. Chiamare qualcosa «rumore» senza specificare la domanda rischia dunque di attribuire all'evento una qualità che dipende dall'uso dei dati.
Propongo di precisare in questo senso la metafora del radiotelescopio organizzativo: per ogni distinzione conservata, aggregata o esclusa, dovrebbe essere riconoscibile la decisione alla quale quella scelta serve. Si potrebbe così valutarne l'adeguatezza e rivederla quando cambia il problema.
L'analogia con la radioastronomia incontra qui un limite ulteriore. Una galassia non cambia comportamento in risposta al punteggio assegnato da un classificatore. Le persone possono invece adattare le proprie azioni a ciò che viene registrato e valutato.
Se il numero delle attività concluse diventasse il criterio prevalente per giudicare il rendimento, potrebbe risultare conveniente suddividere il lavoro in unità più piccole, aumentando il numero delle chiusure senza un corrispondente aumento del lavoro svolto. È un'ipotesi da verificare nel contesto, che richiama una responsabilità precisa: chi sceglie gli indicatori deve considerarne anche i possibili effetti sui comportamenti.
Per questa ragione, ritengo che una classificazione debba essere utile a chi decide, comprensibile a chi registra il lavoro e verificabile da chi viene valutato. Se lo stato «in attesa» comprende una decisione del cliente, una dipendenza tecnica e la mancanza di personale disponibile, la sua durata documenta il tempo trascorso senza chiarirne la causa.
Distinguere i casi può migliorare l'analisi, a condizione che le persone dispongano di criteri applicabili con sufficiente accordo. Una classificazione molto dettagliata, interpretata in modo diverso da ciascun operatore, aggiunge incertezza proprio dove promette precisione.
Per distinguere una modifica sopravvenuta dalla correzione di un difetto servono un riferimento a quanto era stato concordato e una traccia della richiesta successiva. Per interpretare un'attesa occorrono almeno un evento iniziale, una condizione che ne determini la conclusione e un criterio per registrarne la ragione. I casi dubbi devono poter essere indicati come tali. Costringere ogni episodio entro una categoria certa nasconde l'incertezza della classificazione e la trasferisce nelle conclusioni, dove diventa più difficile riconoscerla.
La proposta può essere messa alla prova. Prenderei un campione di attività per le quali siano disponibili richieste, decisioni e cronologia, ne ricostruirei l'origine e confronterei la ricostruzione con ciò che il rapporto consente di distinguere.
Chiederei poi a persone diverse di classificare gli stessi casi, esaminando i disaccordi per capire quali definizioni siano ambigue o quali informazioni manchino. Su casi successivi verificherei se le distinzioni introdotte aiutino davvero a spiegare gli scostamenti. Il beneficio andrebbe valutato insieme al tempo necessario per registrare i dati, agli errori di compilazione e alle lacune rimaste. È una procedura che propongo per verificare l'utilità dello strumento, la cui efficacia deve essere dimostrata sul campo.
La verifica deve poter dare esito negativo. Se le categorie vengono applicate in modo incoerente o non sostengono decisioni meglio fondate, la loro maggiore articolazione non costituisce un progresso. Se funzionano soltanto nel gruppo che le ha definite, occorre accertare che cosa ne consenta l'uso altrove. E se il rapporto appare più leggibile perché i casi difficili sono stati esclusi, bisogna riconoscere il prezzo di quella chiarezza. Chi governa un progetto ha bisogno di conoscere anche le informazioni mancanti o incerte, perché da esse dipende l'affidabilità delle decisioni.
Una sintesi utile deve infine consentire di risalire ai documenti e agli eventi dai quali è stata ricavata. Si possono aggregare molte attività conservando il collegamento con richieste, versioni e decisioni che ne permettono la ricostruzione. Questo consente di formulare una domanda nuova senza dover assumere che le categorie scelte in precedenza siano ancora sufficienti.
La conservazione richiede criteri pertinenti e sostenibili: interessa mantenere le informazioni necessarie a controllare le conclusioni e a riesaminare le classificazioni, entro i limiti di riservatezza e di accesso propri del contesto.
Torno così al risultato da cui sono partito. Nelle condizioni esaminate, gli autori hanno ottenuto buone prestazioni con modelli dotati di meno parametri del riferimento principale, attraverso un addestramento su dati pertinenti e una scelta adeguata del metodo.
La conseguenza che ne traggo per il mio ambito di lavoro riguarda il modo in cui si valuta uno strumento: il grado di dettaglio, la quantità dei dati e la capacità di calcolo acquistano valore in rapporto alle distinzioni che rendono possibili. Prima di affidare a un sistema la spiegazione di un ritardo, voglio poter risalire dal numero agli eventi registrati, alle categorie applicate e alle informazioni escluse. Un indicatore può dirmi quanto tempo è trascorso. Per capire perché, devo poter consultare la storia che quel numero riassume.

Riferimenti
Wong et al., 2025: O. Ivy Wong e altri, Radio Galaxy Zoo data release 1: 100185 radio source classifications from the FIRST and ATLAS surveys, «Monthly Notices of the Royal Astronomical Society», 536, 4, 2025, pp. 3488–3506, DOI: 10.1093/mnras/stae2790. Versione degli autori su arXiv. Il catalogo DR1, il campione RGZ20k e la raccolta di valutazione chiamata RGZ nello studio successivo sono oggetti distinti.
Lastufka et al., 2026: Erica Lastufka, Mariia Drozdova, Vitaliy Kinakh, Taras Holotyak, Miroslava Dessuages-Zavadsky, Daniel Schaerer e Svyatoslav Voloshynovskiy, Learning Radio Astronomical Representations with LeJEPA and Very Small Models, arXiv:2608.30594v1, 31 agosto 2026. Dati e preparazione: § 2; modelli e procedure: § 3 e appendice A.2; distribuzioni delle rappresentazioni: § 4; classificazione: § 5 e tabella 3.
Balestriero e LeCun, 2025: Randall Balestriero e Yann LeCun, LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics, arXiv:2511.08544v3, 2025. SIGReg significa Sketched Isotropic Gaussian Regularization.
Lastufka et al., tabella 3: Lastufka e altri, cit., tabella 3. Dopo fine-tuning completo, i valori riportati per LeJEPA ViT-Tiny sono RGZ 0,72 ± 0,007; FIRST 0,77 ± 0,001; MiraBest 0,96 ± 0,01. Per EUPE-ViT-Small: RGZ 0,71 ± 0,0004; FIRST 0,74 ± 0,03; MiraBest 0,93 ± 0,0001. Con modello fisso e classificatore lineare, su MiraBest: LeJEPA ViT-Tiny 0,84 ± 0,005; EUPE-ViT-Small 0,92 ± 0,01; LeJEPA EfficientNet-B0 0,93 ± 0,007. Gli autori hanno indicato le quantità dopo il segno ± come variazione fra esecuzioni con tre semi casuali. Queste quantità non vengono qui reinterpretate come intervalli di confidenza né come test di significatività. Il macro-F1 è la media dei punteggi F1 delle singole classi, ciascuno calcolato come media armonica fra precisione e richiamo. Non coincide con la percentuale complessiva di immagini classificate correttamente.
Bonasia, 2026, cap. 10: Calogero Bonasia, Cartografie delle zone d'ombra. Segnale, rumore e sapere tacito nelle organizzazioni, Delos Digital, 2026, ISBN 9788825437331, cap. 10, «Il radiotelescopio organizzativo».
Bonasia, saggi sui workflow: Calogero Bonasia, Vedere l'invisibile: progettare workflow come radiotelescopi organizzativi, «Stultifera Navis»; si vedano anche Strumenti di percezione e strumenti di controllo nella governance dei progetti e la seconda parte.