Pseudonymizing Log Data in Cribl Detect with the LogTotal Sanitizer Pack

Pseudonymizing Log Data in Cribl Detect with the LogTotal Sanitizer Pack

SOC Prime Team
SOC Prime Team linkedin icon Segui

Riepilogo

Cribl Detect, rilasciato il 29 settembre 2026, è un SIEM che funziona sulla piattaforma dati di Cribl. I dati che memorizza e cerca vengono ingeriti tramite i Cribl Stream Routes e Pipelines, quindi un passaggio di sanificazione in quelle Pipelines determina a quali dati possono accedere analisti, triage assistite da IA, notifiche di avviso e dataset conservati.

The Cribl LogTotal Sanitizer è un Cribl Pack open-source (questo progetto non è affiliato a Cribl o SOC Prime) costruito sul motore di sanificazione di LogTotal di SOC Prime. Pseudonimizza i dati di log in formato testo libero in-stream. Rileva undici categorie di valori sensibili e ne sostituisce ciascuna con un token HMAC con etichetta di tipo, ad esempio <USER:…> o <IP:…>. I token sono deterministici, quindi eventi che fanno riferimento allo stesso utente, host o indirizzo possono ancora essere correlati dopo che il valore originale è stato rimosso.

  • Credenziali, dati di pagamento, dati sanitari e identificatori personali vengono rimossi prima che i dati siano memorizzati. Questo riduce l’impatto di una violazione e l’ambito di conformità del SIEM.
  • Le rilevazioni basate sulla correlazione continuano a funzionare sui valori tokenizzati.
  • Il Pack è con licenza MIT e funziona sulla capacità Worker esistente, senza alcuna tariffa di licenza per GB.

Contatta le Vendite

Dove la sanificazione si inserisce nel percorso dati di Detect

Detect utilizza il modello standard di Cribl di Sources, Routes, Pipelines e Destinations. Le rilevazioni in-stream, la ricerca federata, l’investigazione assistita da IA e l’instradamento degli avvisi operano sui dati che Stream scrive nei dataset di Cribl Lake o Cribl Search (Panoramica di SOC Prime). I dati che Detect interroga localmente tramite la ricerca federata, come un bucket S3 esistente, non passano attraverso una Pipeline e devono essere sanitizzati quando vengono scritti.

Un SIEM espone il contenuto degli eventi a più consumatori rispetto a una tipica pipeline di log: analisti di primo livello, partner MSSP, agenti IA, notifiche Slack e PagerDuty e conservazione a lungo termine. Rimuovere i valori sensibili una volta, a monte di tutti loro, è più semplice da gestire e verificare rispetto all’applicazione di controlli di accesso su ciascun consumatore.

Origine: LogTotal di SOC Prime

Il motore di sanificazione nel Pack è stato sviluppato da SOC Prime. SOC Prime ha rilasciato LogTotal come anteprima pubblica gratuita il 26 agosto 2026 (annuncio). LogTotal sanitizza i file di log localmente nel browser prima che qualsiasi cosa venga caricata. Gli eventi sanitizzati vengono quindi correlati con il contenuto di rilevamento di SOC Prime: circa un milione di regole di rilevamento, un dataset di 13.000 etichette, regole Sigma di ordine superiore e correlazione AI agente. LogTotal non conserva i log caricati.

SOC Prime ha pubblicato il componente di sanificazione separatamente come libreria open-source @socprime/logtotal-sanitizer sotto la licenza Apache-2.0. Il Cribl Pack è un progetto di comunità di M3NIX che avvolge questa libreria.

Le decisioni di progettazione descritte di seguito seguono la logica di SOC Prime per LogTotal, che identifica tre modalità comuni di errore nella redazione dei log:

  • Il mascheramento statico sostituisce ogni indirizzo IP o nome utente con lo stesso segnaposto. Dieci accessi falliti appaiono quindi identici e un singolo account compromesso non può più essere distinto da un attacco di spray di password contro dieci account.
  • La semplice ricerca e sostituzione manca dei valori in JSON nidificati o codifiche inusuali, e redige eccessivamente valori che appaiono solo sensibili, come numeri di versione formati come indirizzi IP o UUID utilizzati come ID messaggi.
  • Gli hash non chiaviati possono essere invertiti da attacchi dizionario, e hash uguali non salati da organizzazioni diverse possono collegare falsamente incidenti non correlati.

I token chiaviati e etichettati risolvono tutti e tre i problemi.

Come funziona il Pack

Il Pack (cc-stream-logtotal-sanitizer) implementa una funzione personalizzata Cribl. Per impostazione predefinita, la funzione applica tutti i rilevatori integrati a _raw, sostituisce ogni corrispondenza con un token e imposta __logtotal_sanitized: true sugli eventi che modifica. _time e tutti gli altri campi rimangono invariati.

I rilevatori vengono valutati in questo ordine di priorità:

  1. Segreti: bearer tokens, JWT, chiavi API, blocchi PEM e token di provider cloud
  2. Cookie di sessione
  3. Dati di pagamento, validati con checksum Luhn e mod-97
  4. Identificativi governativi
  5. Identificatori sanitari e codici simili a ICD
  6. Numeri di telefono
  7. Indirizzi IPv4, IPv6 e MAC
  8. Nomi host e FQDN
  9. Nomi utenti e indirizzi email
  10. Geolocalizzazione
  11. Percorsi di directory domestiche

Per input JSON, i valori sotto nomi di chiavi sensibili conosciuti vengono sostituiti in base al nome della chiave. Il resto dell’evento viene comunque elaborato dai rilevatori regex.

Un token è l’HMAC-SHA-256 dell’ID della regola e del valore originale, troncato a 16 caratteri esadecimali. La stessa chiave, regola e valore producono sempre lo stesso token. In modalità pseudo, il token include un’etichetta di tipo. In modalità di mascheramento, usata per segreti e dati di pagamento, il token ha la forma neutra <R:…>. Esempio, con valori dei token accorciati:

prima: l’utente alice@corp.example ha fallito l’accesso da 10.20.1.7 a db-prod-01.corp.example

dopo: utente <USER:3f9a…> ha fallito l’accesso da <IP:b81c…> a <HOST:0d4e…>

Le regole personalizzate sono definite come un array JSON nella configurazione della Funzione. Ogni regola specifica un ID, un’espressione regolare, una modalità e un prefisso di token. I numeri di ticket interni o dei dipendenti, ad esempio, possono essere mappati sui token <TICKET:…>.

Distribuzione

Il Pack è installato con il workflow standard di Pack di Cribl nel Worker Group che invia dati a Detect. I file di rilascio, i requisiti e le istruzioni di installazione si trovano nel repository GitHub del progetto. In sintesi, il Pack viene importato con funzioni personalizzate abilitate, una chiave HMAC casuale viene memorizzata come uno Scret di Worker Group, e l’output viene verificato confrontandolo con il campione di anteprima fornito. Il Pack viene quindi impostato come la Pipeline di un Route che fornisce i dati ai dataset di Detect, con un filtro che seleziona le fonti contenenti dati sensibili.

Tre dettagli di implementazione richiedono attenzione:

  • Il Pack riscrive un unico campo stringa di primo livello, _raw per impostazione predefinita. I campi estratti in precedenza nella Pipeline mantengono i loro valori originali, quindi il Pack deve funzionare prima del parsing, o i campi devono essere ri-estratti dal _raw sanificato.
  • Tutti i Worker che devono produrre token corrispondenti devono utilizzare la stessa chiave, versione del Pack e configurazione delle regole. La rotazione della chiave modifica ogni token, quindi la rotazione dovrebbe essere programmata tenendo conto dei periodi di conservazione del dataset.
  • Detect è disponibile solo su Cribl.Cloud. Eseguire il Pack su un Worker Group gestito dal cliente (ibrido) pseudonimizza i dati prima che lascino la rete del cliente. Storicamente, Cribl.Cloud ha circoscritto le funzioni personalizzate e la scripting ai Worker ibridi (blog di Cribl), quindi il supporto dovrebbe essere confermato prima di affidarsi ai Worker gestiti da Cribl.

In questo layout, i valori non modificati esistono solo all’interno della rete del cliente. Le rilevazioni e l’arricchimento che necessitano dei valori originali vengono eseguiti prima del Pack, e tutto ciò che viene scritto alla destinazione contiene token.

Caratteristiche distintive

La principale differenza tecnica rispetto alle opzioni native di Cribl è la pseudonimizzazione chiaviata. I valori originali vengono rimossi, ma i riferimenti alla stessa entità rimangono collegabili tra eventi.

I token chiaviati non sono vulnerabili agli attacchi dizionario che funzionano contro gli hash semplici. Un SHA-256 non chiaviato di un indirizzo IPv4 o un nome utente può essere invertito enumerando il piccolo spazio di input. Un HMAC token non può essere calcolato senza la chiave segreta. L’etichetta di tipo in ogni token (<HOST:…>, <USER:…>) informa comunque gli analisti e gli strumenti di triage basati su LLM sul tipo di entità cui si riferisce un evento, in modo che le timeline rimangano leggibili.

Undici famiglie di rilevatori funzionano senza configurazione aggiuntiva. La validazione dei checksum riduce i falsi positivi, come stringhe di cifre casuali che vengono abbinate come numeri di carta.

La re-identificazione non richiede diritti di decrittazione di massa. Chiunque possegga la chiave può calcolare il token per un indicatore noto, come un nome account sospetto, e cercarlo.

Poiché il motore è la libreria LogTotal di SOC Prime, è disponibile anche come applicazione web LogTotal, un pacchetto CLI e Node.js, incluso per ambienti air-gapped. Con la stessa chiave e configurazione delle regole, un estratto di log preparato per un ticket del fornitore o un incarico di risposta a un incidente può essere processato in modo coerente con i dati del SIEM. Il codice è open source, non c’è alcuna tariffa per GB, e il Pack include le sue dipendenze.

Limitazioni e considerazioni operative

L’impatto operativo maggiore è sul contenuto di rilevamento che dipende dai valori originali.

  • Gli indirizzi IP, i domini e i nomi utente tokenizzati non corrispondono ai feed IOC, ai database GeoIP, alle regole basate su CIDR o alle ricerche di asset. Mitigazioni: eseguire rilevamenti e arricchimenti in-stream prima del Pack, disabilitare le regole ips e hosts sul Route interessato, oppure inviare una copia a fedeltà completa a un archivio limitato.
  • La libreria sottostante supporta una whitelist ‘neverRedact’, ma le impostazioni documentate del Pack non la espongono.
  • Ogni evento viene valutato rispetto a un ampio set di espressioni regolari. La modalità aggressiva aumenta sia i costi CPU sia i falsi positivi, e il dimensionamento dei Worker dovrebbe tener conto di questo.
  • I token non possono essere decrittati. La re-identificazione è possibile solo ricomputando il token per un valore noto.

Conclusione

Per le implementazioni che inviano dati di sicurezza a Cribl Detect, il LogTotal Sanitizer Pack fornisce pseudonimizzazione in-pipeline a basso costo. I valori sensibili vengono rimossi prima che arrivino agli analisti, agli agenti IA e alla conservazione a lungo termine, mentre le relazioni tra entità utilizzate dalle regole di correlazione vengono conservate. Un’implementazione pratica inizia con una singola fonte ad alto rischio. Validare l’output con il campione di anteprima, confermare che le rilevazioni rilevanti siano ancora attive, quindi estendere il Pack ad ulteriori Routes.

Unisciti alla piattaforma Detection as Code di SOC Prime per migliorare la visibilità sulle minacce più rilevanti per il tuo business. Per aiutarti a iniziare e aumentare immediatamente il valore, prenota ora un incontro con gli esperti di SOC Prime.