
Spese, chat ed email passate al setaccio in sei fasi, e la tradizione di storici che contavano le parole prima dei computer.
Tre cose fatte con Claude: un resoconto di spese, un’analisi dei propri comportamenti fatta attraverso le chat di WhatsApp, un piano editoriale ricavato da anni di email. E poi molte cose sulla storiografia dell’analisi dei testi.
1. Le spese
Divido qualunque lavoro sui dati in sei fasi: chiedi, raccogli, pulisci, analizza, condividi, agisci. È l’ossatura classica dell’analisi, e l’ho chiamata A.P.P.A.S.A. per ricordarmela. Vale su seicento scontrini come su una campagna da centomila euro: cambia quanto dura ciascuna fase.
Chiedi. La mia domanda era: quanto costa davvero mantenere la struttura che affitto su Airbnb. Sembra una domanda sola e sono due, perché «quanto costa» può voler dire quanto esce dal conto ogni mese oppure quanto pesa ciascuna voce sul totale. La prima chiede una somma, la seconda una ripartizione, e si preparano in modo diverso.
Raccogli. L’estratto conto della carta, che copre le uscite tracciate. Resta fuori quello che non passa di lì, cioè i contanti e le spese anticipate da altri: è la differenza fra un totale e una stima, e conviene saperlo prima di cominciare invece di scoprirlo alla fine.
Pulisci. Qui c’è tutto da ricostruire, perché le descrizioni sono quelle che scrive la banca: sigle, ragioni sociali che non corrispondono all’insegna, incassi intestati a persone fisiche. «Supermercato Idea Dist» è il Conad sotto casa, e nessuno strumento può saperlo. Lo dico una volta e lo metto per iscritto in un elenco di corrispondenze, così vale anche per i mesi successivi invece di andare corretto ogni volta.
Poi il raggruppamento, che va fatto adesso e non dopo aver visto un grafico. Seicento spese vanno ridotte a una ventina di gruppi, e quei gruppi funzionano come una lente. Tutto ciò che finisce insieme diventa indistinguibile, e resta così finché non si rifà il lavoro. La regola che uso è mettere insieme le spese su cui prenderei la stessa decisione. Se creo un gruppo «manutenzione» ci finiscono dentro l’idraulico d’urgenza e il cambio programmato della biancheria, e su quel totale non posso fare niente, perché somma una cosa che subisco e una che scelgo.
Analizza. Non scrivo codice e non serve saperlo fare: carico i file e chiedo in italiano. Quello che conviene sapere è che Claude non guarda quei numeri per sommarli a mente, ma scrive un piccolo programma e lo esegue. Non è un dettaglio tecnico: decide che tipo di errori si possono correggere. Un modello che «guarda» quaranta importi prima o poi produce una cifra plausibile e falsa, e plausibile è il problema. Un programma può sbagliare anche lui, però l’errore sta nelle istruzioni, che si rileggono, e il conto rifatto dà sempre lo stesso risultato.
Quindi: le domande di significato le gestisce la conversazione, i numeri devono venire da un calcolo. Il controllo che uso è chiedere lo stesso totale per una strada diversa. Se sommo per categoria e per mese devo ottenere lo stesso numero; se non torna, si sono perse delle righe.
Condividi. Le pagine che preparo le chiamo a volte «racconti» e non dashboard. Qui ce n’è una di esempio, con numeri inventati: conviene aprirla, perché il resto si capisce guardandola.
Hanno un titolo che afferma qualcosa e non un’etichetta neutra, e sotto il titolo una frase che dice la conclusione a parole. I numeri vengono dopo. È l’ordine opposto a quello di un report classico.
Il resto è quello che una pagina fa e un elenco no. Tiene più risposte sotto gli occhi insieme, e l’occhio le collega da solo. Incorpora il confronto, perché la media è una riga tratteggiata e non bisogna calcolare niente per vedere chi sta sopra. Mette l’avvertenza accanto al numero invece che in fondo: nell’esempio un riquadro rosso spiega che marzo sembra il mese più caro solo perché ci sono cadute dentro due bollette bimestrali, e che quindi non va usato come base per un budget. Una nota metodologica in coda non la legge nessuno, una nota accanto alla barra si legge per forza.
E soprattutto apre una conversazione invece di chiuderla. L’esempio finisce con tre domande a chi legge, e la seconda chiede se qualcosa è finito nel gruppo sbagliato. Chi la riceve non se ne va con un verdetto ma con uno strumento.
Due cautele. Una pagina mandata gira senza controllo, quindi dentro ci va solo quello che le persone coinvolte accettano di metterci, e i movimenti bancari altrui si usano dopo averglielo detto. E le anomalie saltano all’occhio rispetto ai gruppi che ho scelto io, per cui chi legge deve poter contestare anche quelli.
Agisci. È la fase che si salta più spesso: si guarda, si dice «interessante», e finisce lì. Qui è servita ad accorgermi che una spesa che credevo occasionale tornava tutti i mesi, e a scoprire che due voci che tenevo insieme andavano decise separatamente. Poi c’è un esito che vale sempre: alla fine si sa quale dato sarebbe servito e non c’era, e da domani lo si registra. È il motivo per cui le sei fasi sono un cerchio.
2. Le proprie chat come autoanalisi
Il secondo caso è il più divertente. Chiunque di noi scrive su WhatsApp ha creato senza volerlo un archivio molto ampio sul proprio modo di stare con le persone, scritto in situazioni vere e non davanti a un questionario. La memoria non regge il confronto, perché il ricordo di come ci si comporta si riscrive in base a come si sta adesso.
Esportare è facile: su WhatsApp basta aprire la conversazione, menu in alto a destra, «Altro», «Esporta chat», senza file multimediali. Arriva un file di testo, e anni di conversazione stanno in pochi megabyte. Conviene esportarne cinque o sei, con persone diverse, perché su una chat sola non si distingue quello che sono io da quello che è quel rapporto.
Alcune domande che possiamo fare.
Come mi pongo con questa persona. Quante volte le chiedo come sta senza che me lo chieda prima lei, e quante volte torno su una cosa che mi aveva raccontato la settimana prima. Sono due misure semplici e dicono parecchio: chi fa domande sta in un modo, chi risponde e basta sta in un altro. Vale la pena guardarle su più rapporti insieme, perché quasi sempre si scopre di essere premurosi con qualcuno e distratti con qualcun altro, e di non essersene mai accorti.
Come cambio a seconda di chi ho davanti. La lunghezza dei messaggi, il livello di formalità, quanto scrivo di me. Le differenze sono più istruttive delle costanti, perché mostrano con chi mi sento a mio agio.
Che cosa faccio quando qualcosa non va. Scuse, giustificazioni non richieste, condizionali. Confrontati fra interlocutori dicono due cose diverse: se mi scuso dieci volte tanto con una persona il dato riguarda quel rapporto, se con tutti riguarda me.
Che cosa non dico. Gli argomenti evitati si riconoscono dalla struttura più che dalle parole: una domanda che resta senza risposta e nessuno ripete, un tema che sparisce dopo una certa data. È la categoria più difficile, perché nessun conteggio elenca ciò che manca: bisogna arrivarci con l’ipotesi in mano e poi andare a verificare.
Sul linguaggio conviene rubare i metodi a chi conta le parole da cinquant’anni, e il principale è controintuitivo: non accorpare le forme. «Vediamoci», «ci vediamo?» e «ci si potrebbe vedere» sono tre mosse diverse, e ridurle tutte a «vedersi» cancella l’unica cosa interessante.
Una trappola può essere quella di scambiare un periodo per un carattere. Un tratto che salta fuori dai numeri sembra stabile perché è scritto nero su bianco. Poi si guardano le altre chat degli stessi mesi e a volte c’è ovunque in quel periodo e in nessun altro: non era un modo di essere, era come stavo in quei mesi. Il conteggio è giusto in entrambi i casi, quello che cambia è la finestra, e la finestra la scelgo io.
Alcuni avvertimenti. Metà di quei messaggi li ha scritti un’altra persona che non ne sa niente, quindi ovviamente l’analisi non va pubblicata o simili. Una chat conserva solo la parte scritta di un rapporto. Chi telefona sembra assente, chi organizza le cose di persona sparisce, e chi scrive molto occupa tutta la scena. Spesso per dimostrare qualcosa su qualcun altro funziona malissimo: in un archivio il rischio è di trovare la prova di quello che si vuole, quindi solo l’onestà intellettuale, ben allenata, può salvarci.
3. Le email di lavoro come base per un piano editoriale
Racconto l’impostazione e non i dettagli.
Da dove sono partita. Per preparare un piano editoriale sono partita da un archivio di email. Con un’agenzia con cui collaboro condivido dei clienti e in quei lavori sono in copia, quindi avevo già anni di scambi in casella. Averli lì non vuol dire poterci fare qualunque cosa, quindi è meglio parlarne prima.
Che cosa ho chiesto all’archivio. Non «riassumi le email», che avrebbe restituito un riassunto e basta. La domanda era: quali dubbi tornano da un cliente all’altro.
Come ci si arriva senza caricare niente. Qui servono i connettori, che sono la cosa più utile e meno conosciuta di questi strumenti. Un connettore collega Claude a un servizio che uso già: la posta, il calendario, i file, Google Search Console, Semrush. Si attiva dalle impostazioni, si autorizza con la stessa schermata di consenso che compare quando si collega un’app a un account, e si revoca quando si vuole. Per un lavoro come questo basta il permesso di lettura.
Da quel momento non carico file: Claude interroga il servizio. Cerca i messaggi che rispondono a certi criteri, apre un thread, legge un allegato. Ogni richiesta compare nella conversazione mentre viene fatta, quindi vedo sia che cosa ha chiesto sia che cosa gli è tornato indietro, e niente resta copiato altrove.
Che cosa ottengo, e che cosa mi manca. Ottengo un elenco di dubbi ricorrenti, con gli esempi da cui vengono. Quello che manca è il denominatore. Con un file esportato so quante righe ci sono in tutto, quindi quaranta occorrenze vogliono dire quaranta su tremila; interrogando una casella scopro solo che una cosa c’è. Ho la presenza, la frequenza no. E la fonte ha una seconda distorsione: lì dentro ci sono solo clienti che l’agenzia ce l’hanno già, quindi è un campione di persone convinte, cosa da ricordare quando si scrive per chi ancora non lo è.
Come colmo la mancanza. Con due strumenti che rispondono a domande diverse.
La Google Search Console è lo strumento gratuito di Google che, per un sito che si possiede, mostra su quali ricerche il sito è già comparso, in che posizione e quante volte è stato cliccato. Dice come sta andando quel sito, oggi, su un certo tema.
Semrush stima invece quante volte al mese una parola viene cercata in generale sui motori di ricerca, da chiunque, e quanto è difficile arrivare in alto su quella ricerca. Dice quanto è grande il tema, indipendentemente da chi ci lavora.
Messi in fila i tre segnali dicono cose diverse. Il dubbio nelle email dice che il problema esiste. Il volume di ricerca dice quante persone lo cercano. La Search Console dice se su quel tema il sito ha già una posizione da difendere oppure parte da zero. Un’idea nata dalla posta passa da tutti e tre prima di finire in un piano.
Che cosa succede quando si incrociano. Alcune idee reggono. Altre hanno volume su ricerche dove il sito non può competere. Altre sono nicchie sottili, dove il volume non c’è ancora ma non c’è nemmeno concorrenza, e vanno segnate come tali invece che gonfiate. Qualche volta il confronto ribalta la conclusione invece di rifinirla, ed è un buon segno: una verifica che può solo confermare tanto vale saltarla.
La parte più interessante è dove i segnali non coincidono. Ci sono dubbi che i clienti scrivono spessissimo e che nessuno cerca, perché non sanno come si chiama la cosa che li preoccupa. Il vocabolario di chi ha il problema e quello di chi lo cerca sono due cose diverse, e una parte del lavoro editoriale consiste nel costruire il ponte fra i due.
Il meccanismo comune
Il retroscena: contare le parole non è un’invenzione recente
Ci sono passata prima di occuparmi di SEO. La mia tesi, discussa tanti anni fa a Firenze con il compianto storico inglese Paul Ginsborg, parlava di testamenti, contratti di nozze e interni domestici nella Brindisi dell’Ottocento: gli atti notarili di vent’anni, tra il 1851 e il 1871, fra cui duecentonovantuno testamenti, in una città di ottomila abitanti.
Indagavo la stratificazione sociale, e il problema era che una delle caselle non voleva dire sempre la stessa cosa.
Negli atti la professione c’era, e per avvocati, medici, notai e farmacisti compariva sempre: quei mestieri si dichiaravano volentieri. I lavori umili invece si nascondevano, perché il lavoro manuale era quasi una vergogna, e chi lo faceva si presentava al notaio come «proprietario». Così quella parola finiva per dire due cose diverse. A volte era una condizione giuridica e voleva dire soltanto possedere qualcosa, una barca, una casetta, un pezzo di terra; a volte indicava uno stile di vita e voleva dire vivere di rendita. Negli atti si trovano infatti «villici-proprietari» e «marinari proprietari», che nei registri dello stato civile risultavano semplicemente contadini o marinai.
Il guaio era quando «proprietario» compariva da solo, senza altro accanto: a rigore avrebbe dovuto indicare un rentier, e a volte lo indicava davvero, ma spesso copriva invece un lavoratore manuale. È un caso che chiunque lavori con i dati riconosce: un campo compilato da tutti, che però significa una cosa per una parte delle persone e un’altra per altre, e non c’è modo di distinguerle guardando solo quel campo.
La soluzione è stata smettere di fidarmi di quel campo da solo e affiancargli un secondo segnale, che nello stesso documento c’era già e mi appassionava tantissimo: uno specifico titolo davanti al nome.
Il titolo era «Don», e «Donna» per sua moglie e le sue figlie, e la sua storia spiega perché fosse così utile.
Fino al primo Settecento spettava soltanto al ramo principale delle famiglie del patriziato cittadino, e dietro aveva un ordinamento preciso. Poi quell’ordinamento viene smontato: nel 1800 un editto di Ferdinando IV sopprime i sedili patrizi, e nel 1806 la legge napoleonide abolisce la feudalità. Quello è l’anno zero del superamento della struttura cetuale.
Solo che un ordinamento di quel tipo, abbattuto sulla carta, ci mette decenni a sparire davvero, perché la stratificazione sociale viaggia sui tempi lunghi della mentalità e dell’economia. Il titolo quindi resta in uso e nel frattempo si allarga, prima ai nobili viventi e poi al notabilato.
Nel 1851, quando cominciava il mio corpus, eravamo esattamente lì in mezzo: una società che sulla carta i ceti non li aveva più, e che continuava a usare un marcatore nato per segnalarli. Chi lo portava lo portava perché gli altri glielo riconoscevano, e il riconoscimento si giocava su una miscela di fattori: famiglia di origine, istruzione e tenore di vita. La ricchezza del momento contava però meno di quanto si penserebbe. Il cadetto impoverito di una grande famiglia restava «Don», il commerciante arricchito da poco no, semmai lo sarebbero diventati i figli. Chi aveva una laurea lo aveva sempre.
Così avevo spogliato gli atti seguendo quell’appellativo, uno per uno. Per la gran parte delle persone il titolo era stabile: chi lo aveva se lo portava dietro in ogni atto, e insieme a lui lo avevano la moglie e i figli.
Le eccezioni sono state però una scoperta, e la più istruttiva riguardava gli scritturali.
Lo scritturale era chi scriveva per conto d’altri: copiava atti, teneva registri, compilava suppliche, contratti e lettere per chi non sapeva farlo. Non un impiegato con uno stipendio, ma qualcuno che esercitava per conto proprio e veniva pagato a lavoro, un po’ come l’avvocato o il capitano mercantile, con la differenza che quello che vendeva era solo la mano e non il consiglio: il testo lo dettava il cliente, o lo imponeva la formula.
In una città dove leggere e scrivere era abilità rara, questo bastava a renderlo «distinto». Solo che era un mestiere pagato poco e a cottimo, sospeso fra il manuale e l’intellettuale, e molti scritturali erano poverissimi.
Il loro «Don» infatti compare in un atto e sparisce in quello dopo, e spesso non passa alla moglie e ai figli. All’inizio l’ho preso per un difetto dei dati, e invece era il risultato. Il titolo tremava esattamente dove la società non sapeva dove mettere qualcuno: troppo colto per stare con i braccianti, troppo povero per stare con i notabili. Quell’incertezza il notaio la registrava senza volerlo, scrivendo «Don» un giorno sì e uno no.
Dove la posizione sociale era chiara il marcatore teneva; dove era ambigua vacillava, e quel vacillare è la cosa che mi ha insegnato di più.
Con la stessa tesi ho contato anche altre cose, e ci tornerò un’altra volta: i libri che ricorrono negli inventari delle biblioteche brindisine e soprattutto le due case in cui quei libri non ci sono, o il numero di immagini sacre stipate in due stanze a pianterreno, che nella fonte non è scritto e viene fuori solo sommando. Da lì ho imparato una cosa che uso ancora: lo stesso notaio a volte aggrega e a volte elenca uno per uno, quindi l’unità di conteggio cambia da una riga all’altra, com’è per un estratto conto dove la stessa spesa compare ora da sola ora dentro un totale.
C’era poi un problema che quel corpus si portava dentro. I vent’anni stavano a cavallo dell’Unità: fino al 1864 valgono le Leggi civili del Regno delle Due Sicilie, dal 1865 il Codice civile italiano. Due codici, quindi due regole diverse su che cosa un contratto di nozze deve contenere. La serie non è omogenea, e una variazione dopo il 1865 può essere l’effetto della legge nuova invece che un cambiamento nelle famiglie. È il problema di chi confronta i dati di un sito prima e dopo un cambio di tracciamento: a cambiare è stato lo strumento che registra, mentre il mondo è rimasto dov’era.
Il conteggio lo faceva un foglio di calcolo, e la parte lenta era arrivarci: gli atti sono manoscritti, e ogni riga è passata dalla lettura della carta in archivio. Mesi di quello per una tabella che poi si somma in un secondo. È anche il motivo per cui, da allora, quando posso decido in anticipo come registrare le cose.
La tradizione dietro
Contare le parole è un’idea vecchia: le concordanze bibliche nascono nel Duecento, e la prima versione meccanizzata è del 1949, quando IBM finanzia lo spoglio di Tommaso d’Aquino di un gesuita italiano su schede perforate. Da lì si fa cominciare l’informatica umanistica.
Poi arrivano gli storici. Dalla corrente storiografica delle Annales vengono due idee che ancora reggono: che un’epoca può pensare solo ciò per cui ha le parole, e che si possono costruire lunghe serie di documenti e contarle, arrivando fino alle mentalità. Ad esempio lo storico francese Michel Vovelle nel 1973 contava le formule con cui migliaia di provenzali del Settecento dispongono per la propria anima nei testamenti: quando si diradavano, stava datando una scristianizzazione.
Da lì vengono due lezioni. La prima è che la domanda non deve per forza essere quella dell’andamento: la composizione risponde a «di che cosa è fatto», e non è inferiore. L’andamento però gode di un prestigio che non sempre merita, perché assomiglia a un racconto, ha una direzione, si commenta bene. E spesso non siamo noi a chiederlo ma lo strumento, visto che le dashboard si aprono su un grafico temporale.
La seconda è che quei documenti non erano affatto pronti: nessun notaio scriveva pensando a una serie storica, e la regolarità delle formule è un effetto collaterale del mestiere. Si vedono così tre situazioni. L’archivio progettato per la domanda, in cui qualcuno ha deciso in anticipo di annotare una cosa perché sapeva che l’avrebbe contata, è raro. L’archivio regolare per caso, come i testamenti, è fortunato. Il caso normale è il terzo, l’archivio senza nessuna regolarità garantita, dove le formule vanno scoperte prima di contarle. Ed è lì che l’AI cambia di più le cose, perché rende esplorabile in un pomeriggio del materiale che nessuno avrebbe attraversato a mano.
C’è poi chi ha fatto questo di mestiere: dal 1967, a Saint-Cloud, un laboratorio di lessicometria dedicato ai testi politici, con cantieri sulla Rivoluzione francese, sul vocabolario socialista, sui discorsi delle destre. La loro decisione più utile è quella che ho descritto sopra: tenere separate le forme. Nel 1974 le dedicano un intervento intitolato, letteralmente, Perorazione per una non lemmatizzazione.
Al conteggio arrivano infine due obiezioni contrarie fra loro. Da fuori, la microstoria: nel 1979 lo storico italiano Carlo Ginzburg avvicina il metodo dello storico a quello del cacciatore e del medico, che leggono indizi. Il bersaglio però sono le serie che rendono anonimi gli individui: la proposta alternativa resta infatti di attraversare gli archivi, seguendo la traccia del nome proprio da una fonte all’altra. È la critica da tenere in tasca quando un conteggio restituisce una curva troppo pulita, e vale anche su un archivio di messaggi, dove il caso singolo che rompe la media è spesso quello che spiega tutto. Nella pratica le due cose si tengono: la mia tesi conta i «don» su vent’anni e insieme scende dentro singole famiglie. La serie individua la regola, il caso singolo ne mostra il margine.
L’altra obiezione viene da dentro, ed è un’autocritica: vent’anni dopo Jacques Guilhaumou, che di quella scuola era uno dei protagonisti, scrive sugli apporti e i limiti della lessicometria e riconosce che il conteggio riorganizza un corpus ma non mostra, da solo, le strategie di chi quei testi li ha scritti.
Che cosa è diventato più facile
Di tutto il lavoro raccontato qui, la parte che l’AI ha reso quasi istantanea è una sola: il conteggio. Non è poco, perché è quella che a Saint-Cloud richiedeva un laboratorio con decine di persone al lavoro per anni, e che a me, alcuni decenni dopo, ha richiesto tanti mesi chiusa in archivio, passati a trasformare pagine manoscritte in righe di tabella.
Tutto il resto è dov’era. Decidere che cosa vale la pena chiedere, sapere che cosa una fonte non registra, scegliere che cosa conta come unità, riconoscere quando una variazione è nel mondo e quando è solo nello strumento, e alla fine dire che cosa significa. Sono le stesse cose che decideva chi costruiva questi corpora cinquant’anni fa.
Il vantaggio si è quindi spostato. Quando contare costava mesi, era il conteggio a fare la differenza fra chi poteva permettersi una ricerca e chi no. Adesso che costa un pomeriggio, la differenza la fa la capacità di domandare. A volte abbiamo i dati, abbiamo gli strumenti per contare, ma non sappiamo cosa chiedere.
Finché contare costava mesi, il limite era lo strumento: se un’analisi non veniva bene si poteva sempre dare la colpa al tempo che non c’era. Adesso che lo strumento risponde a tutto e in fretta, quel riparo è sparito.
Per approfondire
- Michel Vovelle, Piété baroque et déchristianisation en Provence au XVIIIe siècle, Plon, Paris 1973. → recensione su Persée
- Régine Robin, Histoire et linguistique, Armand Colin, Paris 1973.
- Carlo Ginzburg, «Spie. Radici di un paradigma indiziario», in Crisi della ragione, Einaudi, Torino 1979.
- Jacques Guilhaumou, La langue politique et la Révolution française, Paris 1989. → testo integrale
- Lynn Hunt, La rivoluzione francese. Politica, cultura, classi sociali, il Mulino, Bologna 2007.
- La mia tesi, da cui vengono gli esempi brindisini: Testamenti, contratti di nozze e interni domestici nella Brindisi dell’Ottocento (1851-1871), Università di Firenze, relatore Paul Ginsborg, a.a. 2008/2009.





