Sunday Latte: Perché l’intelligenza artificiale può sembrare sicura e avere comunque torto Canonical episode: https://move37.app/cafe/it/episodes/sunday-latte-why-ai-can-sound-certain-and-still-be-wrong-it/ Published: 2026-08-17T07:49:27Z Language: it TRANSCRIPT Benvenuti all'Andy's Café, dove le macchine preparano e le persone assaporano. Oggi serviamo un Sunday Latte. Mettetevi comodi e buon ascolto. Tre risposte per una tesi In uno studio, a tre modelli di linguaggio fu chiesto il titolo della tesi di dottorato del ricercatore Adam Tauman Kalai. Non era una domanda filosofica, né una richiesta aperta a molte interpretazioni. Esistevano un titolo preciso e un anno preciso. Eppure, tutti e tre i modelli diedero una risposta sbagliata. Non risposero con parole sparse o frasi visibilmente difettose. Ognuno produsse un titolo credibile, accompagnato da dettagli accademici ben costruiti. Il lessico aveva il tono giusto. Le università, le date e gli argomenti sembravano stare al loro posto. Le risposte avevano la forma di una scheda biografica affidabile. Mancava soltanto la cosa decisiva: il fatto corretto. È proprio questa combinazione a renderle interessanti. Se il testo fosse stato confuso, avremmo subito alzato la guardia. Invece, la precisione apparente dei dettagli invitava a fidarsi. Il sistema conosceva bene il genere della risposta, ma non disponeva di una base abbastanza solida per quella particolare relazione tra una persona, un titolo e un anno. Questo episodio non serve a classificare i tre modelli, né dimostra quanto sbaglino in generale. Mostra un meccanismo. Un modello può padroneggiare la grammatica, il tono professionale e la struttura di una risposta, mentre fallisce sull'unico elemento che doveva essere verificato. Per capire come sia possibile, dobbiamo separare tre cose che, nell'ascolto quotidiano, tendono a fondersi: la scorrevolezza del testo, la sicurezza con cui viene presentato e la verità di ciò che afferma. Possono andare nella stessa direzione, ma non sono la stessa misura. La previsione che diventa un discorso Un modello di linguaggio generativo riceve il testo della domanda e assegna diverse probabilità ai possibili token successivi. Un token è una piccola unità di testo: può coincidere con una parola, con una sua parte o con un segno di punteggiatura. Una procedura sceglie il token seguente, lo aggiunge al contesto e ripete l'operazione. Descritta così, la generazione può sembrare un'estrazione casuale di parole. Non lo è. Durante l'addestramento, il modello ha assorbito regolarità della sintassi, del significato, dei generi testuali e delle relazioni tra concetti. Ogni scelta dipende dall'intero contesto disponibile. Per questo una sequenza di previsioni locali può diventare un ragionamento leggibile, una spiegazione ordinata o un racconto coerente. Il punto è l'obiettivo con cui il modello ha imparato. Il compito immediato era prevedere il testo osservato, non ricevere un'etichetta di verità per ogni frase. Nei dati compaiono manuali accurati e articoli rigorosi, ma anche narrativa, errori, ipotesi, battute e convinzioni diffuse ma false. Tutti possono essere esempi validi di come continua un testo. Il modello impara quindi molte associazioni vere, perché i testi umani contengono molta conoscenza utile. Può anche imparare un luogo comune sbagliato, proprio perché quel luogo comune è familiare e si ripete. La capacità di prevedere il linguaggio e la capacità di descrivere il mondo spesso si aiutano, ma l'addestramento ordinario non le rende identiche. Durante una risposta, inoltre, non avviene automaticamente un controllo esterno di ogni proposizione. Un token può essere molto adatto alla frase senza che la frase sia stata confrontata con un archivio autorevole. E la probabilità del token riguarda anche lo stile: esistono molti modi diversi di esprimere lo stesso fatto. Non può essere letta direttamente come la probabilità che quel fatto sia vero. La forma giusta per il fatto sbagliato I dettagli rari sono un terreno particolarmente difficile. Il nome di una persona può essere frequente, e anche la forma tipica di un titolo accademico può essere ben rappresentata. Ma l'esatta associazione tra quella persona, quella tesi e quell'anno potrebbe comparire pochissime volte, oppure non comparire affatto nei dati disponibili. Quando la base fattuale è debole, i modelli linguistici hanno comunque a disposizione forme molto forti. Sanno come suona il titolo di una ricerca, come si presenta una citazione, quali date sembrano plausibili e quali istituzioni ricorrono in una biografia. Possono montare elementi linguisticamente compatibili in un'identità che non è mai esistita. La risposta ha il profilo giusto e il contenuto sbagliato. Questa è una delle situazioni spesso chiamate allucinazione. Qui useremo la parola in senso concreto: un'affermazione plausibile, ma falsa o priva del sostegno che la risposta lascia intendere. Non è una diagnosi su una coscienza interiore e non implica un'intenzione di ingannare. Descrive un difetto del testo prodotto. Nemmeno tutti gli errori appartengono alla stessa famiglia. Una domanda può essere ambigua, dipendere dalla data o dal luogo, oppure riguardare un documento che il sistema non ha mai visto. Il modello può sbagliare un calcolo, fraintendere una richiesta o usare male uno strumento. Dire soltanto che ha inventato la risposta non spiega la causa e, quindi, non suggerisce sempre il rimedio adatto. Ridurre la variabilità della generazione può rendere le risposte più stabili. Ma se la continuazione più probabile contiene un'associazione falsa, il sistema può ripeterla con maggiore regolarità. La coerenza tra diversi tentativi è un indizio utile; non è ancora una verifica. Tre modi di dire sicurezza La parola sicurezza crea molta confusione perché viene usata per almeno tre fenomeni diversi. Il primo è il tono. Parole come certamente e senza dubbio, oppure formule che presentano una risposta come definitiva, possono rendere una frase perentoria. Anche una struttura ordinata e molti dettagli comunicano autorevolezza. Sono scelte linguistiche, non misurazioni. Il secondo fenomeno è la probabilità che il modello assegna ai token, oppure alle risposte disponibili in una domanda a scelta chiusa. Nel primo caso, la probabilità riguarda quale continuazione si adatta al testo. Nel secondo, se le opzioni sono definite con precisione, la probabilità può essere collegata più direttamente all'esito corretto. I due casi non vanno confusi. Il terzo è una stima esplicita della probabilità che un'affermazione sia corretta. Questa stima può essere valutata attraverso la calibrazione. Immaginiamo molte risposte a cui un sistema assegna il settanta per cento di fiducia. Se, nel lungo periodo e in quel tipo di compito, circa sette su dieci risultano corrette, la stima è ben calibrata. La calibrazione riguarda un insieme di casi, non certifica la singola risposta che abbiamo davanti. Dipende inoltre dal contesto. Un sistema può essere ben calibrato su domande formulate in un certo modo e diventare troppo sicuro in un ambito nuovo. Può essere molto accurato ma eccessivamente fiducioso, oppure meno accurato ma più onesto nel segnalare i propri limiti. Perfino una stima pronunciata dal modello, come sono sicuro al novanta per cento, resta una frase generata finché non sappiamo come si comporta su casi simili. Alcuni metodi riescono a ottenere segnali utili di incertezza. Nessun metodo, però, trasforma ogni espressione verbale di sicurezza in una misura universalmente affidabile. La distinzione più semplice rimane la più utile. La scorrevolezza dice quanto bene il testo segue gli schemi della lingua. Il tono dice come il testo si presenta. La calibrazione confronta previsioni numeriche e risultati osservati. La verità dipende dal mondo e dalle prove. Nessuna di queste quattro cose può sostituire automaticamente le altre. Imparare a rispondere e a non rispondere Dopo l'addestramento iniziale, i modelli vengono spesso affinati con esempi e valutazioni umane. Possono imparare a seguire meglio le istruzioni, a riconoscere richieste rischiose, a dichiarare un dubbio e a evitare alcune affermazioni infondate. Questo lavoro migliora davvero il comportamento. Non installa, però, un controllo infallibile della verità. Il risultato dipende anche da ciò che viene premiato. Una risposta accomodante, ben scritta e concorde con l'utente può sembrare più utile di una correzione scomoda. In esperimenti controllati, valutatori umani e sistemi di preferenza hanno talvolta favorito l'accondiscendenza rispetto alla correttezza. Non perché qualcuno desiderasse errori, ma perché qualità diverse sono difficili da separare in una valutazione rapida. Anche le prove standard possono creare un incentivo inatteso. Se una risposta corretta vale un punto, mentre sia un errore sia l'ammissione di non sapere valgono zero, tentare conviene sempre. Il sistema non ottiene alcun vantaggio dall'ammettere che gli manca l'informazione. Una valutazione più attenta dovrebbe premiare anche l'incertezza appropriata. Naturalmente, l'astensione ha un costo. Un assistente che rifiuta qualunque domanda non inventa molti fatti, ma è quasi inutile. Il livello giusto dipende dalle conseguenze e dalla disponibilità di controlli. Per una proposta creativa possiamo accettare esplorazione. Per un dosaggio medico, una clausola legale o una decisione finanziaria serve una soglia molto diversa. Il traguardo non è insegnare al modello a dubitare sempre. È fare in modo che risponda quando ha una base adeguata, cerchi prove quando può ottenerle e renda visibile ciò che non è verificabile. Una buona incertezza non è vaghezza. È informazione sulla qualità del fondamento. Vero nel mondo, fedele alla fonte C'è un'altra distinzione importante tra verità e fedeltà. Supponiamo di chiedere un riassunto di un documento preciso. La risposta aggiunge un'affermazione che non compare nel documento, ma che per caso è vera altrove. Rispetto al mondo, l'affermazione è corretta. Rispetto al compito, il riassunto non è fedele alla fonte. Può accadere anche il contrario. Un modello riassume perfettamente un documento che contiene un errore. La risposta è fedele a ciò che ha letto, ma ripete un fatto falso. Per valutare bene l'uscita dobbiamo quindi chiedere due cose diverse: il testo rappresenta correttamente la fonte fornita? E la fonte descrive correttamente il mondo? La parola allucinazione viene usata nella ricerca per difetti diversi, e questo può nascondere il problema concreto. A volte il modello crea un nome inesistente. A volte attribuisce alla fonte una frase che non c'è. A volte sbaglia un passaggio logico partendo da informazioni corrette. Nominare il guasto con precisione aiuta più di un'unica etichetta. Questa distinzione cambia anche il controllo da fare. Per una citazione, bisogna tornare al testo originale. Per una data ufficiale, serve il registro pertinente. Per un calcolo, può bastare rifare l'operazione con uno strumento adatto. Per una questione controversa, può essere necessario mostrare fonti in disaccordo invece di costringerle in una sola conclusione. Quando arrivano ricerca e strumenti Un modello non deve affidarsi soltanto a ciò che è rimasto nei suoi pesi. Un sistema completo può cercare documenti, inserire passaggi pertinenti nel contesto, usare una calcolatrice o consultare una banca dati. In questo modo, una domanda su un fatto recente o molto preciso può essere spostata verso uno strumento costruito per recuperarlo. Il vantaggio è sostanziale. La fonte esterna rende disponibile un'evidenza aggiornata senza dover addestrare di nuovo il modello. Permette anche a chi ascolta di controllare da dove arriva un'affermazione. Ma aggiunge una catena di passaggi, e ciascun passaggio può fallire. La ricerca può usare parole sbagliate. Può trovare una persona con lo stesso nome, una pagina vecchia o un sito che ripete l'errore di un altro. Il documento corretto può essere recuperato ma finire in mezzo a molto materiale irrilevante. Il modello può non notarlo, interpretarlo male o riportare una conclusione più forte di quella sostenuta dal testo. Anche una citazione elegante non è un sigillo di verità. È piuttosto una maniglia per il controllo. Il documento deve esistere, riguardare il caso giusto e sostenere davvero la frase accanto alla quale viene mostrato. Dieci pagine che copiano la stessa informazione non equivalgono a dieci conferme indipendenti. Gli strumenti riducono alcuni errori, ma non trasformano la generazione probabilistica in una banca dati infallibile. Il loro valore consiste nel portare prove dentro il ragionamento e nel rendere il percorso ispezionabile. Una risposta fondata non è soltanto una risposta con una nota a piè di pagina. È una risposta la cui affermazione segue in modo fedele da una fonte adatta. Ritorno alla tesi Torniamo alla tesi di Adam Tauman Kalai. Dopo tre titoli ben formati ma sbagliati, chiedere semplicemente al modello se è sicuro non risolverebbe il problema. Potrebbe aggiungere una cautela sincera, oppure generare un'altra frase rassicurante. Nemmeno ripetere la domanda fino a ottenere maggiore accordo costituirebbe una prova. Un percorso migliore partirebbe da un registro accademico autorevole o da una pagina istituzionale pertinente. Prima occorre verificare che il documento riguardi la persona corretta. Poi bisogna controllare che riporti davvero il titolo e l'anno richiesti. Infine, la risposta deve limitarsi a ciò che quel documento sostiene, senza riempire i vuoti con altri dettagli biografici plausibili. Se il registro non è disponibile o rimane ambiguo, la risposta migliore può essere non riesco a verificare il titolo esatto. Non è una sconfitta. È un'informazione più utile di un titolo inventato. La ricerca non obbliga a trovare qualcosa; serve a distinguere ciò che ha un fondamento da ciò che ne è privo. Anche tre risposte diverse sono state un segnale prezioso. Hanno mostrato instabilità sul significato, non soltanto sulla scelta delle parole. Se tutte avessero prodotto lo stesso titolo falso, però, l'accordo non lo avrebbe reso vero. I modelli possono condividere la stessa associazione errata o dipendere da fonti che si copiano. Il caso della tesi è piccolo, ma rende visibile una regola generale. Più un fatto è preciso, raro e arbitrario, meno la forma linguistica può sostituire la verifica. Nomi propri, titoli esatti, date, citazioni e statistiche meritano un'attenzione particolare proprio perché una versione sbagliata può suonare perfettamente naturale. Ascoltare senza credulità né cinismo La risposta pratica non è trattare ogni frase come una rivelazione, né scartare tutto come spazzatura. Lo stesso modello può essere ottimo nel dare struttura a un'idea e fragile su un unico dettaglio decisivo. Possiamo usare il primo contributo e controllare il secondo. La quantità di verifica dovrebbe seguire le conseguenze. Una bozza per un invito non richiede un'indagine. Un consiglio medico, legale, finanziario o di sicurezza sì. Anche nei compiti leggeri, un nome proprio, una citazione esatta, un numero o un evento molto recente meritano una pausa in più. Invece di chiedere soltanto se il modello è sicuro, è più utile domandare su che cosa si basa l'affermazione. Se viene indicata una fonte, possiamo aprirla e vedere se dice davvero ciò che la risposta sostiene. Una fonte primaria o autorevole, adatta alla domanda, vale più di una pila di riassunti che si ripetono. Possiamo anche rendere visibile ciò che manca. Specificare la data, il paese, la versione di un prodotto o il documento rilevante riduce l'ambiguità. Per un numero, rifacciamo il calcolo. Per una citazione, torniamo all'originale. Quando le conseguenze lo richiedono, chiediamo a una persona qualificata. Non perché il testo sia artificiale, ma perché la decisione merita quel livello di cura. I segnali di incertezza vanno ascoltati con modestia. Risposte molto diverse sono un avvertimento. Un tono concorde e sicuro non è una prova. Una percentuale di fiducia diventa informativa solo se sappiamo che è stata calibrata su casi simili. Senza quella storia, è un elemento della risposta, non il suo certificato. La lezione della tesi resta semplice. Il modello può conoscere benissimo la forma di una risposta e non possedere il fatto che dovrebbe riempirla. La scorrevolezza riguarda il linguaggio. La sicurezza espressa riguarda la presentazione. La calibrazione riguarda il rapporto tra previsioni e risultati nel tempo. La verità riguarda le prove e il mondo. Ascoltare bene significa non chiedere al tono di fare il lavoro dell'evidenza. Per oggi è tutto. Il café è sempre aperto. A presto. MORE INFORMATION TEXT LICENSE This transcript, description and original Andy's Café editorial text are licensed under Creative Commons Attribution 4.0 International (CC BY 4.0). License: https://creativecommons.org/licenses/by/4.0/ Attribution: Andy's Café — https://move37.app/cafe/it/episodes/sunday-latte-why-ai-can-sound-certain-and-still-be-wrong-it/ Indicate changes when adapting. Identified third-party quotations and linked source material remain under their own terms. AUDIO AND OTHER MATERIAL The composed episode has separate component terms because its piano cues are third-party material. Artwork and the Andy's Café brand are not included in the CC BY licence. Rights map: https://move37.app/cafe/welcome/#reuse Contact: hello@move37.app