Le risposte sbagliate (e fuorvianti) di ChatGPT, Gemini & Co

Secondo un’indagine congiunta di BBC e Unione Europea di Radiodiffusione (EBU), quasi la metà delle risposte generate dagli assistenti di intelligenza artificiale contiene errori o imprecisioni. Lo studio, condotto in 18 Paesi, evidenzia problemi sistemici di accuratezza e reperimento delle fonti.

Mappa del mondo con con paesi coinvolti illuminati

Tempo di lettura:

3 minuti


Oggi, per restare aggiornati sulle notizie, si sceglie quasi sempre di affidarsi agli assistenti di intelligenza artificiale. Strumenti come ChatGPT, Gemini, Copilot o Perplexity stanno diventando per molti la nuova porta d’accesso all’attualità.

Ma quanto sono realmente affidabili?

A questa domanda cerca di rispondere una recente indagine dal titolo “News Integrity in AI Assistants. An international PSM study” condotta congiuntamente dalla BBC e dall’Unione Europea di Radiodiffusione (EBU), che ha analizzato oltre 3.000 risposte fornite da questi modelli IA in 14 lingue e 18 Paesi, tra cui Francia, Germania, Spagna, Italia, Regno Unito, Stati Uniti e Ucraina, coinvolgendo 22 media di servizio pubblico.

I risultati non sono rassicuranti.

Secondo lo studio, il 45% delle risposte generate dai modelli IA analizzati contiene almeno un errore significativo, mentre l’81% presenta qualche tipo di anomalia. Emergono dunque errori diffusi e sistemici, indipendentemente dalla lingua utilizzata o dal modello interrogato.

L’analisi si è concentrata su cinque criteri principali: accuratezza, reperimento delle fonti, distinzione tra fatti e opinioni, editorializzazione e contesto.

Tra questi, il reperimento delle fonti è risultato l’aspetto più critico. Il 31% delle risposte conteneva errori di sourcing, come citazioni fuorvianti, mancanza di fonti dirette o attribuzioni scorrette.

A guidare questa preoccupante statistica è l’assistente IA di Google Gemini, il 72% delle sue risposte mostrava errori significativi di reperimento delle fonti, più del triplo rispetto agli altri (Copilot e Perplexity 15%, ChatGPT 24%).

Figura 1 – Percentuale di risposte AI giudicate contenere problemi, lievi o significativi, nel reperimento delle fonti (sourcing)

Nel report, Gemini risulta spesso privo di link diretti ai contenuti citati o presenta attribuzioni vaghe e non verificabili, come espressioni del tipo “Secondo le fonti di Radio France…” senza indicare collegamenti a fonti reali e verificabili.
Il risultato è una pericolosa “illusione di affidabilità” le risposte appaiono autorevoli anche quando non lo sono.
Gli assistenti IA non rispondono solo a domande ma silenziosamente ridefiniscono il nostro rapporto con la verità e con il gesto stesso del conoscere. Si assiste ad una transizione dal pensiero critico all’assenso automatizzato, che porta alla perdita della profondità della conoscenza facendo diventare l’informazione il riflesso rapido di una verità confezionata altrove.

Oltretutto, accanto ai problemi di sourcing, il report evidenzia criticità nell’accuratezza delle informazioni riportate, che è ciò che più dovrebbe preoccupare il giornalismo.
Perché se l’errore tecnico può essere corretto, l’errore informativo mina la fiducia.
Quando un assistente IA diffonde notizie scorrette o inventate con tono sicuro e linguaggio credibile, non compromette solo la verità dei fatti, ma anche la percezione di affidabilità dell’intero ecosistema informativo.

In un certo senso, l’autorità della forma finisce per sostituire la sostanza della verifica e i dati del report lo confermano: nel documento emerge infatti che il 20% delle risposte totali analizzate conteneva errori di accuratezza delle informazioni riportate significativi.
In questo caso, a differenza del sourcing, tutti gli assistenti hanno mostrato performance simili, con tassi d’errore compresi tra il 18% e il 22%.

Figura 2 – Percentuale di risposte AI con citazioni dirette giudicate contenere problemi, lievi o significativi, di accuratezza delle citazioni

Ad esempio alla domanda “Chi è il Papa?”.
A maggio 2025, ChatGPT, Copilot e Gemini indicavano ancora Papa Francesco come pontefice in carica, ignorando la sua morte avvenuta ad aprile e l’elezione di Papa Leone XIV.
Copilot, in un caso, si è addirittura contraddetto nella stessa risposta, dichiarando Papa Francesco vivo e morto.

Questi errori sono aggravati dalla presentazione sicura e autorevole delle risposte.
Il fenomeno dell’overconfidence cioè la tendenza a rispondere anche quando non si conosce la risposta è evidente: solo lo 0,5% delle oltre 3.100 domande ha ricevuto un rifiuto, rispetto al 3% del precedente studio.
Gli assistenti mimano l’autorità giornalistica, ma senza il rigore giornalistico, creando un pericoloso effetto di fiducia automatica negli utenti meno esperti.

L’agenzia di stampa Reuters ha contattato le principali aziende coinvolte per un commento.

Google ha affermato di “accogliere con favore i feedback degli utenti per migliorare costantemente la piattaforma”.

OpenAI e Microsoft, da parte loro, hanno riconosciuto che il fenomeno delle cosiddette “allucinazioni” — ovvero la generazione di informazioni errate o inventate — rappresenta ancora una sfida aperta.

Perplexity, che ha ottenuto risultati più solidi, sostiene che la propria modalità “Deep Search” raggiunga una precisione del 93,9% in termini di fattualità, benché il report BBC-EBU mostri margini di errore più ampi.

L’analisi sottolinea che l’attuale livello di errore pone un problema concreto di affidabilità, soprattutto se l’uso degli assistenti AI dovesse consolidarsi come canale informativo principale per una parte dell’utenza.

Il report chiede che gli sviluppatori di intelligenza artificiale si assumano la responsabilità dei contenuti generati, evidenziando come i miglioramenti rilevati siano ancora parziali.

Tra le raccomandazioni finali del report:

  • rafforzare la trasparenza dei sistemi di generazione delle risposte;
  • pubblicare regolarmente i risultati delle verifiche di affidabilità, distinti per lingua e area geografica;
  • inserire link diretti alle fonti originali, per garantire tracciabilità e verifica;
  • avviare un dialogo strutturato con le organizzazioni giornalistiche, al fine di definire regole comuni di trasparenza, correttezza e precisione.

Perché in un’epoca in cui chiedere direttamente a un modello di intelligenza artificiale qualsiasi dubbio o curiosità è diventato un gesto quotidiano, la tutela della verità non può essere delegata solo all’algoritmo.

Alcune immagini,traduzioni e sintesi possono essere stati realizzati con ausilio di strumenti di intelligenza artificiale.

I contenuti sono sottoposti a revisione e controllo editoriale umano