LLM e giornalismo: test ed esperimenti

Testati i nuovi modelli linguistici “o1-preview” e “o1-mini” di OpenAI in ambito giornalistico. Questi modelli, progettati per affrontare compiti complessi attraverso il “chain-of-thought reasoning” (CoT), offrono risposte più dettagliate e logiche. I modelli si sono dimostrati utili per l’analisi dei dati e la selezione dei titoli, potenzialmente migliorando le prestazioni editoriali con un approccio strutturato

macchina da scrivere che esplode

Tempo di lettura:

3 minuti


In un articolo su Medium, Nick Hagar, ricercatore della Northern University, ha effettuato alcuni test sui i nuovi modelli linguistici “o1-preview” e “o1-mini” di OpenAI in contesti specificamente giornalistici, come l’analisi dei dati e la selezione dei titoli.

Per valutare l’efficacia relativa dei modelli o1, l’autore ha testato anche GPT-4o, GPT-4o-mini e Llama3.1–7b, quest’ultimo per valutare le prestazioni di un modello più piccolo che potesse essere eseguito localmente.

I modelli “o1” sono sviluppati per risolvere compiti complessi attraverso un approccio di ragionamento a tappe, noto come chain-of-thought reasoning (CoT). Rispetto ai modelli standard come GPT-4o, questi modelli pianificano un percorso logico prima di rispondere, rendendoli adatti a compiti che richiedono più passaggi, come programmazione e analisi dei dati.

In sostanza il modello elabora e mostra una “catena” di passaggi intermedi, simile al modo in cui un essere umano spiegherebbe il proprio ragionamento. Di seguito alcuni semplici esempi per comprendere questo meccanismo.

Esempi di risposte CoT

  1. Problema di Matematica:
    • Prompt: “Se ci sono 24 caramelle e ogni amico riceve 4 caramelle, quanti amici posso servire? Per favore, risolvi passo per passo.”
    • Risposta CoT: “Prima, consideriamo quante caramelle ha ciascun amico: 4. Ora, dividiamo 24 caramelle per 4 per ottenere il numero di amici. Risultato: 6 amici.”
  2. Analisi Giornalistica:
    • Prompt: “Analizza l’impatto delle emissioni di CO₂ sul cambiamento climatico, spiegando in fasi come contribuisce all’effetto serra.”
    • Risposta CoT: “1. Le emissioni di CO₂ aumentano l’effetto serra. 2. L’effetto serra intrappola il calore solare nell’atmosfera. 3. Questo riscaldamento aumenta le temperature globali e causa scioglimento dei ghiacci.”
  3. Scelta Editoriale per Titoli:
    • Prompt: “Valuta quale di questi titoli attira più lettori e spiega il motivo, passo dopo passo.”
    • Risposta CoT: “1. Leggibilità: il primo titolo è più corto, quindi più attraente. 2. Interesse: il secondo titolo evidenzia una ‘scoperta’, che potrebbe suscitare curiosità. 3. Conclusione: il secondo titolo è preferibile per un maggiore coinvolgimento.”

Uso del CoT per il Giornalismo

Il CoT permette di affrontare compiti complessi, come la verifica delle fonti o l’interpretazione di dati, suddividendoli in fasi logiche. Questo approccio può offrire ai giornalisti un supporto dettagliato per l’analisi approfondita e la spiegazione di concetti articolati in modo comprensibile.

Ritornando all’articolo ed ai test effettuati da Hagar, nel contesto dell’analisi dei dati, i modelli o1 hanno mostrato il potenziale del chain-of-thought prompting (CoT) perché, nonostante non superassero costantemente GPT-4o, riuscivano a eseguire compiti di elaborazione dati end-to-end, ovvero erano in grado di gestire l’intero processo di trattamento e analisi dei dati, dalla raccolta iniziale fino all’interpretazione finale dei risultati.

Attraverso CoT, i modelli o1 sono stati guidati passo per passo nella pulizia, analisi e visualizzazione dei dati, come nel caso di una mappa termica degli incidenti per distretto di New York. Questo processo a tappe facilita la gestione di compiti complessi in cui è necessario un ragionamento strutturato e metodico.

Il CoT permette quindi ai modelli di IA di affrontare in modo ordinato attività articolate come l’analisi di dati economici o demografici, anche se i modelli o1 non sempre hanno superato le prestazioni di GPT-4o.

Altro test effettuato, che riguarda direttamente l’ambito giornalistico, è stato sulla selezione dei titoli. L’analisi dei modelli nella scelta dei titoli vincenti per test A/B (confronto tra più titoli per identificare il più efficace) ha rivelato alcune difficoltà.

Mentre GPT-4o si è dimostrato più accurato nei test, il CoT ha migliorato le prestazioni di o1-preview per la scelta di titoli, evidenziando che questo tipo di prompting è una strategia versatile per compiti editoriali che richiedono un’attenta analisi delle preferenze del pubblico.

Ovvero, al momento è necessaria l’introduzione delle informazioni e dell’expertise umano per raggiungere risultati accettabili. Ma è chiaro che si tratta di una fase di transizione; laddove i modelli acquisiranno più informazioni, raggiungeranno percentuali di accuratezza previsionale maggiore.

Alcune immagini,traduzioni e sintesi possono essere stati realizzati con ausilio di strumenti di intelligenza artificiale.

I contenuti sono sottoposti a revisione e controllo editoriale umano