Il 40% dei thread citati dai chatbot ha natura promozionale, minando la neutralità delle risposte generate
Reddit è diventato, silenziosamente, il più grande dataset per le risposte dell’intelligenza artificiale generativa. Secondo i dati compilati per The Verge da Semrush, a maggio il social network è stato il dominio più citato in assoluto da ChatGPT, Perplexity, Gemini e dalla AI Mode di Google — più di qualsiasi testata giornalistica, archivio accademico e persino di Wikipedia. Il problema, ed è un problema che chiunque si occupi di ottimizzazione delle conversioni dovrebbe esaminare con metodo, è che circa il 40% di quelle discussioni ha natura commerciale. Parliamo di consigli su creme solari in r/SkincareAddiction, raccomandazioni su integratori in r/loseit, playlist sponsorizzate in r/indieheads. L’IA che promette risposte “imparziali” sta attingendo a piene mani da contenuti generati in contesti dove l’intento promozionale è la norma, non l’eccezione.
Jared Nelson, responsabile delle partnership di Reddit, ha confermato la stima a The Verge senza giri di parole. Lo stesso Reddit ha annunciato lo scorso luglio di bloccare 23 milioni di visualizzazioni di spam al giorno grazie a nuovi strumenti di rilevamento basati su IA, intercettando 25.000 post e commenti spam ogni ventiquattr’ore. Sono numeri che raccontano uno sforzo reale, ma anche la portata del fenomeno: se devi filtrare milioni di visualizzazioni, significa che il segnale commerciale indesiderato è già dentro il sistema, diluito tra i thread che i modelli linguistici trattano come fonti affidabili. Per uno specialista CRO, la domanda non è se Reddit stia pulendo casa — la domanda è se questa pulizia basti a rendere affidabili i dati che le IA estraggono dalla piattaforma per formulare risposte su cui basiamo decisioni di acquisto.
Il crollo delle citazioni: quando ChatGPT cerca di resistere alla manipolazione
Già nel maggio 2024, Reddit aveva annunciato la partnership ufficiale con OpenAI che lo avrebbe reso il dominio più citato nelle risposte dei chatbot. L’azienda si presentava come il baluardo dell’autenticità contro lo spam, forte di quell’aura da “voce della gente” che nessun publisher tradizionale poteva eguagliare. Proprio mentre questa narrazione si consolidava, però, i dati iniziavano a raccontare un’evoluzione diversa.
A settembre 2025, secondo un’analisi condotta da Semrush, le citazioni di Reddit da parte di ChatGPT sono diminuite drasticamente. Non si è trattato di un aggiustamento marginale: è stato un ripensamento strutturale di come il modello valuta le fonti. Il responsabile della visibilità organica e AI di Semrush ha spiegato che il calo rappresenta un tentativo deliberato di evitare l’over-citation di determinati siti, riducendo i pregiudizi verso di essi durante la generazione delle risposte. In altre parole, ChatGPT è diventato più resiliente ai tentativi di manipolazione proprio perché aveva iniziato a riconoscere in Reddit un pattern di dipendenza eccessiva, potenzialmente distorsivo.
Per chi testa funnel e misura tassi di conversione, questo è un segnale metodologico importante. Se il modello stesso sta implementando filtri per riequilibrare le proprie fonti, significa che il dato in ingresso era percepito come insufficientemente neutrale. La metrica da osservare non è più solo il volume delle citazioni, ma la loro stabilità nel tempo e la varianza tra settori. Un dominio che oggi domina le SERP con AI Overviews può domani essere declassato da un aggiornamento del modello, e senza preavviso. Nell’analisi di Semrush su oltre 600.000 parole chiave in 10 settori, gli AI Overview sono cresciuti in media del 71% nelle SERP con intento commerciale. La direzione è chiara: le risposte generate dall’IA stanno occupando sempre più spazio nelle query dove si decide un acquisto. Se le fonti a monte sono instabili, lo sono anche le basi su cui costruiamo test A/B e analisi pre-acquisto.
E adesso? Cosa resta da testare sulla fiducia nelle risposte AI
La dipendenza da Reddit si è rivelata un’arma a doppio taglio. Google, dal canto suo, mantiene una posizione rassicurante: Jennifer Kutz ha dichiarato che l’azienda ha mantenuto i risultati di ricerca liberi da spam al 99% per anni, estendendo queste protezioni anche alle funzionalità AI. Ma la domanda che uno specialista CRO deve porsi è diversa da quella di un comunicatore aziendale. Non è se il sistema abbia filtri anti-spam — li ha, e funzionano su parametri noti. La domanda è come si misura l’affidabilità di una risposta generata quando il modello stesso sta ricalibrando, in tempo reale e con logiche non trasparenti, il peso che assegna alle proprie fonti.
Se anche le IA iniziano a diffidare di Reddit, su quali basi costruiranno le loro risposte per le query d’acquisto? Torneranno a privilegiare publisher tradizionali, con il loro carico di contenuti editoriali sponsorizzati e recensioni con link affiliati? O si sposteranno su fonti meno battute ma non necessariamente più verificabili? Il punto non è dichiarare Reddit inaffidabile — sarebbe una semplificazione scorretta — ma riconoscere che ogni corpus di training ha un bias, e che il bias di Reddit è particolarmente insidioso perché si maschera da conversazione spontanea mentre è per il 40% orientato commercialmente. Testare la conversione oggi significa includere nei propri disegni sperimentali una variabile nuova: la volatilità delle fonti da cui l’IA attinge per descrivere il prodotto che stiamo vendendo.
Forse il vero test di conversione non è più nel ranking, ma nel capire quali fonti sopravvivranno ai filtri anti-manipolazione delle IA. Un modello può affinare i propri criteri, ridurre l’over-citation, diventare più resiliente — ma non può eliminare il problema a monte: ogni tentativo di separare il segnale autentico dal rumore commerciale è, per definizione, un esercizio probabilistico. E Reddit, oggi, è il caso di studio perfetto per chi vuole smettere di dare per scontata l’integrità dei dati e iniziare a testarla sul serio.




