Google Research riduce la latenza del fan-out da 50 secondi a meno di uno.

Secondo uno studio di Seer Interactive, Gemini 3 genera in media 10,7 query fan-out per prompt, con un minimo di 3 e un massimo di 28 da un singolo prompt, e ne genererebbe circa cinque volte quelle di ChatGPT. Non è un’anomalia tecnica: è la voce di costo che sta ridisegnando il costo per clic (CPC), la metrica che ogni performance manager osserva quando valuta l’efficienza di una campagna. La scorsa settimana, in un post pubblicato da Google Research, è emerso un framework chiamato Retrieve-for-Train che cambia i termini del problema.

Il costo invisibile del prompt

Prima ancora di parlare di modelli di diffusione, bisogna capire cosa significa per un budget. Il query fan-out è il meccanismo per cui un prompt viene espanso in più query di ricerca interne: non una sola chiamata, ma un ventaglio di richieste che devono essere generate, instradate e pagate in termini di compute. Secondo quanto dichiarato da Robby Stein e riportato da Search Engine Journal, le esperienze di ricerca basate sull’AI, incluse le query fan-out, servono oggi circa 1,5 miliardi di utenti al mese.

Numeri così spiegano perché la media di 10,7 query fan-out per prompt non è una curiosità da paper. Quando il minimo è 3 e il massimo arriva a 28 da un singolo prompt, il costo per interazione non è lineare: può moltiplicarsi per dieci o per venti a seconda della complessità della richiesta. La domanda che resta aperta, però, è un’altra: cosa succede quando queste query devono essere generate in tempo reale, mentre un utente aspetta una risposta?

Un secondo o cinquanta: la fisica del fan-out

La risposta sta nei numeri della latenza. Nell’approccio autoregressivo, la latenza del fan-out si espande linearmente: con grandi batch di contesto può arrivare a quasi 50 secondi. Non è un dettaglio da laboratorio: cinquanta secondi sono un abbandono di sessione, non una query. Retrieve-for-Train-Diffusion, invece, resta tra meno di un secondo e pochi secondi.

Il salto tecnico è descritto nel post di Google Research: un modello di diffusione leggero, con 53,9 milioni di parametri, impara a mappare direttamente l’embedding della query in un insieme completo di embedding target in un singolo passaggio non autoregressivo. In pratica, salta i token di ragionamento testuali tipici delle catene di pensiero.

Il guadagno dichiarato è uno speedup da 12 a 20 volte rispetto agli approcci autoregressivi. E non è solo velocità: R4T migliora anche la qualità del retrieval rispetto a baseline solide su benchmark su larga scala di moda e musica, riducendo la latenza di fan-out di un ordine di grandezza, come documentato nell’articolo su arXiv. Con la latenza che crolla, il collo di bottiglia si sposta dal tempo al margine: quanto vale davvero questo guadagno?

34% di margine, 1,06 centesimi: chi paga la velocità?

Se la latenza non è più il limite, il margine diventa il campo di battaglia. La business unit Services di Google ha un margine operativo del 34,15%, secondo l’analisi pubblicata da Semianalysis. È un margine robusto, ma ogni query fan-out aggiuntiva erode la base dei costi: il costo per una singola query di ricerca Google è di 1,06 centesimi, a fronte di 1,61 centesimi di ricavi.

Per chi pianifica campagne, il punto non è il singolo numero, ma l’effetto moltiplicatore. Se un prompt genera 10,7 query fan-out medie e il costo unitario della query resta ancorato a pochi centesimi, il costo reale di una sessione di ricerca AI non può essere scambiato per un costo fisso. La velocità del modello di diffusione non elimina il costo: lo sposta dalla latenza al margine, e quindi alla sostenibilità del traffico che compriamo.

Chi gestisce budget pubblicitari non può più trattare le query AI come un costo inerte. Il passaggio dal fan-out autoregressivo alla diffusione in Retrieve-for-Train non è un problema da ingegneri: è una revisione dell’allocazione. Alla prossima pianificazione, la domanda non è più quale sia il CPC medio, ma quanto costa davvero ogni query generata prima che l’annuncio venga servito.