Il modello guida su 12 dei 18 benchmark, con un prezzo che ridisegna il confronto.

Un prezzo d’ingresso a 2 dollari per milione di token in input e 10 dollari per milione in output non si giudica con le classifiche: si giudica con il costo per automazione completata. È questo il dato che sposta davvero i budget, soprattutto per chi deve motivare ogni allocazione davanti a un cliente o a un direttore finanziario. Lo scorso 30 settembre Google ha annunciato il lancio di Gemini 4 Argon, il nuovo modello di frontiera distribuito attraverso il Fairwind Program a un gruppo ristretto di difensori informatici fidati. Ma il numero che interessa a chi pianifica automazione non è il modello in sé: è il prezzo. Con input in cache scontato del 95% sul prezzo dell’input, Argon entra in un territorio in cui il costo marginale per task diventa la variabile decisionale, non il punteggio sul benchmark.

Dodici primi posti, due dollari

I numeri sono pubblici e vanno letti insieme. Sui 18 benchmark divulgati da Google, Argon guida in solitaria su 12 e condivide il primo posto su uno, secondo i dati diffusi da Google e riportati da VentureBeat. Su DeepSWE v1.1, che misura la capacità di un modello di gestire attività di ingegneria software di lungo periodo in condizioni reali, stabilisce un nuovo stato dell’arte con il 77,9%. Su AutomationBench, il benchmark di Zapier che misura l’esecuzione end-to-end tra le funzioni aziendali principali, Argon si classifica al primo posto con il 51,3%, secondo i dati citati da Zapier. Su CWE-bench v1, che valuta la capacità di risanare le vulnerabilità di sicurezza, arriva a pari merito al primo posto con il 68%, costruendo sulla performance del modello 3.8 Flash Cyber su CWE-bench v0.

Questo è il dato che ogni responsabile budget vede per primo: dodici primi posti su diciotto benchmark e un prezzo che, almeno in fase introduttiva, ridisegna il confronto. Se il costo per token scende a quel livello, anche un modello che vince su due benchmark in meno può risultare più conveniente per automazione completata. Resta però una domanda aperta: questi numeri valgono per tutti, o solo per chi ha già un accesso privilegiato?

Chi entra prima, chi aspetta

I benchmark sono pubblici, ma l’accesso no. Argon arriva senza guardrail informatici ai difensori fidati e ai team interni di Google, mentre il resto del mercato attende. E il meccanismo è più vincolato di un semplice rollout graduale: il quadro volontario della Casa Bianca prevede che gli sviluppatori forniscano al governo federale accesso ai modelli di frontiera coperti fino a 30 giorni prima del rilascio ad altri partner fidati, e che la selezione di quei partner avvenga in collaborazione con il governo federale stesso. Il contrasto è netto: per i difensori fidati l’accesso è immediato e senza guardrail; per tutti gli altri è mediato da una fila in cui il governo federale entra per primo. Se l’accesso è ristretto, il prezzo introduttivo dice molto sulla strategia di Google, ma poco sul costo reale per chi pianifica campagne oggi.

Il ricalcolo del budget

Con un vincitore sui benchmark ancora confinato a un accesso fidato, il problema per chi gestisce budget diventa: quanto tempo posso permettermi di restare su modelli che vincono meno? La risposta non sta nelle classifiche, sta nel costo per automazione completata e nel ritorno sulla spesa. GPT-6 Astra di OpenAI guida in solitaria su tre benchmark e condivide un primo posto con Argon; Claude Opus 5.5 di Anthropic guida in solitaria su due. Se Argon offre un costo per token inferiore e in molti casi un punteggio superiore, ogni trimestre di attesa si traduce in un costo opportunità misurabile. Questa è una mossa di riaffermazione: Google sta cercando di ristabilire la propria posizione nell’IA di frontiera dopo mesi di pressione da parte di OpenAI e Anthropic.

Per chi pianifica l’automazione, la domanda da porsi non è se Gemini 4 Argon è migliore: è se il prezzo di ingresso basso e l’accesso ristretto cambiano il calcolo del ritorno sulla spesa, e quando conviene entrare. La vera incognita non è il modello ma la risposta dei concorrenti: se OpenAI e Anthropic non adeguano i prezzi, il costo opportunità di non migrare cresce ogni trimestre. Chi gestisce budget seri oggi dovrebbe fare due cose: ricalcolare il costo per task completato sui benchmark citati, e prepararsi a uno switch di budget nel momento in cui l’accesso si allarga oltre i partner fidati. Il prezzo di ingresso è basso, ma la finestra per approfittarne è il vero fattore competitivo.