Gemini 4 Pro in prova su Arena sotto il nome Gemini 3.8 Flash: cosa sappiamo davvero
Di Daniele Forciniti

Secondo diversi sviluppatori, una versione di prova di Gemini 4 Pro, il prossimo modello di punta di Google, si sta facendo votare in incognito su Arena, la piattaforma dove le persone confrontano due AI alla cieca. Si nasconde dietro l’etichetta gemini-3.8-flash, cioè il nome di un modello che esiste già ed è uscito il 2 settembre. Chi l’ha provato parla di un modello molto veloce e con un ottimo gusto nel design, soprattutto nel 3D. Google però non ha confermato niente: non c’è una data di uscita, non c’è un prezzo e non c’è una scheda tecnica.
Quando esce una notizia così, in rete girano in poche ore numeri, benchmark e date che nessuno ha verificato. In questo articolo metto in ordine le cose: cos’è Arena e perché un modello ci finisce sotto falso nome, cosa è successo giorno per giorno, cosa dicono davvero i tester, cosa è confermato da Google e cosa no, cosa vuol dire quella sigla RSI che si legge ovunque e quando potrebbe uscire il nuovo modello.
Perché questa notizia è importante
Google non pubblica un nuovo modello Pro da febbraio 2026, quando è uscito Gemini 3.1 Pro. Nel frattempo ha fatto uscire un modello Flash dopo l’altro, cioè la fascia veloce ed economica, mentre Anthropic e OpenAI alzavano l’asticella con i loro modelli di punta. Se ti sei perso gli ultimi arrivi, li ho messi a confronto nell’articolo su prezzi e benchmark di Claude Opus 5.5, GPT-6 Sol e Luna.
Un nuovo Pro di Google cambierebbe gli equilibri per tutti quelli che usano l’AI per lavorare: chi scrive codice, chi crea contenuti, chi costruisce siti. E il fatto che venga provato in pubblico, anche se sotto falso nome, di solito vuol dire che il lancio non è lontano. Per questo vale la pena capire bene cosa si sa e cosa no, prima di farsi un’idea.
Cos’è Arena e perché un modello ci finisce sotto falso nome
Arena è una piattaforma pubblica e gratuita che valuta i modelli di intelligenza artificiale con il voto delle persone. Funziona così: scrivi una richiesta, due modelli anonimi rispondono, tu voti la risposta migliore e solo dopo il voto scopri chi erano. Con milioni di voti nasce una classifica. È nata nel 2023 all’Università di Berkeley con il nome Chatbot Arena, nel 2024 è diventata LMArena e da gennaio 2026 si chiama semplicemente Arena.
Le grandi aziende la usano anche per provare i modelli prima del lancio, con nomi di fantasia. Il caso più famoso riguarda proprio Google: il modello di immagini che tutti chiamavano “Nano Banana” era Gemini 2.5 Flash Image, provato su Arena prima dell’annuncio ufficiale, come ricostruisce la pagina Wikipedia di Arena. È un modo per avere il giudizio di persone vere senza che il marchio influenzi il voto.
La novità di questi giorni è il metodo. Invece di un nome inventato, il modello di prova userebbe l’etichetta di un modello che esiste già. Così chi vota non si accorge di niente, a meno che la qualità della risposta non sia troppo alta per quel nome. Ed è esattamente quello che hanno notato i tester.
Una cosa da tenere a mente: Arena misura quanto una risposta piace alle persone, non se è corretta in ogni dettaglio. Negli ultimi anni ci sono state anche critiche sul metodo e sul peso che le aziende possono avere nei test. Resta uno strumento utile, ma un buon voto su Arena non equivale a un buon modello per il tuo lavoro.
Cosa è successo, giorno per giorno
Mettendo in fila i post dei tester e gli articoli delle testate specializzate, la sequenza è questa:
- 14 settembre: un utente che su X si firma Lentils scrive che le prime versioni di prova del nuovo Pro sono comparse internamente da qualche giorno. Il nome in codice sarebbe “argon”. Lo riporta TestingCatalog, un sito che segue proprio questi test.
- 17 settembre: un altro tester pubblica le prime prove, tra cui il sito web di una rivista monografica descritto come pulito e curato.
- 19 settembre: un terzo account dice di aver trovato il modello su Arena sotto un’altra etichetta, gemini-3.7-flash, e mostra un disegno vettoriale di un controller Xbox.
- 23 e 24 settembre: Koray Kavukcuoglu, dirigente di Google DeepMind, parla di Gemini 4 al summit organizzato dalla testata The Information. Questa è l’unica parte ufficiale della storia, e la vediamo più sotto.
- Dal 26 settembre: circolano screenshot con l’etichetta gemini-3.8-flash e lo sviluppatore Pankaj Kumar pubblica su X le sue impressioni sulla nuova versione, quelle che hanno fatto il giro della rete.
Nota bene: sono tutte fonti non ufficiali. Sono persone che provano i modelli ogni giorno e spesso ci prendono, ma non hanno accesso a Google. Il fatto che sia il nuovo Pro di Google è una deduzione fatta dalla qualità delle risposte, non un’informazione confermata.
Attenzione: Gemini 3.8 Flash esiste già
Qui molti articoli fanno confusione, quindi lo dico chiaro. Oggi, quando leggi “Gemini 3.8 Flash”, puoi trovarti davanti a due cose diverse.
La prima è il modello pubblico. Google lo ha presentato il 2 settembre 2026 come il suo modello più intelligente nella fascia veloce, con miglioramenti nella programmazione, nei compiti da agente e nel ragionamento su più passaggi. Lo usi nell’app Gemini con gli abbonamenti AI Pro e Ultra, in AI Mode, in Fogli Google e, per chi sviluppa, in Antigravity, in Google AI Studio e nelle API. Costa 0,75 dollari per milione di token in entrata e 3,75 in uscita fino al 31 dicembre 2026. Dal 1° gennaio 2027 il prezzo raddoppia: 1,50 e 7,50 dollari. I token sono i pezzetti di testo con cui il modello legge e scrive: un milione di token corrisponde più o meno a un libro molto lungo.
Su Arena questo modello pubblico ha debuttato bene: nella classifica di testo era al settimo posto con 1.494 punti, subito davanti a Claude Opus 5, come ha comunicato la stessa Arena su X. Se vuoi vedere come se la cava nei confronti diretti, ho messo i numeri nell’articolo su GPT-6 Astra e Gemini 3.8 Flash.
La seconda è il modello misterioso che risponde con quell’etichetta in alcuni test su Arena e che, secondo i tester, è una versione in prova del nuovo Pro. Se provi Gemini 3.8 Flash nell’app Gemini o in AI Studio, stai usando il modello pubblico, non quello di prova. Non c’è un modo per scegliere di provare il modello nascosto: su Arena i modelli in test compaiono a caso nelle sfide.
Cosa dicono i tester: velocità, design e 3D
Il post che ha fatto più rumore è quello di Pankaj Kumar. In sintesi dice cinque cose:
- È molto veloce: quasi due volte più dei modelli di punta degli altri.
- Ha un ottimo gusto nel design: secondo lui il migliore che abbia mai visto in un modello.
- Nel 3D cura molto di più i dettagli: le scene sono più ricche e precise.
- È migliorato rispetto alla versione di prova precedente, soprattutto in velocità e resa grafica.
- Se il ritmo continua così, il lancio potrebbe arrivare tra inizio e metà ottobre.
Altri tester vanno nella stessa direzione. Circolano scene 3D fatte con Three.js (la libreria più usata per il 3D nel browser), come un dirigibile fotorealistico e una monoposto di Formula 1 con materiali in fibra di carbonio e luci realistiche, generate in un solo passaggio. E circolano siti web e disegni vettoriali (SVG) descritti come puliti e rifiniti.
Due cose però vanno lette con attenzione:
- “Veloce” è relativo. Nelle prove riportate da TestingCatalog i lavori più complessi richiedevano da poco più di 2 minuti fino a 14 minuti. Per una scena 3D completa è poco, ma non è una risposta istantanea. Il “due volte più veloce” è un’impressione di chi l’ha usato, non una misura fatta con un metodo.
- Le demo sono scelte. Chi pubblica su X mostra i risultati migliori, non i tentativi andati male. È normale, ma vuol dire che non sappiamo quanto spesso il modello arriva a quel livello.
Cosa è confermato e cosa no
Per non perdersi, ho diviso tutto in due colonne. A sinistra quello che viene da Google, a destra quello che viene dalle indiscrezioni.

Confermato da Google:
- A fine luglio Google ha annunciato l’avvio dell’addestramento di base di Gemini 4, definito il più ambizioso mai fatto.
- A fine settembre Kavukcuoglu ha detto che il modello è passato alla fase di rifinitura e che l’intenzione è farlo uscire “il prima possibile”, perché i primi risultati sono promettenti. Lo riporta, tra gli altri, TuttoAndroid.
- Non esiste ancora un annuncio del modello: niente nome ufficiale, niente data, niente prezzo, niente documentazione.
Solo indiscrezioni:
- Che il modello dietro l’etichetta gemini-3.8-flash sia davvero la nuova versione Pro.
- Il nome in codice “argon”.
- La velocità doppia e il gusto nel design, che sono impressioni personali.
- La data di inizio o metà ottobre.
Poi c’è una terza categoria, quella da prendere con le pinze. In rete girano anche un limite di 256.000 token in uscita, una memoria di lavoro da milioni di token, prezzi al milione di token e percentuali precise nei benchmark di programmazione. Nessuno di questi numeri ha una fonte primaria: arrivano da screenshot e da siti che si citano a vicenda. Li ho lasciati fuori di proposito. Quando Google pubblicherà la scheda ufficiale, sapremo quali erano veri.
Cosa vuol dire RSI e perché se ne parla
Nel suo post Pankaj Kumar scrive che il miglioramento è così rapido da far pensare che “la loro RSI stia funzionando”. RSI sta per recursive self-improvement, in italiano auto-miglioramento ricorsivo: l’idea che un’AI diventi abbastanza brava da aiutare a costruire la versione successiva di sé stessa, che a sua volta costruisce quella dopo, e così via, sempre più in fretta. È un concetto di cui si parla da decenni nella ricerca, e la voce di Wikipedia ne riassume bene la storia.
Se ne parla proprio ora perché ad agosto Jasjeet Sekhon, responsabile della strategia di Google DeepMind, ha detto che gli enormi investimenti in data center sono in buona parte una scommessa sull’auto-miglioramento. Ha anche ammesso che oggi i ricavi dell’AI non coprono quelle spese. Come racconta The Next Web, l’RSI in senso pieno resta un obiettivo di ricerca, non qualcosa che esiste già. Nei laboratori si parla di un orizzonte intorno al 2027-2028.
Quindi la frase del tester va letta per quello che è: una sensazione di chi vede il modello migliorare in pochi giorni. Oggi i modelli aiutano già a scrivere codice e a fare test, anche dentro le aziende che li costruiscono, ma nessuno ha dimostrato che Gemini 4 si stia migliorando da solo.
Quando esce Gemini 4 Pro
La risposta onesta è: non si sa. Google ha detto solo “il prima possibile” e “molto prima della fine dell’anno”. La community punta su inizio o metà ottobre, ma è una stima basata sul ritmo delle versioni di prova, non su un’informazione.
Per capire se il lancio è vicino, ci sono alcuni segnali da guardare:
- Il blog ufficiale di Google e la pagina dei modelli Gemini di DeepMind: è lì che arriva l’annuncio vero, con prezzi e benchmark.
- Google AI Studio e l’app Gemini: di solito i nuovi modelli compaiono prima in anteprima per sviluppatori e abbonati.
- La classifica di Arena: quando un modello esce, compare con il suo nome vero, e il suo punteggio viene reso pubblico.
Fino a quel momento, qualsiasi scheda tecnica completa che trovi in rete è una ricostruzione.
La mia opinione su questa storia
Lavoro con siti web e SEO da oltre dieci anni, e negli ultimi due ho visto cambiare moltissimo il modo in cui si costruisce una pagina. Per questo la parte che mi interessa di più è quella sul gusto nel design. Se un modello genera un sito o una scena 3D che sembra fatta da un professionista in pochi minuti, il primo impatto è fortissimo. Ed è proprio il tipo di risultato che su Arena prende voti, perché chi vota guarda l’effetto, non il codice.
Nella mia esperienza, però, tra una bella demo e un sito che funziona c’è di mezzo tutto il resto: velocità di caricamento, accessibilità, testi scritti per chi cerca su Google, struttura chiara, un gestionale che il cliente sappia usare, aggiornamenti nel tempo. Un modello con più gusto è un ottimo punto di partenza e mi farà risparmiare tempo nelle bozze, ma non sostituisce chi sa cosa deve fare un sito per vendere. Quando costruisco un sito web in WordPress, l’AI mi aiuta nelle parti ripetitive, ma le scelte le faccio io.
L’altra cosa che mi colpisce è il metodo. Provare un modello sotto il nome di un altro è furbo, ma rende ancora più difficile capire cosa stiamo guardando. È il motivo per cui, prima di cambiare strumenti o abbonamenti, aspetto sempre i dati ufficiali e qualche settimana di prove vere. Lo stesso vale per gli strumenti che lavorano direttamente sul sito, come l’MCP di Elementor: la potenza del modello conta, ma conta di più come lo usi.
Conclusione
C’è un modello su Arena, con l’etichetta gemini-3.8-flash, che secondo diversi tester è troppo bravo per essere un Flash e sarebbe una versione di prova del nuovo Pro di Google. Chi l’ha provato lo descrive come molto veloce e con un gusto nel design sopra la media, soprattutto nel 3D. Di ufficiale c’è solo quello che ha detto Google: Gemini 4 è in rifinitura e uscirà il prima possibile, molto prima di fine anno.
Il resto sono impressioni e stime, alcune probabilmente giuste. Il mio consiglio è di seguire la notizia con curiosità, ma di non prendere decisioni su numeri che nessuno ha verificato. Quando uscirà l’annuncio ufficiale, lo analizzerò con i dati veri.
FAQ
Gemini 4 Pro è già disponibile?
No. Google non ha ancora annunciato il modello. Quello che circola è una versione di prova che, secondo alcuni tester, compare in modo anonimo su Arena. Non si può scegliere di usarla.
Gemini 3.8 Flash e Gemini 4 sono la stessa cosa?
No. Gemini 3.8 Flash è un modello pubblico uscito il 2 settembre 2026, che puoi usare nell’app Gemini e nelle API. Il presunto Gemini 4 in prova su Arena userebbe solo la sua etichetta per non farsi riconoscere.
Quando esce Gemini 4?
Non c’è una data ufficiale. Google ha detto che vuole farlo uscire il prima possibile e molto prima della fine del 2026. La community parla di inizio o metà ottobre, ma è solo una stima.
Cos’è Arena?
È una piattaforma pubblica dove confronti le risposte di due modelli di AI senza sapere quali sono, e voti la migliore. Con i voti nasce una classifica. Le aziende la usano anche per provare i modelli prima del lancio.
Cosa vuol dire RSI?
Recursive self-improvement, cioè auto-miglioramento ricorsivo: un’AI che aiuta a costruire versioni migliori di sé stessa. Google DeepMind lo considera un obiettivo su cui sta investendo, ma non è stato raggiunto.
Leggi anche:
Gemini 3.8 Live: benchmark ufficiali, prezzi veri e cosa cambia per gli assistenti vocali ·
Claude Fable 5.1 e Mythos 5.1: benchmark, prezzi e taglio del 75% ·
Agenti IA: la guida completa
Fonti
- Google, blog ufficiale, 2 settembre 2026: la presentazione di Gemini 3.8 Flash con prezzi e disponibilità.
- Arena su X: il debutto di Gemini 3.8 Flash nelle classifiche.
- TestingCatalog, 23 settembre 2026: le prime versioni di prova, il nome in codice e i tempi di generazione.
- Pankaj Kumar su X: le impressioni sulla nuova versione di prova.
- TuttoAndroid, 24 settembre 2026: le dichiarazioni di Koray Kavukcuoglu sui tempi di Gemini 4.
- The Next Web: Jasjeet Sekhon di Google DeepMind sugli investimenti e l’auto-miglioramento.
- Wikipedia, Arena: storia della piattaforma e test dei modelli prima del lancio.
7 risorse gratuite per sviluppatori: API di AI, database, email
7 risorse gratuite per sviluppatori: API di AI, database, email e monitoraggio Di Daniele Forciniti Queste sono 7 risorse gratuite per sviluppatori…
Gemini 4 Argon: tutte le novità, costi e benchmark
Gemini 4 Argon: tutte le novità, costi e benchmark Di Daniele Forciniti Gemini 4 Argon è il nuovo modello di punta di…
GPT-6.1 Sol: novità, benchmark e costi
GPT-6.1 Sol: novità, benchmark e costi Di Daniele Forciniti GPT-6.1 Sol è il nuovo modello di OpenAI presentato ieri, 29 settembre 2026,…
Ricerca multimodale: ora Search Console mostra chi ti trova con
Ricerca multimodale: ora Search Console mostra chi ti trova con una foto Di Daniele Forciniti Dal 24 settembre 2026 Google Search Console…
SEO, AEO, GEO, AIO e SXO: le 5 sigle della
SEO, AEO, GEO, AIO e SXO: le 5 sigle della SEO moderna spiegate in modo semplice Di Daniele Forciniti SEO, AEO, GEO,…
Claude Opus 5.5, GPT-6 Sol e Luna: prezzi e benchmark
Claude Opus 5.5, GPT-6 Sol e Luna: prezzi e benchmark a confronto Di Daniele Forciniti Il 22 settembre 2026 Anthropic ha pubblicato…