Google ha rilasciato Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, i due nuovi modelli audio pensati per conversazioni vocali in tempo reale. Per chi usa l'app cambia la naturalezza della voce.
Per chi sviluppa, come me, cambia qualcosa di più concreto: quanto costa un minuto di conversazione, quanto regge una sessione e quanto è affidabile un agente vocale quando deve chiamare API mentre parla.
Io costruisco centralini e segretarie AI per aziende italiane, quindi ho letto la documentazione della Gemini 3.8 Live API con una domanda sola in testa: conviene usarla in produzione? In questa guida trovi i prezzi reali, i limiti tecnici che la presentazione non dice, il confronto con GPT-Live-1 di OpenAI e i casi in cui la sceglierei.
Cos'è Gemini 3.8 Live e in cosa è diverso da Extended Thinking
Gemini 3.8 Live è un modello audio-to-audio: riceve la voce e risponde con la voce, senza passare dalla classica catena trascrizione, modello di testo e sintesi vocale. Questo taglia la latenza e rende la conversazione meno "a turni".
I due modelli hanno un ruolo preciso:
- Gemini 3.8 Live: il modello pensato per volumi alti e costi contenuti. Conversazione fluida, comprensione di immagini quasi in tempo reale, cambio automatico tra 97 lingue a metà dialogo.
- Gemini 3.8 Live Extended Thinking: il modello per i compiti complessi. Ragiona e parla nello stesso momento, usa frasi di attesa naturali mentre lavora e racconta l'avanzamento delle operazioni in background.
Il punto tecnico che mi interessa di più è la chiamata di strumenti in background. Il modello può lanciare una funzione (per esempio controllare la disponibilità in agenda) e continuare a parlare con l'utente mentre la risposta arriva.
Nei centralini AI questo è il problema numero uno: il silenzio di tre secondi mentre il sistema interroga il gestionale fa riattaccare le persone.
Benchmark dichiarati: cosa dicono davvero
Google dichiara per Extended Thinking il primo posto nello Speech to Speech Quality Index di Artificial Analysis con 82,6 punti, il 68,6% su τ-Voice e il 35,1% sul test bancario τ-Voice-banking. Gemini 3.8 Live base è secondo nella Speech Agent Arena.
Leggo questi numeri con cautela. Il 35,1% sul test bancario significa che in scenari complessi con molti passaggi l'agente fallisce ancora più spesso di quanto riesca. Per un centralino che prende appuntamenti va bene, per un agente che deve chiudere pratiche delicate da solo non ancora: serve sempre un passaggio a un operatore umano.
Prezzi della Gemini 3.8 Live API
I due modelli hanno lo stesso listino nel piano a pagamento. Nel piano gratuito sono utilizzabili senza costi, ma i contenuti possono essere usati da Google per migliorare i prodotti: per dati di clienti reali il piano gratuito non è un'opzione.
| Voce | Input | Output |
|---|---|---|
| Testo | 0,75 $ per milione di token | 4,50 $ per milione di token |
| Audio | 3,00 $ per milione di token (circa 0,005 $ al minuto) | 12,00 $ per milione di token (circa 0,018 $ al minuto) |
| Immagini e video | 1,00 $ per milione di token (circa 0,002 $ al minuto) | non previsto |
Il dato che molti non hanno notato: il vecchio gemini-3.1-flash-live-preview ha lo stesso identico listino. Se oggi hai un agente su quel modello, passare a Gemini 3.8 Live non ti costa un centesimo in più.
Quanto costa una telefonata: il mio conto
Faccio un'ipotesi su una chiamata tipica da centralino di 3 minuti, in cui l'audio del cliente viene inviato per tutta la durata e l'agente parla per circa metà del tempo:
- Input audio: 3 minuti x 0,005 $ = 0,015 $
- Output audio: 1,5 minuti x 0,018 $ = 0,027 $
- Totale indicativo: circa 0,04 $ a chiamata, a cui aggiungere le eventuali ricerche Google (5.000 gratuite al mese condivise tra i modelli Gemini 3, poi 14 $ ogni 1.000) e i costi della linea telefonica.
Nel caso peggiore, con l'agente che parla per tutti i 3 minuti, si arriva a circa 0,07 $. Sono cifre che rendono sostenibile un agente vocale anche per una PMI con centinaia di chiamate al mese.
Gemini 3.8 Live vs GPT-Live-1: il confronto sui costi
Pochi giorni fa OpenAI ha aperto GPT-Live-1 nelle API. Nell'articolo su quanto costa una segretaria vocale con GPT-Live-1 ho fatto il conto dettagliato. La differenza di impostazione è netta:
- GPT-Live-1: 0,05 $ al minuto solo per il livello vocale, poi paghi a parte il modello che ragiona (GPT-6 Astra o uno più leggero).
- Gemini 3.8 Live: voce e ragionamento nello stesso modello, con un costo audio che nell'esempio sopra resta sotto 0,02 $ al minuto di conversazione.
Sul puro costo Gemini 3.8 Live vince. GPT-Live-1 però ha dalla sua il supporto telefonico nativo e la libertà di abbinare il cervello che preferisci.
Nella mia esperienza la scelta non si fa sul listino ma su due cose: la qualità dell'italiano parlato con accenti regionali e la stabilità delle chiamate a strumenti. Entrambe vanno testate con le tue telefonate vere, non con le demo.
I limiti tecnici della Live API che devi conoscere
Qui c'è la parte che nessuna presentazione racconta, ma che in produzione fa la differenza.
Durata delle sessioni
- Sessioni solo audio: massimo 15 minuti senza compressione del contesto.
- Sessioni audio e video: massimo 2 minuti senza compressione.
- Connessione WebSocket: dura circa 10 minuti, poi il server la chiude.
Le soluzioni ci sono. Attivando la compressione della finestra di contesto (sliding window) la sessione può proseguire senza il limite dei 15 minuti. Con la ripresa di sessione ricevi un token valido 2 ore che ti permette di riaprire la connessione senza perdere la conversazione.
Il server invia anche un messaggio GoAway con il tempo residuo prima della chiusura. Se non gestisci questi tre meccanismi, la chiamata cade a metà.
Formati audio
L'input è audio PCM a 16 bit a 16 kHz, l'output è PCM a 16 bit a 24 kHz. La linea telefonica tradizionale lavora a 8 kHz: tra centralino e modello serve un passaggio di ricampionamento, altrimenti la voce arriva distorta o non viene capita.
Client o server
Puoi collegarti direttamente dal browser (client-to-server) oppure far passare il flusso dal tuo backend (server-to-server). Per un prodotto vero scelgo sempre il server: tieni nascosta la chiave API, registri i log e controlli cosa può fare l'agente.
Se proprio vuoi il collegamento diretto, usa i token effimeri e mai la chiave principale nel frontend.
Come iniziare a usare Gemini 3.8 Live API
Il percorso che seguo per un prototipo è questo:
- Prova in Google AI Studio: nella sezione Live scegli gemini-3.8-live e parla con il modello per capire la resa in italiano.
- Crea la chiave API e attiva la fatturazione se lavori con dati reali.
- Usa l'SDK Google GenAI (Python o JavaScript) con il model id gemini-3.8-live o gemini-3.8-live-extended-thinking.
- Configura compressione e ripresa di sessione fin dal primo giorno.
- Definisci le funzioni che l'agente può chiamare (agenda, CRM, ordini) con descrizioni chiare e parametri stretti. Se il gestionale non espone API, va prima costruito un livello di integrazione, come faccio nei progetti di sviluppo web app.
- Aggiungi il passaggio a un operatore quando l'agente non capisce o la richiesta è fuori perimetro.
Se non vuoi gestire WebSocket e media streaming a mano, piattaforme come LiveKit, Pipecat, Agora e Vercel supportano già la Gemini Live API e si occupano dell'infrastruttura in tempo reale.
Quando sceglierei Gemini 3.8 Live (e quando no)
- Sì per centralini con alto volume di chiamate semplici: prenotazioni, orari, stato ordini, smistamento.
- Sì se il cliente parla più lingue: il cambio automatico tra 97 lingue è utile per hotel e attività turistiche.
- Extended Thinking quando l'agente deve fare più operazioni in fila durante la stessa chiamata.
- No se ti serve un agente che chiude pratiche sensibili in autonomia: i benchmark sugli scenari complessi dicono che non è ancora il momento.
Ricorda anche l'aspetto normativo: un agente vocale che parla con i clienti deve dichiarare di essere un'AI. Ne ho parlato nell'articolo sugli obblighi di trasparenza dell'AI Act per chatbot e assistenti. Tutto l'audio generato da Gemini 3.8 Live porta inoltre la filigrana SynthID.
Se invece stai valutando quale modello Gemini usare per i compiti testuali, trovi il confronto nella guida Gemini 3.8 Flash vs 3.1 Pro.
Vuoi un centralino AI senza sviluppare da zero?
Costruire un agente vocale affidabile richiede telefonia, ricampionamento audio, gestione delle sessioni, integrazioni e test sulle chiamate vere. Per le PMI italiane che vogliono il risultato senza il progetto, ho creato Centra: centralino AI e WhatsApp, zero hardware, attivo in 24 ore e pensato per il GDPR. Puoi provarlo registrandoti oppure chiedere informazioni.
Se invece hai bisogno di un agente vocale su misura collegato al tuo gestionale, dai un'occhiata ai miei servizi di automazione AI e ai casi in cui un assistente automatico serve davvero.
Leggi anche
- GPT-Live-1 nelle API: quanto costa una segretaria vocale AI
- Gemini 3.8 Flash vs 3.1 Pro: quale usare e quanto costa
- Chatbot per aziende: quando serve e quando no
Stai pensando a un agente vocale per la tua attività e non sai da dove partire? Scrivimi: ti dico con franchezza se ha senso e quale strada costa meno.



