Tecnologie

Gemini TTS vs ElevenLabs: voce AI in italiano e costi

Gemini 3.8 TTS costa circa 0,01 $ al minuto, ElevenLabs fino a 0,10 $. Il confronto al minuto, i limiti in Italia sulla voce clonata e quale scegliere per ogni uso.

Cosmin-Anton Mihoc
8 min di lettura
Gemini TTS vs ElevenLabs: voce AI in italiano e costi
Indice dei contenuti (7 sezioni)

Se usi ElevenLabs per generare voce in italiano, conosci il problema: la qualità è ottima, ma a fine mese il conto sale in fretta. Il 23 settembre Google ha lanciato Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS, due modelli di sintesi vocale che secondo i benchmark pubblicati sono tra i migliori sul mercato. E costano molto meno.

Ho fatto il conto al minuto con i listini ufficiali di entrambi. In questo articolo trovi quanto costa davvero ElevenLabs rispetto a Gemini TTS, cosa fanno i nuovi modelli di Google, i tre limiti che contano per chi lavora in Italia e quale scegliere in base a cosa devi fare: audiolibri, video, podcast o un centralino vocale.

La risposta breve: per volumi alti Gemini TTS oggi costa circa 7 volte meno di ElevenLabs v3. Ma se ti serve clonare una voce e lavori dall'Europa, ElevenLabs resta l'unica delle due strade percorribili.

Cosa sono Gemini 3.8 Flash TTS e Flash-Lite TTS

Sono due modelli text to speech: gli dai un testo, restituiscono audio. Google li ha pensati per due usi diversi.

  • Gemini 3.8 Flash TTS: per la regia creativa. Crei voci nuove descrivendole a parole (ruolo, accento, carattere), dirigi ogni battuta con indicazioni di recitazione e gestisci dialoghi a due voci da un unico copione.
  • Gemini 3.8 Flash-Lite TTS: per i grandi volumi a basso costo. Pensato per doppiaggio, contenuti audio in serie e agenti vocali, con controllo su tono e ritmo.

Le funzioni principali:

  • Oltre 2.000 voci pronte e più di 100 lingue e dialetti dichiarati.
  • Design della voce da prompt: descrivi la voce che vuoi e il modello la crea.
  • Suoni non verbali da copione, come risate, sospiri e interiezioni tipo "mhm".
  • Audio lungo stabile: Google dichiara ore di audio senza deriva della voce.
  • Filigrana SynthID in ogni clip, per rendere riconoscibile l'audio generato.

Sui benchmark indipendenti di Hume AI, Flash TTS e Flash-Lite TTS sono primo e secondo nell'indice di qualità complessiva. Un dettaglio da non perdere però: nelle classifiche di preferenza per lingua pubblicate da Google, l'italiano non compare. Quindi la qualità in italiano va provata sul tuo testo prima di decidere.

Quanto costa ElevenLabs e quanto costa Gemini TTS

I due servizi fanno pagare in modo diverso: ElevenLabs a caratteri, Gemini a token. Per confrontarli ho portato tutto a costo per minuto di audio generato, che è il dato che ti serve davvero.

Prezzi ElevenLabs via API

  • v3 e v2 Multilingual: 0,10 $ ogni 1.000 caratteri, circa 0,10 $ al minuto.
  • v3 Conversational e Flash/Turbo: 0,05 $ ogni 1.000 caratteri, circa 0,05 $ al minuto.

Gli abbonamenti includono una quota di caratteri: Starter a 6 $ al mese, Creator a 22 $ (11 $ il primo mese), Pro a 99 $, Scale a 299 $, Business a 990 $. C'è anche un piano gratuito con 10.000 caratteri, circa 10 minuti di audio con v3.

Prezzi Gemini 3.8 TTS via API

Google fa pagare il testo in ingresso e l'audio in uscita. L'audio vale 25 token al secondo, cioè 1.500 token al minuto. Il costo del testo in ingresso è trascurabile, quindi conta quasi solo l'uscita.

  • Flash TTS: 9 $ per milione di token audio fino al 31 dicembre 2026, poi 18 $. Cioè circa 0,0135 $ al minuto oggi e 0,027 $ dal 2027.
  • Flash-Lite TTS: 6 $ per milione di token audio fino al 31 dicembre 2026, poi 12 $. Cioè circa 0,009 $ al minuto oggi e 0,018 $ dal 2027.
  • Batch e Flex: metà prezzo, se non ti serve l'audio in tempo reale.

Esiste anche un livello gratuito, ma con una condizione importante: i contenuti inviati possono essere usati da Google per migliorare i prodotti. Per testi di clienti o dati aziendali non lo userei.

Il confronto al minuto

Modello Costo al minuto oggi Dal 1° gennaio 2027
ElevenLabs v3 circa 0,10 $ circa 0,10 $
ElevenLabs Flash / v3 Conversational circa 0,05 $ circa 0,05 $
Gemini 3.8 Flash TTS circa 0,0135 $ circa 0,027 $
Gemini 3.8 Flash-Lite TTS circa 0,009 $ circa 0,018 $

Tradotto in casi concreti, con i prezzi di oggi:

  • Audiolibro di 5 ore (300 minuti): circa 30 $ con ElevenLabs v3, circa 4 $ con Gemini Flash TTS.
  • 1.000 minuti di voce al mese per un agente vocale: circa 50 $ con ElevenLabs Flash, circa 9 $ con Gemini Flash-Lite TTS.

Occhio al 2027: il prezzo di Gemini raddoppia dal 1° gennaio. Anche dopo resta sotto ElevenLabs, ma il vantaggio passa da circa 7 volte a circa 3,5 volte sul modello di punta. Se costruisci un prodotto, fai i conti sul prezzo pieno, non su quello promozionale. È la stessa trappola che ho spiegato parlando di Gemini 3.8 Flash e dei suoi prezzi a scadenza.

Tre limiti che contano se lavori in Italia

Il prezzo non è tutto. Questi tre punti nelle altre guide non li ho trovati, e per chi lavora dall'Italia cambiano la scelta.

1. La clonazione della voce di Google non è disponibile in Europa

Gemini 3.8 Flash TTS permette di replicare una voce da un campione di 30 secondi, con verifica del consenso del titolare. Ma Google specifica che la replica vocale tramite AI Studio non è disponibile nello Spazio Economico Europeo, nel Regno Unito e in Svizzera. Se ti serve la voce del titolare dell'azienda o di uno speaker preciso, oggi da qui con Google non puoi farlo. ElevenLabs invece la clonazione la offre.

2. L'italiano non è tra le lingue testate pubblicamente

I risultati di preferenza pubblicati riguardano giapponese, portoghese brasiliano, vietnamita, arabo, spagnolo messicano e hindi. L'italiano rientra nelle lingue supportate, ma non ci sono dati pubblici sulla sua resa. ElevenLabs ha una base di utenti italiani molto più ampia e voci italiane già collaudate.

3. Il piano gratuito di Gemini usa i tuoi dati

Nel livello gratuito i contenuti possono essere usati per migliorare i prodotti Google. Nel livello a pagamento no. Se lavori con testi riservati o dati personali, parti direttamente dal piano a pagamento: con questi prezzi il costo è irrisorio.

Gemini TTS vs ElevenLabs: quale scegliere

La mia indicazione per caso d'uso:

  • Video, tutorial e contenuti social in serie: Gemini Flash-Lite TTS. Il volume è alto, la voce standard basta e il risparmio è enorme.
  • Audiolibri e podcast: Gemini Flash TTS, se la voce italiana ti convince al test. Dialoghi a due voci e stabilità sulle lunghe durate sono proprio il suo punto forte.
  • Voce clonata del brand o di una persona: ElevenLabs, perché in Europa Google non la offre.
  • Doppiaggio professionale: ElevenLabs ha prodotti dedicati, ma costano molto di più al minuto. Per volumi grandi conviene provare Gemini prima.
  • Centralini e agenti vocali: qui il TTS è solo un pezzo. Serve anche riconoscimento vocale, un modello che ragiona e bassa latenza. Spesso conviene un modello voce-voce nativo, come ho spiegato su Gemini 3.8 Live e su GPT-Live-1.

Come provare Gemini TTS in 10 minuti

Prima di cambiare fornitore, fai un test con il tuo testo reale. Ecco come lo farei.

  1. Apri Google AI Studio e scegli il modello gemini-3.8-flash-tts nella sezione di generazione vocale.
  2. Incolla un testo tuo di almeno un minuto, con nomi propri, numeri e termini tecnici italiani: sono i punti dove i TTS sbagliano di più.
  3. Prova tre voci dalla libreria e una creata da prompt, descrivendo tono e accento.
  4. Genera lo stesso testo su ElevenLabs con la voce italiana che usi oggi.
  5. Ascolta alla cieca: chiedi a qualcuno di scegliere senza sapere quale è quale.
  6. Fai il conto sul tuo volume mensile con il prezzo pieno del 2027.

Per l'integrazione in un'applicazione, Gemini TTS è già supportato da piattaforme come LiveKit, Pipecat, Agora e Vercel, quindi non devi riscrivere la tua pipeline vocale da zero.

Cosa uso io per la voce nei progetti

Lavoro sulla voce AI anche per un mio prodotto, Centra, un centralino AI con WhatsApp per le PMI italiane. Quello che ho imparato è che il costo del TTS pesa, ma la scelta vera la fanno latenza, naturalezza in italiano e affidabilità nelle chiamate. Il modello più economico sulla carta non è sempre quello che costa meno quando un cliente riattacca perché la voce suona finta.

Se ti serve un centralino AI già pronto, senza hardware e attivo in 24 ore, puoi provare Centra o scrivere al team di Centra. Se invece vuoi integrare la sintesi vocale in un tuo software, un sito o un flusso di automazione AI, possiamo valutare insieme quale modello conviene sul tuo volume reale: contattami.

In sintesi

Gemini 3.8 Flash TTS costa circa 0,0135 $ al minuto e Flash-Lite TTS circa 0,009 $, contro 0,05-0,10 $ di ElevenLabs: oggi il risparmio è di circa 5-7 volte, dal 2027 si dimezza. Per volumi alti e voci standard Gemini TTS è la scelta più conveniente. ElevenLabs resta la scelta obbligata se ti serve una voce clonata in Europa o se la resa italiana di Gemini, al tuo test, non ti convince.

Condividi questo articolo
Hai domande? Contattami

Pronto a dare vita al tuo progetto?

Contattami per discutere della tua idea e ricevere una consulenza gratuita.

Iniziamo insieme