Veo è il modello di intelligenza artificiale di Google per la generazione di video realistici con audio integrato. La versione attuale è Veo 3.1. Nel 2026, però, Veo non è più l’unico modello video di Google: nell’app Gemini il modello predefinito ora è Gemini Omni. In questa guida scopri cos’è Veo, come funziona, quanto costa e come usarlo in Italia.
Veo 3.1 è il generatore video di Google DeepMind: clip da 8 secondi fino al 4K, con dialoghi, musica ed effetti sonori generati insieme alle immagini. In Italia si usa soprattutto da Google Flow e via API. Nell’app Gemini il modello video predefinito è diventato Gemini Omni, e per generare video serve un abbonamento Google AI, da 4,99 €/mese. Il piano gratuito di Gemini non include i video.
Indice
- Cos’è Veo e da dove viene
- Come funziona Veo 3.1
- La rivoluzione dell’audio nativo
- Le versioni di Veo e il ruolo di Gemini Omni
- Si può usare Veo gratis in Italia?
- Prezzi e piani 2026
- Limiti e cosa non sa fare
- Veo 3.1 vs Kling AI vs Higgsfield
- Domande frequenti
Cos’è Veo e da dove viene
Veo è il modello di generazione video sviluppato da Google DeepMind. La versione 3 è stata annunciata al Google I/O 2025 ed è arrivata in Italia nella seconda metà del 2025. La versione attuale, Veo 3.1, si usa tramite Google Flow, lo strumento di Google per i creator, e via API per gli sviluppatori (Gemini API e Vertex AI).
Quello che ha reso famoso Veo 3 è la capacità di generare audio nativo sincronizzato con il video in un’unica passata. Prima, i generatori video AI producevano clip mute a cui si aggiungeva l’audio in post-produzione. Veo genera dialoghi, musica di sottofondo ed effetti sonori insieme alle immagini, in sincronia. Oggi l’audio nativo è diventato la norma anche per molti concorrenti, come racconta il nostro confronto dei migliori generatori video AI.
Come funziona Veo 3.1
Veo 3.1 parte da un prompt testuale, cioè una descrizione della scena, del movimento, dell’illuminazione e dell’atmosfera, oppure da un’immagine di partenza. Può usare anche fino a 3 immagini di riferimento per mantenere l’aspetto di una persona, di un personaggio o di un prodotto.
Il modello genera insieme la scena, la fisica del movimento (come si muovono i corpi, come interagiscono gli oggetti, come si comportano i fluidi) e l’audio. Le clip durano 4, 6 o 8 secondi e arrivano fino al 4K; 1080p e 4K sono disponibili solo con la durata di 8 secondi. Una clip si può poi estendere a passi di 7 secondi, fino a circa due minuti e mezzo in tutto, ma solo a 720p.
Tutti i video generati da Veo includono una filigrana invisibile chiamata SynthID, sviluppata da Google DeepMind, che identifica il contenuto come generato dall’AI. Per capire come si inserisce Veo nel più ampio ecosistema dell’AI generativa, leggi il nostro articolo su cosa sono gli agenti AI e quello su Claude AI.
La rivoluzione dell’audio nativo
La caratteristica più discussa di Veo 3 è stata la generazione audio nativa. Prima del suo arrivo, il flusso di lavoro standard per un video AI era: genera il video, aggiungi la voce con uno strumento separato (ElevenLabs, Murf), aggiungi gli effetti sonori e la musica, poi sincronizza tutto in post-produzione. Un processo lungo che richiedeva più strumenti e competenze di montaggio.
Con Veo questo processo si comprime in un’unica operazione. Se nel prompt descrivi due persone che parlano in un bar rumoroso con musica jazz in sottofondo, Veo genera il video con i dialoghi sincronizzati alle labbra dei personaggi, il rumore del bar come suono ambientale e la musica jazz, tutto insieme.
Per creator, social media manager e professionisti del marketing significa produrre video completi in tempi rapidi, senza un team di produzione tradizionale.
Le versioni di Veo e il ruolo di Gemini Omni
Nel 2026 Google offre diverse varianti di Veo, con caratteristiche e costi diversi:
- Veo 3.1: il modello principale, con la qualità più alta, audio nativo e risoluzione fino al 4K.
- Veo 3.1 Fast: più veloce e molto più economico via API, con una leggera riduzione della qualità. Adatto per le prove e le iterazioni sui prompt.
- Veo 3.1 Lite: la versione più economica, senza 4K e senza estensione delle clip. È quella inclusa come prova limitata nel piano Google AI Pro.
- Veo 3 e Veo 3 Fast: le versioni precedenti, ancora disponibili via API.
Accanto a Veo, da maggio 2026 c’è Gemini Omni, che Google presenta come il suo modello di generazione video più recente ed è diventato quello predefinito nell’app Gemini. La differenza principale è che con Omni il video si modifica conversando, in più passaggi nella stessa chat: togliere un oggetto, cambiare inquadratura, rifare una scena. In Italia e nel resto dello Spazio economico europeo, però, non si può caricare un proprio video girato da modificare: funzionano la generazione da testo e da immagine. Gemini Omni è anche il modello usato oggi da Google Vids.
Si può usare Veo gratis in Italia?
Rispetto al 2025 le strade gratuite si sono ristrette. Il piano gratuito di Gemini non include la generazione di video: con un account senza abbonamento, Flow dà accesso solo alla creazione di immagini. Restano queste possibilità:
Metodo 1 — I crediti di prova di Google Cloud
Chi apre un nuovo account Google Cloud riceve 300 $ di crediti gratuiti da usare entro 90 giorni. Con questi crediti si può usare Veo 3.1 tramite Vertex AI, pagando a secondo di video generato. Serve un minimo di familiarità con gli strumenti cloud e la registrazione richiede una carta per la verifica.
Metodo 2 — Google Vids, ma con Gemini Omni
Google Vids permette di generare clip AI anche con un account Google personale, entro un limite mensile. Da luglio 2026, però, il modello usato da Vids è Gemini Omni e non più Veo.
Se il gratis non basta
Il piano più economico che include la generazione video nell’app Gemini, Google AI Plus, costa 4,99 €/mese e dà anche 200 crediti per Flow.
Prezzi e piani 2026
Per l’uso consumer in Italia, l’accesso ai video di Google passa dai piani Google AI. I prezzi sono quelli della pagina italiana degli abbonamenti:
| Piano | Prezzo | Cosa include per i video |
|---|---|---|
| Gemini senza abbonamento | Gratis | Nessuna generazione video |
| Google AI Plus | 4,99 €/mese | Gemini Omni Flash nell’app, 200 crediti Flow |
| Google AI Pro | 21,99 €/mese | 1.000 crediti Flow, prova limitata di Veo 3.1 Lite |
| Google AI Ultra | 99,99 € o 219,99 €/mese | Limiti 5 o 20 volte quelli di Pro, 10.000 o 25.000 crediti Flow |
| API (Gemini API) | A secondo di video | Veo 3.1: 0,40 $/s (0,60 $ in 4K); Fast da 0,10 $/s; Lite da 0,05 $/s |
Con l’API, una clip da 8 secondi con Veo 3.1 a 1080p costa quindi 3,20 $, mentre con Veo 3.1 Fast a 720p costa 0,80 $. Nella Gemini API Veo non ha un livello gratuito.
Per la maggior parte degli utenti italiani che vogliono solo provare la generazione video, il punto di partenza più sensato è Google AI Plus a 4,99 €/mese. Chi vuole usare Veo 3.1 con regolarità in Flow deve guardare ai crediti di AI Pro o Ultra, che includono anche l’accesso ai modelli Gemini più avanzati.
Limiti e cosa non sa fare
Nonostante le capacità impressionanti, Veo 3.1 ha limiti concreti che è utile conoscere prima di sceglierlo:
- Durata della clip singola: 8 secondi al massimo. Si può estendere la scena a passi di 7 secondi, ma solo a 720p e non con la versione Lite
- Controllo limitato del movimento: non c’è un equivalente del Motion Brush di Kling per indicare quali parti dell’immagine devono muoversi
- Nessun lip sync su video esistenti: Veo genera dialoghi nei video creati da zero, ma non sincronizza le labbra di un video girato
- Watermark SynthID: tutti i video hanno una filigrana invisibile, non rimovibile, che li identifica come generati dall’AI
- Testi nel video: come quasi tutti i generatori AI, Veo fatica a inserire scritte leggibili e corrette all’interno delle scene
Veo 3.1 vs Kling AI vs Higgsfield
I tre strumenti si rivolgono a profili diversi. Veo 3.1 è la scelta naturale per chi è già nell’ecosistema Google e vuole clip brevi di alta qualità con audio, fino al 4K. Kling AI è preferibile per chi vuole clip singole più lunghe: Kling 3.0 arriva a 15 secondi con audio e in 4K nativo, e Kling 4.0, annunciato a fine settembre, promette 30 secondi. Higgsfield AI è un aggregatore: con un solo abbonamento permette di usare molti modelli diversi, compresi quelli di Google.
In termini di qualità visiva, Veo 3.1, Kling e Seedance 2.5 sono oggi tra i modelli più forti disponibili al pubblico, e il migliore dipende dal tipo di scena. Per il quadro completo, con prezzi e limiti di tutti gli strumenti, c’è il nostro confronto dei generatori video AI.
Domande frequenti su Veo
Veo è disponibile in Italia?
Sì. Veo 3.1 è accessibile in Italia tramite Google Flow con i piani Google AI e via API su Gemini API e Vertex AI. Nell’app Gemini il modello video predefinito oggi è Gemini Omni.
Veo genera audio in italiano?
Veo dà i risultati più stabili in inglese. Per i dialoghi in italiano conviene fare prima qualche prova con clip brevi; se il risultato non convince, si può generare il video con Veo e aggiungere la voce fuori campo in italiano con strumenti dedicati come ElevenLabs.
I video di Veo si possono usare commercialmente?
Google consente l’uso dei contenuti generati nel rispetto delle sue norme sull’uso consentito. Per un uso aziendale conviene leggere i termini del piano o dell’API che si usa. Tutti i video includono la filigrana invisibile SynthID che ne certifica l’origine AI.
Quanto dura un video generato da Veo 3.1?
La clip singola dura al massimo 8 secondi. Con l’estensione si aggiungono 7 secondi alla volta, fino a circa due minuti e mezzo in tutto, ma solo a 720p.
Che differenza c’è tra Veo e Gemini Omni?
Sono due modelli video di Google. Veo 3.1 punta sulla qualità della singola clip, fino al 4K. Gemini Omni, il modello predefinito nell’app Gemini da maggio 2026, punta sulla modifica del video tramite conversazione, un passaggio alla volta.

