Realizzare un Cortometraggio con
l’INTELLIGENZA ARTIFICIALE
Articolo 10
Generare direttamente un video dal testo: come progettare sequenze text-to-video, quali azioni funzionano meglio e quando è preferibile utilizzare prima un’immagine

Dopo aver progettato personaggi, ambienti, costumi, scenografie e oggetti, e dopo aver imparato a trasformare una scena in inquadrature e a scrivere prompt efficaci, possiamo affrontare uno dei passaggi più affascinanti dell’intero percorso: generare direttamente immagini in movimento partendo soltanto da una descrizione testuale.
È ciò che viene normalmente definito Text-to-Video.
In apparenza il procedimento sembra semplicissimo: scriviamo ciò che desideriamo vedere e l’Intelligenza Artificiale costruisce il video. Nella pratica cinematografica, però, la questione è molto più interessante e complessa.
Generare un video non significa semplicemente ottenere “qualcosa che si muove”. Per un cortometraggio dobbiamo ottenere una clip che sia utile al racconto, coerente con le clip precedenti, raccordabile con quelle successive e sufficientemente controllata da poter essere montata.
Il vero problema, quindi, non è: “L’Intelligenza Artificiale riesce a creare questa scena?”
ma: “Riesce a creare esattamente l’inquadratura che mi serve per raccontare questa scena?”
È una differenza fondamentale.
Una singola generazione può essere spettacolare e contemporaneamente risultare inutilizzabile nel film. Può avere il personaggio sbagliato, una porta nel posto sbagliato, un movimento di macchina non previsto, una mano che cambia forma oppure un’azione che comincia correttamente ma non arriva alla conclusione necessaria per raccordarsi con il piano successivo.
Per questo il Text-to-Video deve essere affrontato con una mentalità cinematografica, ovvero: non generiamo un film intero; generiamo inquadrature controllate che, montate insieme, diventeranno il film.
* Dal testo narrativo al video
Consideriamo una semplice frase di sceneggiatura: "Marta entra nella cucina, trova una lettera sul tavolo, la legge e capisce che suo marito vuole lasciarla. Dopo qualche secondo si siede e comincia a piangere."
Per uno spettatore la situazione è perfettamente comprensibile.
Per un generatore Text-to-Video, invece, contiene moltissime operazioni:
Marta deve entrare nella stanza, deve muoversi correttamente nello spazio, deve raggiungere il tavolo, individuare un foglio, prenderlo senza deformarlo, leggerlo, modificare gradualmente la sua espressione, sedersi su una sedia (quale?), mantenere identici il suo volto ed il suo abito, conservare coerente la posizione della lettera tra le mani ed infine piangere.
Possiamo provare a chiedere tutto questo in un’unica generazione, ma stiamo affidando all’IA una quantità enorme di decisioni.
Cinematograficamente sarebbe molto più efficace dividere l’azione in:
Inquadratura 1: campo totale. Marta entra nella cucina e si ferma.
Inquadratura 2: soggettiva o dettaglio. Una lettera è appoggiata sul tavolo.
Inquadratura 3: dettaglio. La mano di Marta prende la lettera.
Inquadratura 4: primo piano. Marta legge.
Inquadratura 5: dettaglio della lettera o di una frase significativa.
Inquadratura 6: primo piano di Marta. Comprende il significato del messaggio.
Inquadratura 7: piano medio. Marta lentamente si siede.
Il risultato sarà quasi certamente più controllabile ed anche più cinematografico.
Questa è la prima grande regola del Text-to-Video:
Più l’azione è semplice, più possiamo controllarne il risultato.
* Text-to-Video non significa “scena intera”
Uno degli errori iniziali più frequenti consiste nel pensare che ad ogni scena della sceneggiatura debba corrispondere un video generato.
In realtà la corrispondenza più utile è: una inquadratura = una generazione principale.
Una scena può quindi essere composta da tre clip, o cinque clip, od otto clip, e perchè non dieci clip?
Esattamente come avverrebbe durante normali riprese cinematografiche.
Immaginiamo ora: "Un uomo anziano percorre lentamente il corridoio del condominio e fa scivolare un biglietto sotto una porta chiusa."
Non dobbiamo necessariamente chiedere alla AI: Genera un uomo che percorre tutto il corridoio, arriva davanti alla porta, si ferma, guarda il biglietto, si inginocchia, lo infila sotto la porta, aspetta e poi se ne va.
Possiamo costruire tutto il processo invece con:
Campo lungo: l’uomo cammina nel corridoio.
Piano medio: arriva davanti alla porta.
Primo piano: guarda la porta con esitazione.
Dettaglio: tiene il biglietto tra le dita.
Figura intera: si china.
Dettaglio a livello del pavimento: il biglietto passa sotto la porta.
Primo piano: l’uomo resta in ascolto.
Campo lungo: si allontana.
La sequenza diventa più facilmente controllabile e, soprattutto, possiamo scegliere in montaggio quanto far durare ogni momento.
* Che cosa il Text-to-Video deve sapere
Per generare direttamente una clip partendo dal testo bisogna comunicare almeno cinque informazioni fondamentali, ovvero: chi vediamo, dove si trova, che cosa accade, come lo stiamo guardando e quale atmosfera deve avere la scena.
A queste informazioni possiamo aggiungere altre ugualmente importanti, come: l'illuminazione; il movimento della macchina; il tipo di ottica; la profondità di campo; la direzione del movimento; la velocità dell’azione; il comportamento dello sfondo; la durata prevista ed eventuali elementi che devono rimanere immobili.
Ecco come possiamo iniziare a descrivere un esempio in modo semplice.
Video cinematografico fotorealistico 16:9. Campo medio di Giacomo, uomo italiano di 68 anni, capelli grigi ricci, barba corta bianca, occhiali sottili e camicia da notte a righe grigie. È nella sua vecchia cucina italiana alle tre di notte. Giacomo versa lentamente acqua calda da un piccolo bollitore in una tazza sul tavolo. Dal liquido sale un leggero vapore. Luce calda proveniente dalla lampada sopra il tavolo, ambiente circostante più scuro, camera completamente fissa, prospettiva naturale equivalente ad un 50 mm. Movimento lento e realistico, atmosfera intima e silenziosa.
Non stiamo chiedendo a Giacomo anche di sedersi, parlare con la nipote, bere, ricordare il passato e alzarsi.
Gli stiamo chiedendo una sola cosa: di versare l’acqua.
* Quali azioni funzionano meglio
Il Text-to-Video offre generalmente risultati più controllabili quando l’azione è leggibile, breve e fisicamente semplice.
Funzionano particolarmente bene situazioni come: un personaggio che cammina lentamente; qualcuno che volta la testa; un uomo che guarda fuori dalla finestra; una donna che alza gli occhi; due persone che si osservano; qualcuno che prende una tazza già vicina alla mano; una persona che apre lentamente una porta; un personaggio che rimane immobile mentre cambia espressione; una tenda che viene mossa dal vento; foglie che oscillano; pioggia sulla strada; vapore che sale da una bevanda; un'automobile che attraversa l'inquadratura; una persona che si avvicina lentamente alla camera.
Sono tutte azioni che possono essere descritte in termini molto chiari.
Un buon esempio
Una donna di 35 anni rimane immobile davanti alla finestra. Dopo due secondi abbassa lentamente lo sguardo. Camera fissa.
Il sistema deve risolvere un compito semplice e limitato.
Un esempio molto più rischioso
La donna corre verso la finestra, apre le tende, vede un uomo nella strada, urla, prende il cellulare dalla tasca, telefona alla polizia, chiude la finestra e cade.
Narrativamente può essere una piccola scena. Generativamente è una catena di problemi.
E' molto meglio, per l'AI, dividerla in più clip.
* Il valore cinematografico delle microazioni
Nel cinema una grande emozione non richiede necessariamente una grande azione.
Un personaggio può ricevere una notizia devastante al telefono e, invece di piangere, continuare meccanicamente a piegare un tovagliolo.
Per il Text-to-Video questa può essere una soluzione perfetta:
Primo piano medio di un uomo di circa 45 anni seduto al tavolo della sala da pranzo. Tiene il telefono all’orecchio con la mano sinistra. Dopo aver ascoltato la notizia rimane immobile, abbassa leggermente gli occhi e continua lentamente a piegare e ripiegare un tovagliolo con la mano destra. Nessun pianto, nessun gesto violento. Recitazione trattenuta. Camera fissa.
L’azione è semplice, ma il significato è complesso.
Il Text-to-Video funziona particolarmente bene quando distinguiamo tra: complessità emotiva e complessità fisica.
Possiamo cercare una grande complessità emotiva mantenendo molto semplice il comportamento fisico del personaggio.
* Le azioni che richiedono maggiore cautela
Esistono invece operazioni che possono diventare più difficili perché richiedono una precisa relazione tra mani, oggetti, spazio e corpo.
Alcuni esempi sono:
- scrivere una frase lunga;
- allacciarsi una cravatta;
- infilare una chiave in una serratura;
- maneggiare utensili piccoli;
- passare un oggetto da una mano all’altra;
- prendere ed utilizzare un cellulare complesso;
- versare liquidi da recipienti con geometrie elaborate;
- aprire e richiudere contenitori;
- salire o scendere rapidamente da un'automobile;
- abbracciare più persone;
- interagire con molti personaggi contemporaneamente;
- vestirsi;
- togliersi una giacca;
- manipolare fotografie, carte o documenti;
- eseguire azioni che devono terminare in una posizione esatta.
Non significa che queste azioni siano impossibili.
Significa che è opportuno valutarle cinematograficamente.
Se l’azione importante è: l’uomo scopre una vecchia chiave, non è indispensabile mostrare tutto il processo, si può suddividere, ad esempio in:
apre il cassetto → rovista → trova la chiave → la prende → la pulisce → la rigira tra le dita.
Altrimenti noi possiamo semplicemente cominciare con: L’uomo tiene già la vecchia chiave nel palmo della mano e la osserva.
La narrazione rimane perfettamente comprensibile.
* Il principio dello stato iniziale e dello stato finale
Ogni clip diventa più controllabile quando sappiamo chiaramente: come comincia e come deve finire.
Ad esempio: "All’inizio Marta è in piedi accanto alla sedia. Lentamente si siede. Alla fine della clip è completamente seduta ed immobile."
Questa formulazione è molto più utile di: Marta si muove nella stanza e poi si siede.
Lo stato finale è importante perché determina il raccordo con l’inquadratura successiva.
Se nella clip successiva Marta è già seduta, dobbiamo essere certi che il piano precedente termini con Marta seduta.
È vero cinema: infatti stiamo progettando la continuità.
* Le sequenze Text-to-Video devono nascere dallo storyboard
Lo storyboard preparato precedentemente diventa ora una vera mappa di generazione.
Ogni riquadro dovrebbe permetterci di determinare:
- il tipo di piano;
- la posizione del soggetto;
- la direzione del suo sguardo;
- l'azione;
- l'eventuale movimento di macchina;
- l'ingresso e l'uscita;
- il raccordo con il piano successivo.
Immaginiamo lo storyboard della scena di Giacomo e Giulia alle tre di notte.
La sceneggiatura potrebbe dire: "Giacomo prepara lentamente una camomilla. Giulia lo osserva e tiene una mano sul cellulare. Tra i due c’è qualcosa che nessuno vuole ancora dire."
Possiamo trasformarla in una serie di piccole sequenze.
Inquadratura 1 - Campo totale
Giacomo è in piedi. Giulia è seduta.
Azione minima: Giacomo prende la tazza.
Inquadratura 2 - Dettaglio
La bustina entra nell’acqua.
Inquadratura 3 - Primo piano di Giulia
Giulia osserva il nonno.
Inquadratura 4 - Dettaglio
La mano della ragazza rimane appoggiata sul cellulare.
Inquadratura 5 - Primo piano di Giacomo
Giacomo si accorge dello sguardo della nipote ma non dice nulla.
Inquadratura 6 - Piano a due
Giacomo porta la tazza al tavolo e si siede.
Nessuna delle singole clip è particolarmente complicata.
La sequenza totale delle inquadrature, invece, può diventare emotivamente molto ricca.
* Quando usare direttamente il Text-to-Video
La generazione diretta dal testo è particolarmente utile quando non dobbiamo mantenere una precisione assoluta dell’immagine iniziale.
È adatta, per esempio, per: inquadrature d’ambiente.
Come: Una strada romana dopo la pioggia, lampioni accesi, passanti e automobili, asfalto lucido.
Establishing shot. Campo lungo di un piccolo paese italiano durante una festa estiva.
Atmosfere. Foglie mosse dal vento in un parco autunnale al tramonto.
Azioni semplici. Un uomo attraversa lentamente un corridoio.
Figure secondarie. Persone che conversano sullo sfondo di una festa.
Elementi naturali. Onde contro una banchina, pioggia sul vetro, neve, fumo, nebbia.
Transizioni visive. La luce del mattino entra lentamente nella stanza.
Sono tutti piani nei quali il volto non deve corrispondere perfettamente ad un personaggio già stabilito.
In questi casi possiamo concedere al sistema una certa libertà interpretativa.
* Quando è preferibile generare prima un’immagine
Ci sono invece molti casi in cui conviene utilizzare un procedimento a due stadi: ovvero: prima Image Generation, poi Image-to-Video.
In altre parole:
- creiamo prima il fotogramma statico corretto;
- lo controlliamo;
- lo approviamo;
- poi lo utilizziamo come base da animare.
Questo metodo è particolarmente utile quando l’inquadratura deve rispettare una forte continuità visiva.
* Caso 1 - Il volto del protagonista deve essere identico
Immaginiamo di aver già stabilito esattamente il volto di Marta.
Se generiamo direttamente: "Primo piano di Marta che guarda verso destra", il sistema di AI potrebbe interpretare Marta in modo leggermente differente.
Se invece possediamo già un’immagine corretta di Marta possiamo utilizzarla come base e chiedere alla AI di: "Mantenere identici volto, capelli, abbigliamento, luce ed inquadratura. Marta rimane quasi immobile e sposta lentamente gli occhi verso destra."
Il controllo di precisione aumenta enormemente.
* Caso 2 - La composizione deve essere precisa
Immaginiamo una scena con due personaggi seduti ai lati opposti di un tavolo e, tra loro, una fotografia della madre in una cornice d’argento.
La posizione della fotografia è narrativamente importante.
Generare direttamente il video dal testo potrebbe produrre:
- un tavolo differente;
- la fotografia spostata;
- i personaggi troppo vicini;
- una composizione asimmetrica;
- una cornice diversa.
È più sicuro creare prima il fotogramma esatto e poi animare soltanto piccoli elementi, come: "I due uomini rimangono seduti. Uno alza lentamente gli occhi verso l’altro. Il lampadario rimane immobile. Camera fissa."
* Caso 3 - La scenografia deve restare identica
Se abbiamo già creato la cucina di Giacomo con:
- la finestra a sinistra;
- i fornelli a destra;
- il frigorifero sul fondo;
- il tavolo centrale;
non vogliamo che in una nuova clip la finestra compaia improvvisamente dietro il frigorifero.
Quando la geografia dello spazio deve essere mantenuta, l’immagine di riferimento è particolarmente utile.
* Caso 4 - Il costume deve rimanere identico
Un personaggio può indossare: una camicia bianca, un cardigan verde scuro, un piccolo orologio, dei pantaloni beige.
In un Text-to-Video diretto, qualche elemento potrebbe variare.
Quando il costume è importante per la continuità, conviene anche qui partire da un’immagine già approvata.
* Caso 5 - È presente un oggetto narrativo preciso
Pensiamo ad elementi come:
- una fotografia;
- una chiave;
- una lettera;
- un giocattolo;
- una particolare tazza;
- una collana;
- una bobina cinematografica;
- un vecchio registratore.
Se l’oggetto deve essere riconosciuto dallo spettatore in più scene, è preferibile stabilirne prima l’aspetto in modo che l'oggetto non cambi nemmeno minimamente.
* Caso 6 - La posizione delle mani deve essere esatta
Per esempio: "Giulia tiene la mano destra appoggiata sul cellulare."
Se questa posizione deve diventare un dettaglio narrativo, meglio creare prima il fotogramma corretto ed animare dopo il minimo indispensabile. Le mani sono un elemento che potrebbe muoversi o sparire.
* Una buona domanda da farsi
Prima di ogni generazione possiamo domandarci:
Quanta libertà posso concedere all’Intelligenza Artificiale
in questa inquadratura?
Se la risposta è: Molta: mi interessa soprattutto l’atmosfera, allora il Text-to-Video diretto è ideale.
Se la risposta invece è: Pochissima: volto, posizione, costume e oggetti devono essere esattamente identici a quelli già utilizzati ed inquadrati, probabilmente, anzi conviene partire da un’immagine.
* Text-to-Video e movimento della macchina
Un altro grande vantaggio del video generativo è la possibilità di simulare movimenti cinematografici.
Ma anche in questo caso la semplicità aiuta.
Una clip può chiedere: lenta carrellata in avanti;
oppure: panoramica delicata da sinistra verso destra;
oppure: camera fissa;
oppure: movimento laterale che accompagna il personaggio;
oppure: leggera macchina a mano controllata.
Sarebbe da evitare, soprattutto all’inizio, formulazioni del tipo: "la camera parte dall’alto, scende rapidamente, compie un’orbita di 180 gradi, passa dietro il personaggio, attraversa una finestra e termina in primissimo piano."
Può produrre qualcosa di suggestivo, ma sarà molto più difficile controllarne lo spazio; il volto; lo sfondo; la continuità; la geometria e la durata.
Un cortometraggio non diventa moderno perché la camera si muove continuamente.
Molto spesso una camera ferma davanti ad un attore interessante produce un’immagine più forte.
* Camera fissa: una soluzione sottovalutata
Con il video generativo la camera fissa presenta molti vantaggi, tra cui:
- una maggiore stabilità del volto;
- minori trasformazioni dello sfondo;
- un migliore controllo degli oggetti;
- una maggiore leggibilità delle azioni;
- la maggiore facilità di raccordo;
- e la possibilità di aggiungere un movimento leggero successivamente in montaggio.
Per esempio: "Campo medio di una donna seduta al tavolo. Camera completamente fissa. Lei ascolta una telefonata, abbassa lentamente lo sguardo e continua a stringere il tovagliolo."
L’emozione è generata dall’attore, non dal movimento della camera.
* La carrellata in avanti
È probabilmente uno dei movimenti più utili.
Partiamo da un piano medio e ci avviciniamo progressivamente.
Può aumentare la tensione, l'intimità, l'attenzione o la sensazione di scoperta.
Prompt: "Lenta e regolare carrellata in avanti verso il volto dell’uomo. Lui rimane completamente immobile e guarda fuori campo. Nessuna rotazione della camera."
La precisazione “lui rimane immobile” evita che personaggio e macchina si muovano simultaneamente senza necessità.
* La carrellata all’indietro
Può comunicare una separazione; la solitudine; una conclusione; una perdita; od un distacco.
Per esempio: "Un uomo anziano rimane fermo davanti alla porta chiusa. La macchina arretra lentamente lungo il corridoio, facendolo apparire progressivamente più piccolo."
Qui il movimento possiede anche un significato emotivo.
* La panoramica
È utile soprattutto per rivelare un nuovo elemento.
Per esempio: "L’inquadratura comincia sulla tazza fumante. Lenta panoramica verso destra fino a mostrare Giulia seduta al tavolo."
Oppure: "L’inquadratura parte dalla porta chiusa e lentamente si sposta verso l’uomo che aspetta."
Non è necessario che la panoramica sia molto ampia.
* Il movimento laterale
Funziona bene con personaggi che camminano.
Ad esempio: "Una giovane donna cammina da sinistra verso destra lungo il marciapiede. La camera si muove parallelamente mantenendola al centro del fotogramma."
Questa indicazione stabilisce una direzione, chi è il soggetto dell'inquadratura ed il rapporto camera/personaggio.
* Il movimento orbitale
È più complesso perché richiede al sistema di ricostruire ciò che non era visibile all’inizio.
Un piccolo movimento di 20-30 gradi può essere molto più sicuro di una rotazione completa intorno al soggetto.
Per esempio: "Leggero movimento semicircolare verso destra intorno ai due personaggi, mantenendo costante la distanza."
È comunque opportuno utilizzarlo soltanto quando ha una reale funzione.
* Ottica e Text-to-Video
Possiamo continuare ad utilizzare il linguaggio delle focali cinematografiche.
Una indicazione come: "grandangolo equivalente a 24 mm" suggerisce un ambiente ampio e leggibile.
Un 35 mm può funzionare bene per una figura intera, per piani a due o per scene ambientate.
Un 50 mm suggerisce una prospettiva naturale.
Un 85 mm può essere utile per primi piani con isolamento del soggetto.
Ma non è necessario trasformare ogni prompt in una scheda tecnica ossessiva.
Se vogliamo semplicemente un primo piano naturale, possiamo dire: "Primo piano senza deformazione del volto, sfondo morbido e leggermente fuori fuoco."
Il risultato cinematografico conta più del valore della focale da utilizzare.
* Non contraddire il tipo di inquadratura
Un prompt può diventare confuso se chiediamo contemporaneamente: "grandissimo campo con tutto l’ambiente visibile, primissimo piano del volto e profondità di campo estremamente ridotta."
Occorre decidere qual è l’inquadratura che ci interessa.
E se servono entrambe allora generiamo due clip. Una per il campo generale. Una per il volto.
È anche esattamente ciò che farebbe un regista sul set.
* Text-to-Video e luce
La luce deve essere descritta come se stessimo parlando con un Direttore della Fotografia.
Non basta scrivere: "bella luce cinematografica."
Meglio scrivere: "luce naturale morbida proveniente dalla finestra sulla sinistra"
oppure: "lampada calda sul tavolo come principale fonte luminosa, ambiente circostante in penombra"
oppure: "luci fluorescenti fredde del parcheggio, alternate a zone più scure"
oppure: "sole molto basso del tardo pomeriggio alle spalle dei personaggi"
oppure: "controluce morbido che rende visibile il profilo".
La direzione della luce è particolarmente importante quando più clip appartengono alla stessa scena.
Se Marta nel campo generale riceve luce da sinistra, nei primi piani la luce dovrebbe continuare a provenire dallo stesso lato.
* Un esempio: " Il parcheggio sotterraneo"
Supponiamo di avere: Laura, 35 anni, è caduta nel parcheggio sotterraneo.
Potremmo generare direttamente:
Campo totale
Parcheggio sotterraneo realistico, illuminato a zone da lampade fluorescenti. Diverse automobili parcheggiate. Laura, donna italiana di 35 anni con capelli castani, camicia chiara e jeans scuri, è a terra vicino al centro dell’inquadratura dopo una caduta. Sta appoggiata sulle mani e cerca lentamente di sollevarsi. Camera fissa, 35 mm, luce fredda realistica.
Primo piano
Qui potrebbe essere preferibile utilizzare una immagine di riferimento per conservare perfettamente i lineamenti e le caratteristiche di Laura.
Quindi possiamo scrivere: "Mantenere identici volto, capelli ed abito. Primo piano di Laura. Ha un piccolo graffio sullo zigomo destro e polvere sugli abiti. Respira rapidamente, guarda fuori campo e cerca di capire che cosa l’abbia fatta cadere."
Dettaglio
Scriviamo: "Dettaglio della mano appoggiata sul cemento, leggera abrasione sul palmo, dita che si muovono lentamente. Camera fissa."
La scena globale poi sembra molto più complessa di quanto lo siano le singole generazioni.
_____________________________________
Link alla seconda parte dll'articolo






