_________________________________________
Link alla prima parte dll'articolo
* Un altro esempio: "Il vecchio cinema"
Sceneggiatura: Un bambino di dodici anni entra nel cinema abbandonato dove il nonno lavorava come proiezionista e trova una bobina mai proiettata.
Possiamo progettare, ad esempio:
Clip 1 - Establishing
Text-to-Video diretto: "Campo lungo dell’interno di un piccolo cinema italiano abbandonato, poltrone impolverate, tendaggi consumati, fascio di luce che entra da una finestra alta, atmosfera sospesa."
Non serve una continuità precisa del volto.
Clip 2 - Il bambino entra
Text-to-Video: "Bambino di 12 anni entra lentamente nella vecchia sala, guardandosi intorno."
Clip 3 - Sala di proiezione
Potremmo creare prima un’immagine della cabina per stabilirne la scenografia.
Clip 4 - La bobina
Fase in cui l'immagine di riferimento è altamente consigliabile: "Il bambino tiene una vecchia bobina cinematografica davanti alla luce."
La posizione delle mani e della bobina è importante.
Clip 5 - Il volto
Partenza da una immagine per mantenere identico il ragazzo: "Il ragazzo guarda la pellicola controluce. Sul volto compare lentamente tanta meraviglia."
Ancora una volta: nello stesso cortometraggio possiamo alternare tranquillamente clip create con Text-to-Video ed Image-to-Video.
* Un progetto non deve scegliere un solo metodo
È un concetto fondamentale.
Non dobbiamo decidere: “Il mio film sarà tutto Text-to-Video.” oppure: “Il mio film sarà tutto Image-to-Video.”
Possiamo utilizzare per ogni inquadratura la tecnica più adatta.
Una sequenza può comprendere:
- due clip Text-to-Video;
- tre clip animate da immagini;
- una vera ripresa;
- un dettaglio creato separatamente;
- un'inquadratura fotografica con movimento aggiunto;
- materiale sonoro costruito successivamente.
Questa è la logica di una produzione cinematografica contemporanea: scegliere lo strumento in funzione del risultato che si vuole raggiungere.
* Problema: il personaggio cambia durante la clip
Può accadere, per esempio, che nella clip ricevuta dalla AI, i capelli si modifichino, o che il volto maturi o ringiovanisca, oppure che gli abiti cambino o che il corpo assuma proporzioni differenti.
Le possibili cause sono: azione troppo complessa, movimento eccessivo, durata troppo lunga, volto visto da angolazioni molto differenti oppure mancanza di un riferimento.
La soluzione può essere, quindi: mantenere il personaggio quasi frontale, ridurre la durata della clip, semplificare l’azione, diminuire i movimenti di macchina, o, meglio ancora, utilizzare una immagine iniziale già approvata.
* Problema: il personaggio non completa il gesto
Marta deve sedersi, ma rimane a metà. Perchè?
Soluzioni possibili: allungare leggermente la clip;
oppure: semplificare il movimento;
oppure: iniziare più vicino allo stato finale.
In alcuni casi la soluzione migliore è addirittura eliminare la necessità di mostrare quel gesto.
Clip A: Marta è in piedi.
Taglio.
Clip B: Marta è seduta.
Lo spettatore comprenderà automaticamente che si è seduta.
Questa è una delle grandi risorse del montaggio: non siamo obbligati a mostrare ogni singolo passaggio fisico.
* Problema: gli oggetti cambiano
Una lettera bianca diventa beige. Una tazza cambia manico. Una fotografia cambia persona. Una borsa cambia forma.
Quando l’oggetto è narrativamente importante, è preferibile:
- crearne una versione di riferimento;
- inserirlo già nel fotogramma iniziale;
- limitare il suo movimento;
- evitare che venga ruotato eccessivamente;
- od anche utilizzare un dettaglio separato.
Per un oggetto molto importante possiamo anche riprenderlo realmente ed integrarlo nel montaggio.
* Problema: le mani risultano poco credibili
L’interazione delle mani è più controllabile quando:
- è visibile una mano alla volta;
- il movimento è lento;
- l’oggetto è già impugnato;
- l’oggetto è sufficientemente grande;
- la camera non compie contemporaneamente movimenti complessi.
Piuttosto che: "il personaggio prende una fotografia dal cassetto con entrambe le mani, la gira, la apre e la passa a un altro personaggio", possiamo creare 3 clip o dettagli:
Dettaglio 1: mano dentro il cassetto.
Dettaglio 2: fotografia già nella mano.
Dettaglio 3: fotografia appoggiata sul tavolo.
Lo spettatore ricostruirà mentalmente l’azione.
* Problema: lo sfondo si trasforma
In una camera che si muove molto, l’IA deve continuamente inventare nuove parti dell’ambiente.
Una libreria può deformarsi. Una finestra può diventare una porta. Una sedia può scomparire.
Quali sono le soluzioni possibili:
- tenere la camera fissa;
- fare un movimento di camera molto piccolo;
- una immagine iniziale ben definita;
- usare ambienti semplici;
- evitare rotazioni complete;
- utilizzare una clip più breve.
* Problema: compaiono persone non richieste
Se la scena deve avere un solo personaggio, è utile indicarlo chiaramente: "È l’unica persona presente nella stanza."
Oppure: "La cucina è vuota eccetto Giacomo."
Se abbiamo uno sfondo molto popolato, invece, possiamo concedere alla AI una maggiore libertà: "comparse indistinte sullo sfondo."
* Problema: l’azione diventa troppo teatrale
Richieste generiche come: devastato dal dolore; terrorizzato; furioso;.. eccetera possono portare ad una mimica molto accentuata.
È spesso preferibile specificare i segni fisici utilizzati: stringe le labbra, trattiene il respiro, abbassa lentamente lo sguardo;
oppure: corruga leggermente la fronte e rimane immobile;
oppure: gli occhi diventano lucidi ma non piange.
La recitazione cinematografica può nascere proprio dalla sottrazione.
* Problema: il video sembra una pubblicità
Molti sistemi tendono spontaneamente verso immagini molto pulite, belle e patinate.
Ma se il cortometraggio richiede realismo possiamo indicazioni come: fotografia cinematografica naturalistica; ambiente vissuto; pelle naturale; nessun effetto glamour; luce credibile; movimenti umani imperfetti ma naturali; abiti leggermente vissuti; scenografia quotidiana.
Un thriller, un dramma familiare od una scena di solitudine non hanno necessariamente bisogno di sembrare pubblicità di lusso.
* Problema: il movimento è troppo veloce
Specificare la velocità.
Non solo: "si gira verso la finestra."
Ma: "dopo un breve momento, gira lentamente la testa verso la finestra."
Oppure: "cammina con passo lento e regolare."
Oppure: "con un movimento minimo e controllato."
Il ritmo fa parte della regia.
* Problema: troppe cose si muovono contemporaneamente
Una clip può contenere in contemporanea vari movimenti come: la videocamera che avanza; il personaggio principale che cammina; delle tende che si muovono; alcune persone sullo sfondo che si muovono; una automobile che passa; e delle pioggia, con dei riflessi,... ed un cane che corre.
Tutti questi elementi possono funzionare, ma aumentano l’instabilità del risultto.
Stabiliamo quindi una gerarchia:
azione principale: personaggio.
azione secondaria: ambiente.
camera: possibilmente semplice.
Per esempio: "La donna cammina lentamente verso la camera. Sullo sfondo poche persone si muovono naturalmente. Camera fissa."
* La durata delle clip
Per un cortometraggio generativo non è sempre necessario creare clip molto lunghe.
Una clip di pochi secondi può essere perfettamente sufficiente.
Pensiamo al montaggio cinematografico: un dettaglio della mano può durare due secondi; un primo piano può durare quattro; un campo totale può rimanere cinque o sei; un’attesa emotiva può invece aver bisogno di più tempo.
Non bisogna generare dieci secondi soltanto perché il sistema li permette.
Una clip più lunga aumenta anche il tempo durante il quale devono rimanere coerenti tutti gli elementi principali, quali: il volto; il corpo; gli oggetti; l'ambiente e la luce.
Perciò, quando non serve narrativamente, la brevità è un vantaggio tecnico e cinematografico.
* Costruire una sequenza attraverso clip sovrapposte
È utile prevedere un piccolo margine all’inizio ed alla fine di ogni clip.
Se ci serve un’azione di tre secondi, potremmo generare qualcosa di leggermente più lungo, in modo da avere:
- un momento prima dell’azione;
- l’azione;
- un momento dopo.
Questo offre al montatore maggiore libertà.
Esempio: Marta deve alzare gli occhi.
Non chiediamo che lo faccia immediatamente nel primo fotogramma.
Meglio allora chiedere: "Marta rimane immobile per circa un secondo, poi alza lentamente gli occhi ed alla fine resta nella nuova posizione."
Così il montatore potrà decidere esattamente quando tagliare.
* Il ruolo decisivo del montaggio
Il Text-to-Video non elimina il montaggio. Al contrario, lo rende ancora più importante.
Una clip generata non deve necessariamente contenere tutto ciò che vogliamo raccontare. Il significato può nascere dall’accostamento.
Immaginiamo: un Primo piano dell’uomo. Che guarda verso qualcosa.
Taglio.
Fotografia di una donna.
Taglio.
Primo piano dell’uomo.
L'uomo abbassa lo sguardo.
Non abbiamo mai chiesto al generatore di far prendere all’uomo la fotografia, guardarla e reagire.
Il montaggio ha creato il rapporto.
È il principio classico del linguaggio cinematografico applicato alla produzione generativa.
* Il suono può risolvere ciò che l’immagine non mostra
Il suono può ampliare enormemente il mondo della clip.
Una donna seduta in cucina sente: una porta chiudersi fuori campo.
Non dobbiamo generare la porta.
Un uomo in corridoio sente: un bambino ridere dall’altra parte della porta.
Non dobbiamo mostrare il bambino.
Una ragazza nel parcheggio sente: un’auto accendersi dietro di lei.
Non dobbiamo necessariamente mostrare immediatamente il veicolo.
Un uomo osserva una fotografia mentre ascoltiamo: la voce registrata della persona ritratta.
Il suono permette quindi di mantenere semplici le azioni visive e contemporaneamente rendere complessa la narrazione.
* Esempio completo: “Novanta secondi”
Immaginiamo Lea, montatrice e sound designer freelance.
La sceneggiatura dice: "Lea lavora di notte nel proprio studio. Sul computer compare un file audio che non ricorda di aver importato. Ascoltandolo comprende che contiene il grido della vicina Maya. Novanta secondi dopo sentirà realmente quel grido."
Come generarlo?
Non serve una lunghissima clip.
Inquadratura 1 - Campo totale
Text-to-Video diretto: "Studio di montaggio professionale ricavato in un appartamento. È notte. Lea lavora davanti a tre monitor. Camera fissa. Luci calde della stanza e fredde dei monitor."
Azione: Lea lavora al computer.
Inquadratura 2 - Monitor
Potrebbe essere creato separatamente o preparato graficamente.
Compare un nuovo file audio.
Il testo preciso del nome del file può essere inserito successivamente.
Inquadratura 3 - Primo piano
Partenza da immagine consigliata per mantenere l'immagine di Lea identica.
Text-to-Video: "Lea smette di muovere il mouse e fissa lo schermo. Cambia lentamente espressione."
Inquadratura 4 - Audio
Non serve alcuna nuova immagine di Lea.
Possiamo rimanere sul volto mentre ascoltiamo il grido.
Inquadratura 5 - Dettaglio
Orologio o timer.
Inquadratura 6 - Lea si alza
Se il movimento dell'alzarsi di Lea risulta difficile, possiamo fare:
piano A: Lea seduta.
Taglio.
piano B: Lea già in piedi.
Inquadratura 7 - Corridoio
Text-to-Video: "Lea corre verso la porta della vicina."
La complessità della scena nasce dal montaggio e dal suono, non da una generazione impossibile da controllare.
* Esempio romantico: "La stazione"
Scena: Chiara sta per partire. Andrea arriva di corsa perché finalmente vuole confessarle quello che prova.
Una versione generativamente difficile sarebbe: "Andrea corre attraverso tutta la stazione, evita persone, raggiunge Chiara, lei sale sul treno, lui la chiama, lei scende, parlano, si abbracciano."
Meglio costruire:
Campo lungo: Chiara vicino al treno con le valigie.
Piano medio: Chiara sta per salire sul treno.
Campo lungo: Andrea arriva correndo lungo il binario.
Primo piano di Chiara: Chiara sente il proprio nome e si gira.
Piano medio di Andrea: Andrea si ferma, senza fiato.
Campo/controcampo: Chiara ed Andrea si guardano.
Dettaglio: La mano di Chiara ancora sulla maniglia della valigia.
Primo piano: Andrea finalmente parla.
Il momento emotivo sarà molto più forte e ogni clip sarà più semplice.
* Esempio di una scena con due gemelli
Immaginiamo Jacopo e Tommaso, gemelli quarantenni, quasi indistinguibili.
La continuità dei due volti è particolarmente delicata.
In questo caso il Text-to-Video diretto potrebbe essere utile soltanto per:
- mostrare il deposito sul mare;
- i dettagli degli oggetti;
- gli esterni;
- alcune azioni senza volto.
Per i piani nei quali vediamo chiaramente entrambi i gemelli è preferibile partire da immagini di riferimento approvate.
Campo totale: "Mantenere identici i due gemelli. Jacopo rimane vicino alla porta con la macchina fotografica al collo. Tommaso sposta un vecchio giocattolo nello scatolone con la scritta “tenere”. Movimento naturale e minimo."
Primo piano di Jacopo: "Identico volto. Guarda il fratello senza parlare."
Primo piano Tommaso: "Identico volto ma postura ed espressione differenti. Evita lo sguardo e continua ad ordinare gli oggetti."
In questo modo l’IA serve alla messa in scena senza compromettere il principale elemento narrativo: sono davvero gemelli quasi identici.
* Una metodologia operativa efficace
Per ogni scena possiamo seguire questa procedura.
Prima: rileggere la scena ed identificare ciò che cambia realmente.
Poi: dividerla in inquadrature.
Successivamente: decidere per ogni inquadratura se utilizzare Text-to-Video diretto oppure Image-to-Video.
Quindi stabilire: lo stato iniziale; l'azione; lo stato finale; la posizione della camera; l'eventuale movimento; la luce; la durata; ed il raccordo.
Dopodiché si genera una versione di prova.
Se qualcosa non funziona, non bisogna modificare tutto contemporaneamente.
Cambiamo una sola variabile: o l'azione o la velocità; o il movimento dell camera; o la composizione; o la durata.
Una volta approvata la clip, viene catalogata ed inserita in un primo montaggio.
Il montaggio ci dirà se serve realmente un’altra inquadratura.
* Non generare tutte le clip prima di montare
È un errore molto costoso in termini di tempo. Meglio procedere scena per scena.
Per esempio: generiamo cinque inquadrature;
le montiamo;
aggiungiamo un audio provvisorio;
guardiamo la sequenza.
Potremmo scoprire, ad esempio, che:
- manca un primo piano;
- il dettaglio non serve;
- un campo può durare di più;
- due clip raccontano la stessa cosa;
- serve una reazione;
- un movimento è troppo evidente.
Solo allora generiamo ciò che manca.
L’Intelligenza Artificiale non elimina la necessità di pensare. Permette, invece, di provare e controllare più rapidamente le nostre decisioni.
* Il prompt deve descrivere ciò che vediamo, non ciò che sappiamo
Consideriamo: "Carlo è sconvolto perché ha appena scoperto che suo fratello gli ha mentito per vent’anni."
L’IA non può vedere direttamente “vent’anni di menzogne”.
Dobbiamo tradurli: "Carlo rimane immobile. Tiene la lettera abbassata nella mano destra. Guarda fuori campo verso il fratello, stringe leggermente le labbra e respira lentamente. Gli occhi diventano lucidi ma non piange."
Questa è un’azione video.
La grande regola resta:
Trasformare sempre l’emozione in comportamento visibile.
* Il Text-to-Video come forma di regia
Quando scriviamo: Una donna entra in una stanza, stiamo narrando.
Quando scriviamo: "Campo totale 16:9. La donna entra lentamente dalla porta sul lato sinistro e percorre tre passi verso il centro. Si ferma prima del tavolo e guarda fuori campo verso destra. Camera fissa. Luce laterale morbida dalla finestra. Movimento naturale e trattenuto." invece stiamo già facendo regia.
Abbiamo infatti deciso:
- la dimensione del piano;
- la direzione;
- la posizione;
- la durata dell’azione;
- lo sguardo;
- la luce;
- il movimento di macchina;
- ed il tono interpretativo.
Il prompt video è quindi molto vicino ad una sintetica indicazione di regia esecutiva.
* Non cercare sempre il risultato spettacolare
Una delle tentazioni più forti dell’IA generativa consiste nel chiedere immagini che sarebbe difficilissimo ottenere normalmente. Come: Camera che vola. Oppure: Città trasformate. Prospettive impossibili. Movimenti giganteschi.
Tutto questo può essere utile quando la storia lo richiede.
Ma un cortometraggio non ha necessariamente bisogno di dimostrare continuamente di essere stato realizzato con l’Intelligenza Artificiale.
Un primo piano credibile di una donna che aspetta inutilmente qualcuno davanti a due tazzine di caffè può essere narrativamente molto più interessante di una camera che attraversa l’intera città.
L’IA deve diventare invisibile quando il racconto lo richiede.
* Il vero obiettivo è la continuità emotiva
Possiamo perdonare una piccola differenza nella posizione di una tazza.
È molto più difficile perdonare una scena nella quale il personaggio sembra emotivamente differente ma senza ragione.
Bisogna quindi progettare anche una continuità della recitazione.
Se Marta nella prima clip è soltanto sospettosa, nella seconda non dovrebbe già apparire disperata se ancora non ha scoperto nulla.
Possiamo quindi costruire:
Clip A: curiosità.
Clip B: sospetto.
Clip C: comprensione.
Clip D: incredulità.
Clip E: dolore trattenuto.
È la stessa progressione che un regista chiederebbe ad un’attrice reale.
* Una semplice scheda per ogni clip
Prima della generazione possiamo compilare mentalmente o materialmente una piccola scheda, del tipo:
Scena: 4
Inquadratura: 6
Metodo: Text-to-Video
Personaggio: Marta
Piano: Primo piano
Stato iniziale: guarda la lettera
Azione: alza lentamente gli occhi
Stato finale: guarda fuori campo verso il marito
Camera: fissa
Luce: calda laterale da sinistra
Durata utile: circa 4 secondi
Raccordo successivo: controcampo del marito
Priorità: volto e sguardo
Elementi secondari: sfondo della cucina sfocato
A questo punto il prompt sarà molto più facile da scrivere.
* Quando rigenerare e quando correggere in montaggio
Non ogni piccola imperfezione richiede una nuova generazione.
Se la clip è ottima ma, ad esempio, dura un secondo di troppo, o l’ingresso è lento, od il finale è troppo lungo, o serve un piccolo avvicinamento, oppure il colore è leggermente differente, ... possiamo intervenire in fase di montaggio.
Possiamo:
- tagliare;
- rallentare moderatamente;
- stabilizzare;
- fare un piccolo crop;
- aggiungere una carrellata digitale;
- correggere il colore;
- sostituire l’audio;
- mascherare un piccolo errore con un’inquadratura di copertura.
Il principio produttivo è importante:
non chiedere alla fase generativa di risolvere ciò che
il montaggio può risolvere meglio.
* Le inquadrature di copertura
Durante la progettazione conviene generare alcuni inserti che possano essere utilizzati per nascondere raccordi difficili.
Per esempio, generare una tazza; una finestra; un orologio; una fotografia; le mani; un telefono; una porta; un’insegna; il cielo; una macchina che passa; un oggetto sulla scrivania...
Supponiamo che due primi piani di Giacomo non raccordino perfettamente.
Possiamo inserire un dettaglio della bustina di camomilla nella tazza.
Il pubblico non percepirà il salto.
Questa tecnica esiste da sempre nel montaggio cinematografico ed è ancora più importante nel cinema generativo AI.
* La forza del fuori campo
Il Text-to-Video diventa più semplice quando ricordiamo che il cinema non deve mostrare tutto.
Un personaggio può guardare qualcosa che non vediamo.
Possiamo sentire qualcuno entrare.
Possiamo ascoltare un’automobile frenare.
Possiamo udire una voce da un’altra stanza.
Possiamo vedere una reazione e scoprire soltanto dopo la causa.
Il fuori campo riduce la complessità generativa ed aumenta spesso la suspense.
In conclusione...
Generare direttamente un video dal testo è uno degli strumenti più potenti messi a disposizione dall’Intelligenza Artificiale, ma per utilizzarlo bene bisogna dimenticare l’idea che sia sufficiente raccontare al sistema l’intera scena.
Il Text-to-Video funziona meglio quando ragioniamo da registi e montatori.
Non chiediamo: “Fammi questa storia.” Ma chiediamo: “Realizza questa precisa inquadratura.”
Dobbiamo stabilire: chi vediamo, dove si trova, che cosa compie, da dove lo osserviamo, come si muove, da dove arriva la luce ed in quale situazione deve terminare l’inquadratura.
Le azioni semplici sono generalmente più controllabili.
I piccoli movimenti permettono una migliore coerenza.
Le emozioni possono essere complesse anche quando il gesto è minimo.
Quando un volto, gli abiti, gli oggetti, la composizione o la scenografia devono essere estremamente precisi, è spesso preferibile creare prima una buona immagine di riferimento ed animarla successivamente.
Quando, invece, conta soprattutto l’atmosfera, l’ambiente o un’azione semplice, possiamo sfruttare direttamente il Text-to-Video.
Il metodo più efficace non consiste quindi nello scegliere tra testo ed immagine, ma nell'utilizzarli strategicamente insieme.
Una produzione potrebbe impiegare Text-to-Video per un campo lungo, Image-to-Video per il primo piano del protagonista, una vera fotografia per un oggetto, una ripresa reale per le mani ed un suono costruito successivamente per completare la scena.
È proprio questa libertà a rendere interessante il nuovo modo di fare cinema.
Ma rimane una regola che l’Intelligenza Artificiale non cambia: il film nasce dalle scelte.
La tecnologia può generare movimento, luce, corpi, ambienti e trasformazioni. È ancora lo sceneggiatore-regista a stabilire quale immagine deve venire prima, quale dopo, quanto deve durare e soprattutto perché lo spettatore debba guardarla.
Il Text-to-Video diventa veramente cinematografico quando smette di essere una dimostrazione tecnologica e comincia a comportarsi come una macchina da presa: una inquadratura alla volta, al servizio della storia.






