OpenAI ha sviluppato un modello nativamente multimodale capace di generare immagini precise, accurate e fotorealistiche, rendendo questa tecnologia non solo esteticamente apprezzabile, ma anche estremamente utile.
Convinta che la generazione di immagini debba essere una capacità primaria dei modelli linguistici, OpenAI ha integrato il suo generatore di immagini più avanzato all’interno di GPT-4o. Il risultato è un sistema che non solo crea immagini di alta qualità, ma le rende uno strumento efficace per la comunicazione visiva.
Una generazione di immagini utile
Dalle pitture rupestri alle moderne infografiche, OpenAI riconosce il ruolo fondamentale delle immagini nella comunicazione, nell’analisi e nella persuasione. I modelli generativi attuali sono in grado di creare scenari surreali e straordinari, ma spesso faticano a produrre immagini pratiche e funzionali, come loghi o diagrammi, che trasmettano un significato chiaro e preciso.
Con GPT-4o, OpenAI ha sviluppato un modello che eccelle nella resa accurata del testo, nel rispetto preciso delle istruzioni fornite e nell’uso del contesto della chat. Il modello è inoltre capace di trasformare immagini caricate dagli utenti o di utilizzarle come ispirazione visiva, facilitando la creazione di immagini personalizzate e migliorando la comunicazione attraverso i contenuti visivi.
Capacità migliorate
Per addestrare il modello, OpenAI ha utilizzato un approccio basato sulla distribuzione congiunta di immagini e testi online, permettendogli di apprendere non solo il rapporto tra immagini e linguaggio, ma anche tra le immagini stesse. Questo processo, combinato con un’intensa fase di addestramento posteriore, ha conferito al modello una notevole fluidità visiva, rendendolo capace di generare immagini coerenti, contestualizzate e di elevata utilità.
Rendering del testo
OpenAI ha dotato GPT-4o della capacità di integrare simboli e testo all’interno delle immagini, trasformando la generazione visiva in un potente strumento di comunicazione.
Generazione multi-turno
Grazie all’integrazione diretta della generazione di immagini in GPT-4o, OpenAI permette agli utenti di affinare le immagini attraverso conversazioni naturali. Il modello può mantenere la coerenza visiva tra più iterazioni, rendendolo ideale per processi creativi come la progettazione di personaggi per videogiochi.
Seguire istruzioni dettagliate
Rispetto ad altri modelli, GPT-4o di OpenAI è in grado di gestire fino a 10-20 oggetti distinti in un’unica immagine, garantendo un’elevata fedeltà nella rappresentazione di oggetti, attributi e relazioni tra di essi.
Apprendimento contestuale
OpenAI ha sviluppato il modello affinché possa analizzare immagini caricate dagli utenti e integrare i dettagli rilevanti nella generazione di nuovi contenuti visivi.
Conoscenza del mondo
La generazione di immagini con GPT-4o consente a OpenAI di collegare la conoscenza testuale con quella visiva, migliorando le capacità di ragionamento e di contestualizzazione del modello.
Fotorealismo e versatilità stilistica
Grazie a un addestramento su un’ampia varietà di stili visivi, OpenAI ha reso il modello capace di creare e trasformare immagini in modo altamente realistico e versatile.
Limitazioni
OpenAI riconosce che il modello non è perfetto e sta lavorando per migliorarne le capacità con aggiornamenti futuri.
Sicurezza
In linea con le specifiche del modello, OpenAI punta a massimizzare la libertà creativa supportando applicazioni come lo sviluppo di giochi, l’esplorazione storica e l’educazione, mantenendo al contempo rigorosi standard di sicurezza. L’azienda continua a bloccare le richieste che violano queste linee guida, garantendo un utilizzo responsabile della tecnologia.
Tracciabilità tramite C2PA e ricerca interna
Tutte le immagini generate con GPT-4o includono metadati C2PA, consentendo di identificare la loro origine per garantire maggiore trasparenza. OpenAI ha inoltre sviluppato un sistema interno che permette di verificare se un contenuto è stato generato dal proprio modello, analizzandone le caratteristiche tecniche.
Blocco dei contenuti dannosi
OpenAI continua a rafforzare le misure di sicurezza per impedire la generazione di contenuti che violano le sue politiche, come materiale di abuso sessuale su minori o deepfake a sfondo sessuale. Quando le immagini riguardano persone reali, l’azienda adotta restrizioni particolarmente severe, soprattutto per quanto riguarda la nudità e la violenza esplicita. La sicurezza rimane un impegno costante e le politiche verranno aggiornate in base all’uso effettivo del modello.
Per maggiori dettagli, OpenAI invita gli utenti a consultare l’addendum sulla generazione di immagini della scheda di sistema di GPT-4o.
Uso del ragionamento per la sicurezza
Durante lo sviluppo del modello, OpenAI ha addestrato un sistema di intelligenza artificiale dedicato al ragionamento sulla sicurezza, basato su specifiche umane. Questo sistema aiuta a individuare e risolvere eventuali ambiguità nelle politiche aziendali. Combinando questi strumenti con le tecnologie di sicurezza già implementate in ChatGPT e Sora, OpenAI è in grado di moderare sia i testi in input che le immagini generate, garantendo il rispetto delle proprie linee guida.
Accesso e disponibilità
A partire da oggi, OpenAI rende disponibile la generazione di immagini con GPT-4o per gli utenti Plus, Pro, Team e Free, come generatore predefinito di immagini in ChatGPT. Nei prossimi mesi, l’accesso sarà esteso anche agli utenti Enterprise ed Edu, e la funzionalità è già integrata in Sora. Coloro che preferiscono utilizzare DALL·E possono ancora accedervi tramite un GPT dedicato.
Gli sviluppatori potranno presto generare immagini con GPT-4o tramite API, con il rilascio previsto nelle prossime settimane.
OpenAI ha reso la creazione e la personalizzazione delle immagini estremamente intuitiva: gli utenti possono descrivere il contenuto desiderato specificando dettagli come proporzioni, colori in codice HEX o sfondi trasparenti. Poiché il modello genera immagini molto dettagliate, il tempo di rendering può richiedere fino a un minuto.

