En résumé:
- PCWorld a testé le nouveau modèle Images 2.0 de ChatGPT, qui démontre une précision remarquable dans le rendu du texte dans les images générées par l’IA, y compris les styles manuscrits.
- Le modèle mis à niveau est désormais disponible pour tous les utilisateurs et introduit des fonctionnalités améliorées telles que la recherche sur le Web, la création d’infographies et la prise en charge multilingue, y compris les scripts non latins.
- Le rendu de texte amélioré d’Images 2.0 ouvre des applications pratiques pour créer des catalogues, des storyboards et une documentation technique détaillée avec une précision textuelle parfaite.
Les modèles de génération d’images ont une longue histoire de texte maladroit. Mais alors que les lettres tronquées étaient autrefois un indicateur clair de l’IA, le nouvel outil de génération d’images de ChatGPT est le meilleur que j’ai jamais vu pour rendre du texte.
J’ai demandé au modèle Images 2.0 de ChatGPT (disponible dès maintenant pour tous les utilisateurs de ChatGPT, y compris ceux du niveau gratuit) de prendre du texte d’une de mes histoires récentes et de le restituer au crayon sur un bloc-notes légal jaune et, eh bien, cela me semble à peu près parfait :
Je l’ai également invité à créer une infographie sur les jetons IA, en lui demandant d’abord de rechercher des informations précises sur le Web et d’utiliser une police serif dans un format paysage 3:2. Voici ce que j’ai obtenu :

Ensuite, j’ai chargé Images 2.0 de créer une autre infographie, détaillant cette fois les différents modèles de Raspberry Pi avec leurs spécifications et autres détails :

Enfin, j’ai demandé au mannequin de prendre une photo de moi au bord de la piscine et de créer un lookbook de tenues d’été, mettant en vedette :

OpenAI affirme qu’Images 2.0 est son premier modèle de génération d’images doté de capacités de « réflexion », ce qui signifie qu’il peut s’arrêter et réfléchir à une invite d’image avant de s’y plonger directement.
En ce qui concerne le texte, Images 2.0 prend en charge une variété de langues, notamment le japonais, le coréen, le chinois, l’hindi, le bengali et d’autres qui utilisent du texte non latin.
Il peut également rechercher sur le Web des informations en temps réel avant de restituer des images, ainsi que créer plusieurs images en une seule fois, ce qui est idéal pour le rendu d’images de catalogue, de panneaux de style bande dessinée et de storyboards.
OpenAI promet qu’Images 2.0 offrira un « niveau de spécificité et de fidélité sans précédent », ce qui signifie (espérons-le) qu’il fera un meilleur travail en cas de respect rapide, c’est-à-dire en créant des images qui suivront vos instructions à la lettre.
Avec ce niveau de précision, Images 2.0 pourrait offrir une réponse à la question que je me pose depuis longtemps sur les modèles générateurs d’images : à quoi servent-ils, à part créer des mèmes loufoques ou des deepfakes effrayants ? Quelle est l’application réelle et pratique ?
La composition quasi instantanée, la création d’infographies et le rendu de catalogue pourraient être quelques-unes des solutions, même si la correction d’une faute de frappe nécessiterait un nouveau rendu complet de l’image.
Il est également possible que plus vous expérimentez avec Images 2.0 (je ne joue avec lui que depuis environ une heure), plus les images rendues se ressemblent, c’est pourquoi vous auriez probablement besoin d’un prompteur humain qualifié avec un œil pour le design à la barre.











