En los aproximadamente 200 años de historia de la fotografía, alterar una fotografía requería un cuarto oscuro, algo de experiencia en Photoshop o al menos mano firme con tijeras y pegamento. El martes, OpenAI lanzó una herramienta que reduce el proceso a escribir una oración.
No es la primera empresa que hace esto. Si bien OpenAI tenía un modelo de edición de imágenes conversacional desde GPT-4o en 2024, Google ganó OpenAI para comercializar con un prototipo público en marzo y luego lo perfeccionó hasta convertirlo en un popular modelo de imagen Nano Banana (y Nano Banana Pro). La entusiasta respuesta al modelo de edición de imágenes de Google en la comunidad de IA llamó la atención de OpenAI.
El nuevo GPT Image 1.5 de OpenAI es un modelo de síntesis de imágenes de IA que genera imágenes cuatro veces más rápido que su predecesor y cuesta aproximadamente un 20 por ciento menos a través de la API. El modelo se lanzó a todos los usuarios de ChatGPT el martes y representa otro paso hacia hacer de la manipulación de imágenes fotorrealistas un proceso informal que no requiere habilidades visuales especiales.

Se agregó «Reina Galáctica del Universo» a una foto de una habitación con un sofá usando la imagen GPT 1.5 de ChatGPT.
GPT Figura 1.5 es notable porque es un modelo de imagen «nativo multimodal», lo que significa que la generación de imágenes ocurre dentro de la misma red neuronal que procesa las solicitudes de lenguaje. (Por el contrario, DALL-E 3, un generador de imágenes OpenAI anterior construido sobre ChatGPT, utilizó una técnica diferente llamada difusión para generar imágenes).
Este nuevo modelo, que exploramos con más detalle en marzo, trata imágenes y texto como la misma cosa: piezas de datos llamadas «tokens» que se deben predecir, patrones que se deben completar. Si subes una foto de tu padre y escribes «ponle un esmoquin en una boda», el modelo procesa tus palabras y píxeles de imagen en un espacio unificado, luego genera nuevos píxeles como si fuera la siguiente palabra en una oración.
Usando esta técnica, GPT Image 1.5 puede cambiar la realidad visual más fácilmente que los modelos de imágenes de IA anteriores, cambiando la pose o posición de alguien o renderizando una escena desde un ángulo ligeramente diferente, con distintos grados de éxito. Puede eliminar objetos, cambiar estilos visuales, ajustar la ropa y refinar áreas específicas, todo ello manteniendo la semejanza del rostro en ediciones sucesivas. Puede hablar con el modelo de IA sobre una foto, refinarla y revisarla, de la misma manera que redactaría un correo electrónico en ChatGPT.

