IA y datos · 3 min read · Mar 26, 2026

El nuevo conjunto de datos Pico-Banana-400K de Apple establece las bases para una edición de imágenes AI más inteligente

Apple Pico-Banana

Apple ha lanzado un nuevo conjunto de datos de investigación llamado Apple Pico-Banana-400K, y es uno de los movimientos más grandes que la compañía ha hecho en la investigación de IA últimamente.

El conjunto de datos tiene 400,000 imágenes editadas, cada una creada y revisada cuidadosamente para entrenar sistemas de IA que pueden editar imágenes basándose en instrucciones de texto escritas.

Este nuevo lanzamiento ayuda a solucionar uno de los principales problemas en la edición de imágenes por IA, que es la falta de conjuntos de datos abiertos y de buena calidad para la investigación.

Lo que lo hace más interesante es que Apple utilizó los modelos Gemini-2.5 de Google para ayudar a generar y filtrar los datos.

Esto muestra cómo ambas compañías están abiertas a trabajar a través de las fronteras de la investigación para mejorar el futuro de la IA.

¿Por qué es importante este conjunto de datos?

En su artículo titulado “Pico-Banana-400K: Un conjunto de datos a gran escala para la edición de imágenes guiada por texto”, el equipo de Apple mencionó que la mayoría de los conjuntos de datos de edición de IA existentes son pequeños, no diversos o están bloqueados detrás de sistemas propietarios.

Debido a esto, los investigadores a menudo encuentran difícil entrenar o probar nuevos modelos de manera consistente.

El conjunto de datos Apple Pico-Banana soluciona directamente ese problema. Está abierto para uso no comercial, lo que significa que los investigadores pueden acceder libremente a él desde GitHub, estudiarlo y usarlo en sus proyectos de IA. Sin embargo, no puede ser utilizado para ningún propósito comercial o con fines de lucro.

Pico-Banana

¿Cómo construyó Apple el conjunto de datos Pico-Banana?

Los investigadores de Apple comenzaron recolectando un gran conjunto de imágenes reales del conjunto de datos OpenImages, que incluye personas, objetos y escenas con texto.

Luego prepararon 35 instrucciones de edición diferentes divididas en ocho categorías principales. Algunas ediciones eran simples, como aplicar un filtro, mientras que otras eran complejas, como convertir a una persona en una figura de dibujos animados o en una versión estilo juguete.

Apple Pico-Banana-400K

Para crear realmente las imágenes editadas, Apple utilizó el modelo Nano-Banana de Google (Gemini-2.5-Flash-Image).

Después de eso, cada imagen generada fue revisada por otro modelo, Gemini-2.5-Pro, que verificó qué tan bien la edición coincidía con el aviso y qué tan realista se veía la imagen.

Solo las imágenes que pasaron ambas verificaciones fueron añadidas al conjunto de datos final Apple Pico-Banana-400K. Este proceso aseguró que el conjunto de datos mantuviera una fuerte calidad y variedad.

Lectura adicional:

  • Apple M5 vs. M4: Diferencias clave para ayudarte a elegir mejor

  • Google Vibe Coding da paso a una nueva era de creatividad AI en Gemini Studio

  • Microsoft presenta MAI Image 1, un generador de imágenes AI revolucionario

¿Qué hace único al conjunto de datos Apple Pico-Banana?

A diferencia de otros conjuntos de datos que solo muestran un par de imágenes de antes y después, Pico-Banana-400K también incluye ediciones de múltiples turnos, donde una imagen pasa por una serie de hasta cinco cambios. Esto ayuda a los modelos a aprender cómo seguir un proceso de edición más largo y paso a paso.

También incluye pares de preferencias, que comparan una buena edición con una mala. Esto ayuda a los modelos de IA a aprender qué evitar, mejorando la precisión y fiabilidad en tareas del mundo real.

Apple admitió que todavía hay algunos problemas menores, especialmente con detalles finos o texto dentro de las imágenes, pero en general, el conjunto de datos es sólido.

Está diseñado para ayudar a construir mejores sistemas de edición de imágenes guiados por texto que entiendan los avisos más claramente y produzcan ediciones más limpias y naturales. Los investigadores pueden leer el estudio completo en arXiv y descargar el conjunto de datos directamente desde GitHub.

Share: X/Twitter LinkedIn

Recibe nuevas publicaciones en tu bandeja de entrada.

No spam. Cancela la suscripción en cualquier momento.