¿Cómo reconoce imágenes la IA? Una guía sencilla, de los píxeles a las CNN

AI Neural ·

Desbloqueo facial, álbumes agrupados por persona, identificar plantas con una foto: detrás de todo ello hay lo mismo, lograr que una máquina entienda imágenes. La clave es simple: primero ver cómo son los números y luego cómo la red los combina en «características».

Para una máquina, una imagen es una cuadrícula de números

Una foto en color está formada por decenas de miles de píxeles, y cada píxel guarda tres valores de brillo —rojo, verde y azul— normalmente entre 0 y 255. Así que, cuando se entrega una imagen a una red, en realidad es una larga lista de números colocados en una cuadrícula ordenada.

Con esta «cuadrícula de números», el primer paso de la red es muy modesto: buscar pequeños cambios locales en la cuadrícula, por ejemplo un aumento o una caída brusca de brillo entre píxeles vecinos, es decir, un borde.

De los píxeles a las características: combinar capa por capa

Un borde por sí solo dice poco, pero combinarlos empieza a tener sentido. Las capas más profundas ensamblan los bordes simples en curvas, esquinas y texturas; otras aún más profundas los unen en partes como un ojo, una nariz, una rueda o un pétalo.

Nadie programa estas reglas a mano; la red las aprende durante el entrenamiento. Las «características» que aprende cada capa son una recombinación de la salida anterior, y cuanto más profundo, más abstractas son.

El ejemplo clásico: los dígitos manuscritos MNIST

Casi todo el mundo empieza el reconocimiento de imágenes con MNIST. Son decenas de miles de imágenes de dígitos manuscritos de 28×28 píxeles, cada una ya etiquetada con la respuesta correcta del 0 al 9: perfecto para practicar «mirar y clasificar».

Como las imágenes son pequeñas y hay pocas clases, incluso una red modesta alcanza una alta precisión en minutos: ideal para observar qué ocurre realmente durante el entrenamiento. Una vez entiendes MNIST, abordar tareas de imagen más complejas resulta natural.

Qué aporta una CNN frente a una red normal

Si conectas cada posición de píxel directamente a la capa siguiente, los parámetros se disparan y entrenar se vuelve difícil. La idea clave de una CNN es la convolución: deslizar una ventana diminuta por toda la imagen y reutilizar el mismo conjunto de pesos para buscar el mismo tipo de patrón. Así se conservan las relaciones espaciales y se recorta muchísimo el número de parámetros.

Además, las CNN suelen usar «pooling» para reducir los mapas de características, de modo que la red se fije más en si una característica existe que en el píxel exacto donde cae, haciéndola más robusta a pequeños desplazamientos. Apilar convolución y pooling capa tras capa es la estructura básica del reconocimiento de imágenes moderno.

FAQ

¿Por qué una imagen en escala de grises tiene un canal y una en color, tres?

Una imagen en escala de grises solo necesita un valor de brillo por píxel, de ahí un canal; una en color guarda tres valores —rojo, verde y azul— por píxel, de ahí tres canales. La red las trata igual, solo con algunos números de entrada más.

¿Entrenar el reconocimiento de imágenes requiere muchas imágenes?

Por lo general, cuantas más, mejor, pero puedes ampliarlas con el aumento de datos: girar, recortar o voltear ligeramente las imágenes para sumar efectivamente más. También puedes usar el aprendizaje por transferencia: un modelo ya entrenado con enormes conjuntos de imágenes que ajustas con pocos datos propios.

¿La IA puede dejarse engañar por ilusiones ópticas?

Sí. Cambiar unos pocos píxeles puede hacer que un modelo confunda una A con una B: son los ejemplos adversarios. Demuestran que el modelo aprende similitud estadística en lugar de comprender la imagen como una persona, por lo que en aplicaciones críticas de seguridad hacen falta protecciones adicionales.

AI Neural

Entiende el reconocimiento de imágenes paso a paso con AI Neural

Abre AI Neural y, con ejemplos interactivos, observa cómo los píxeles se convierten en bordes y los bordes en partes; captarás la idea de la CNN de forma intuitiva, mucho más fácil que memorizar definiciones.

App Store ↗

← AI Neural