Comment l’IA reconnaît-elle les images ? Un guide clair, des pixels aux CNN

AI Neural ·

Déverrouillage par visage, albums triés par personne, identification de plantes sur simple photo : derrière tout cela, la même chose — amener une machine à comprendre les images. La clé est simple : d’abord voir à quoi ressemblent les nombres, puis comment le réseau les combine en « caractéristiques ».

Pour une machine, une image est une grille de nombres

Une photo couleur est faite de dizaines de milliers de pixels, et chaque pixel stocke trois valeurs de luminosité — rouge, vert et bleu — généralement entre 0 et 255. Quand une image est donnée à un réseau, c’est donc en réalité une longue liste de nombres disposés dans une grille bien ordonnée.

Face à cette « grille de nombres », la première étape du réseau est très modeste : chercher dans la grille de petits changements locaux, par exemple une brusque montée ou chute de luminosité entre pixels voisins, c’est-à-dire un contour.

Des pixels aux caractéristiques : combiner couche après couche

Un contour seul ne dit pas grand-chose, mais les combiner commence à faire sens. Les couches plus profondes assemblent les contours simples en courbes, coins et textures ; des couches encore plus profondes les assemblent en éléments comme un œil, un nez, une roue ou un pétale.

Personne ne code ces règles à la main ; le réseau les apprend pendant l’entraînement. Les « caractéristiques » apprises par chaque couche sont une recombinaison de la sortie précédente, et plus on descend, plus elles deviennent abstraites.

L’exemple classique : les chiffres manuscrits MNIST

Presque tout le monde commence la reconnaissance d’images par MNIST. Ce sont des dizaines de milliers d’images de chiffres manuscrits de 28×28 pixels, chacune déjà étiquetée avec la bonne réponse de 0 à 9 : parfait pour s’exercer à « regarder et classer ».

Comme les images sont petites et les classes peu nombreuses, même un réseau modeste atteint une grande précision en quelques minutes — idéal pour observer ce qui se passe réellement à l’entraînement. Une fois MNIST compris, les tâches d’image plus complexes deviennent naturelles.

Ce qu’un CNN apporte à un réseau ordinaire

Si l’on relie directement chaque position de pixel à la couche suivante, le nombre de paramètres explose et l’entraînement devient difficile. L’idée clé d’un CNN est la convolution : faire glisser une petite fenêtre sur toute l’image et réutiliser le même jeu de poids pour chercher le même type de motif. On préserve ainsi les relations spatiales tout en réduisant énormément les paramètres.

Les CNN utilisent aussi souvent le « pooling » pour réduire les cartes de caractéristiques, afin que le réseau se soucie davantage de la présence d’un motif que du pixel exact où il tombe — d’où une meilleure robustesse aux petits décalages. Empiler convolution et pooling couche après couche constitue l’ossature de la reconnaissance d’images moderne.

FAQ

Pourquoi une image en niveaux de gris a-t-elle un canal et une image couleur trois ?

Une image en niveaux de gris n’a besoin que d’une valeur de luminosité par pixel, d’où un canal ; une image couleur enregistre trois valeurs — rouge, vert, bleu — par pixel, d’où trois canaux. Le réseau les traite de la même manière, avec juste quelques nombres d’entrée en plus.

L’entraînement à la reconnaissance d’images exige-t-il beaucoup d’images ?

En général, plus il y en a, mieux c’est, mais l’augmentation de données — légère rotation, recadrage ou retournement des images — permet d’en « ajouter » efficacement. Vous pouvez aussi recourir au transfer learning : un modèle déjà entraîné sur d’énormes jeux d’images, que vous affinez avec peu de données personnelles.

L’IA peut-elle se faire tromper par des illusions d’optique ?

Oui. Modifier quelques pixels suffit à faire prendre un A pour un B : ce sont les exemples adversariaux. Ils montrent que le modèle apprend une similarité statistique plutôt qu’il ne comprend vraiment l’image comme un humain, d’où la nécessité de protections supplémentaires dans les usages sensibles.

AI Neural

Comprendre la reconnaissance d’images pas à pas avec AI Neural

Ouvrez AI Neural et, grâce à des exemples interactifs, observez les pixels devenir des contours et les contours devenir des éléments : vous saisirez l’idée du CNN de façon intuitive, bien plus facilement qu’en mémorisant des définitions.

App Store ↗

← AI Neural