NIST vient de terminer un test à grande échelle de logiciels de reconnaissance de tatouages, testant 12 algorithmes sur une base de données de 100 000 images de tatouages. L'agence affirme que les résultats font passer la technologie de la simple recherche par étiquettes de loisir à une correspondance visuelle de niveau forensique, obligeant les ingénieurs en vision par ordinateur à repenser leurs pipelines et leurs interfaces utilisateur.

Des mots-clés aux courbes

Pendant des années, les outils de recherche de tatouages destinés au grand public reposaient sur de simples étiquettes textuelles — « encre bleue », « dragon », « boussole ». Ces étiquettes ne fonctionnent que si la personne qui télécharge l'image utilise les mêmes termes que le chercheur. Cette incohérence rend la recherche par mots-clés peu fiable pour les forces de l'ordre ou les tribunaux, où les preuves doivent être reproductibles.

L'évaluation du NIST traite chaque tatouage comme un motif biométrique, à l'instar d'une empreinte digitale. Au lieu de chercher une correspondance de mots, les algorithmes analysent la courbure des lignes, les gradients de couleur et la forme globale, transformant chaque tatouage en un vecteur de haute dimension. La comparaison de deux vecteurs produit un score de similitude qui résiste aux changements d'éclairage, d'angle ou d'état de la peau.

Pourquoi les tatouages sont plus difficiles que les visages

La reconnaissance faciale bénéficie de points de repère stables — yeux, nez, bouche — qui restent sensiblement les mêmes sur les photos. Les tatouages, eux, manquent de points fixes. Les muscles étirent l'encre lorsque la personne bouge, et la texture de la peau change avec l'âge ou les variations de poids. Un algorithme qui obtient un bon score sur un cliché net et frontal peut échouer lorsque le même tatouage apparaît de profil dans une lumière tamisée.

Le test de 100 000 images du NIST a mis en évidence cette faiblesse. Beaucoup des 12 algorithmes ont performé de manière adéquate sur quelques milliers d'images sélectionnées, mais leur précision a chuté de manière notable face à des motifs courants tels que des lions, des crânes ou des roses des vents, qui apparaissent sous des milliers de variations dans le jeu de données.

Ce que les développeurs doivent changer

  • Abandonner les décisions binaires. Une correspondance « oui/non » n'est plus réaliste. Les systèmes devraient renvoyer une liste classée de candidats, chacun avec un score de similitude explicite.
  • Faire de l'humain l'arbitre final. Le logiciel peut réduire les possibilités, mais un analyste formé doit confirmer la correspondance avant qu'une conclusion juridique ne soit tirée.
  • Prioriser l'explicabilité. Dans un tribunal, l'accusation doit démontrer comment l'algorithme est parvenu à ses principaux candidats. Des superpositions visuelles simples mettant en évidence les courbes ou les zones de couleur correspondantes aident à remplir cette obligation.
  • Concevoir des interfaces utilisateur pour une confiance calibrée. Les interfaces qui n'affichent qu'un seul bouton « correspondance » encouragent une dépendance excessive. Les tableaux de bord devraient afficher toute la distribution des scores, permettre aux utilisateurs d'ajuster les seuils et indiquer clairement le niveau de confiance.

Enjeux pour la communauté forensique

Si une correspondance de tatouage peut être présentée avec la même rigueur qu'une empreinte digitale ou un profil ADN, les enquêteurs disposent d'un nouvel outil puissant dans les cas où l'art corporel d'un suspect est le seul élément distinctif. L'avantage est de disposer d'une boîte à outils probatoire plus large pour la révision des affaires non résolues et les enquêtes sur les personnes disparues.

L'inconvénient est le risque de fausse confiance. Même l'algorithme le plus performant de l'essai du NIST a encore identifié à tort un tatouage non correspondant comme un candidat principal dans un pourcentage faible mais non négligeable de cas. Surestimer la fiabilité de la technologie pourrait conduire à des accusations injustifiées, en particulier lorsque les jurés ne sont pas familiers avec les scores de similitude visuelle.

Contre-point : les limites de la technologie actuelle

Les critiques soutiennent que les tatouages sont intrinsèquement variables et qu'aucun algorithme ne pourra jamais atteindre la certitude d'une analyse ADN. Ils soulignent que de nombreux tatouages sont stylisés, contiennent du texte dans des écritures étrangères ou sont partiellement masqués par des vêtements, autant d'éléments qui dégradent la performance de la correspondance. Tant que le taux de faux positifs ne tombera pas à un niveau comparable à celui des biométries établies, les tribunaux pourraient rester sceptiques quant à l'acceptation des preuves par tatouage en l'état.

À surveiller ensuite

Le NIST prévoit de publier des mesures de performance détaillées pour chacun des 12 systèmes testés, permettant aux développeurs de comparer leurs propres pipelines à la norme publique. L'agence a également laissé entendre qu'un cycle de tests suivant introduirait des scénarios de capture en direct — des vidéos plutôt que des photos statiques — pour tester la capacité des algorithmes à gérer le flou de mouvement et les distorsions en temps réel.

Pour quiconque développe des outils de vision par ordinateur, l'enseignement est clair : la reconnaissance de tatouages passe d'une fonctionnalité de recherche gadget à un instrument forensique, et cette transition exige de la rigueur tant dans les mathématiques que dans la manière dont les résultats sont présentés aux utilisateurs humains.