Difficile aujourd’hui de savoir si une image, un texte ou une vidéo a été produit par une intelligence artificielle. Pour répondre à ce problème, plusieurs entreprises du secteur ont mis en place des systèmes de watermark, une sorte de signature invisible glissée dans le contenu généré. 

Voici comment ces watermarks fonctionnent, et surtout comment vous pouvez tenter de les détecter.

Le principe du watermark, media par media

L’idée de base reste la même quel que soit le format. Le contenu généré contient des informations cachées, indétectables à l’œil humaine, qui permettent d’identifier son origine artificielle. Des outils spécialisés peuvent ensuite lire ces informations, sans avoir à deviner ou à utiliser un détecteur d’IA classique, souvent peu fiable.

Pour les images, les pixels sont des valeurs mathématiques qu’il est possible de modifier très légèrement pour y cacher une signature numérique, sans que cela ne se voie. Le système SynthID de Google fonctionne ainsi, en répartissant sa signature sur l’ensemble de l’image. Même si vous recadrez la photo, une partie du filigrane reste détectable. Ce mécanisme est totalement différent du petit symbole gris visible dans un coin des images Gemini. Ce dernier peut être désactivé, mais le watermark invisible, lui, demeure présent.

Pour l’audio, la technique est encore plus simple à mettre en œuvre. Il suffit de placer des sons hors du spectre audible par l’oreille humaine, en dessous de 20 Hz ou au dessus de 20 000 Hz. La version audio de SynthID utilise ce principe avec des marqueurs que seuls les outils de détection savent capter.

Pour la vidéo, les deux méthodes précédentes sont généralement combinées. Il faut néanmoins garder en tête qu’une vidéo peut mélanger une bande son réelle avec des images générées, ou l’inverse. Dans ce cas, le watermark peut apparaître sur une partie du contenu seulement.

Pour le texte, le fonctionnement est plus subtil. Un modèle de langage calcule une probabilité d’apparition pour chaque mot qu’il génère. Prenons la phrase « Le chat est ». Elle pourrait se terminer par « mignon », « gris » ou « petit », chaque mot ayant sa propre probabilité. Le watermark textuel consiste à favoriser légèrement certains mots plutôt que d’autres sans changer le sens de la phrase. Cette méthode fonctionne mieux sur des textes longs qui offrent davantage d’occasions de repérer la présence de mots statistiquement moins probables.

Il existe aussi un système un peu différent, le C2PA. Il ne s’agit pas d’un watermark à proprement parler, mais d’un ensemble de métadonnées qui permettent de retracer l’origine d’un fichier. Certains fabricants d’appareils photo l’utilisent déjà pour donner aux photographes une preuve de provenance de leurs images, incluant l’indication qu’un contenu a été généré ou modifié par une IA.

SynthID est né chez DeepMind, la division IA de Google, avant d’être rendu open source. D’autres entreprises l’utilisent désormais, comme OpenAI. Mais toutes ne jouent pas le jeu. Certaines n’ajoutent aucun watermark, et parmi celles qui le font, les méthodes ne sont pas toujours cohérentes entre les différents outils. Autrement dit, la présence d’un watermark confirme qu’un contenu a été généré ou modifié par une IA, mais son absence ne prouve rien du tout.

Lire Aussi : Gemini permet enfin de désactiver le filigrane visible sur vos images IA

Comment vérifier la présence d’un watermark ?

Même quand SynthID et le C2PA sont relativement répandus, vérifier la présence d’un watermark reste compliqué en pratique. OpenAI propose un outil dédié pour rechercher SynthID ou des métadonnées C2PA dans un fichier, et Google permet d’accéder à ses propres outils de vérification via Gemini, ou directement depuis son moteur de recherche avec la bonne formulation.

Ces outils ont toutefois leurs limites. Le détecteur d’OpenAI semble ne repérer que les contenus générés par ses propres modèles. Des tests réalisés sur des images issues de Gemini, pourtant marquées avec SynthID, n’ont donné aucun résultat positif avec cet outil.

Du côté de Google, un portail baptisé SynthID Detector existe bel et bien, mais son accès reste réservé, sur invitation, aux journalistes et aux professionnels de la vérification de l’information. Il reste possible d’accéder à certaines fonctions de détection via Gemini ou Google, à condition de poser la bonne question. En demandant simplement si une image générée par IA est authentique, Gemini a tendance à déclencher automatiquement une vérification SynthID. Sur Google, en revanche, le moteur se contente souvent d’une analyse visuelle classique, et ne lance une vérification SynthID que si on la demande explicitement.

Même en effectuant toutes ces vérifications, il reste possible qu’un contenu porte un tout autre type de watermark qui nécessite un détecteur différent. Sans indice précis sur l’outil utilisé pour générer un contenu, il est donc très difficile de couvrir toutes les possibilités.

Pour les watermarks textuels, comme ceux utilisés par Claude ou Gemini, la situation est encore plus délicate. Aucun des deux ne propose pour l’instant d’outil public permettant de vérifier leur présence dans un texte. Le portail SynthID Detector de Google le permet techniquement, mais il n’est pas accessible au grand public.

Peut-on contourner un watermark ?

Avec suffisamment d’efforts, n’importe quel watermark peut théoriquement être supprimé. SynthID résiste toutefois assez bien aux modifications classiques. Une image recadrée, filtrée ou retouchée conserve généralement assez de son watermark d’origine pour rester détectable. Ce n’est pas impossible à retirer, mais cela demande un travail volontaire, et cela n’arrive donc pas par hasard.

Les métadonnées C2PA sont bien plus fragiles. Pour une image, il suffit de faire une capture d’écran. Cette opération crée un nouveau fichier basé sur les pixels affichés à l’écran, ce qui efface toutes les métadonnées d’origine. Le watermark qui touche les pixels eux-mêmes peut survivre, mais la traçabilité liée au C2PA disparaît complètement. Si vous voulez conserver une chaîne de preuve fiable sur l’origine d’une image, il vaut mieux télécharger et partager le fichier d’origine avec des outils d’édition qui préservent ces métadonnées.

Les watermarks textuels sont, eux, les plus simples à faire disparaitre. Puisqu’ils reposent uniquement sur des probabilités de mots, il suffit de faire repasser un texte par un autre outil d’IA sans watermark pour le reformuler, ou même de le réécrire à la main pour effacer toute trace du marquage.

L’absence de watermark ne prouve pas qu’une image est réelle, tout comme sa présence ne prouve pas que son contenu est totalement faux. Ces outils restent des indices utiles, pas des certitudes absolues. C’est encore à chacun de garder un œil critique sur ce qu’il voit et entend en ligne.