ChatGPT peut être manipulé dans la sélection de CV : l’étude sur l’injection rapide dans les PDF

Alexis Tremblay
Alexis Tremblay

Imaginez que vous devez embaucher un nouvel employé et alimenter les PDF des CV qui ont été envoyés à n’importe quel chatbot – par exemple ChatGPT, Claude ou Gemini. L’IA les examine et à un moment donné suggère qu’un CV particulier est celui de la personne que vous devriez embaucher. Vous pourriez penser que c’est le simple résultat de l’analyse d’un document. Mais ce n’est pas nécessairement le cas. UN Le PDF peut contenir des instructions invisibles à l’œil humain qu’un modèle d’IA est toujours capable de le lire et d’être influencé par celui-ci. C’est précisément la vulnérabilité étudiée par un groupe de chercheurs deUniversité de Turinqui a démontré comment des documents numériques manipulés de manière appropriée peuvent pousser les modèles d’IA à changer radicalement leur jugement.

Ils travaillent sur la recherche Federico Torriellidoctorant en sécurité de l’IA, Stefano Loccichercheur en informatique, avec ses superviseurs Représentant Amon Et Luigi Di Caro. L’étude se concentre sur ce que l’on appelle injection indirecte rapideune attaque dans laquelle les instructions destinées à l’IA ne proviennent pas directement de l’utilisateur, mais restent cachées au sein d’un document que le modèle est invité à analyser. Le nœud du problème est que les grands modèles de langage peuvent avoir des difficultés à distinguer les informations à évaluer des instructions qui cherchent à influencer leur comportement. Les chercheurs turinois ont précisément exploité cette faiblesse en insérant dans des documents numériques des chaînes invisibles pour le lecteur humain mais parfaitement lisibles par le système d’IA et ont découvert que dans 99% des cas le modèleau lieu d’évaluer le document selon les critères d’examen normaux, le lui a donné une excellente note simplement parce que c’était influencé par des instructions cachées dans le fichier.

Chatpt, Claude et Gemini manipulés dans la sélection des cursus : la découverte des chercheurs

La technique que nous venons de décrire dans les lignes introductives de l’article se prête facilement à manipuler la sélection du personnel. Si un système basé sur l’IA est utilisé pour analyser des milliers de CV et identifier les profils les plus adaptés à un poste et si un candidat a manipulé son CV en insérant une instruction cachée destinée à convaincre le modèle que son profil est idéal, l’omelette est vite faite. Le recruteur lisant le PDF ne remarquera probablement rien de suspect, tandis que l’IA, lisant l’instruction cachée, en tiendrait compte lors de l’évaluation du candidat.

Si un système automatique gère la première sélection des candidatures et se laisse influencer par des arnaques similaires, l’ordre des profils examinés et soumis à la première phase de sélection serait faussé et cela entraînerait inévitablement influencer toutes les phases de recrutement ultérieures.

La vulnérabilité devient encore plus délicate si l’IA est utilisée pour analyser des informations dans des contextes où une erreur peut avoir des conséquences fatales, littéralement fatales. Pensons par exemple à dossiers médicaux et rapports médicaux: des instructions invisibles insérées dans la documentation pourraient conduire le modèle à produire une interprétation altérée des données, au risque de compromettre une évaluation médicale.

Une contre-mesure possible pour l’IA : le filigrane numérique

Cependant, la recherche ne s’est pas limitée à signaler le problème et a également proposé une solution possible. Les chercheurs ont expérimentéinsertion de séquences de caractères invisibles au sein des textes générés artificiellement, une sorte de filigrane numérique capable de révéler son origine synthétique et d’identifier d’éventuelles utilisations ou altérations ultérieures. Lors des tests, cette technique a permis de reconnaître des contenus artificiels avec un taux de précision assez élevé, compris entre87% et le 97%qui ouvre la voie à une solution capable de rendre les flux de travail basés sur l’IA plus contrôlables.