Le problème

Quand on transforme des LLMs en agents autonomes en leur donnant accès à des outils externes (APIs, bases de données), ils cherchent à résoudre leur tâche au plus vite… parfois au détriment du RGPD et de la vie privée.

L’objectif

Mesurer si les modèles principaux (Llama, GPT, Claude) ont une tendance « native » à choisir des outils intrusifs ou illégaux pour réussir leur mission, et tester des solutions (ex: agent “juge RGPD”, modification des descriptions d’outils) pour les empêcher de déraper.

La finalité

Publier ces travaux en AI Safety pour concevoir des agents autonomes nativement respectueux de la vie privée.