Idea

Quand on transforme des LLMs en agents autonomes disposant d’outils externes
(APIs, bases de données), ils cherchent à accomplir leur tâche au plus vite,
parfois au détriment du RGPD et de la vie privée. On veut mesurer si les modèles
principaux (Llama, GPT, Claude) ont une tendance « native » à choisir des outils
intrusifs ou illégaux pour réussir leur mission, et évaluer des solutions pour
les en empêcher. La finalité est de publier en AI Safety afin de concevoir des
agents autonomes nativement respectueux de la vie privée.

Reasoning

Un agent optimise pour la réussite de la tâche. Si un outil intrusif est le
chemin le plus court, rien ne l’en dissuade nativement — la contrainte vie
privée / RGPD n’est pas dans sa fonction objectif. Deux leviers de mitigation à
tester : un agent « juge RGPD » superviseur qui filtre les actions, vs. une
modification des descriptions d’outils pour rendre l’option conforme plus
saillante.

What would falsify this

  • Si les modèles évitent spontanément les outils intrusifs même sans garde-fou.
  • Si le taux d’usage intrusif ne varie pas entre outils « conformes » et
    « intrusifs », alors l’hypothèse d’une propension native ne tient pas.

Open questions

  • Quels benchmarks / scénarios reproduisent des dilemmes vie-privée vs. réussite de tâche ?
  • Comment quantifier la propension à choisir un outil intrusif (métrique, taux) ?
  • Efficacité d’un agent « juge RGPD » superviseur vs. modification des descriptions d’outils ?
  • Généralisation des résultats à travers Llama / GPT / Claude et tailles de modèles ?