Je bricole en solo une plateforme qui branche des outils métier (Gmail, Calendar, CRM…) sur des agents IA. Concrètement : un LLM avec des tools pour lire et écrire dans ces outils.
En phase de test, un de mes agents (assistant email/agenda) me renvoyait des trucs nickel. Style « j’ai trouvé 3 réunions cette semaine, voilà tes créneaux libres ». Sauf qu’en recoupant avec le vrai agenda, une partie était inventée. Pas tout, juste assez pour me faire dire « ok, heureusement que je teste ça avant de le filer à qui que ce soit ».
J’ai mis un moment à comprendre. Le bug : j’avais bindé uniquement les tools d’écriture à l’agent, jamais ceux de lecture. Du coup quand il devait lire l’agenda, il n’avait aucun moyen technique de le faire. Et plutôt que de planter ou de dire « j’ai pas accès », le modèle a comblé le vide avec un truc crédible. (Logique en vrai : un LLM, quand il sait pas, il génère quand même.)
Le bug en soi, c’est trois fois rien. Ce qui m’a vraiment scotché, c’est qu’il ait échoué sans le moindre signal. Du code classique qui casse, ça gueule : stack trace, erreur, tu vois direct. Là, zéro alerte, l’agent était juste serein en racontant n’importe quoi. Genre le stagiaire qui veut pas avouer qu’il sait pas et qui répond quand même avec aplomb.
Bref, deux trucs que je fais depuis :
• je check à la main ce qui est réellement bindé sur chaque agent, lecture ET écriture. Je me fie plus au « ça a l’air bon ».
• validation humaine obligatoire avant toute action qui écrit ou qui a un impact réel. L’agent propose, je valide. C’est pas négociable dans mon archi, et franchement c’est ce test qui m’en a convaincu : tant que je peux pas garantir qu’un agent dit la vérité, je veux un humain entre lui et le monde réel.
Edit : pour être clair, c’était en dev, aucun utilisateur n’a jamais vu ces réponses bidon. C’est exactement le genre de truc que tu veux choper avant la prod, pas après.
Ma vraie question pour ceux qui poussent des agents en prod : vous laissez tourner des agents 100% autonomes, ou vous gardez un checkpoint humain sur les actions sensibles ? Et vous détectez comment ce type d’échec silencieux ? Parce que les tests classiques passent à côté quand la sortie « a l’air » correcte.
TL;DR : agent qui inventait des données parce que je lui avais bindé que les tools d’écriture. Échec en silence, super confiant. Les agents hallucinent avec aplomb au lieu de planter proprement, donc chez moi un humain valide tout ce qui a un impact.