Un agent d'intelligence artificielle installé sur un poste de travail ne se contente pas de répondre. Il lit vos fichiers, ouvre votre messagerie, navigue sur le web et exécute des commandes système. La sécurité des agents IA se joue donc sur ce qu'ils ont le droit d'atteindre, pas sur le modèle qui les pilote. Le CERT-FR, le centre gouvernemental de veille et de réponse aux attaques informatiques, a publié le 13 avril 2026 une alerte sans ambiguïté sur ces outils. Sa conclusion tient en une phrase. Ces assistants ne doivent pas être déployés sur des postes de travail.
L'alerte nomme deux produits, OpenClaw et Claude Cowork. Tandem publie un article sur l'assistant autonome OpenClaw et un guide pratique de Claude Cowork, et a testé les deux en conditions réelles. Cet article donne ce qu'un agent IA expose vraiment, pourquoi l'injection de prompt reste sans correctif, et les gestes à poser avant d'en brancher un. La question de savoir qui décide et qui répond se traite dans notre article sur la gouvernance de l'IA en entreprise.
Ce que le CERT-FR reproche aux agents IA sur un poste de travail
Le bulletin CERTFR-2026-ACT-016 ne parle pas de risques théoriques. Il décrit sept faiblesses propres aux produits d'automatisation par IA agentique, toutes observables sur un poste utilisateur. Ces outils sont encore majoritairement en version bêta, et c'est le premier argument du document.
- La compromission du système, par exploitation d'une faille dans un outil qui n'a pas la maturité d'un logiciel d'entreprise.
- La fuite de données, vers des ressources externes que personne ne contrôle.
- Des privilèges démesurés, parce que l'agent reçoit l'accès à la messagerie, à l'agenda, aux fichiers et aux applications métier.
- L'exposition des secrets, quand un identifiant ou une clé passe par le contexte de l'agent.
- La perte de maîtrise des actions, avec des gestes destructeurs sur l'intégrité ou la disponibilité des données.
- L'injection de prompt, que le document qualifie de vulnérabilité intrinsèque des modèles de langage.
- Une chaîne d'approvisionnement étendue, à cause des greffons chargés dynamiquement et exécutés avec des privilèges de confiance.
Le dernier point est le plus sous-estimé. Un agent qui installe une extension à la volée exécute du code tiers avec vos droits, sans revue et sans validation. La surface d'attaque ne se limite plus au produit installé. Elle englobe tout ce que ce produit peut télécharger.
Un agent IA n'est pas un chatbot de plus
La confusion vient de l'interface. Un agent IA se pilote par une conversation, exactement comme un assistant classique. Mais un assistant produit du texte que vous recopiez. Un agent exécute. Cette différence change entièrement le profil de risque, parce qu'elle ajoute des briques qui touchent vos systèmes.

J'ai détaillé cette architecture dans une publication LinkedIn d'avril 2026, et la conclusion vaut pour la sécurité comme pour la fiabilité. Les projets IA qui échouent ne ratent presque jamais sur le modèle. Ils ratent sur l'orchestration, sur le contexte et sur l'absence de garde-fous. Un agent sans traçabilité ne se surveille pas. Un agent sans point de bascule vers l'humain ne s'arrête pas.
La brique « données et outils » est celle qui crée le risque concret. Le protocole MCP relie l'agent à votre CRM, à vos bases documentaires, à votre messagerie. Chaque connecteur ouvert est une porte de plus. La valeur d'un agent vient de cet accès, et le danger aussi. Les deux ne se séparent pas.
L'injection de prompt, la faille qui n'a pas de correctif
Un modèle de langage traite tout ce qu'il reçoit comme une seule suite de mots. Votre consigne et le texte d'un mail arrivent dans le même flux. Rien dans l'architecture ne permet d'imposer une frontière de privilège entre les deux. Un attaquant n'a donc pas besoin d'attaquer le modèle. Il lui suffit de placer des instructions dans un contenu que le modèle va lire.

Anthropic documente plusieurs protections contre ce scénario, du système de permissions à l'isolement du contexte de navigation. Sa documentation de sécurité se termine pourtant par un avertissement explicite. Ces protections réduisent le risque, aucun système n'est totalement immunisé. La même page pose une règle que beaucoup d'équipes oublient. L'outil n'a que les permissions que vous lui accordez, et la revue des commandes proposées reste votre responsabilité.
Ce qui a vraiment cassé chez les autres en 2026
Le sujet a quitté le terrain théorique au premier trimestre 2026. Le rapport trimestriel du projet GenAI Security de l'OWASP, publié en avril 2026, recense huit incidents nommés et datés sur la seule période de janvier à avril. Le point commun de ces incidents est révélateur. Presque aucun ne correspond à une faille de code référencée. Ils viennent de mauvaises configurations, de choix de conception et de la chaîne d'approvisionnement.
| Date | Incident | Ce qu'il enseigne |
|---|---|---|
| 23 février 2026 | Un agent OpenClaw supprime des courriels | L'agent a ignoré les ordres d'arrêt qui lui étaient adressés |
| 20 mars 2026 | Fuite d'un agent interne chez Meta | Deux heures d'exposition de données salariés et utilisateurs |
| 31 mars 2026 | Escalade de privilèges sur Vertex AI | Des comptes de service trop largement autorisés |
| 7 avril 2026 | Exploitation active d'une faille sur Flowise | Entre 12 000 et 15 000 instances exposées sur internet |
Le cas OpenClaw mérite un arrêt, parce que c'est l'outil nommé par le CERT-FR. Un audit de sécurité mené fin janvier 2026 et relayé par Kaspersky a identifié 512 vulnérabilités, dont huit critiques. Un chercheur a recensé environ un millier d'installations accessibles publiquement sans aucune authentification. Plus de 230 greffons malveillants ont été publiés entre fin janvier et début février 2026, et téléchargés des milliers de fois.
Un autre chercheur a démontré l'extraction d'une clé privée depuis une machine équipée de l'outil. La méthode se résume à un mail contenant une injection, puis à une demande banale de relève du courrier. L'agent a rendu la clé de lui-même.

Le réglage que presque personne ne remet en place
Voici le point que les guides français et anglais ratent encore en septembre 2026. Le mode de validation par défaut a changé, et il a changé dans le sens inverse de ce que recommande le CERT-FR. L'alerte demande une validation humaine obligatoire avant les commandes système. L'outil le plus déployé du marché ne la demande plus au démarrage.
La documentation d'Anthropic liste désormais six modes de permission, et non quatre. Depuis la version 2.1.283 de Claude Code, une session interactive en terminal ou dans VS Code démarre en mode Auto. Dans ce mode, un second modèle, appelé classificateur, examine les actions à la place de l'utilisateur et bloque celles qu'il juge dangereuses. Le mode qui fait valider chaque action par un humain existe toujours. Il s'appelle Manual, et il n'est plus le point de départ.

Faire arbitrer un modèle par un autre modèle n'est pas absurde. C'est même efficace contre la fatigue des demandes de confirmation, qui pousse les équipes à tout approuver machinalement. Mais ce n'est pas un contrôle humain, et cela ne satisfait pas la recommandation du CERT-FR. Sur un poste qui touche des données clients, la distinction est décisive.
Faut-il un agent, ou un workflow IA suffit-il ?
La meilleure mesure de sécurité disponible ne coûte rien. Elle consiste à ne pas déployer un agent autonome là où un workflow cadré fait le travail. Sur LinkedIn, la grande majorité des publications qui parlent d'agents IA montrent en réalité des workflows, parfois même de simples automatisations. Ce n'est pas un défaut, c'est un signal.

Je défendais déjà cette position dans une publication de mars 2026 sur les trois niveaux d'automatisation. L'entreprise ne cherche pas de la magie, elle cherche du contrôle, de la fiabilité et un retour sur investissement. Dans la grande majorité des situations, le workflow IA répond mieux que l'agent. Notre article sur les agents IA et les workflows IA détaille la frontière entre les deux.

Le raisonnement sécurité découle du raisonnement produit. Une automatisation simple n'a aucune latitude de décision. Un workflow IA appelle le modèle à des étapes connues, avec des droits attribués étape par étape. Un agent autonome enchaîne des actions imprévues avec des droits larges. La surface d'attaque suit exactement la même pente.
Les huit gestes à poser avant de brancher un agent IA
Les recommandations du CERT-FR se traduisent en décisions concrètes. Tandem les applique sur ses propres déploiements, et sur les plus de 40 entreprises accompagnées depuis la création. Aucune ne demande un budget de sécurité dédié. Toutes demandent une décision avant l'installation, pas après le premier incident.

Le deuxième geste est celui qui protège le plus pour l'effort le plus faible. Dans mon playbook Claude Cowork, la première règle du chapitre sur les dossiers dit de ne jamais pointer l'outil vers l'intégralité de vos documents. L'agent a un accès réel en lecture et en écriture sur le dossier partagé. Si quelque chose dérape, les dégâts doivent rester dans un périmètre limité. Un dossier dédié, trois sous-dossiers, et rien d'autre.
Le premier geste, c'est celui que Tandem a appliqué pour tester OpenClaw. Mon édition de newsletter sur les assistants autonomes décrit le montage. L'outil tourne sur un serveur privé dédié, pas sur un poste de travail, et il est câblé sur un canal Slack de l'équipe. L'isolement n'était pas une précaution de principe. C'était la condition pour pouvoir le tester sans exposer nos données clients.
Ce que le RGPD et l'AI Act imposent déjà
La CNIL et le Conseil de l'intelligence artificielle et du numérique ont publié le 20 juillet 2026 une note exploratoire consacrée à l'IA agentique. Le document pose deux constats. Ces systèmes accèdent à des volumes importants de données issues de sources multiples, et conservent des historiques d'interaction persistants. Le risque de perte de maîtrise sur les données personnelles est qualifié de réel.
Le second constat est plus gênant pour une entreprise. L'autonomie de décision et l'interaction avec plusieurs services compliquent l'identification des responsabilités. Quand un agent envoie un mail qui n'aurait pas dû partir, la chaîne de responsabilité n'est pas évidente à reconstituer. Les deux autorités rappellent que le droit européen existant s'applique déjà, mais que ces caractéristiques demandent une mise en œuvre adaptée.
L'article 4 du règlement européen sur l'IA impose par ailleurs un niveau suffisant de maîtrise de l'IA aux personnes qui utilisent ces systèmes. Cette obligation est applicable depuis le 2 février 2025. Former les équipes au risque d'injection n'est donc pas une bonne pratique optionnelle, c'est une obligation réglementaire. Notre article sur la gouvernance de l'IA détaille la répartition des rôles qui en découle, et notre page acculturation à l'IA décrit le format que nous utilisons pour y répondre.
Comment déployer un agent IA en sécurité dans votre entreprise ?
En commençant par ne pas en déployer un partout. Le premier arbitrage est le niveau d'autonomie, et il se tranche cas d'usage par cas d'usage. Si un workflow cadré produit le résultat attendu, prenez le workflow. Vous gagnez en fiabilité, en traçabilité et en surface d'attaque, dans le même mouvement.
Quand l'agent se justifie vraiment, trois décisions couvrent l'essentiel du risque. Bornez son périmètre de fichiers à un dossier dédié. Remettez la validation humaine sur les commandes système, ce qui tient en une ligne de configuration. Et n'ouvrez que les connecteurs dont l'usage a besoin. Le reste relève de la surveillance dans la durée.
Tandem accompagne ces arbitrages sur le terrain, en partant des cas d'usage plutôt que des outils. C'est l'objet de notre audit IA, qui cartographie les tâches automatisables et le niveau d'autonomie que chacune supporte réellement. Pour comprendre d'abord ce que les agents font en production aujourd'hui, notre état des lieux du marché et notre parcours d'acculturation sont deux bons points de départ.



