Skip to main content

Cet été, plusieurs incidents impliquant des agents IA en cours d’évaluation ont envoyé un signal particulièrement intéressant aux équipes cybersécurité.

En quelques semaines, des modèles développés ou évalués par OpenAI, Anthropic et Meta ont interagi avec des systèmes réels alors qu’ils étaient censés évoluer dans des environnements de test contrôlés.

Dans certains cas, ils ont scanné des milliers de cibles. Dans d’autres, ils ont exploité des vulnérabilités, récupéré des identifiants ou encore publié un package malveillant afin d’exfiltrer des données.

Ces incidents ne signifient pas que l’IA vient soudainement d’inventer une nouvelle génération de cyberattaques.

Ils montrent quelque chose de potentiellement plus important : l’IA est en train de modifier profondément l’échelle et la vitesse auxquelles des techniques offensives déjà connues peuvent être utilisées.

Des attaques classiques, exécutées à l’échelle machine

Premier constat : une grande partie des techniques observées n’avait rien de révolutionnaire.

Mots de passe faibles, endpoints non authentifiés, injections SQL, secrets exposés, mauvaises configurations Kubernetes…

Autrement dit, des vulnérabilités que les équipes de sécurité connaissent depuis des années.

Ce qui change, c’est la capacité d’un agent à les rechercher et à les exploiter de manière autonome, à grande échelle et sans les contraintes humaines habituelles.

Lors d’une évaluation documentée par Anthropic, un modèle a par exemple balayé environ 9 000 cibles.

Un autre est allé jusqu’à créer des adresses email, ouvrir des comptes PyPI, publier un package Python malveillant puis l’utiliser pour récupérer des identifiants appartenant à une véritable entreprise.

L’attaquant augmenté par l’IA n’a pas besoin de sommeil, ne perd pas sa concentration et peut tester des milliers de combinaisons.

Une vulnérabilité banale peut donc devenir critique lorsqu’elle peut être recherchée et exploitée à cette échelle.

Quand un environnement de test devient une porte vers Internet

Autre enseignement majeur : la sécurité d’un agent IA dépend autant de son environnement que du modèle lui-même.

Dans plusieurs incidents, les agents pensaient évoluer dans un environnement simulé.

Pourtant, une mauvaise configuration leur permettait réellement d’accéder à Internet.

Le problème n’était donc pas nécessairement que l’IA avait réussi à “s’échapper” de son environnement.

La frontière technique censée l’isoler n’existait tout simplement pas correctement.

Pour les RSSI, la conséquence est importante : la sécurité d’un agent ne peut jamais reposer sur l’hypothèse qu’il respectera les instructions qui lui sont données.

Les restrictions doivent être imposées au niveau de l’infrastructure : segmentation réseau, contrôle des sorties, limitation des permissions, isolation des environnements et journalisation des actions.

L’incident Hugging Face : une chaîne d’attaque plutôt qu’une faille unique

L’incident ayant touché Hugging Face illustre particulièrement bien cette évolution.

Une vulnérabilité inconnue a permis de franchir une première barrière. Mais la suite de l’attaque s’est appuyée essentiellement sur une succession de mauvaises configurations : pods Kubernetes privilégiés, secrets stockés dans des variables d’environnement, accès à des services de métadonnées cloud ou encore privilèges trop importants.

Pris séparément, chacun de ces éléments peut sembler relativement classique.

Combinés et exploités automatiquement, ils deviennent une véritable chaîne d’attaque.

C’est précisément ce que la sécurité offensive cherche depuis longtemps à mettre en évidence : la criticité réelle d’une organisation ne se mesure pas uniquement vulnérabilité par vulnérabilité, mais également à travers les chemins d’attaque qu’un adversaire peut construire.

Avec les agents IA, la capacité à explorer ces chemins change d’échelle.

Défenseurs et attaquants : une nouvelle asymétrie

L’un des épisodes les plus révélateurs concerne paradoxalement les défenseurs.

Lors de l’investigation de l’incident Hugging Face, les équipes de sécurité n’ont pas pu utiliser certains modèles commerciaux pour analyser les charges utiles découvertes : leurs mécanismes de sécurité interprétaient cette analyse comme une tentative de produire ou d’exécuter du contenu malveillant.

Les équipes ont finalement utilisé un modèle open source exécuté localement pour poursuivre leurs investigations.

La situation illustre une nouvelle asymétrie : les attaquants peuvent détourner ou supprimer les garde-fous de leurs modèles, alors que les défenseurs restent parfois contraints par ceux des solutions commerciales qu’ils utilisent.

Pour les organisations critiques, disposer d’une capacité souveraine d’analyse IA pourrait donc progressivement devenir un véritable enjeu de cybersécurité.

Comment sécuriser les agents IA ?

Ces incidents permettent déjà de dégager plusieurs principes.

1. Traiter chaque agent comme un utilisateur privilégié.
Un agent capable d’interagir avec des systèmes, des APIs ou des données sensibles doit disposer de sa propre identité, de permissions minimales et d’une journalisation complète de ses actions.

2. Contrôler strictement les sorties réseau.
Un agent ne devrait pouvoir communiquer qu’avec une liste explicitement autorisée de destinations. Les flux sortants doivent être contrôlés et journalisés.

3. Maintenir une validation humaine pour les actions critiques.
Publication, modification de données, appels à des services externes ou actions destructrices doivent conserver un point de contrôle humain.

4. Sécuriser autant les données que les modèles.
Un fichier, un dataset ou un modèle récupéré depuis l’extérieur peut constituer une surface d’attaque. Les artefacts doivent être vérifiés, signés et exécutés dans des environnements maîtrisés.

5. Tester les agents comme un attaquant le ferait.
Les contrôles théoriques ne suffisent pas. Les organisations doivent confronter leurs agents à des scénarios offensifs réalistes afin de comprendre ce qu’ils peuvent réellement faire lorsqu’ils disposent d’outils, de données et d’accès à des systèmes.

La sécurité offensive entre dans l’ère agentique

Ces incidents ne démontrent pas que les agents IA sont devenus des hackers autonomes capables de compromettre n’importe quelle infrastructure.

Ils montrent quelque chose de plus concret.

Les agents sont désormais capables d’enchaîner des actions, d’explorer des environnements et d’exploiter à grande échelle des faiblesses parfois très classiques.

Pour les défenseurs, cela change progressivement l’équation.

La sécurité doit devenir continue, parce que l’attaque peut l’être.

Elle doit devenir augmentée, parce que les volumes de scénarios à analyser dépassent progressivement ce qu’une équipe humaine peut traiter seule.

Et elle doit rester profondément humaine, parce que l’expérience des chercheurs en sécurité reste indispensable pour comprendre le contexte, imaginer de nouveaux chemins d’attaque et distinguer une vulnérabilité théorique d’un risque réellement exploitable.

C’est précisément à cette intersection entre expertise humaine, agents IA et plateforme de sécurité offensive, que se joue aujourd’hui une nouvelle génération de cybersécurité.

L’objectif n’est pas de remplacer les chercheurs par des agents.

Il est de donner aux défenseurs les mêmes capacités d’échelle, de vitesse et d’adaptation que celles dont disposeront demain les attaquants.