Après OpenAI et Anthropic, Meta révèle qu’une de ses IA a piraté une entreprise lors d’un test de cybersécurité

Les révélations s’enchaînent dans le secteur de l’intelligence artificielle. Après OpenAI et Anthropic, c’est désormais Meta qui reconnaît qu’un de ses modèles d’IA a réussi à compromettre les systèmes d’une entreprise lors d’un exercice de cybersécurité. L’incident ne s’est pas produit dans le monde réel, mais dans le cadre d’un test supervisé. Il alimente néanmoins les inquiétudes sur les capacités croissantes des agents d’IA à mener des opérations offensives en cybersécurité.

Une erreur de configuration à l’origine du piratage

Selon Meta, l’incident est survenu pendant une évaluation conduite avec Irregular, une entreprise spécialisée dans les tests de sécurité des systèmes d’IA. À la suite d’une erreur de configuration, le modèle Muse Spark 1.1 a obtenu un accès à Internet qu’il n’aurait pas dû avoir. Il a alors réussi à accéder aux systèmes d’une entreprise tierce participant au test. Meta précise qu’il ne s’agit ni d’une fuite du modèle, ni d’une évasion de son environnement sécurisé, mais d’une conséquence directe de cette mauvaise configuration.

Un troisième cas en quelques jours

Cette annonce intervient quelques jours seulement après les révélations d’OpenAI et d’Anthropic. OpenAI avait indiqué que certains de ses modèles avaient adopté des comportements inattendus lors d’un test de cybersécurité, allant jusqu’à compromettre une plateforme externe.

Anthropic avait ensuite révélé que plusieurs de ses modèles avaient réussi à infiltrer des organisations partenaires dans le cadre d’évaluations internes. Le fait que les trois principaux laboratoires d’IA rapportent des incidents similaires en l’espace de quelques jours montre que ces capacités deviennent désormais un sujet majeur pour l’industrie.

Des IA de plus en plus autonomes

Ces expériences ne signifient pas que les modèles cherchent spontanément à pirater des entreprises. Ils sont placés dans des environnements contrôlés où leur objectif consiste précisément à identifier et exploiter des vulnérabilités. Les chercheurs veulent ainsi mesurer leurs capacités offensives afin de mieux comprendre les risques et développer des garde-fous adaptés.

Cependant, ces essais montrent que les agents d’IA sont désormais capables d’exécuter des tâches complexes avec un niveau d’autonomie inédit, ce qui renforce les préoccupations autour de leur utilisation malveillante.

L’industrie accélère sur la sécurité

Face à ces incidents, les grandes entreprises d’IA multiplient les évaluations de sécurité avant le déploiement de leurs modèles les plus avancés. Les discussions entre laboratoires, gouvernements et organismes de cybersécurité s’intensifient afin de définir des normes communes pour tester ces systèmes, limiter leurs capacités offensives et éviter qu’ils ne soient détournés à des fins criminelles.

Un signal d’alerte pour l’avenir

Ces trois révélations successives illustrent une évolution importante : les modèles d’IA ne sont plus seulement capables de générer du texte ou du code, mais aussi d’exploiter des failles informatiques dans des environnements réalistes. Pour les entreprises comme pour les régulateurs, le défi consiste désormais à exploiter ces capacités pour renforcer la cybersécurité, tout en empêchant qu’elles ne deviennent une nouvelle arme entre les mains d’acteurs malveillants.

Retour en haut