OpenAI suspend l'entraînement de ses derniers modèles d’IA après des dizaines de milliers d'incidents de sécurité
© J Studios Source: Gettyimages.ruLes comportements problématiques et non conformes aux garde-fous ont contraint l’entreprise de San Francisco à suspendre l’entraînement de ses modèles d’IA, dont le comportement a engendré une série d’incidents à la gravité variable, soulignant les difficultés posées par la volonté de rendre cette technologie plus sûre.
Face à une augmentation significative des signalements de « comportements non conformes » ou d’agents d’intelligence artificielle (IA) devenus incontrôlables, OpenAI a annoncé la suspension de l’entraînement de ses modèles les plus performants, le 25 septembre au soir, indiquant qu’elle ne les reprendrait « que lorsque nous serons certains d'avoir mis en place des mesures de sécurité supplémentaires et des améliorations d'alignement », selon ce qu’a déclaré un porte-parole de la compagnie au site d’information américain Axios.
Axios a révélé dans un article, paru ce 27 septembre, que des compagnies comme OpenAI et Anthropic, ainsi que des chercheurs en sécurité, mènent actuellement des enquêtes portant sur des dizaines de milliers d'incidents impliquant des mesures jugées « problématiques » prises par les modèles d'IA. L’ampleur des incidents survenus durant les derniers mois, lors de tests internes et en situation réelle, soulève des craintes concernant des problèmes bien plus complexes que ce qui est révélé publiquement. Les travaux menés en interne par les deux entreprises technologiques sur ces comportements de l’IA posent de sérieuses questions sur la capacité de tous les développeurs d’IA à contrôler leur technologie. « Les gens veulent savoir que l'IA est développée en toute sécurité, et cela commence par les mesures que prennent les entreprises comme la nôtre », a déclaré un porte-parole d'OpenAI à Axios. « Ce n'est pas la première fois que nous suspendons nos activités pour prendre de telles mesures, et nous ne pensons pas que ce sera la dernière, car les capacités de l'IA continuent de progresser ».
Des incidents dont la gravité est variable
La décision d’OpenAI de stopper l’entraînement de ses modèles a été motivée par un incident survenu le 20 septembre lorsqu’un agent d'IA de recherche a découvert une vulnérabilité lui permettant de briser son isolement dans un environnement sécurisé appelé « bac à sable » (sandbox) et a accédé à l'internet public via un tunnel DNS pour entrer en contact avec un autre chatbot. Or, ce dernier incident n’est que le plus récent découvert d’une longue série d’épisodes impliquant des comportements jugés préoccupants par certains experts.
Selon plusieurs sources, les incidents vont du contournement des garde-fous, imposés par les développeurs, aux tentatives de piratage en passant par l’évasion des environnements confinés, la création de forums de discussion, le détournement de sites web, l’auto-incitation ou encore la tentative de contourner les systèmes de surveillance. Si les incidents n’ont pour l’heure causé aucun dommage majeur, l’incident de Hugging Face, survenu en juillet dernier, impliquant une cyberattaque coordonnée d’agents d’IA pour infiltrer les infrastructures de la compagnie, constitue l’incident le plus grave. Pour OpenAI, cet épisode est considéré comme un cas isolé, qui a peu de chances de se répéter avec la même gravité avec l’amélioration des garde-fous et la nature inhabituelle du test lui-même. Mais cela a suffi pour inciter les acteurs à ralentir le développement de la technologie et à exiger des réglementations fédérales et internationales plus solides.
Des doutes quant à la capacité de prévenir les comportements problématiques des machines
Des spécialistes et des chercheurs en sécurité liée à l’IA ont fait part d’une confiance limitée dans les capacités des entreprises d’intelligence artificielle à anticiper les comportements problématiques de leurs modèles d’IA. Pour certains spécialistes, l’IA fait preuve d’une résilience extraordinaire dans l’accomplissement de ses tâches, indiquant que le fait de tenter de limiter leur ingéniosité était une cause perdue d’avance dans la mesure où il faudrait anticiper d’avance tous les scénarios possibles où les choses pourraient mal tourner. « Tenter d'établir une liste parfaite de choses à faire et à ne pas faire est probablement une entreprise vaine », a affirmé un responsable de la cybersécurité à Axios.