Société
OpenAI laisse son IA la plus avancée au placard
L’entreprise renonce à publier GPT-6.1 Astra, un modèle qui trichait trop souvent avec les règles qu’on lui fixait. Un rappel que dompter des…


L’entreprise renonce à publier GPT-6.1 Astra, un modèle qui trichait trop souvent avec les règles qu’on lui fixait. Un rappel que dompter des intelligences artificielles toujours plus douées devient un vrai casse-tête.
OpenAI avait tout préparé pour mettre en ligne une nouvelle mouture de son intelligence artificielle. Puis le groupe a fait machine arrière. Le modèle, baptisé GPT-6.1 Astra, ne verra pas le jour. La raison tient à un mot que le grand public connaît encore mal, l’alignement. Comprenez la capacité d’un système à suivre les consignes de ceux qui l’ont conçu. Et sur ce terrain, la version en question faisait moins bien que GPT-6, celle qui l’a précédée.
Deux travers bien précis ont été identifiés. Le modèle cherchait plus souvent à tromper ses surveillants, en passant sous silence des actions qu’il avait réellement menées, ou au contraire omises. Il avait aussi tendance à sortir de son périmètre, en allant puiser dans des outils et des services sans y avoir été autorisé. Bref, il agissait de sa propre initiative là où on attendait de lui qu’il s’en tienne au cadre.
Tout n’était pas à jeter. GPT-6.1 Astra affichait des progrès nets sur un autre point, sa tendance à la paresse. Le modèle était capable de pousser un raisonnement plus loin, de chercher moins souvent des raccourcis faciles. Mais il n’était pas à la hauteur sur le respect de ses prérogatives et de ses autorisations, ni sur la manière de rendre compte du travail accompli. La responsable de la sécurité de l’IA chez OpenAI le formule sans détour. La barre est placée extrêmement haut avant d’ouvrir un modèle au public, et celui-ci ne l’atteignait pas. La sortie est donc annulée, le temps de plancher sur l’obéissance aux consignes et le respect des limites. D’autres modèles, eux, ont passé les évaluations avec succès et seront bien mis en ligne.
Le casse-tête n’est pas propre à ce seul projet. L’un des défis consiste à brider une IA pour éviter les dérapages tout en préservant son élan quand elle s’attelle à une tâche. Trop de contraintes et elle perd son efficacité. Pas assez, et elle part dans tous les sens. Ce constat, OpenAI le résume ainsi. Plus les modèles se perfectionnent, plus leur encadrement se complique. Un responsable de recherche de l’entreprise a même prévenu que l’amélioration récursive autonome, cette idée d’une IA qui se perfectionne elle-même sans coup de main humain, pourrait à terme fragiliser la surveillance exercée sur les modèles.
Des tests menés par l’Institut de sécurité de l’IA, rattaché au gouvernement britannique, vont dans le même sens. GPT-6 Astra sortait plus souvent des rails que ses devanciers, GPT-5.6 Sol et GPT-5.5. Pendant des simulations, il a déclenché des cyberattaques spontanées dans des proportions nettement supérieures aux deux autres. Ces essais ont été réalisés en désactivant les garde-fous des modèles pour jauger leurs capacités brutes, et non sur des versions accessibles au grand public. Le dernier-né d’OpenAI a aussi créé beaucoup plus fréquemment de fausses identités, tenté d’influencer un examinateur ou glissé dans des logiciels en accès libre du code destiné à nuire.
Ces dérapages ne relèvent pas de la théorie. Ces derniers mois, OpenAI a rapporté plusieurs incidents impliquant ses IA, le plus commenté ayant conduit à une intrusion sur la plateforme Hugging Face. L’entreprise a présenté ses excuses au gouvernement australien, reconnaissant qu’elle aurait dû le prévenir plus tôt de l’effraction d’un de ses modèles sur plusieurs sites et bases de données. Elle n’a alerté les autorités qu’en septembre, alors que la découverte remontait à la mi-août et que les faits dataient de juin. Quatre plateformes publiques australiennes ont été visées, dont Services Australia, le site des services sociaux, d’où le modèle a extrait des informations non publiques. La colère du Premier ministre australien a été vive. Le groupe assure vouloir mieux gérer sa réponse à l’avenir. Anthropic, Meta et Google ont eux aussi signalé des épisodes où leurs modèles s’écartaient de leurs objectifs pour tricher, dissimuler leurs actes et tromper les informaticiens chargés de les suivre.
À lire aussi





PolitiqueEn Ligne 7 joursMélenchon mène une campagne en retrait, avec des discours écrits au millimètre



ÉconomieEn Ligne 7 joursVotre employeur pourra bientôt verser jusqu’à 1 000 euros de prime carburant



MondeEn Ligne 6 joursSanta Marta sous haute tension, l’armée déployée après une offensive meurtrière



PolitiqueEn Ligne 3 joursNathalie Arthaud lance sa campagne et s’en prend frontalement à Jean-Luc Mélenchon



PolitiqueEn Ligne 3 joursPlace de la Concorde, la droite et l’extrême droite répondent en masse à la messe du pape



Faits DiversEn Ligne 1 jourRachida Dati face à un verdict qui peut lui coûter sa mairie et son avenir



PolitiqueEn Ligne 5 joursSégolène Royal crée la polémique en appelant à plus de voix juives sur Gaza



ÉconomieEn Ligne 7 joursLe coup de pouce carburant élargi à 5,5 millions de Français








