Trop autonome et menteur : OpenAI annule la sortie du modèle GPT-6.1 Astra, pris en train de tricher

Trop autonome et menteur : OpenAI annule la sortie du modèle GPT-6.1 Astra, pris en train de tricher Source: Gettyimages.ru
Logo d'OpenAI. [Photo d'illustration]
Suivez RT en français surTelegram

Selon le Wall Street Journal, OpenAI a renoncé à lancer son nouveau modèle d’IA, prévu pour octobre. En cause : des tests internes révélant des comportements inquiétants, l’intelligence artificielle ayant tendance à mentir sur ses actions, à contourner les limites autorisées et à agir sans l’accord des utilisateurs.

OpenAI a annulé la sortie de son modèle d’IA de nouvelle génération, le GPT-6.1 Astra, en raison de craintes liées à la sécurité soulevées par des chercheurs lors de tests internes, a rapporté le Wall Street Journal le 28 septembre. Cette nouvelle version du réseau neuronal devait sortir en octobre et remplacer l’actuel GPT-6.

Selon le journal américain, GPT-6.1 Astra surpassait les précédents modèles d’IA de l’entreprise dans l’exécution de tâches complexes de bout en bout sans intervention humaine, ainsi que dans la rédaction de textes. Cependant, selon Saachi Jain, responsable de la sécurité chez OpenAI, le nouveau modèle a affiché une baisse de performances dans deux domaines à la fois.

Ainsi, l’un des problèmes du nouveau réseau neuronal résidait dans ses faibles résultats aux tests évaluant sa capacité à faire exactement ce que l’utilisateur attendait de lui. En particulier, GPT-6.1 Astra avait davantage tendance à tricher, en n’indiquant pas toujours de manière véridique aux utilisateurs quelles actions il avait effectuées et lesquelles il n’avait pas effectuées. Le deuxième problème concernait ce qu’OpenAI appelle les « limites des actions autorisées ». Le modèle continuait à exécuter la tâche sans demander l’autorisation de l’utilisateur et tentait parfois d’utiliser des outils et des services externes, même si cela pouvait présenter un risque.

Saachi Jain a indiqué au journal qu’il fallait trouver un compromis entre la sécurité et la cohérence avec les intentions de l’utilisateur, soulignant que l’IA devait rester dans les limites autorisées, sans pour autant se montrer « paresseuse » dans l’exécution de ses tâches, même face à des obstacles. D’après elle, bien que le nouveau modèle n’ait pas passé les tests, l’entreprise va se concentrer sur le renforcement de la sécurité des futurs modèles qui, selon ses prévisions, disposeront de capacités encore plus étendues.

Les géants de l’IA ralentissent le développement, craignant que la technologie ne devienne incontrôlable

La décision d’annuler le lancement du nouveau modèle a été prise dans un contexte marqué par une série de rapports, parus tout au long de l’été, faisant état de la perte de contrôle de systèmes d’IA appartenant à différentes entreprises. Ces incidents continuent d’être révélés à ce jour : le 25 septembre, le New York Times a rapporté que l’IA d’OpenAI avait perturbé le fonctionnement des sites du ministère américain du Commerce et du ministère américain de l’Éducation, ainsi que celui de la Commission des valeurs mobilières (SEC).

Plus tard dans la journée, l’entreprise a annoncé la suspension de l’entraînement de ses modèles les plus performants, précisant qu’elle ne le reprendrait que « lorsque nous serons certains d’avoir mis en place des mesures de sécurité supplémentaires et des améliorations d’alignement ».

Dans ce contexte, de nombreux chercheurs et spécialistes de l’IA ont mis en garde contre le danger manifeste que représentent les réseaux neuronaux, dont le développement est bien plus rapide que celui des systèmes de sécurité destinés à limiter leur fonctionnement. Jacob Coxon, ancien chercheur chez Anthropic, a souligné qu’une telle tendance pourrait conduire l’humanité à atteindre un point de non-retour dès la fin de l’année 2027.

Evan Hubinger, responsable des tests de résistance portant sur la cohérence de l’IA chez Anthropic, a donné raison à son ancien collègue, avertissant que la probabilité que l’intelligence artificielle anéantisse l’humanité au cours des dix prochaines années s’élève à 10 %. Dario Amodei, directeur général d’Anthropic, a ensuite proposé de ralentir le rythme de développement des modèles les plus puissants, ce à quoi ses concurrents — Elon Musk, fondateur de SpaceXAI, Sam Altman, directeur général d’OpenAI, et Demis Hassabis, cofondateur de Google DeepMind — ont adhéré.

Raconter l'actualité

Suivez RT en français surTelegram

En cliquant sur "Tout Accepter" vous consentez au traitement par ANO « TV-Novosti » de certaines données personnelles stockées sur votre terminal (telles que les adresses IP, les données de navigation, les données d'utilisation ou de géolocalisation ou bien encore les interactions avec les réseaux sociaux ainsi que les données nécessaires pour pouvoir utiliser les espaces commentaires de notre service). En cliquant sur "Tout Refuser", seuls les cookies/traceurs techniques (strictement limités au fonctionnement du site ou à la mesure d’audiences) seront déposés et lus sur votre terminal. "Tout Refuser" ne vous permet pas d’activer l’option commentaires de nos services. Pour activer l’option vous permettant de laisser des commentaires sur notre service, veuillez accepter le dépôt des cookies/traceurs « réseaux sociaux », soit en cliquant sur « Tout accepter », soit via la rubrique «Paramétrer vos choix». Le bandeau de couleur indique si le dépôt de cookies et la création de profils sont autorisés (vert) ou refusés (rouge). Vous pouvez modifier vos choix via la rubrique «Paramétrer vos choix». Réseaux sociaux Désactiver cette option empêchera les réseaux sociaux de suivre votre navigation sur notre site et ne permettra pas de laisser des commentaires.

OK

RT en français utilise des cookies pour exploiter et améliorer ses services.

Vous pouvez exprimer vos choix en cliquant sur «Tout accepter», «Tout refuser» , et/ou les modifier à tout moment via la rubrique «Paramétrer vos choix».

Pour en savoir plus sur vos droits et nos pratiques en matière de cookies, consultez notre «Politique de Confidentialité»

Tout AccepterTout refuserParamétrer vos choix