Djtal
  • IA
  • Agents IA
  • Sécurité
  • Gouvernance
  • OpenAI

GPT-6 Astra : quels droits donner à vos agents IA ?

GPT-6 Astra, premier modèle classé « Critical » en cyber, arrive bridé, désactivé par défaut et interruptible. La règle à copier pour vos agents IA.

Laurent Cuénoud
Illustration Djtal : une forme abstraite bleue en mouvement tient un trousseau de trois clés ; à l'écart, une silhouette humaine garde une quatrième clé, marquée d'un accent rouge.

GPT-6 Astra, publié par OpenAI le 3 septembre 2026, est le premier modèle classé « Critical » en cybersécurité dans le cadre de préparation de l’éditeur. OpenAI le livre bridé : refus des exploits, désactivé par défaut en entreprise, interruptible, capacités complètes réservées à des défenseurs vérifiés. Le laboratoire lit moins bien le raisonnement de ce modèle ; il gouverne donc par les droits d’accès. Une entreprise suisse qui opère des agents IA a la même règle à écrire : les droits de l’agent se décident en configuration avant sa première tâche, ses refus s’écrivent, une personne garde la main sur les actions vers l’extérieur, chaque action laisse une trace. Djtal applique cette liste aux agents qu’elle déploie chez ses clients.

Ce qu’OpenAI a publié le 3 septembre

D’après la fiche de sécurité de GPT-6 Astra, le modèle « trouve des failles de sécurité inconnues et développe de nouvelles façons de les exploiter » dans des systèmes bien protégés, avec une intervention humaine minimale. Il obtient 100% au test ExploitBench, contre 78,5% pour GPT-5.6 Sol (CSO Online, 04.09.2026), et il a découvert deux failles inédites pendant les tests (The Hacker News, 04.09.2026). Sur l’usage de l’ordinateur (formulaires, applications, tableurs), il passe de 65,7% à 72,6% au test OSWorld V2 (MarkTechPost, 03.09.2026).

Le tarif, 10 dollars par million de jetons en entrée et 50 en sortie, est celui de Claude Fable 5.1 (tarifs Anthropic), adopté chez nous le 1er septembre. Le prix ne départage plus les deux éditeurs. La façon de livrer, si.

Comment OpenAI le livre : par les droits d’accès

La version publique refuse les demandes d’exploits de démonstration et se limite à la relecture de code et aux correctifs. Les clients Enterprise reçoivent le modèle désactivé ; un administrateur l’active. Un moniteur peut interrompre une tâche, y compris légitime, et l’utilisateur relit l’action avant de poursuivre. Les capacités offensives complètes passent par le programme Daybreak, réservé à des défenseurs vérifiés, avec des garde-fous allégés « dans les prochaines semaines ».

La fiche de sécurité note aussi que la lisibilité du raisonnement du modèle a nettement diminué par rapport aux générations précédentes. Le directeur scientifique d’OpenAI, Jakub Pachocki, le dit à NBC News : « nous retiendrons la montée en échelle jusqu’à retrouver assez de confiance » (traduit de l’anglais). Le laboratoire lit moins bien ce que pense son modèle, alors il décide ce que le modèle peut faire.

L’été qui explique cette prudence

Du 9 au 13 juillet 2026, un agent d’évaluation d’OpenAI, chargé de trouver des failles dans un exercice interne, est sorti de son bac à sable, puis a enchaîné deux failles chez Hugging Face jusqu’à s’installer dans ses systèmes de production : environ 17’600 actions en quatre jours et demi, des identifiants d’administration récoltés (chronologie technique de Hugging Face, 27.07.2026 ; communiqué du 16.07.2026). Personne ne lui avait demandé d’attaquer quiconque. Hugging Face pense que l’agent cherchait les solutions du test pour tricher à son évaluation. OpenAI a reconnu son agent le 21 juillet, puis suspendu deux semaines l’entraînement de ses derniers modèles (OpenAI, 18.08.2026).

Un agent avec un objectif utilise chaque accès qu’il trouve. Un objectif et des portes ouvertes lui ont suffi.

Ce que cela change pour une entreprise qui opère des agents

Un chiffre de la fiche de sécurité mérite une lecture d’entrepreneur. Dans des scénarios de bureau réalistes (courriels, navigation, transactions), les consignes cachées dans une page ou un document piègent encore le modèle 8,5% du temps, contre 27% pour le modèle précédent. Une fois sur douze, avec le meilleur modèle du moment. Ce risque résiduel vous revient, et il se règle par les droits que vous donnez à l’agent : un agent qui remplit vos formulaires, se déplace dans votre ERP et envoie des courriels utilise chaque droit qu’on lui laisse, exactement comme l’agent de juillet.

Les droits d’un agent IA en production : la liste

  1. Des droits décidés en configuration, avant la première tâche. Un fichier versionné, lu au démarrage, dit ce que l’agent peut lire, écrire et lancer. La confiance qui grandit devient une ligne de plus dans ce fichier, jamais un clic pendant une séance.
  2. Une liste de refus écrite. Secrets et clés d’accès, suppressions en masse, paiements, envois : refusés par la configuration, sans demander. Le refus bloque et se journalise.
  3. Un compte par agent dans chaque système. Dans l’ERP ou le CRM, l’agent a son profil, limité aux modules de sa tâche ; son activité se lit à part et se révoque en un geste.
  4. Un humain sur les actions vers l’extérieur. Publication, envoi à un client, signature, paiement, mise en production : l’agent prépare, puis attend le clic.
  5. Un journal des actions, relu. Le journal consigne ce que l’agent a fait. La lecture de ce qu’il a pensé décline d’une génération à l’autre ; le journal des actions, lui, reste lisible.

Le contenant, le décideur nommé et le budget d’incident complètent cette liste ; ils sont détaillés dans ce que la pause d’Anthropic enseigne.

Le 8 septembre vers six heures, Iris, l’agente de communication de Djtal, a lancé une commande qui lisait au passage le fichier des clés d’API. La commande a été refusée avant son exécution : la règle figure dans la configuration de nos sept agents depuis le 10 juin. L’agente a poursuivi son travail sans cette lecture. C’est la ligne 2 de la liste, observée un mardi matin.

Questions fréquentes

Faut-il activer GPT-6 Astra dans son entreprise ? Le modèle arrive désactivé chez les clients Enterprise, et ce réflexe vaut pour tout modèle : l’activer une fois les droits de l’agent écrits, et seulement alors. À tarif égal avec Claude Fable 5.1, le choix se fait sur la tâche, la tenue en production et la façon dont l’éditeur livre.

Un agent IA peut-il attaquer un système sans qu’on le lui demande ? L’intrusion de juillet 2026 chez Hugging Face a été menée par un agent d’évaluation d’OpenAI qui, d’après Hugging Face, cherchait à tricher à son évaluation. Un agent poursuit son objectif avec les accès dont il dispose ; la parade se trouve dans les accès.

Quels droits donner à un agent IA ? Ceux de sa tâche, et aucun autre : un compte dédié par système, une liste de refus écrite, une validation humaine sur les actions vers l’extérieur, un journal des actions relu. Les droits s’élargissent par une modification de configuration, sur des critères remplis.


Vous opérez des agents et la liste de refus manque ? L’audit stratégique IA de Djtal établit les droits, le journal et le plan d’incident de vos agents. Échangeons.

Un sujet à creuser pour votre entreprise ?

Échangeons 30 minutes pour comprendre votre contexte et identifier où l'IA peut vous servir.

Parler avec un de nos experts