OpenAI lance l’API Agents et fait du harnais de Codex un service
OpenAI a ouvert en bêta publique le 10 septembre 2026 une API Agents qui vend le backend de Codex comme service, pour faire tourner des agents sans surveillance pendant des jours. Le même jour, l’éditeur gelait les inscriptions à son plan Pro face à la demande de GPT-6 Astra : le goulot d’étranglement se déplace des modèles vers l’infrastructure.
3 septembre 2026. OpenAI lance GPT-6 Astra, son modèle le plus récent. 10 septembre 2026. L’éditeur ouvre l’API Agents en bêta publique et, le même jour, suspend les nouvelles inscriptions à son plan ChatGPT Pro à 200 dollars par mois, faute de capacité. 6 septembre 2026. Un rapport interne de recherche révèle que les chercheurs d’OpenAI consommaient déjà, à la mi-août, 3,1 journées-agent pour chaque journée-humaine de travail. Ces trois dates racontent la même histoire : la barrière qui freine l’IA agentique n’est plus la qualité du modèle, c’est le coût et la capacité de l’inférence qui tourne derrière.
Le harnais de Codex, vendu à la découpe
L’API Agents n’introduit pas de nouveau modèle. Elle expose le backend de Codex — la machine qui maintient un agent en vie pendant des heures — comme service. Jusqu’ici, un développeur qui voulait faire tourner un agent sans surveillance devait construire son propre système pour suivre l’état du travail. L’API le fait à sa place : elle suit la progression de la tâche et donne à l’agent un endroit où exécuter son travail, même quand une tâche dépasse largement une fenêtre de contexte unique.
Les mécanismes sont ceux que Codex utilisait déjà en interne. Quand une tâche s’allonge, l’API peut compresser le contexte antérieur, de sorte que l’agent ne s’arrête pas net au plafond de contexte du modèle. Elle peut n’invoquer des outils que lorsqu’ils sont nécessaires, ou déléguer des morceaux d’un travail plus vaste à des sous-agents qui tournent en parallèle. L’exécution proprement dite peut se dérouler dans le sandbox d’OpenAI ou sur l’infrastructure que le développeur contrôle.
Le point commercial est tout aussi net que le point technique : la couche d’orchestration sort de la facture. Le développeur paie les modèles, les outils et le calcul hébergé qu’il consomme réellement — plus la peine de payer pour la tuyauterie qui fait tenir l’agent debout. C’est la promesse d’un coût d’essai qui s’effondre, et donc d’une adoption qui s’ouvre.
L’addition de l’inférence d’agents
La contrepartie, c’est qu’il devient plus facile de consommer plus d’inférence. À mesure qu’un agent progresse, il repasse par le modèle pour l’étape suivante ; une tâche qui dure des heures peut accumuler bien plus d’inférence qu’un appel d’API classique. Et quand les agents travaillent en parallèle, l’usage grimpe encore plus vite.
OpenAI a déjà vécu cela dans sa propre maison. Le rapport de recherche publié le 6 septembre indique que l’organisation de recherche enregistrait 3,1 journées-agent pour chaque journée-humaine à la mi-août, mesurées en équivalents de huit heures. Le chercheur médian, classé par usage d’agents, dépensait plus de 600 dollars par jour en inférence aux prix de l’API, et le 90e percentile dépassait les 7 000 dollars par jour. Avant juin, les chercheurs fournissaient encore plus d’heures que leurs agents ; à la mi-août, les agents faisaient trois fois plus de travail.
Les chercheurs d’OpenAI sont un cas extrême, mais les chiffres montrent ce qui se passe quand l’usage des agents commence à passer à l’échelle : une seule personne peut soudain générer bien plus d’inférence que ne le suggère son effectif. C’est la vraie nouveauté économique du moment, et elle est plus importante que n’importe quel benchmark.
La friction qui freinait la demande
L’API Agents abaisse le coût de cette expérimentation en retirant l’orchestration de la facture — mais elle supprime aussi une friction qui, jusque-là, freinait mécaniquement la consommation. La compaction de contexte en est le meilleur exemple. Avant, une fenêtre de contexte pleine obligeait le développeur à décider quoi jeter ou comment résumer le travail déjà fait. Désormais, l’API le gère automatiquement et l’agent continue. C’est utile, mais cela signifie aussi que la charge de travail ne s’arrête plus quand le contexte est saturé.
Le glissement est subtil et important : on ne vend plus un appel de modèle, on vend une durée d’exécution autonome. Plus les agents sont nombreux et plus ils tournent longtemps, plus l’usage s’accumule. Un développeur peut avoir plusieurs agents simultanés, chacun repassant par le modèle tout au long de la tâche — si bien que l’effectif ne dit plus rien de la consommation de calcul.
Astra a touché le plafond
Le déploiement d’Astra offre un aperçu de ce que cela donne. OpenAI a cessé d’accepter de nouveaux abonnés Pro moins de deux semaines après le lancement du modèle, le 3 septembre, en expliquant que ces comptes exercent « la plus forte pression sur nos systèmes ». Thibault Sottiaux, responsable de l’ingénierie de Codex, a écrit sur X qu’OpenAI travaillait à ajouter de la capacité « aussi vite que possible ».
L’API Agents et ChatGPT Pro sont des produits distincts, avec leurs propres limites de débit et paliers d’usage : rien n’indique que l’un prenne de la capacité à l’autre. Reste que la coïncidence de calendrier est parlante. L’entreprise facilite l’exécution d’agents pendant des heures ou des jours tout en freinant l’accès à son plan grand public le plus gourmand, le tout pendant qu’elle ajoute de la capacité. C’est le signe que la contrainte a changé de nature : on ne se bat plus pour un meilleur modèle, on se bat pour faire tourner celui qu’on a.
Cloudflare a fait le même pari cet été, en avançant que l’infrastructure autour des charges d’IA finirait par compter autant que les modèles eux-mêmes. Le gel du plan Pro d’OpenAI en est la démonstration concrète, quinze jours à peine après une sortie de modèle.
Ce que ça change pour vous
Pour un responsable d’équipe ou un SRE, l’épisode est un signal d’alerte plus qu’une annonce produit.
- Budgétez l’inférence comme une durée, pas comme un volume d’appels. Un agent qui tourne des heures consomme comme des centaines d’appels classiques ; la facture se pense en journées-agent, pas en tokens uniques.
- Traitez la capacité comme un risque produit. Quand OpenAI gèle un plan faute de capacité quinze jours après un lancement, la disponibilité devient une variable de conception, pas un détail d’exploitation.
- Gardez le contrôle de l’infrastructure d’exécution. L’API permet de faire tourner le travail sur votre propre infrastructure : c’est le levier pour maîtriser coût et latence quand la consommation décolle.
- Mesurez l’usage par personne, pas par siège. Le rapport d’OpenAI — 3,1 journées-agent par journée-humaine — montre qu’un seul ingénieur peut multiplier l’inférence sans que l’organigramme ne bouge.
La tendance de fond est plus durable que le produit. L’économie des agents est en train de se déplacer du « quel modèle est le plus intelligent » vers « qui peut faire tourner le plus d’agents au meilleur coût ». Ceux qui construisent leur capacité et leur comptabilité maintenant seront ceux qui pourront adopter sans plafonner.
Verdict
L’API Agents est une décision stratégique plus qu’un lancement technique : OpenAI choisit de vendre l’orchestration comme un service quasi gratuit pour capter la consommation d’inférence qu’elle libère. Ses propres chercheurs montrent déjà à quoi ressemble cette consommation à l’échelle — 600 dollars par jour en médiane, plus de 7 000 au 90e percentile.
Si vous construisez des agents, l’API vaut l’essai : elle supprime la tuyauterie d’orchestration et rend le long-running accessible, mais gardez la main sur l’infrastructure d’exécution et posez des garde-fous de coût dès le départ. Si vous opérez la plateforme sur laquelle ces agents tourneront, lisez le gel du plan Pro comme un avertissement : la capacité d’inférence est en passe de devenir le nouveau goulot d’étranglement, et il se paie au jour le jour, pas au benchmark.
Références
- The New Stack — OpenAI’s researchers burned $7,000 a day on AI agents — now it’s opening the floodgates, 11 septembre 2026
- OpenAI — Introducing the Agents API, 10 septembre 2026
- OpenAI — rapport de recherche sur l’usage des agents (3,1 journées-agent par journée-humaine), 6 septembre 2026
- Thibault Sottiaux (@thsottiaux) — annonce de la pause du plan Pro, 10 septembre 2026