·6 min
Le vrai bureau de l’agent n’est plus le chat
Le chat devient une mauvaise interface pour les agents qui travaillent longtemps. Inbox asynchrone, harness managé, plugins portables et FinOps par outcome redessinent le poste de travail agentique.
- Agentic AI
- Software Delivery
- Agent Runtime
- MCP
- Agent Skills
- FinOps AI
- ESN
Le chat a été une excellente interface pour découvrir l’IA. Il devient une mauvaise métaphore dès que le travail dure vingt minutes, attend une validation, se déclenche la nuit ou mobilise plusieurs spécialistes.
Trois nouveautés convergent : AWS transforme le travail agentique en inbox asynchrone, OpenAI expose le harness de Codex comme infrastructure managée, et Google commence à empaqueter skills + MCP en plugins portables. Le signal n’est donc pas “un agent de plus”. C’est le début d’un nouveau poste de travail : tâches durables, capacités installables, approbations explicites et résultats qui reviennent vers l’humain.
⚡ Le signal de la semaine — Arrêtons de regarder travailler les agents
Le 10 septembre, AWS a publié Pizza Bot, une application open source qui fait un choix d’UX radicalement simple : un agent de fond doit fonctionner comme un collègue, pas comme un chatbot qu’on surveille.
Une tâche peut être lancée manuellement, par cron ou webhook. Elle continue côté serveur, persiste grâce à des checkpoints, peut déléguer à des workers spécialisés et revient dans trois files : All, Unread et Action. Si une opération nécessite une décision, le run se met durablement en pause jusqu’à approbation, modification ou rejet.
Le thread devient l’unité durable de travail ; l’agent possède un état persistant ; les spécialistes sont décrits par des skills ; leurs outils MCP sont explicitement limités. AWS indique que des versions antérieures ont été utilisées par plus de 2 000 personnes en interne.
Pour le Delivery, la prochaine vague de productivité consiste à supprimer l’attente humaine autour du travail délégué. Pour chaque workflow agentique, demandez si l’utilisateur doit vraiment rester devant l’écran. Sinon, concevez queue, état durable, notifications et approbations.
1 — OpenAI transforme le harness en infrastructure consommable
Le 10 septembre, OpenAI a lancé Agents API en bêta publique. L’API expose le harness utilisé derrière Codex : sessions longues, compaction du contexte, recherche de tools, appels programmatiques, MCP, sous-agents parallèles et sandboxes.
Le point intéressant est la séparation entre modèle, harness et environnement d’exécution. OpenAI propose ses propres sandboxes mais aussi plusieurs fournisseurs d’environnement.
Des clients cités par OpenAI déclarent -60 % de coût par dossier chez SafetyKit, 4× de réduction de latence chez Ciridae et -86 % de réponses agentiques en échec chez Hypha. Ce sont des résultats clients déclarés, pas des benchmarks indépendants.
Pour les architectes, le runtime agentique devient une couche de plateforme à choisir et benchmarker. Pour les ESN : architecture de runtime, portabilité des tools, stratégie sandbox et maîtrise du coût deviennent de nouveaux sujets de mission.
2 — Google propose le plugin comme unité de packaging des capacités
Le 10 septembre, Google Cloud a publié son Developer Plugin pour AI Coding Agents. Il regroupe skills et configuration MCP dans un bundle installable et respecte la spécification ouverte Agent Plugins.
Le même plugin google-cloud-developer est documenté pour Antigravity CLI, Claude Code et Codex CLI. Après les packages pour le code et les containers pour le runtime, nous voyons apparaître une unité de distribution pour les capacités agentiques.
Pour une DSI, cela suggère un catalogue interne de plugins versionnés, signés et approuvés. Pour une ESN, cela rend crédible la création d’accélérateurs réellement portables.
3 — Le coût par token devient une métrique trop pauvre
Le 11 septembre, AWS a publié un benchmark open source proposant de comparer les modèles en coût par bonne réponse, coût de trajectoire agentique et qualité du livrable.
Sur leur échantillon AIME, AWS rapporte un coût observé par bonne réponse de 0,0021 $ pour GPT‑5.6 Luna contre 0,0139 $ pour mini. Le résultat dépend du workload, des paramètres et des prix : ce n’est pas un classement universel.
Un modèle moins cher au token peut coûter davantage s’il consomme plus, échoue plus souvent ou déclenche davantage de reprises. Le FinOps IA doit déplacer le dénominateur vers l’outcome.
4 — MCP commence à transporter une interface
Le 11 septembre, AWS a publié un guide pour déployer des MCP Apps interactives sur Bedrock AgentCore. Le serveur MCP peut retourner des widgets HTML interactifs de manière host-agnostic.
Signal discret mais important pour le Product : certaines interactions métier peuvent progressivement voyager avec la capacité elle-même plutôt que d’être reconstruites dans chaque assistant.
🧭 Ce que ça change pour nous
Développeurs : pensez moins conversation et davantage job durable : état, retry, pause, reprise, résultat et notification.
Architectes : formalisez quatre couches — modèle, harness, sandbox/runtime et capabilities/plugins.
Platform Engineering : préparez un registre interne de plugins/skills/MCP avec ownership, version, permissions et compatibilité.
CTO / DSI : mesurez coût par outcome et temps humain immobilisé, pas seulement tokens et adoption.
ESN : transformez vos accélérateurs en capacités installables et multi-harness.
🏢 Le sujet que je mettrais sur la table d’un COMEX IT
Combien d’heures payons-nous encore des collaborateurs pour regarder une IA travailler ? La KPI intéressante pourrait devenir : minutes humaines synchrones nécessaires pour obtenir une heure de travail agentique utile.
🧪 À tester lundi
Transformez un workflow agentique de plus de cinq minutes en tâche asynchrone : job ID, état persistant, reprise, notification et file Action requise.
Empaquetez ensuite une capacité interne comme skill/plugin avec une liste minimale de tools et testez-la dans deux agents différents.
Enfin, calculez le coût par tâche réussie pour deux modèles sur 30 tâches réelles.
💰 Où est le business ?
Agentic Workplace Accelerator : copilots synchrones → workflows de fond avec inbox, HITL, notifications, observabilité et SLA.
Enterprise Plugin Factory : industrialiser skills, plugins et MCP avec catalogue, sécurité, versioning et compatibilité multi-agent.
AI Outcome FinOps : instrumenter coût par tâche réussie, trajectoire, retry et intervention humaine.
❓ Question de la semaine
Si vos agents pouvaient travailler pendant que vos équipes font autre chose, quelle part de vos interfaces IA resterait réellement sous forme de chat ?
🤓 Pour ceux qui ont encore du contexte window
AWS — Pizza Bot · OpenAI — Agents API · Google Cloud — Developer Plugin · AWS — Beyond price per token · AWS — MCP Apps.
Le chat restera utile pour réfléchir. Mais pour déléguer du vrai travail, l’interface la plus importante sera peut-être celle que l’on ne regarde pas.
Recevez la prochaine édition par email
Une inscription, pas de spam, désinscription sur simple demande.