·7 min
L’agent entre dans la CI : on ne merge plus une régression comportementale
Les agents entrent dans les quality gates du SDLC : evals en CI, nouveaux profils FDE, context engineering mesurable et agents connectés au monde physique. Le Delivery agentique devient enfin testable.
- Agentic AI
- Software Delivery
- CI/CD
- AI Evals
- Forward Deployed Engineer
- Context Engineering
- ESN
AI × SOFTWARE DELIVERY × ESN
9 septembre 2026 · 7 min
Le SDLC agentique vient de franchir une étape plus importante qu’un nouveau benchmark : le comportement de l’agent devient un artefact testable du build.
⚡ Le signal de la semaine — Les agents gagnent enfin leur quality gate
AWS a publié le 8 septembre un pipeline reliant Amazon Bedrock AgentCore Evaluations à GitHub Actions : modification du prompt, modèle, tools ou configuration → déploiement → scénarios → scoring → PR bloquée si la qualité régresse. GoalSuccessRate, Correctness, ToolSelectionAccuracy, ToolParameterAccuracy et trajectoires deviennent des métriques de CI. Les traces OpenTelemetry alimentent l’évaluation.
Pour le Delivery : code vert + sécurité verte + evals agentiques vertes. Pour l’organisation : datasets de référence, trajectoires attendues et seuils par environnement. Pour les ESN : industrialiser les quality gates agentiques devient une offre plus défendable qu’un atelier de prompting.
2 — Accenture matérialise un nouveau profil de Delivery : le Forward Deployed Engineer
Accenture et Google Cloud ont annoncé le 8 septembre la création de l’Accenture Gemini Enterprise Business Group et une force prévue de 1 000 Forward Deployed Engineers. Ce rôle brouille les frontières entre architecte, développeur, product engineer, consultant et spécialiste métier : l’ingénieur est placé au contact du problème client pour transformer rapidement un besoin en système exploitable.
Sur un cas YouTube cité, un agent Gemini Enterprise utilisé pendant les pics NFL Sunday Ticket aurait amélioré le sentiment client de 11 % et réduit l’average handle time de 37 %. Ce sont des chiffres partenaires sur un cas précis, pas une promesse généralisable.
3 — DiDi rappelle que le context engineering bat souvent le prompt magique
DiDi et AWS documentent un système de QA de centre de contact. La vérification d’intention passe de 38 % à 86 % lorsque l’équipe cesse de montrer au modèle l’arbre complet des catégories et isole précisément l’information pertinente. Le système dépasse aussi 90 % de précision sur le scoring de conformité et ramène l’analyse Voice of Customer de plusieurs heures à quelques minutes.
Avant de changer de modèle, regardez la forme du contexte, les données, les règles déterministes et la décomposition du workflow.
4 — Codex ne pilote plus seulement du code : il commence à piloter le monde physique
OpenAI décrit un cas du MIT où GPT‑5.6 Sol via Codex est connecté au logiciel pilotant des expériences sur des qubits supraconducteurs. L’agent choisit des paramètres, opère le matériel, analyse les résultats puis décide de raffiner la mesure. Les signaux ambigus nécessitent encore l’expertise humaine ; les mesures routinières peuvent être laissées aux agents pendant plusieurs heures.
Pour les CTO industriels : dès qu’un équipement possède une couche de contrôle logiciel, un coding agent peut devenir un agent d’opération. Permissions, blast radius, observabilité, rollback et human-in-the-loop deviennent des exigences d’architecture.
🧭 Ce que ça change pour nous
Développeurs — prompts, tools et policies entrent dans versioning, tests, evals et review.
Architectes — ajoutez dataset d’évaluation, trajectoires attendues et politique d’autorisation des tools.
CTO / DSI — mesurez le taux de workflows agentiques disposant de quality gates, d’un owner et d’un SLO.
ESN — préparez des profils hybrides proches du FDE, responsables d’un outcome.
🏢 Le sujet que je mettrais sur la table d’un COMEX IT
Combien de nos agents peuvent aujourd’hui faire échouer automatiquement une pipeline lorsque leur comportement régresse ? Si la réponse est aucun, nous avons probablement davantage de capacité d’automatisation que de capacité de contrôle.
🧪 À tester lundi
Prenez un agent interne, 20 scénarios réels et quatre métriques : succès de l’objectif, exactitude, bon tool, bons paramètres. Versionnez le dataset et faites échouer la CI sous un seuil. Puis prenez un workflow LLM peu fiable et retirez du contexte au lieu d’en ajouter.
💰 Où est le business ?
Agentic Quality Gate Accelerator : eval datasets, GitHub/GitLab CI, OpenTelemetry, trajectoires, policy-as-code et dashboards de régression.
FDE-as-a-Service : petites équipes seniors + agents + accélérateurs, facturées sur un outcome.
Context Engineering Review : audit court des applications LLM.
❓ Question de la semaine
Votre pipeline sait déjà refuser du mauvais code. Sait-elle refuser un agent qui prend de moins bonnes décisions qu’hier ?
🤓 Pour ceux qui ont encore du contexte window
AWS AgentCore + GitHub Actions · Accenture Gemini Enterprise Business Group · DiDi contact-center QA · OpenAI Codex quantum experiments · HPE Zerto agentic troubleshooting.
Le sujet n’est plus de savoir si les agents peuvent produire. Il devient : avons-nous construit le système de Delivery qui permet de leur faire confiance ?
Recevez la prochaine édition par email
Une inscription, pas de spam, désinscription sur simple demande.