Ik heb een maand lang een door AI aangestuurde agent mijn CI/CD-pipeline laten draaien. Aan het einde van de proefperiode was de agent bezig met het oplossen van mislukte builds, het openen van pull requests en het opnieuw triggeren van jobs, waardoor er nog maar één menselijke goedkeuringsstap overbleef. Het experiment laat zien dat “agentic” DevOps de routine-triage kan verplaatsen van de backoffice naar een geautomatiseerd brein, maar het legt ook de guardrails bloot die een autonoom systeem ervan weerhouden een nieuwe bron van risico te worden.
Waarom het experiment ertoe deed
De meeste softwareteams beschouwen AI nog steeds als een geavanceerde autocomplete—een tool die een regel code suggereert of een foutmelding uitlegt. In 2025 verschuift de industrie van “AI die je helpt typen” naar “AI die handelt”. Een handelende agent kan logs lezen, beslissen over een fix, deze toepassen en leren van de uitkomst—alles zonder dat een developer een enkele opdracht hoeft te typen.
Het onderliggende idee: een agentic pipeline
Een agentic pipeline is geen enkel monolithisch model met onbeperkte toegang tot productie. Het is een nauwe orchestrator die gespecialiseerde tools coördineert, context behoudt en opereert achter strikte guardrails. De kernlus weerspiegelt het probleemoplossende proces van een mens:
- Waarnemen – logs, testoutput en metrics ophalen.
- Redeneren – de fout analyseren, de veiligste oplossing plannen.
- Handelen – een beperkte tool aanroepen om een patch toe te passen, een dependency te upgraden of een job opnieuw uit te voeren.
- Leren – het resultaat vastleggen zodat de volgende beslissing beter onderbouwd is.
De architectuur die het experiment veilig hield, zag er als volgt uit:
- CI/CD-platform – plant jobs in en voert ze uit.
- Orchestrator – het “brein” dat gegevens ontvangt, de control loop draait en beslist wat er moet gebeuren.
- Tools – de handen die concrete acties uitvoeren (bijv. het openen van een PR, het verhogen van een versie).
- Context store – een lichtgewicht geheugen van recente fouten en fixes.
- Guardrails – harde limieten die voorkomen dat de agent direct de productie aanraakt of wijzigingen aanbrengt zonder expliciete menselijke goedkeuring.
Door het large language model (LLM) weg te houden van directe schrijfacties in productie, verminderde het systeem de aanvalsoppervlakte terwijl het model nog steeds kon redeneren over het probleem.
Een maand uit het leven van de agent
Week 1 – Alleen-lezen observatie
De agent draaide in een “explain-only” modus. Elke mislukte build genereerde een Slack-bericht dat de fout samenvatte en mogelijke oorzaken suggereerde. Er werd geen code gewijzigd. Deze fase bewees dat de stappen voor waarneming en redenering werkten op echte logs en gaf het team het vertrouwen dat de agent de codebase begreep.
Week 2 – Voorstellen van fixes
De volgende zeven dagen opende de orchestrator pull requests voor laag-risico problemen, zoals linting-fouten of verouderde dependencies. Engineers beoordeelden de PR's voordat ze werden samengevoegd.
Week 3 – Gecontroleerde actie
Met de goedkeuringsworkflow op zijn plaats kreeg de agent toestemming om jobs opnieuw uit te voeren in een niet-productieomgeving. Wanneer een build mislukte, pinte de orchestrator automatisch de juiste versie van een defecte dependency, opende een PR en, nadat de PR was samengevoegd, triggerde hij de pipeline opnieuw.
Week 4 – Impact meten
De laatste week lag de focus op het meten van de resultaten en het bijhouden van hoeveel fouten de agent had opgelost.
De voordelen: saai werk elimineren
Het experiment toonde aan dat een AI-agent de repetitieve delen van CI/CD kan afhandelen: logs lezen, bekende patronen herkennen, versies verhogen en jobs opnieuw uitvoeren. Engineers hoefden alleen de definitieve wijzigingen goed te keuren en de weinige fouten in edge cases te onderzoeken die de agent niet kon oplossen. In de praktijk betekende dit minder nachtelijke meldingen, minder context-switching en een snellere feedbackloop voor developers.
De valkuilen en hoe deze te beperken
- Zelfverzekerd foute fixes – De agent paste soms een patch op symptoomniveau toe die een dieperliggende bug maskeerde. Guardrails die menselijke goedkeuring vereisen voor elke wijziging die de productiecode aanraakt, hielden dit risico onder controle.
- Ruis-overbelasting – Ongefilterde meldingen kunnen echte waarschuwingen overstemmen.
- Scope creep – Het geven van onbeperkte toegang aan het model leidt snel tot onbedoelde neveneffecten. De strikte scheiding in de architectuur tussen de LLM (redeneren) en de tools (handelen) voorkwam dat de agent willekeurige wijzigingen aanbracht.
Een stapsgewijs uitrolplan voor andere teams
Als uw organisatie een agentic pipeline wil proberen, volg dan dit stapsgewijze pad:
- Stel de orchestrator in – een lichtgewicht service die de LLM kan aanroepen, context kan opslaan en CI/CD-API's kan aansturen.
- Definieer guardrails – maak een whitelist van de CI/CD-jobs die de agent mag triggeren, vereis PR-goedkeuring en blokkeer directe schrijfacties naar productie.
- Week 1: Observatiemodus – voer logs aan de orchestrator en laat deze diagnostische samenvattingen posten in een chatkanaal.
- Week 2: Suggestiemodus – sta de agent toe om PR's te openen voor niet-kritieke fixes; houd menselijke beoordeling verplicht.
- Week 3: Gecontroleerde actie – verleen toestemming om jobs opnieuw uit te voeren in staging- of testomgevingen nadat een PR is samengevoegd.
- Week 4: Metrieken en tuning – houd triaged fouten, false positives en bespaarde tijd bij; pas alertdrempels en guardrails dienovereenkomstig aan.
- Itereer – breid de toolset uit (bijv. geautomatiseerde rollbacks, security scans) pas nadat elke nieuwe functionaliteit dezelfde veiligheidscontroles heeft doorstaan.
Het tegenargument
Sceptici wijzen erop dat agents met veel zelfvertrouwen fout kunnen zijn. Het experiment heeft deze zorg niet weggenomen; het liet enkel zien dat gedisciplineerde guardrails je de voordelen laten benutten terwijl het risico beheersbaar blijft.
De belangrijkste les
Een AI-agent die de CI/CD-control loop aanstuurt, kan een reactief, handmatig triageproces veranderen in een bijna zelfhelende pipeline, mits je het model isoleert, strikte goedkeuringsstappen afdwingt en begint met een risicoarme, eerst op observatie gerichte aanpak. De echte waarde ligt niet in het vervangen van engineers, maar in het overnemen van de saaie, repetitieve taken die ervoor zorgen dat pipelines 'groen' blijven en ontwikkelaars zich kunnen concentreren op het bouwen.
