A single click on the wrong link no longer just steals passwords or installs malware. It can birth a persistent AI agent inside your organization that reads your emails, rifles through your files, and chats with your coworkers under your name. Security researchers at Zenity Labs have demonstrated exactly this scenario with a technique they call AgentForger, and the mechanics reveal a disturbing gap in how we secure autonomous AI tools.

From CSRF to AgentForger: A New Class of Attack

Most security professionals know Cross-Site Request Forgery, or CSRF, as a classic web vulnerability. In its traditional form, an attacker tricks an authenticated user’s browser into firing off a single unauthorized request. Maybe it changes an account email address or disables two-factor authentication. The damage is usually contained to one action.

AgentForger blows that model apart. Rather than forging one request, it forges an entire autonomous agent inside OpenAI’s ChatGPT Workspace Agents. The attack starts at the ChatGPT Agent Builder, which lives at chatgpt.com/agents/studio/new. Under normal circumstances, building an agent is a hands-on process. You select a template, you review which tools the agent can touch, and you set guardrails so the machine asks before it reads your inbox or writes to your drive. The workflow assumes a human is paying attention at each step.

Zenity Labs discovered that these safeguards evaporate when an attacker controls the URL. By embedding specific query parameters—namely template_name and initial_assistant_prompt—a malicious link can pre-populate the entire creation form. When the victim clicks, the initial_assistant_prompt is submitted and executed automatically. The template selection, the tool review, and the permission dialogs never appear. The agent simply spawns in the background, configured exactly the way the attacker wants it, while the victim may only see an ordinary-looking ChatGPT page load and then close the tab.

This is not a traditional malware infection. Nothing gets downloaded to the laptop. The threat lives entirely inside the victim’s SaaS session, operating with the full legitimacy of the platform behind it.

Hijacking Trust Instead of Credentials

The real brutality of AgentForger lies in how it handles permissions. Enterprise users of ChatGPT Workspace routinely link their AI agents to business applications through OAuth. They authenticate once to connect Gmail, Outlook, Slack, Google Drive, or Microsoft Teams, and from then on the agent can query those services on their behalf.

AgentForger inherits all of this access automatically. Because the victim is already logged into ChatGPT and has already established those OAuth connections, the forged agent reuses them. The victim does not see a fresh consent screen asking whether this new agent should be allowed into their email. The system treats the agent as an extension of the user.

In Zenity’s demonstration, the attacker crafted the malicious URL to do something even more aggressive. It instructed the Agent Builder to flip every permission toggle for reading, writing, and deleting to "Never ask." Normally, the platform would prompt a human before executing sensitive actions—opening a spreadsheet, sending a message, deleting a calendar event. By forcing these controls to silent mode, the attacker removes the human-in-the-loop entirely. The agent becomes a ghost in the account, free to move through connected apps without generating a single alert or confirmation dialog.

A Command Channel Hiding in Plain Sight

Persistence turns a nasty exploit into an operational nightmare, and AgentForger achieves persistence through ChatGPT’s built-in scheduling features. The attacker sets multiple staggered schedules during the creation process, producing an agent that wakes up and runs as often as every five minutes.

Here is how the command-and-control loop works. The attacker sends an email to the victim’s Outlook inbox. The subject line contains a trigger word, such as "TASK." Every five minutes, the rogue agent scans the inbox looking for that trigger. When it finds a match, it opens the email, reads the instructions, executes them using the victim’s authenticated applications, and sends the results back to the attacker.

Die eigene Unternehmens-E-Mail des Opfers wird zur Command-and-Control-Infrastruktur. Es gibt kein verdächtiges DNS-Beacon, keine Verbindung zu einer unbekannten IP-Adresse in Osteuropa und keine Malware-Binärdatei, die von der Endpoint-Detection gemeldet werden könnte. Der Datenverkehr fließt über Microsoft- oder Google-APIs unter Verwendung völlig legitimer Anmeldedaten. Für ein Security-Operations-Team, das die Netzwerkprotokolle überwacht, sieht dies wie ein beschäftigter Mitarbeiter aus, der zugelassene SaaS-Tools nutzt.

Auswirkungen in der Praxis: Organisationen kartieren und Vertrauen als Waffe nutzen

Zenity Labs hat die praktischen Grenzen dieses Angriffs in kontrollierten Umgebungen getestet, und die Ergebnisse sollten jeden CISO beunruhigen.

Mit einem einzigen Befehl, der über den E-Mail-Trigger ausgelöst wurde, wiesen die Forscher den Agenten an, die Organisation zu kartieren. Er fragte Slack, Microsoft Teams und SharePoint ab. Er lieferte Kanalnamen, Teamstrukturen und Dateirepositories zurück. Der Agent lokalisierte sensible Dokumente, einschließlich M&A-Term-Sheets und Gehaltsdaten der Mitarbeiter. Jeder einzelne Zugriff wurde unter der legitimen Identität des Opfers protokolliert, was die forensische Erkennung zu einer Frage der Unterscheidung zwischen normalem Nutzerrauschen und bösartigem Nutzerrauschen macht.

Dann ist da noch das Social-Engineering-Potenzial. Da der Agent Nachrichten über die offiziellen Slack- oder Teams-Konten des Opfers senden kann, kann er interne Phishing-Kampagnen durchführen, die externe E-Mail-Gateways und DMARC-Prüfungen vollständig umgehen. Stellen Sie sich eine Direktnachricht von einem vertrauenswürdigen Kollegen vor, in der Sie gebeten werden, einen bevorstehenden SSO-Rollout zu bestätigen oder auf einen Link zu klicken, um das neue Benefits-Portal zu testen. Die Nachricht trägt den Namen des Kollegen, sein Profilbild und den Kontext des Chatverlaufs. Sie landet im selben Konversationsverlauf, in dem Sie gestern über Mittagessenpläne gesprochen haben. Dieses Maß an Vertrauen unterscheidet sich grundlegend von einer gespooften Domain oder einer falsch geschriebenen Absenderadresse, und AgentForger nutzt dies gnadenlos aus.

Das eigentliche Fazit

AgentForger legt ein strukturelles Problem offen, wie Enterprise-KI-Plattformen Vertrauen erben. Wir bauen autonome Agenten, die sich selbst planen, Code schreiben und sensible Daten abfragen können, aber wir verwenden immer noch Berechtigungsmodelle, die für statische Webanwendungen entwickelt wurden, bei denen ein Mensch jeden Button anklickt. Die Grenze zwischen dem, „was der Benutzer tut“, und dem, „was der Agent des Benutzers tut“, ist kollabiert, und Angreifer sind nun in der Lage, diesen Kollaps in großem Maßstab auszunutzen.

Unternehmen, die ChatGPT Workspace nutzen, müssen die Erstellung von Agenten als eine privilegierte Operation behandeln, nicht als einen beiläufigen Workflow. Das bedeutet, die OAuth-Scopes zu prüfen, um sicherzustellen, dass Agenten nicht stillschweigend auf gesamte Posteingänge oder Dateispeicher zugreifen können. Es bedeutet, auf Aktivitätsschübe zu achten, die eher wie geplante Schleifen als wie menschliches Tempo aussehen. Und es bedeutet zu erkennen, dass der nächste große Breach möglicherweise nicht mit einem kompromittierten Passwort oder einer Phishing-E-Mail beginnt. Er könnte mit einem einzigen abgelenkten Klick beginnen, der Ihre Identität stillschweigend an eine Maschine delegiert, die niemals schläft.