Zum Inhalt springen
AtheronLABS

Erkanntes Land: Vereinigte Staaten. Preise werden in US-Dollar angezeigt. Nicht richtig?

labs@atheron:~/insights/agent-guardrails$ agent run --tools read-only --max-steps 12 --approve writes

Grenzen für einen KI-Agenten

Werkzeuge, Budgets und Bewertung.

Ein Agent ist ein Sprachmodell, das handeln kann: Dinge nachschlagen, Formulare ausfüllen, Nachrichten senden, Datensätze ändern. Das macht ihn nützlich und riskant. Das lösen Sie nicht, indem Sie dem Modell mehr vertrauen. Sie bauen die Grenzen um es herum, und dieser Ratgeber zeigt Ihnen, wie.

KI · Veröffentlicht 2. Oktober 2026 · 7 min read

Warum ein Agent Grenzen braucht

Ein Chat-Assistent, der Fragen beantwortet, kann sich irren, und das ist ein Problem. Ein Agent, der handelt, kann sich irren und danach handeln: die falsche Bestellung erstatten, dem falschen Kunden schreiben, die falsche Datei löschen. Sprachmodelle lassen sich außerdem leicht in die Irre führen, entweder von der Person, die sie nutzt, oder von Text, den sie unterwegs lesen.

Die OWASP Top 10 für LLM-Anwendungen nennen die Risiken, auf die es hier am meisten ankommt, darunter Prompt Injection, übermäßige Handlungsfreiheit und unbegrenzter Verbrauch [1]. Für jedes gibt es eine praktische Antwort, und keine davon hängt davon ab, dass sich das Modell perfekt verhält. Es sind dieselben Kontrollen, die Sie um einen neuen Mitarbeitenden mit Zugang zu echten Systemen legen würden: begrenzter Zugang, Aufsicht bei wichtigen Entscheidungen, ein Ausgabenlimit und eine Aufzeichnung dessen, was er getan hat.

Geben Sie ihm die wenigsten Werkzeuge mit dem geringsten Zugriff

Die Werkzeuge eines Agenten sind die Funktionen, die er aufrufen kann: die Wissensdatenbank durchsuchen, eine Bestellung nachschlagen, ein Ticket anlegen, eine Erstattung auslösen. OWASP beschreibt übermäßige Handlungsfreiheit als ein System, das mehr Funktionen, mehr Berechtigungen oder mehr Autonomie hat, als seine Aufgabe braucht, und empfiehlt, sowohl die Werkzeuge, die ein Agent aufrufen darf, als auch das, was jedes Werkzeug tun kann, auf das Nötigste zu beschränken [2].

  • Enge Werkzeuge schlagen allgemeine. Ein Werkzeug, das eine Bestellung nach Nummer nachschlägt, ist sicherer als eines, das jede beliebige Datenbankabfrage ausführt.
  • Erst lesen, dann schreiben. Starten Sie einen Agenten mit Werkzeugen, die nur lesen; ergänzen Sie die Fähigkeit, Dinge zu ändern, Aktion für Aktion, während er sich Vertrauen verdient.
  • Als Nutzer handeln, nicht als Administrator. OWASP empfiehlt, Werkzeuge im eigenen Kontext des Nutzers auszuführen statt über ein privilegiertes Konto, sodass der Agent nie mehr tun kann als die Person, der er hilft [2].
  • Berechtigungen im aufgerufenen System prüfen, nicht nur im Prompt. Das nachgelagerte System sollte eine Aktion ablehnen, die der Nutzer nicht darf, egal was das Modell verlangt hat [2].

Behandeln Sie alles, was er liest, als nicht vertrauenswürdig

Prompt Injection ist Text, der versucht zu ändern, was das Modell tut. Er kann direkt vom Nutzer kommen oder indirekt aus Inhalten, die das Modell liest, etwa einer Webseite, einer E-Mail oder einer Datei [3]. Ein Agent, der die E-Mail eines Kunden liest und zugleich ein Erstattungswerkzeug hat, kann von dieser E-Mail angewiesen werden, eine Erstattung auszulösen.

  • Halten Sie Anweisungen und Daten getrennt und kennzeichnen Sie fremde Inhalte klar als nicht vertrauenswürdig, wie OWASP empfiehlt [3].
  • Legen Sie das Ausgabeformat fest und prüfen Sie es mit gewöhnlichem Code, nicht mit einem anderen Modell, bevor Sie danach handeln [3].
  • Lassen Sie nie zu, dass Inhalte, die der Agent liest, seine eigenen Berechtigungen erhöhen. Ein Dokument kann keinen Zugang gewähren; das können nur Ihre Systeme.
  • Testen Sie vor dem Start und danach regelmäßig mit gegnerischen Eingaben, so wie Sie jede andere Sicherheitskontrolle testen würden [3].

Setzen Sie Menschen an die richtigen Kontrollpunkte

Nicht jede Aktion braucht einen Menschen, und Freigaben für alles bringen Menschen bei, Ja zu klicken, ohne zu lesen. Ordnen Sie Aktionen danach, was ein Fehler kosten würde, und verlangen Sie Freigaben nur, wo es zählt. OWASP empfiehlt menschliche Freigabe für folgenreiche Aktionen [2].

Ein Beispiel für Freigaben nach Risiko
AktionRisiko bei FehlerKontrolle
Dokumente durchsuchen, eine Bestellung nachschlagenGering: eine falsche Antwort, für den Nutzer sichtbarKeine über Berechtigungen und Protokollierung hinaus
Eine Antwort vorbereiten oder ein Formular zur Prüfung ausfüllenGering: Ein Mensch sieht es, bevor es irgendwohin gehtDem Nutzer zum Bearbeiten und Senden gezeigt
Ein Ticket anlegen oder einen nicht finanziellen Datensatz ändernMittel: ein unsauberer Datensatz zum KorrigierenErlaubt, protokolliert, umkehrbar
Eine E-Mail an einen Kunden sendenMittel bis hoch: lässt sich nicht zurückholenFreigabe durch den Nutzer oder auf Vorlagen beschränkt
Erstatten, zahlen, löschen, Berechtigungen ändernHoch: Geld oder Daten verlorenJedes Mal Freigabe durch eine berechtigte Person

Budgets: Schritte, Zeit und Ausgaben

Ein Agent arbeitet in einer Schleife: denken, ein Werkzeug aufrufen, das Ergebnis lesen, wieder denken. Ohne Grenzen kann ein verwirrter Agent lange kreisen, und jede Runde verbraucht Tokens oder GPU-Zeit. OWASP führt unbegrenzten Verbrauch als eigenes Risiko, einschließlich Angreifern, die absichtlich eine nutzungsabhängige Rechnung in die Höhe treiben, und empfiehlt Ratenlimits, Kontingente, Zeitlimits und Überwachung [4].

  • Eine Höchstzahl an Schritten je Aufgabe. Ist sie erreicht, hält der Agent an und übergibt mit dem bisherigen Stand an einen Menschen.
  • Ein Zeitlimit je Aufgabe und je Werkzeugaufruf, damit ein langsames System nicht alles aufhält.
  • Ein Ausgabenlimit je Aufgabe, je Nutzer und je Tag, von Ihrem Code vor jedem Modellaufruf durchgesetzt.
  • Grenzen für die Eingabegröße, damit niemand eine ganze Bibliothek ins Chatfeld einfügen kann.
  • Warnungen, wenn die Nutzung vom Normalen abweicht, an jemanden, der darauf reagieren kann.

Budgets machen auch die Betriebskosten berechenbar. Die Beispiele unten zeigen die monatlichen Modellkosten bei einer bestimmten Nutzung; Grenzen halten sie dort.

Bewertung vor und nach dem Start

Ob ein Agent sicher und nützlich ist, erkennen Sie nicht, indem Sie ihn ein paarmal ausprobieren. Sie brauchen einen Satz realistischer Aufgaben mit bekannten guten Ergebnissen, automatisch ausgeführt, vor dem Start und vor jeder Änderung. Das AI Risk Management Framework des NIST, ein freiwilliger Rahmen, um Vertrauenswürdigkeit in Gestaltung, Entwicklung, Nutzung und Bewertung von KI-Systemen einzubauen, ist eine nützliche Struktur, um zu entscheiden, was gemessen wird und wer verantwortlich ist [5].

  1. 01

    Echte Aufgaben sammeln

    Fragen und Anfragen der Menschen, die den Agenten nutzen werden, mit dem richtigen Ergebnis für jede, einschließlich Aufgaben, die er ablehnen oder übergeben sollte.

  2. 02

    Gegnerische Fälle ergänzen

    Eingeschleuste Anweisungen in Dokumenten, Anfragen nach Dingen, die der Nutzer nicht darf, und Versuche, ihn in eine Schleife zu bringen.

  3. 03

    Mehr als die Antwort bewerten

    Hat er die richtigen Werkzeuge in der richtigen Reihenfolge genutzt, im Budget, und hat er aufgehört, als er sollte?

  4. 04

    Eine Messlatte setzen und halten

    Vereinbaren Sie die Punktzahl, die er für den Livegang erreichen muss. Eine Änderung, die darunter fällt, wird nicht ausgeliefert.

  5. 05

    Im Betrieb weiter bewerten

    Nehmen Sie Stichproben echter Gespräche, prüfen Sie sie und fügen Sie die Fehlschläge dem Testsatz hinzu.

Protokolle, Überwachung und ein Ausschalter

  • Protokollieren Sie jeden Schritt: worum der Agent gebeten wurde, welche Werkzeuge er mit welchen Eingaben aufrief, was zurückkam und was er tat. Maskieren Sie personenbezogene Daten in den Protokollen wie überall sonst.
  • Machen Sie jede Aktion auf einen Nutzer und eine Aufgabe zurückführbar, damit sich eine seltsame Änderung an einem Datensatz erklären lässt.
  • Beobachten Sie Fehlerquoten, Übergaben, Ablehnungen und Ausgaben, und prüfen Sie jede Woche eine Stichprobe von Gesprächen.
  • Haben Sie einen Ausschalter, der kein Deployment braucht: eine Einstellung, die den Agenten oder ein einzelnes Werkzeug sofort abschaltet.
  • Schreiben Sie auf, wer für das Verhalten des Agenten verantwortlich ist und wer entscheidet, wann er abgeschaltet wird.

Eng beginnen, mit Belegen erweitern

Die sichersten Agenten beginnen klein. Starten Sie mit einer klar umrissenen Aufgabe, Werkzeugen, die nur lesen, und einer Handvoll vertrauenswürdiger Nutzer. Beobachten Sie einige Wochen lang die Protokolle und die Bewertungsergebnisse. Erweitern Sie dann eins nach dem anderen: mehr Nutzer, dann ein Werkzeug, das schreibt, dann weniger Freigaben bei Aktionen, die sich als sicher erwiesen haben. Jeder Schritt ist eine Entscheidung auf Grundlage von Belegen, und jeder lässt sich zurücknehmen.

Das ist langsamer, als alles auf einmal einzuschalten, und so werden Agenten zu etwas, dem man vertraut, statt nach dem ersten Vorfall abgeschaltet zu werden. Es gibt auch den Menschen, die mit dem Agenten arbeiten, Zeit zu lernen, was er gut kann, und Ihnen zu sagen, wo nicht.

Zwei Agenten, nach unserer Preisliste berechnet

Die durchgerechneten Beispiele unten zeigen die Spanne nach unserer heutigen Preisliste, mit Entwicklung und monatlichen Betriebskosten. Die Entwicklung umfasst die Werkzeuge, die Berechtigungen, die Freigabeschritte, die Budgets und den Prüfsatz; sie gehören zum Agenten und sind keine Extras.

Durchgerechnetes Beispiel, jetzt berechnet

Ein Betriebsagent auf einem Spitzenmodell

Ein interner Agent, der Bestellungen und Kunden nachschlägt, Tickets anlegt und Erstattungen zur Freigabe vorbereitet, angebunden an bestehende Systeme, auf einem Spitzenmodell über dessen API.

Entwicklung
≈ 70.200 USD bis 107.000 USD, delivered within 19 weeksCAD 99,900 to 152,800

Preise in Ihrer Währung sind Schätzungen zum heutigen Kurs der Bank of Canada. Alle Rechnungen werden in CAD oder USD gestellt.

Betrieb

Hosting
≈ 558 USD im MonatCAD 795 im Monat
Support
≈ 2.500 USD im MonatCAD 3,565 im Monat
Laufende Modellkosten
≈ 383 USD im MonatCAD 545 im Monat

Durchgerechnetes Beispiel, jetzt berechnet

Ein Agent für regulierte Daten auf einem Open-Source-Modell

Ein Agent, der regulierte Dokumente durchsucht und in internen Systemen handelt, auf einem Modell mit offenen Gewichten, das auf gemieteten GPUs in Ihrem eigenen Cloud-Konto läuft, mit bevorzugtem Support.

Entwicklung
≈ 115.000 USD bis 175.000 USD, delivered within 23 weeksCAD 163,200 to 249,400

Preise in Ihrer Währung sind Schätzungen zum heutigen Kurs der Bank of Canada. Alle Rechnungen werden in CAD oder USD gestellt.

Betrieb

Hosting
≈ 7.020 USD im MonatCAD 10,000 im Monat
Support
≈ 5.010 USD im MonatCAD 7,135 im Monat
Laufende Modellkosten
≈ 6.530 USD im MonatCAD 9,300 im Monat

Eine Checkliste, bevor ein Agent live geht

  1. 01

    Werkzeuge aufgelistet und eingegrenzt

    Jedes Werkzeug benannt, mit dem, was es lesen und ändern kann, und nichts darüber hinaus.

  2. 02

    Berechtigungen nachgelagert durchgesetzt

    Die Systeme, die der Agent aufruft, prüfen die Rechte des Nutzers selbst.

  3. 03

    Freigaben für folgenreiche Aktionen

    Geld, Löschungen, Berechtigungen und ausgehende Nachrichten brauchen einen Menschen.

  4. 04

    Budgets festgelegt und im Code durchgesetzt

    Schritte, Zeit, Ausgaben je Aufgabe und je Tag, und Eingabegröße.

  5. 05

    Bewertung bestanden

    Echte und gegnerische Aufgaben, bewertet, auf oder über der vereinbarten Messlatte.

  6. 06

    Protokolle, Warnungen und Ausschalter getestet

    Jemand hat ihn vor dem Start absichtlich aus- und wieder eingeschaltet.

// sources

Woher die Zahlen kommen.

Jede Statistik in diesem Ratgeber verlinkt hierher. Preise kommen aus unserem Rechner, nicht aus einer Quelle.

  1. [1]OWASP GenAI Security Project, Top 10 for LLM Applications, 2025. genai.owasp.org/llm-top-10/
  2. [2]OWASP GenAI Security Project, LLM06:2025 Excessive Agency. genai.owasp.org/llmrisk/llm062025-excessive-agency/
  3. [3]OWASP GenAI Security Project, LLM01:2025 Prompt Injection. genai.owasp.org/llmrisk/llm01-prompt-injection/
  4. [4]OWASP GenAI Security Project, LLM10:2025 Unbounded Consumption. genai.owasp.org/llmrisk/llm102025-unbounded-consumption/
  5. [5]NIST, AI Risk Management Framework, 2023. www.nist.gov/itl/ai-risk-management-framework

// questions

Kurze Antworten.

Kann ein Agent vollständig autonom sein?

Bei risikoarmen, umkehrbaren Aktionen innerhalb enger Grenzen ja. Bei allem, was Geld, Löschungen oder Nachrichten an Kunden betrifft, empfehlen wir, dass ein Mensch freigibt, zumindest bis Monate an Protokollen zeigen, dass eine Lockerung sicher ist.

Macht ein besseres Modell Grenzen überflüssig?

Nein. Bessere Modelle machen weniger Fehler, können aber weiterhin von dem, was sie lesen, in die Irre geführt werden. Grenzen machen die verbleibenden Fehler harmlos.

Wer ist verantwortlich, wenn ein Agent einen Fehler macht?

Die Organisation, die ihn eingesetzt hat. Deshalb sollte jede Aktion protokolliert, auf einen Nutzer und eine Aufgabe zurückführbar und wo möglich umkehrbar sein. Ihre Berater können Ihnen sagen, was in Ihrer Branche gilt.

// weiter

Haben Sie ein Projekt im Kopf?

Geben Sie es in den Rechner und erhalten Sie in wenigen Minuten eine Spanne. Oder erzählen Sie uns davon, und wir melden uns mit Fragen.

Grenzen für KI-Agenten: Werkzeuge, Berechtigungen, Budgets, Bewertung | Atheron Network Labs