Warum ein Agent Grenzen braucht
Ein Chat-Assistent, der Fragen beantwortet, kann sich irren, und das ist ein Problem. Ein Agent, der handelt, kann sich irren und danach handeln: die falsche Bestellung erstatten, dem falschen Kunden schreiben, die falsche Datei löschen. Sprachmodelle lassen sich außerdem leicht in die Irre führen, entweder von der Person, die sie nutzt, oder von Text, den sie unterwegs lesen.
Die OWASP Top 10 für LLM-Anwendungen nennen die Risiken, auf die es hier am meisten ankommt, darunter Prompt Injection, übermäßige Handlungsfreiheit und unbegrenzter Verbrauch [1]. Für jedes gibt es eine praktische Antwort, und keine davon hängt davon ab, dass sich das Modell perfekt verhält. Es sind dieselben Kontrollen, die Sie um einen neuen Mitarbeitenden mit Zugang zu echten Systemen legen würden: begrenzter Zugang, Aufsicht bei wichtigen Entscheidungen, ein Ausgabenlimit und eine Aufzeichnung dessen, was er getan hat.
Geben Sie ihm die wenigsten Werkzeuge mit dem geringsten Zugriff
Die Werkzeuge eines Agenten sind die Funktionen, die er aufrufen kann: die Wissensdatenbank durchsuchen, eine Bestellung nachschlagen, ein Ticket anlegen, eine Erstattung auslösen. OWASP beschreibt übermäßige Handlungsfreiheit als ein System, das mehr Funktionen, mehr Berechtigungen oder mehr Autonomie hat, als seine Aufgabe braucht, und empfiehlt, sowohl die Werkzeuge, die ein Agent aufrufen darf, als auch das, was jedes Werkzeug tun kann, auf das Nötigste zu beschränken [2].
- Enge Werkzeuge schlagen allgemeine. Ein Werkzeug, das eine Bestellung nach Nummer nachschlägt, ist sicherer als eines, das jede beliebige Datenbankabfrage ausführt.
- Erst lesen, dann schreiben. Starten Sie einen Agenten mit Werkzeugen, die nur lesen; ergänzen Sie die Fähigkeit, Dinge zu ändern, Aktion für Aktion, während er sich Vertrauen verdient.
- Als Nutzer handeln, nicht als Administrator. OWASP empfiehlt, Werkzeuge im eigenen Kontext des Nutzers auszuführen statt über ein privilegiertes Konto, sodass der Agent nie mehr tun kann als die Person, der er hilft [2].
- Berechtigungen im aufgerufenen System prüfen, nicht nur im Prompt. Das nachgelagerte System sollte eine Aktion ablehnen, die der Nutzer nicht darf, egal was das Modell verlangt hat [2].
Behandeln Sie alles, was er liest, als nicht vertrauenswürdig
Prompt Injection ist Text, der versucht zu ändern, was das Modell tut. Er kann direkt vom Nutzer kommen oder indirekt aus Inhalten, die das Modell liest, etwa einer Webseite, einer E-Mail oder einer Datei [3]. Ein Agent, der die E-Mail eines Kunden liest und zugleich ein Erstattungswerkzeug hat, kann von dieser E-Mail angewiesen werden, eine Erstattung auszulösen.
- Halten Sie Anweisungen und Daten getrennt und kennzeichnen Sie fremde Inhalte klar als nicht vertrauenswürdig, wie OWASP empfiehlt [3].
- Legen Sie das Ausgabeformat fest und prüfen Sie es mit gewöhnlichem Code, nicht mit einem anderen Modell, bevor Sie danach handeln [3].
- Lassen Sie nie zu, dass Inhalte, die der Agent liest, seine eigenen Berechtigungen erhöhen. Ein Dokument kann keinen Zugang gewähren; das können nur Ihre Systeme.
- Testen Sie vor dem Start und danach regelmäßig mit gegnerischen Eingaben, so wie Sie jede andere Sicherheitskontrolle testen würden [3].
Setzen Sie Menschen an die richtigen Kontrollpunkte
Nicht jede Aktion braucht einen Menschen, und Freigaben für alles bringen Menschen bei, Ja zu klicken, ohne zu lesen. Ordnen Sie Aktionen danach, was ein Fehler kosten würde, und verlangen Sie Freigaben nur, wo es zählt. OWASP empfiehlt menschliche Freigabe für folgenreiche Aktionen [2].
| Aktion | Risiko bei Fehler | Kontrolle |
|---|---|---|
| Dokumente durchsuchen, eine Bestellung nachschlagen | Gering: eine falsche Antwort, für den Nutzer sichtbar | Keine über Berechtigungen und Protokollierung hinaus |
| Eine Antwort vorbereiten oder ein Formular zur Prüfung ausfüllen | Gering: Ein Mensch sieht es, bevor es irgendwohin geht | Dem Nutzer zum Bearbeiten und Senden gezeigt |
| Ein Ticket anlegen oder einen nicht finanziellen Datensatz ändern | Mittel: ein unsauberer Datensatz zum Korrigieren | Erlaubt, protokolliert, umkehrbar |
| Eine E-Mail an einen Kunden senden | Mittel bis hoch: lässt sich nicht zurückholen | Freigabe durch den Nutzer oder auf Vorlagen beschränkt |
| Erstatten, zahlen, löschen, Berechtigungen ändern | Hoch: Geld oder Daten verloren | Jedes Mal Freigabe durch eine berechtigte Person |
Budgets: Schritte, Zeit und Ausgaben
Ein Agent arbeitet in einer Schleife: denken, ein Werkzeug aufrufen, das Ergebnis lesen, wieder denken. Ohne Grenzen kann ein verwirrter Agent lange kreisen, und jede Runde verbraucht Tokens oder GPU-Zeit. OWASP führt unbegrenzten Verbrauch als eigenes Risiko, einschließlich Angreifern, die absichtlich eine nutzungsabhängige Rechnung in die Höhe treiben, und empfiehlt Ratenlimits, Kontingente, Zeitlimits und Überwachung [4].
- Eine Höchstzahl an Schritten je Aufgabe. Ist sie erreicht, hält der Agent an und übergibt mit dem bisherigen Stand an einen Menschen.
- Ein Zeitlimit je Aufgabe und je Werkzeugaufruf, damit ein langsames System nicht alles aufhält.
- Ein Ausgabenlimit je Aufgabe, je Nutzer und je Tag, von Ihrem Code vor jedem Modellaufruf durchgesetzt.
- Grenzen für die Eingabegröße, damit niemand eine ganze Bibliothek ins Chatfeld einfügen kann.
- Warnungen, wenn die Nutzung vom Normalen abweicht, an jemanden, der darauf reagieren kann.
Budgets machen auch die Betriebskosten berechenbar. Die Beispiele unten zeigen die monatlichen Modellkosten bei einer bestimmten Nutzung; Grenzen halten sie dort.
Bewertung vor und nach dem Start
Ob ein Agent sicher und nützlich ist, erkennen Sie nicht, indem Sie ihn ein paarmal ausprobieren. Sie brauchen einen Satz realistischer Aufgaben mit bekannten guten Ergebnissen, automatisch ausgeführt, vor dem Start und vor jeder Änderung. Das AI Risk Management Framework des NIST, ein freiwilliger Rahmen, um Vertrauenswürdigkeit in Gestaltung, Entwicklung, Nutzung und Bewertung von KI-Systemen einzubauen, ist eine nützliche Struktur, um zu entscheiden, was gemessen wird und wer verantwortlich ist [5].
- 01
Echte Aufgaben sammeln
Fragen und Anfragen der Menschen, die den Agenten nutzen werden, mit dem richtigen Ergebnis für jede, einschließlich Aufgaben, die er ablehnen oder übergeben sollte.
- 02
Gegnerische Fälle ergänzen
Eingeschleuste Anweisungen in Dokumenten, Anfragen nach Dingen, die der Nutzer nicht darf, und Versuche, ihn in eine Schleife zu bringen.
- 03
Mehr als die Antwort bewerten
Hat er die richtigen Werkzeuge in der richtigen Reihenfolge genutzt, im Budget, und hat er aufgehört, als er sollte?
- 04
Eine Messlatte setzen und halten
Vereinbaren Sie die Punktzahl, die er für den Livegang erreichen muss. Eine Änderung, die darunter fällt, wird nicht ausgeliefert.
- 05
Im Betrieb weiter bewerten
Nehmen Sie Stichproben echter Gespräche, prüfen Sie sie und fügen Sie die Fehlschläge dem Testsatz hinzu.
Protokolle, Überwachung und ein Ausschalter
- Protokollieren Sie jeden Schritt: worum der Agent gebeten wurde, welche Werkzeuge er mit welchen Eingaben aufrief, was zurückkam und was er tat. Maskieren Sie personenbezogene Daten in den Protokollen wie überall sonst.
- Machen Sie jede Aktion auf einen Nutzer und eine Aufgabe zurückführbar, damit sich eine seltsame Änderung an einem Datensatz erklären lässt.
- Beobachten Sie Fehlerquoten, Übergaben, Ablehnungen und Ausgaben, und prüfen Sie jede Woche eine Stichprobe von Gesprächen.
- Haben Sie einen Ausschalter, der kein Deployment braucht: eine Einstellung, die den Agenten oder ein einzelnes Werkzeug sofort abschaltet.
- Schreiben Sie auf, wer für das Verhalten des Agenten verantwortlich ist und wer entscheidet, wann er abgeschaltet wird.
Eng beginnen, mit Belegen erweitern
Die sichersten Agenten beginnen klein. Starten Sie mit einer klar umrissenen Aufgabe, Werkzeugen, die nur lesen, und einer Handvoll vertrauenswürdiger Nutzer. Beobachten Sie einige Wochen lang die Protokolle und die Bewertungsergebnisse. Erweitern Sie dann eins nach dem anderen: mehr Nutzer, dann ein Werkzeug, das schreibt, dann weniger Freigaben bei Aktionen, die sich als sicher erwiesen haben. Jeder Schritt ist eine Entscheidung auf Grundlage von Belegen, und jeder lässt sich zurücknehmen.
Das ist langsamer, als alles auf einmal einzuschalten, und so werden Agenten zu etwas, dem man vertraut, statt nach dem ersten Vorfall abgeschaltet zu werden. Es gibt auch den Menschen, die mit dem Agenten arbeiten, Zeit zu lernen, was er gut kann, und Ihnen zu sagen, wo nicht.
Zwei Agenten, nach unserer Preisliste berechnet
Die durchgerechneten Beispiele unten zeigen die Spanne nach unserer heutigen Preisliste, mit Entwicklung und monatlichen Betriebskosten. Die Entwicklung umfasst die Werkzeuge, die Berechtigungen, die Freigabeschritte, die Budgets und den Prüfsatz; sie gehören zum Agenten und sind keine Extras.
Durchgerechnetes Beispiel, jetzt berechnet
Ein Betriebsagent auf einem Spitzenmodell
Ein interner Agent, der Bestellungen und Kunden nachschlägt, Tickets anlegt und Erstattungen zur Freigabe vorbereitet, angebunden an bestehende Systeme, auf einem Spitzenmodell über dessen API.
- Entwicklung
- ≈ 70.200 USD bis 107.000 USD, delivered within 19 weeksCAD 99,900 to 152,800
Preise in Ihrer Währung sind Schätzungen zum heutigen Kurs der Bank of Canada. Alle Rechnungen werden in CAD oder USD gestellt.
Betrieb
- Hosting
- ≈ 558 USD im MonatCAD 795 im Monat
- Support
- ≈ 2.500 USD im MonatCAD 3,565 im Monat
- Laufende Modellkosten
- ≈ 383 USD im MonatCAD 545 im Monat
Durchgerechnetes Beispiel, jetzt berechnet
Ein Agent für regulierte Daten auf einem Open-Source-Modell
Ein Agent, der regulierte Dokumente durchsucht und in internen Systemen handelt, auf einem Modell mit offenen Gewichten, das auf gemieteten GPUs in Ihrem eigenen Cloud-Konto läuft, mit bevorzugtem Support.
- Entwicklung
- ≈ 115.000 USD bis 175.000 USD, delivered within 23 weeksCAD 163,200 to 249,400
Preise in Ihrer Währung sind Schätzungen zum heutigen Kurs der Bank of Canada. Alle Rechnungen werden in CAD oder USD gestellt.
Betrieb
- Hosting
- ≈ 7.020 USD im MonatCAD 10,000 im Monat
- Support
- ≈ 5.010 USD im MonatCAD 7,135 im Monat
- Laufende Modellkosten
- ≈ 6.530 USD im MonatCAD 9,300 im Monat
Eine Checkliste, bevor ein Agent live geht
- 01
Werkzeuge aufgelistet und eingegrenzt
Jedes Werkzeug benannt, mit dem, was es lesen und ändern kann, und nichts darüber hinaus.
- 02
Berechtigungen nachgelagert durchgesetzt
Die Systeme, die der Agent aufruft, prüfen die Rechte des Nutzers selbst.
- 03
Freigaben für folgenreiche Aktionen
Geld, Löschungen, Berechtigungen und ausgehende Nachrichten brauchen einen Menschen.
- 04
Budgets festgelegt und im Code durchgesetzt
Schritte, Zeit, Ausgaben je Aufgabe und je Tag, und Eingabegröße.
- 05
Bewertung bestanden
Echte und gegnerische Aufgaben, bewertet, auf oder über der vereinbarten Messlatte.
- 06
Protokolle, Warnungen und Ausschalter getestet
Jemand hat ihn vor dem Start absichtlich aus- und wieder eingeschaltet.