Was bedeutet Prompt Injection?
Bei einer Prompt Injection gelangen Anweisungen in die Eingabe eines Sprachmodells, die es von seiner vorgesehenen Aufgabe abbringen sollen. Direkt geschieht das über den Chat, etwa mit der Aufforderung, alle bisherigen Regeln zu ignorieren. Indirekt steckt die Anweisung in Inhalten, die das System verarbeitet: in einer Webseite, einer E-Mail oder einem hochgeladenen Dokument.
Besonders riskant wird das, wenn das Modell Werkzeuge nutzen oder auf Daten zugreifen darf. Schutzmaßnahmen setzen deshalb an mehreren Stellen an: Zugriffe auf das Nötigste beschränken, Eingaben und Ausgaben prüfen, externe Inhalte klar als Daten behandeln und folgenreiche Aktionen erst nach menschlicher Freigabe ausführen.
Ein Beispiel aus dem Betrieb
Ein Support-Chatbot darf Bestellungen nachschlagen. Ein Nutzer schreibt, der Bot solle alle Regeln vergessen und sämtliche Kundendaten ausgeben. Weil der Bot technisch nur die Bestellungen des angemeldeten Kunden abfragen kann und jede Antwort vor dem Versand geprüft wird, läuft der Versuch ins Leere.
Worauf Sie achten sollten
- Das System erhält nur die Zugriffe, die für seine Aufgabe unbedingt nötig sind.
- Externe Inhalte wie Webseiten, E-Mails und Dokumente werden als Daten behandelt, nicht als Anweisungen.
- Ausgaben werden geprüft, bevor sie Nutzer erreichen oder Aktionen auslösen.
- Folgenreiche Aktionen wie Versand, Löschung oder Zahlung erfordern eine menschliche Freigabe.
- Das System wird vor dem Start gezielt mit Angriffsversuchen getestet.
Wo die Grenzen liegen
Prompt Injection lässt sich nach heutigem Stand nicht vollständig ausschließen, weil Anweisungen und Daten für ein Sprachmodell im selben Text stehen. Mehrere Schutzschichten senken das Risiko; entscheidend ist, welche Rechte das System im ungünstigsten Fall besitzt.
Verwandte Begriffe
-
KI-Agent
Ein KI-Agent ist ein KI-System, das über das reine Antworten hinausgeht: Es ruft Werkzeuge auf, verarbeitet Daten und durchläuft definierte Abläufe innerhalb fester Grenzen.
-
Tool Use
Tool Use, auch Function Calling genannt, bedeutet: Ein Sprachmodell fordert den Aufruf definierter Funktionen an – etwa eine Datenbankabfrage, einen Kalenderblick oder eine API-Anfrage –, statt nur Text zu antworten.
-
Human in the Loop
Human in the Loop bezeichnet einen Prozess, in dem ein Mensch definierte Entscheidungen, Ausnahmen oder unsichere Ergebnisse prüft und freigibt.
-
Rollen und Berechtigungen
Ein Rollen- und Berechtigungskonzept legt fest, wer in einer Anwendung welche Daten sehen und welche Handlungen ausführen darf.
Passende Leitfäden und Leistungen
-
KI in Geschäftsprozessen einsetzen
Kontrollierte KI-Schritte mit Quellen, Grenzen und Freigaben planen.
-
Support-Bot für Ihre Website
Antworten aus einer freigegebenen Wissensbasis, mit Grenzen und Übergabe an Menschen.