Ein Agent kann Dateien verändern, einen Browser bedienen oder weitere Werkzeuge nutzen. Damit wächst neben dem Nutzen auch die Bedeutung klarer Grenzen. In diesem Themenbereich geht es darum, Sicherheit als Teil der täglichen Arbeit zu verstehen. Du brauchst dafür keine Programmierkenntnisse, solltest aber erkennen können, wann eine Aktion über deinen Auftrag hinausgeht.
Fremde Inhalte und eigene Entscheidungen
Was passiert, wenn eine gelesene Webseite, E-Mail oder Datei plötzlich Anweisungen enthält? Unter dem Begriff Prompt Injection betrachten wir, wie fremde Inhalte einen Agenten beeinflussen können. Dabei geht es um die Grenze zwischen Arbeitsmaterial und einem tatsächlich erteilten Auftrag. Ebenso behandeln wir, welche Rolle menschliche Freigaben bei folgenreichen Aktionen spielen.
Rechte, Schutz und Wiederherstellung
Eine Formulierung im Chat, technische Zugriffsrechte und eine Sandbox haben unterschiedliche Aufgaben. Wir besprechen, welche Grenzen sich daraus ergeben und warum keine einzelne Schutzmaßnahme vollständige Sicherheit verspricht. Dazu gehören auch Sicherungen, nachvollziehbare Aktionsverläufe und die Frage, welche Änderungen überhaupt rückgängig gemacht werden können.
Praxis im Kurs
An begrenzten Übungsfällen mit erfundenen Daten betrachten wir erwünschte und unerwünschte Handlungen. Du lernst, eine überzeugende Antwort von einer nachvollziehbar ausgeführten Aufgabe zu unterscheiden. Ziel ist ein realistischer Blick auf die Möglichkeiten und Grenzen deiner Agentenumgebung – einschließlich der Situationen, in denen weitere Klärung nötig ist.
Weiterführend: OWASP zu Prompt Injection.