Prompt Injection erkennen
Prompt Injection erkennen: Texte, E-Mails und Webinhalte auf versteckte Anweisungen, Jailbreak-Muster und unsichtbare Zeichen prüfen, bevor eine KI sie verarbeitet.
Wie Prompt Injection funktioniert
Bei Prompt Injection verstecken Angreifer Anweisungen in Inhalten, die ein KI-System verarbeitet: in einer E-Mail, einer Bewerbung, einem PDF oder einer Website. Liest ein Assistent diesen Inhalt, hält er die versteckten Anweisungen womöglich für die seines Nutzers, ignoriert seine Regeln, verrät Daten oder ruft Werkzeuge auf.
Der Prüfer sucht nach bekannten Mustern, um Prompt Injection zu erkennen: Aufforderungen, Anweisungen zu ignorieren, Rollenwechsel, gefälschte Systemmarkierungen, versteckte Anweisungen in HTML-Kommentaren oder weißer Schrift, unsichtbare Zeichen, verdächtige Links und typische Jailbreak-Formeln. Das ist eine Heuristik: Sie findet Auffälliges, beweist aber keine Sicherheit. Echte KI-Sicherheit entsteht durch Architektur: wenige Rechte für den Agenten, Bestätigung durch Menschen bei folgenreichen Aktionen und klare Trennung von Anweisungen und Daten.
Häufige Fragen
Was ist Prompt Injection?
Ein Angriff auf KI-Systeme, bei dem Anweisungen in Inhalte eingeschleust werden, die das Modell verarbeitet. Das Modell kann Anweisungen und Daten nicht sicher unterscheiden und folgt womöglich den eingeschleusten.
Was ist der Unterschied zu einem Jailbreak?
Beim Jailbreak versucht der Nutzer selbst, die Regeln des Modells zu umgehen. Bei Prompt Injection kommt der Angriff von Dritten über Inhalte, etwa eine Website, die ein Agent liest.
Kann man Prompt Injection sicher verhindern?
Nach heutigem Stand nicht vollständig. Filter wie dieser senken das Risiko; entscheidend ist, dass ein KI-Agent nur die nötigsten Rechte hat und folgenreiche Aktionen von Menschen bestätigt werden.
Zum Weiterlesen
- Prompt Injection: Wie Angriffe auf KI-Systeme funktionierenPrompt Injection erklärt: wie versteckte Anweisungen in E-Mails, Dokumenten und Websites KI-Assistenten und Agenten manipulieren und welche Schutzmaßnahmen wirken.
- KI-Agenten absichern: Rechte, Freigaben und ProtokolleKI-Agenten absichern: Mit minimalen Rechten, Freigaben durch Menschen, Schutz vor Prompt Injection und lückenlosen Protokollen bleiben Agenten kontrollierbar.
- RAG einfach erklärt: KI mit eigenen Dokumenten nutzenRAG einfach erklärt: wie Retrieval-Augmented Generation funktioniert, wofür man Embeddings und Vektordatenbanken braucht und was ein RAG-System kostet.
Das könnte auch helfen
JSON formatierenneu
JSON formatieren, prüfen und minifizieren, mit Fehlerstelle und Tokenzahl.
ÖffnenJSON reparierenneu
Kaputtes JSON aus KI-Antworten reparieren: Codeblöcke, Kommas, Anführungszeichen.
ÖffnenBatch-Datei-Generatorneu
Aus einer Vorlage und einer Liste viele Prompts erzeugen, als JSONL für die Batch-APIs.
ÖffnenAPI-Anfrage-Generatorneu
Fertige cURL-Anfragen für die APIs von OpenAI, Anthropic und Google erzeugen.
ÖffnenJSON-Schema-Generator
Aus einem JSON-Beispiel ein JSON Schema für strukturierte Ausgaben von KI-Modellen erzeugen.
ÖffnenDurchsatz-Rechner
Wie lange 10.000 Anfragen bei Rate Limits dauern und was der Engpass ist.
Öffnen