Prompt Injection erkennen

Prompt Injection erkennen: Texte, E-Mails und Webinhalte auf versteckte Anweisungen, Jailbreak-Muster und unsichtbare Zeichen prüfen, bevor eine KI sie verarbeitet.

Text, Dokument oder Website-Inhalt
–
    Markierte Stellen

    Wie Prompt Injection funktioniert

    Bei Prompt Injection verstecken Angreifer Anweisungen in Inhalten, die ein KI-System verarbeitet: in einer E-Mail, einer Bewerbung, einem PDF oder einer Website. Liest ein Assistent diesen Inhalt, hält er die versteckten Anweisungen womöglich für die seines Nutzers, ignoriert seine Regeln, verrät Daten oder ruft Werkzeuge auf.

    Der Prüfer sucht nach bekannten Mustern, um Prompt Injection zu erkennen: Aufforderungen, Anweisungen zu ignorieren, Rollenwechsel, gefälschte Systemmarkierungen, versteckte Anweisungen in HTML-Kommentaren oder weißer Schrift, unsichtbare Zeichen, verdächtige Links und typische Jailbreak-Formeln. Das ist eine Heuristik: Sie findet Auffälliges, beweist aber keine Sicherheit. Echte KI-Sicherheit entsteht durch Architektur: wenige Rechte für den Agenten, Bestätigung durch Menschen bei folgenreichen Aktionen und klare Trennung von Anweisungen und Daten.

    Fragen

    Häufige Fragen

    Was ist Prompt Injection?

    Ein Angriff auf KI-Systeme, bei dem Anweisungen in Inhalte eingeschleust werden, die das Modell verarbeitet. Das Modell kann Anweisungen und Daten nicht sicher unterscheiden und folgt womöglich den eingeschleusten.

    Was ist der Unterschied zu einem Jailbreak?

    Beim Jailbreak versucht der Nutzer selbst, die Regeln des Modells zu umgehen. Bei Prompt Injection kommt der Angriff von Dritten über Inhalte, etwa eine Website, die ein Agent liest.

    Kann man Prompt Injection sicher verhindern?

    Nach heutigem Stand nicht vollständig. Filter wie dieser senken das Risiko; entscheidend ist, dass ein KI-Agent nur die nötigsten Rechte hat und folgenreiche Aktionen von Menschen bestätigt werden.

    Ratgeber

    Zum Weiterlesen

    Alle Artikel
    1. Prompt Injection: Wie Angriffe auf KI-Systeme funktionierenPrompt Injection erklärt: wie versteckte Anweisungen in E-Mails, Dokumenten und Websites KI-Assistenten und Agenten manipulieren und welche Schutzmaßnahmen wirken.
    2. KI-Agenten absichern: Rechte, Freigaben und ProtokolleKI-Agenten absichern: Mit minimalen Rechten, Freigaben durch Menschen, Schutz vor Prompt Injection und lückenlosen Protokollen bleiben Agenten kontrollierbar.
    3. RAG einfach erklärt: KI mit eigenen Dokumenten nutzenRAG einfach erklärt: wie Retrieval-Augmented Generation funktioniert, wofür man Embeddings und Vektordatenbanken braucht und was ein RAG-System kostet.
    Weitere Werkzeuge

    Das könnte auch helfen

    Alle 65 Werkzeuge