Injection-Test — prüf die dritte Schicht selbst
Ein hochgeladenes Dokument kann Anweisungen an die KI enthalten („Ignoriere alle vorherigen Anweisungen …“). Schicht 3 des Sicherheitskonzepts sucht danach, bevor ein Dokument in die Wissensdatenbank kommt. Hier kannst du sie mit eigenem Text füttern: Es läuft dieselbe Mustererkennung, die auch über jedem Upload steht — kein Nachbau für die Vorführung.
Beispiele zum Einsetzen
Ein Klick setzt den Text ins Feld. Geprüft wird erst, wenn du auf „Text prüfen“ klickst.
Was diese Seite bewusst nicht tut
- Sie speichert deinen Text nicht. Er wird geprüft und ist danach weg: kein Protokolleintrag, keine Datei, keine Zeile im Server-Log. Das ist die einzige Stelle des Projekts ohne Eintrag im Nachweis — ein Feld, das ausdrücklich zum Eintippen von Angriffstexten einlädt, darf diese Eingaben nicht sammeln.
- Sie zeigt nur Stufe 1. Beim echten Upload folgt auf die Mustererkennung ein KI-Klassifikator — das Sprachmodell mistral-small-latest —, der auch umformulierte Angriffe erkennt. Hier läuft er nicht: Auf dieser Seite ist überhaupt kein KI-Modell im Spiel, nur feste Muster. Ein offenes Textfeld ohne Anmeldung wäre sonst ein bezahlter Modellzugang für jeden mit einem Skript. „Kein Befund“ heißt hier deshalb Stufe 1 hat nichts gefunden.
- Sie ist absichtlich stumpf. Die Muster schlagen auch an, wenn ein harmloser Text einen Angriff nur zitiert — etwa eine Schulungsunterlage über Prompt-Injection. Genau dafür gibt es Stufe 2, die zwischen „beschreibt einen Angriff“ und „ist einer“ unterscheidet. Lieber ein Fehlalarm zu viel als ein Dokument zu wenig geprüft.