Unter der Haube

Wie es funktioniert.

Acht Schritte von einem Dokument auf Ihrer Festplatte zu einer Antwort, die ihre Quelle nennt.

Einfach gesagt

Diese Seite erklärt, was Provenize technisch tut — ohne dass Sie dafür etwas Technisches wissen müssen. Jeder Schritt steht zuerst in normalen Worten da.

Unter jedem Schritt steht das Fachwort, das Entwickler dafür benutzen. Nützlich, wenn Sie weiterlesen wollen — überlesen Sie es ruhig, wenn nicht.

Vom Dokument zur Antwort

Acht Schritte. Alles davon existiert heute, außer wo wir es anders sagen.

  1. Alles läuft auf Ihrem eigenen Computer

    Provenize ist ein Programm auf Ihrem Rechner, neben den Programmen, die Sie schon nutzen. Kein Server von uns dazwischen. Schalten Sie das Internet ab, arbeitet es weiter.

    local-first · ein kleines Hilfsprogramm neben Ihrer eigenen App

  2. Ihre Dokumente werden eingelesen und in Stücke geschnitten

    Ein PDF mit zweihundert Seiten ist zu groß, um es auf einmal zu überblicken. Provenize schneidet es in Stücke von wenigen Absätzen und hält zu jedem Stück fest, aus welcher Datei und welcher Seite es kam. Genau dieses Festhalten macht später eine Quellenangabe möglich.

    Ingestion · Chunking · PDFs, Tabellen und Texterkennung für Scans

  3. Jedes Stück bekommt einen Fingerabdruck seiner Bedeutung

    Neben dem wörtlichen Text speichert Provenize eine Zahlenreihe, die zusammenfasst, worum es in diesem Stück geht. Stücke zum selben Thema bekommen Zahlen, die nahe beieinanderliegen. So finden Sie etwas später auch dann, wenn Sie andere Wörter benutzen als die im Text. Diese Rechnung läuft auf Ihrem eigenen Computer.

    Embeddings · Vektorindex · das Modell dafür läuft lokal

  4. Gesucht wird auf zwei Wegen gleichzeitig

    Eine Suche schaut auf die wörtlichen Begriffe, die andere auf die Bedeutung. Die beiden Listen werden zu einer Rangfolge zusammengeführt. Wörtliche Suche ist scharf bei Namen und Nummern, Bedeutungssuche bei Beschreibungen — zusammen übersehen sie weniger.

    hybride Suche · Stichwortsuche plus Vektorsuche, kombiniert

  5. Erst dann kommt ein KI-Modell ins Spiel

    Das Modell bekommt zwei Dinge: Ihre Frage und die wenigen gefundenen Textstellen. Nicht Ihre ganze Akte — die bleibt, wo sie ist. Wollen Sie ein Modell aus der Cloud nutzen, entfernen wir vorher Namen, E-Mail-Adressen und Ausweisnummern. Das klappt nicht immer, und das sagen wir.

    Antworten auf Basis gefundener Textstellen · persönliche Daten vor dem Senden entfernen

  6. Keine Quelle, keine Antwort

    Jede Tatsache in einer Antwort muss an einer dieser Textstellen hängen. Kann das Modell das nicht, gibt es keine Antwort — dann sagt es, dass es nichts Belastbares gefunden hat. Diese Regel steckt im Code, nicht in einer höflichen Bitte an das Modell.

    Quellenangaben im Code erzwungen · Quelle, Seite und wie gut die Stelle passt

  7. Jede Handlung kommt in ein Protokoll, dessen Zeilen aneinanderhängen

    Zu jeder Zeile im Protokoll wird eine kleine Zahl berechnet, und die vorherige Zeile geht in diese Rechnung ein. Ändern Sie eine Zeile, stimmt ihre Zahl nicht mehr — und die aller folgenden Zeilen auch nicht. Manipulation fällt also immer auf. Es kann nur etwas hinzukommen; es geht nie etwas heraus.

    eine Kette berechneter Zahlen · ein Protokoll, an das nur angehängt wird

  8. Löschen, ohne den Beweis zu verlieren

    Daten über eine Person sind mit einem Schlüssel verschlüsselt, der nur dieser Person gehört. Eine Löschanfrage wirft diesen Schlüssel weg: der Inhalt wird unlesbar, während die Kette der Zahlen unversehrt bleibt. Sie können also belegen, dass Sie gelöscht haben, ohne zu behalten, was dort stand.

    ein Schlüssel pro Person · Löschen durch Entfernen des Schlüssels

Ein Wort dabei, das Sie nicht kennen? Schauen Sie ins Glossar.

Für alle, die es selbst probieren wollen

Drei Zeilen: einlesen, suchen, Quelle dabei.

from ai_memory import AIMemory

mem = AIMemory("./vault")
mem.ingest("reports/report-2025.pdf")

hits = mem.search("TLS misconfiguration")
print(hits[0].citation)  # report-2025.pdf · p. 41 · 0.93

Die vollständige Beschreibung steht auf der SDK-Seite.

Worauf es gebaut ist

Die echten Namen, mit dem, was sie in normalen Worten tun.

  • Pythondie Sprache, in der es geschrieben ist
  • SQLitedie Datenbank für eine Person: alles in einer Datei
  • PostgreSQLdie Datenbank fürs Team: jeder sieht nur eigene Daten
  • Vektorsucheder Teil, der über die Bedeutung sucht
  • Lokale Sprachmodelledie Bedeutungsrechnung, auf Ihrem eigenen Rechner
  • SHA-256die Zahl, die die Protokollzeilen aneinanderknüpft
  • ed25519die digitale Signatur unter einem Export oder Nachweis
  • MCPder Anschluss, über den andere KI-Werkzeuge Ihr Gedächtnis lesen dürfen
  • 2.700+ Testsrund neunzig Prozent des Codes automatisch geprüft
Was es nie tut
  • Es führt nie Code aus, den es in einem Dokument findet. Ein Dokument ist Text zum Lesen, kein Auftrag zum Ausführen.
  • Es sendet nie ein ganzes Dokument hinaus. Nur Ihre Frage und die Stellen, die als Quelle dienen — und das nur, wenn Sie ein externes Modell einschalten.
  • Es erfindet nie eine Quelle. Gibt es die Quelle nicht, gibt es keine Antwort.
  • Es spricht nicht mit uns. Wir haben keinen Server, der Ihre Daten sieht — bei uns kann also nichts austreten.

Lieber prüfen als glauben?

Zum Nachweis