Neu: PultOS — Ihr Unternehmen auf einem Bildschirm • 71 fertige Integrationen • Server in Deutschland

Was ist eine Vektordatenbank?

Eine Vektordatenbank findet Inhalte nach Bedeutung statt nach Wörtern. Wie Embeddings funktionieren, der Unterschied zu SQL und ihre Rolle in RAG.

· Aktualisiert:

KI & AgentenWie KI eine Aufgabe erledigt
  1. Eingabe
  2. WissenVektordatenbank
  3. Sprachmodell
  4. Werkzeuge
  5. Ergebnis
Einordnung: Vektordatenbank gehört zum Schritt „Wissen“. Schema zur Einordnung, keine Messwerte.
Inhaltsverzeichnis

Eine Vektordatenbank speichert Inhalte als lange Zahlenreihen, sogenannte Vektoren oder Embeddings, die die Bedeutung eines Textes, Bildes oder Tons abbilden. Dadurch findet sie Inhalte, die inhaltlich passen – auch wenn kein einziges Suchwort übereinstimmt.

Vektordatenbanken sind das Gedächtnis vieler KI-Anwendungen. Wenn ein KI-Assistent in Ihren Handbüchern, Verträgen oder Service-Tickets nachschlägt, steckt fast immer eine Vektorsuche dahinter. Dieser Artikel erklärt das Prinzip ohne Formeln.

Embeddings einfach erklärt

Stellen Sie sich eine Landkarte vor, auf der nicht Orte, sondern Bedeutungen eingetragen sind. „Rechnung“, „Faktura“ und „offener Betrag“ liegen dicht beieinander. „Dachrinne“ liegt weit weg, aber nah bei „Regenrohr“ und „Spengler“.

Ein Embedding ist die Koordinate eines Inhalts auf dieser Karte. Nur hat die Karte nicht zwei, sondern mehrere Hundert bis einige Tausend Dimensionen. Berechnet wird die Koordinate von einem Embedding-Modell, einem KI-Modell, das auf genau diese Aufgabe trainiert ist. Das Ergebnis ist eine Liste von Zahlen – und Inhalte mit ähnlicher Bedeutung bekommen ähnliche Zahlen.

Das funktioniert auch über Sprachgrenzen hinweg: Ein mehrsprachiges Embedding-Modell legt „Kündigungsfrist“ und „notice period“ an dieselbe Stelle.

So funktioniert die Suche

  1. Zerlegen: Dokumente werden in Abschnitte geteilt, etwa Absätze oder Kapitel. Zu große Stücke verwässern die Bedeutung, zu kleine verlieren den Zusammenhang.
  2. Einbetten: Jeder Abschnitt bekommt sein Embedding und wird mit Quelle, Datum und Zugriffsrechten gespeichert.
  3. Fragen: Auch die Suchanfrage wird in ein Embedding verwandelt.
  4. Nachbarn finden: Die Datenbank sucht die Abschnitte, deren Koordinaten der Frage am nächsten liegen. Damit das bei Millionen Einträgen schnell geht, nutzt sie spezielle Indexe, die nicht jeden Eintrag einzeln vergleichen.

Vektorsuche und klassische Datenbank im Vergleich

Klassische Suche (SQL, Volltext)Vektorsuche
Sucht nachWörtern, Zahlen, exakten WertenBedeutung
„Kunde will kündigen“ findet „Vertrag beenden“NeinJa
Rechnungsnummer 2024-117 exakt findenSehr zuverlässigUnzuverlässig
ErgebnisTreffer oder kein TrefferRangliste nach Ähnlichkeit
Typischer EinsatzBuchhaltung, Lager, AuftragsdatenWissen, Texte, Dokumente

In der Praxis kombiniert man beides. Diese hybride Suche findet die Rechnungsnummer exakt und den passenden Absatz im Handbuch nach Sinn.

Die Rolle in RAG

Große Sprachmodelle kennen Ihr Unternehmen nicht. Bei Retrieval Augmented Generation (RAG) sucht deshalb zuerst die Vektordatenbank die passenden Stellen aus Ihren Dokumenten heraus. Erst dann formuliert das Sprachmodell die Antwort – auf Basis dieser Stellen und mit Verweis auf die Quelle. Die Qualität der Antwort hängt damit direkt davon ab, ob die Suche die richtigen Abschnitte liefert.

Welche Lösungen es gibt

  • Erweiterungen bestehender Datenbanken: pgvector ergänzt PostgreSQL um Vektorspalten und Vektorsuche. Vorteil: Wissen, Stammdaten und Rechte liegen in einer Datenbank, die viele Unternehmen ohnehin betreiben.
  • Eigenständige Vektordatenbanken: etwa Qdrant, Weaviate oder Milvus, zum Teil selbst betrieben, zum Teil als Cloud-Dienst. Sinnvoll bei sehr großen Datenmengen oder besonderen Anforderungen an die Geschwindigkeit.
  • Vektorsuche in Suchmaschinen-Software wie Elasticsearch oder OpenSearch, wenn dort bereits eine Volltextsuche läuft.

Für die meisten Mittelständler ist nicht das Produkt die schwierige Frage, sondern der Betrieb: Wer aktualisiert die Inhalte, wer prüft die Treffer, wo liegen die Daten?

Beispiele aus dem Mittelstand

  • Service: Ein Techniker beschreibt ein Fehlerbild in eigenen Worten und bekommt die passenden Stellen aus Handbüchern und früheren Einsätzen.
  • Vertrieb: Ähnliche Angebote aus den letzten Jahren werden gefunden, auch wenn das Projekt anders hieß.
  • Einkauf und Verwaltung: Vertragsklauseln zu Haftung oder Kündigung lassen sich über alle Verträge hinweg vergleichen.
  • Website: Seiten, die fast dasselbe sagen, fallen auf – eine Hilfe gegen Duplicate Content.

Vorteile und Risiken

Vorteile: Mitarbeiter finden Wissen, ohne das richtige Stichwort zu kennen. Die Suche funktioniert über Sprachen hinweg. KI-Antworten stützen sich auf Ihre Dokumente statt auf das Allgemeinwissen des Modells.

Risiken:

  • Zugriffsrechte: Die Vektordatenbank muss die Rechte der Originaldokumente kennen. Sonst findet der Azubi plötzlich die Gehaltsliste.
  • Veraltete Inhalte: Gelöschte oder geänderte Dokumente müssen auch im Index gelöscht oder neu berechnet werden.
  • Modellwechsel: Embeddings verschiedener Modelle passen nicht zusammen. Wer das Modell wechselt, berechnet alle Einträge neu.
  • Datenabfluss: Wird das Embedding über einen externen Dienst berechnet, verlässt der Text dafür Ihr Haus. Prüfen Sie Anbieter und Serverstandort.

In der Praxis: So hilft SEODACH

Bei einer KI-Einführung ist die Vektordatenbank selten das Problem – die Arbeit steckt in sauberen Inhalten, richtigen Rechten und der laufenden Aktualisierung. Das übernehmen wir: Wir bereiten Ihre Dokumente auf, legen fest, wer was sehen darf, und sorgen dafür, dass neue Fassungen automatisch nachgezogen werden. Die Daten liegen dabei auf Servern in Deutschland.

Geht es vor allem um Belege, Rechnungen und Kontoauszüge, ist die intelligente Dokumentenverarbeitung der passende Einstieg: Ihr Team prüft Abweichungen, statt abzutippen.

Häufige Fragen

Was ist der Unterschied zwischen Embedding und Vektor?

Ein Vektor ist allgemein eine Liste von Zahlen. Ein Embedding ist ein Vektor, der die Bedeutung eines Inhalts abbildet und von einem KI-Modell berechnet wurde. Im KI-Umfeld werden beide Wörter meist gleichbedeutend verwendet.

Brauche ich für RAG eine eigene Vektordatenbank?

Nicht unbedingt. Läuft bei Ihnen bereits PostgreSQL, reicht oft die Erweiterung pgvector. Eine eigenständige Vektordatenbank lohnt sich eher bei sehr großen Datenmengen.

Ist eine Vektordatenbank DSGVO-konform?

Das hängt vom Betrieb ab, nicht von der Technik. Entscheidend sind Serverstandort, Zugriffsrechte, Löschkonzept und ein Auftragsverarbeitungsvertrag mit jedem beteiligten Dienstleister.

Brauchen Sie Unterstützung?

Unsere Experten helfen Ihnen, die richtigen SEO- und Digitalstrategien für Ihr Unternehmen umzusetzen.

Erstgespräch vereinbaren
Schreiben Sie uns per WhatsApp