Öffnet in einem neuen Tab

Digitale Begriffe einfach erklärt

Ein Embedding ist die numerische Repräsentation eines Begriffs, Satzes oder Dokuments in Form eines Vektors – einer langen Zahlenreihe, die dessen Bedeutung abbildet. Embeddings sind die Grundlage dafür, dass KI-Systeme Bedeutungsähnlichkeit berechnen können: Inhalte mit verwandter Bedeutung erhalten ähnliche Vektoren, unabhängig davon, ob sie dieselben Wörter verwenden. Sie sind damit ein zentraler Baustein von Sprachmodellen, semantischer Suche und RAG-Systemen.

Grundprinzip

Computer verarbeiten keine Bedeutung, sondern Zahlen. Ein Embedding übersetzt Sprache in eine Form, in der sich Bedeutung rechnerisch vergleichen lässt.

Jeder Text wird dabei auf einen Punkt in einem hochdimensionalen Raum abgebildet – dem semantischen Raum. Dieser Raum umfasst je nach Modell einige Hundert bis mehrere Tausend Dimensionen. Die Position eines Punktes ergibt sich aus den Bedeutungsmerkmalen, die das Modell während des Trainings gelernt hat.

Entscheidend ist der Abstand zwischen zwei Punkten: Je geringer er ausfällt, desto ähnlicher sind sich die Inhalte inhaltlich. “Reputationsmanagement” und “Rufschutz” liegen nahe beieinander, obwohl sie kein gemeinsames Wort enthalten; “Bank” als Geldinstitut und “Bank” als Sitzgelegenheit liegen weit auseinander, obwohl die Zeichenfolge identisch ist.

Ein häufig zitiertes Beispiel für die Struktur dieses Raums sind Rechenoperationen mit Bedeutungen: Zieht man vom Vektor für “König” den Vektor für “Mann” ab und addiert den für “Frau”, landet man in der Nähe von “Königin”. Beziehungen zwischen Begriffen sind im Raum also als Richtungen abgebildet.

Entstehung

Embeddings werden nicht manuell festgelegt, sondern beim Training eines Modells aus großen Textmengen gelernt. Grundlage ist die Beobachtung, dass Begriffe mit ähnlicher Bedeutung in ähnlichen Kontexten auftreten.

Frühe Verfahren wie Word2Vec (2013) und GloVe wiesen jedem Wort einen festen Vektor zu. Moderne Modelle erzeugen dagegen kontextabhängige Embeddings: Dasselbe Wort erhält je nach Satzzusammenhang einen anderen Vektor, sodass Mehrdeutigkeiten aufgelöst werden.

Arten

  • Wort-Embeddings – einzelne Wörter oder Token
  • Satz- und Passagen-Embeddings – ganze Sätze oder Textabschnitte; die für die semantische Suche und für RAG maßgebliche Form
  • Dokument-Embeddings – vollständige Texte, meist für Klassifizierung oder Clustering
  • Multimodale Embeddings – Text, Bild, Audio und Video im selben Vektorraum, sodass sich etwa ein Bild mit einer Textbeschreibung vergleichen lässt

Anwendungen

  • Semantische Suche – Treffer werden nach Bedeutung statt nach Stichwortübereinstimmung ermittelt
  • RAG-Systeme – Anfrage und gespeicherte Textabschnitte werden als Embeddings verglichen, um die passendsten Abschnitte abzurufen
  • Klassifizierung – automatische Zuordnung von Texten zu Kategorien, etwa bei der Auswertung von Bewertungen
  • Clustering – Gruppierung ähnlicher Inhalte, beispielsweise zur thematischen Strukturierung großer Content-Bestände
  • Duplikaterkennung – Auffinden inhaltlich gleicher Texte trotz abweichender Formulierung
  • Empfehlungssysteme – Vorschlag verwandter Inhalte oder Produkte

Bedeutung für die Praxis

Für die Arbeit an Inhalten ergeben sich aus der Funktionsweise von Embeddings mehrere konkrete Folgerungen:

  • Keyword-Dichte verliert an Bedeutung – entscheidend ist, ob ein Text ein Thema semantisch abdeckt, nicht wie oft ein Begriff vorkommt
  • Synonyme und Fachbegriffe wirken mit – verwandte Begriffe stärken die thematische Zuordnung eines Textes, auch ohne exakte Übereinstimmung mit der Suchanfrage
  • Abschnitte müssen für sich stehen – da in RAG-Systemen einzelne Passagen als Embedding abgelegt werden, verliert ein Abschnitt seine Auffindbarkeit, wenn sein Thema nur im vorherigen Absatz genannt wird
  • Eindeutige Benennungen helfen – werden Marke, Produkt oder Leistung durch Pronomen ersetzt, fehlen dem Abschnitt die Bedeutungsmerkmale, über die er gefunden werden könnte
  • Thematische Tiefe zahlt ein – zusammenhängende Inhalte zu einem Themenfeld erzeugen ein klareres semantisches Profil als vereinzelte Beiträge

In der Praxis lässt sich das als Faustregel fassen: Ein Abschnitt sollte auch dann verständlich und thematisch zuordenbar sein, wenn er isoliert und ohne Überschrift gelesen wird.

Grenzen

  • Keine Faktenprüfung – Embeddings messen Ähnlichkeit, nicht Richtigkeit; ein sachlich falscher Text kann einer Anfrage semantisch nahe liegen
  • Schwäche bei exakten Begriffen – Eigennamen, Artikelnummern oder Produktbezeichnungen werden über reine Vektorähnlichkeit teils schlechter gefunden als über Stichwortsuche; deshalb kombinieren viele Systeme beide Verfahren
  • Modellabhängigkeit – unterschiedliche Modelle erzeugen unterschiedliche Vektorräume, die nicht miteinander vergleichbar sind
  • Übernahme von Verzerrungen – Muster und Einseitigkeiten der Trainingsdaten bilden sich im Vektorraum ab
  • Keine Nachvollziehbarkeit – aus einem Vektor lässt sich nicht ablesen, welche Bedeutungsmerkmale ihn bestimmen