Der semantische Raum ist ein mathematischer Vektorraum, in dem Begriffe, Sätze und Dokumente nach ihrer Bedeutung angeordnet sind. Inhalte mit ähnlicher Bedeutung liegen darin nahe beieinander, inhaltlich entfernte Begriffe weit auseinander. Er ist die Struktur, in der Sprachmodelle Bedeutung überhaupt erst handhabbar machen: Jedes Embedding ist ein Punkt in diesem Raum.
In der Sprachwissenschaft bezeichnet ein verwandter Begriff – das semantische Feld oder Wortfeld – die Gruppierung bedeutungsverwandter Wörter. Der hier beschriebene semantische Raum ist dessen rechnerische Entsprechung, entsteht jedoch nicht durch sprachwissenschaftliche Systematik, sondern automatisch aus Trainingsdaten.
Aufbau
Der Raum wird durch Dimensionen aufgespannt, deren Zahl je nach Modell von einigen Hundert bis zu mehreren Tausend reicht. Jede Dimension entspricht einem Bedeutungsmerkmal, das das Modell während des Trainings selbst gebildet hat.
Diese Merkmale sind nicht vorgegeben und in aller Regel auch nicht benennbar. Anders als bei einer manuell gepflegten Taxonomie lässt sich nicht sagen, dass eine bestimmte Dimension “Branche” oder “Tonalität” abbildet. Die Struktur ergibt sich allein daraus, in welchen Zusammenhängen Begriffe in den Trainingsdaten vorkommen.
Die Position eines Inhalts im Raum ist damit kein Etikett, sondern das Ergebnis der Gesamtheit seiner beobachteten Verwendungen.
Eigenschaften
- Nähe bedeutet Ähnlichkeit – der Abstand zwischen zwei Punkten drückt inhaltliche Verwandtschaft aus, üblicherweise gemessen über den Winkel zwischen den Vektoren
- Richtungen tragen Bedeutung – Beziehungen zwischen Begriffen bilden sich als gleichgerichtete Verschiebungen ab; die Differenz zwischen Singular und Plural oder zwischen Land und Hauptstadt verläuft im Raum jeweils ähnlich
- Nachbarschaften bilden Themenfelder – bedeutungsverwandte Begriffe gruppieren sich zu Bereichen, die sich als Cluster auswerten lassen
- Kontext verschiebt Positionen – in modernen Modellen erhält dasselbe Wort je nach Satzzusammenhang eine andere Position, sodass Mehrdeutigkeiten aufgelöst werden
- Sprach- und medienübergreifend – mehrsprachige Modelle bilden Begriffe verschiedener Sprachen in denselben Raum ab; multimodale Modelle zusätzlich Bilder, Audio und Video
Die letztgenannte Eigenschaft hat praktische Folgen: Ein deutschsprachiger Inhalt kann einer englischsprachigen Anfrage semantisch nahe liegen, ohne ein gemeinsames Wort zu enthalten.
Modellabhängigkeit
Jedes Modell erzeugt einen eigenen Raum. Die Vektoren zweier unterschiedlicher Modelle sind nicht miteinander vergleichbar, auch wenn sie dieselbe Dimensionszahl aufweisen.
Für den Betrieb von RAG-Systemen bedeutet das: Wird das Embedding-Modell gewechselt, muss der gesamte Bestand neu berechnet werden. Anfragen und gespeicherte Inhalte müssen stets aus demselben Raum stammen.
Bedeutung für die Praxis
Aus der Raumlogik ergeben sich mehrere Folgerungen für die inhaltliche Arbeit:
- Themen statt Einzelbegriffe – Sichtbarkeit entsteht dadurch, dass Inhalte ein Themenfeld abdecken, nicht dadurch, dass ein Begriff wiederholt wird
- Verwandte Begriffe stärken die Position – Fachbegriffe, Synonyme und typische Fragestellungen eines Themas schärfen die Verortung eines Textes
- Assoziationen sind steuerbar – in welchen Zusammenhängen eine Marke genannt wird, bestimmt mit, in welcher Nachbarschaft sie im Raum landet und bei welchen Anfragen sie auftaucht
- Abgrenzung ist möglich – wer in einer thematischen Nachbarschaft nicht erscheinen möchte, sollte die entsprechenden Begriffsumfelder nicht bedienen
- Sprachliche Klarheit wirkt unmittelbar – vage oder werbliche Formulierungen ohne fachlichen Begriffskern erzeugen eine unscharfe Position
Für die Reputationsarbeit ist besonders die Assoziationsebene relevant: Wird ein Unternehmensname über Jahre hinweg überwiegend im Umfeld von Konflikten, Verfahren oder Kritik genannt, verschiebt sich seine Position im Raum entsprechend – unabhängig davon, was auf der eigenen Website steht. Der Aufbau positiver, fachlich verankerter Erwähnungen ist damit keine reine Imagefrage, sondern wirkt auf die maschinelle Einordnung.
Auswertung
Der Raum lässt sich nicht direkt betrachten, da er zu viele Dimensionen umfasst. Für Analysezwecke kommen Verfahren zur Dimensionsreduktion zum Einsatz, die eine zweidimensionale Darstellung erzeugen – etwa zur Visualisierung thematischer Cluster in großen Content-Beständen.
Praktische Anwendungen sind unter anderem die Gruppierung bestehender Inhalte nach Themen, das Auffinden inhaltlicher Lücken und die Erkennung inhaltlich redundanter Seiten.
Grenzen
- Keine Wahrheitsebene – Nähe im Raum bedeutet Bedeutungsähnlichkeit, nicht Richtigkeit
- Übernahme von Verzerrungen – Einseitigkeiten der Trainingsdaten bilden sich als Nachbarschaften ab und wirken in den Ergebnissen fort
- Nicht interpretierbar – aus der Position eines Punktes lässt sich nicht ableiten, welche Merkmale sie bestimmen
- Schwäche bei Eigennamen – seltene Marken- oder Produktnamen sind im Raum schwach verankert, solange sie kaum in Texten vorkommen
- Träge – die Position einer Entität verändert sich erst mit der Datenlage, nicht mit einzelnen Veröffentlichungen
