Startseite / Artikel / Lassen Sie die genauen Begriffe und ihre Bedeutung bei der Suche zusammenwirken.

Lassen Sie die genauen Begriffe und ihre Bedeutung bei der Suche zusammenwirken.

Kombinieren Sie die lexikalischen und semantischen Kandidatenlisten, ohne inkompatible Suchbewertungen als austauschbar zu betrachten.

572 Wörter

Ein Entwickler, der nach ERR_CACHE_STALE sucht, erwartet den entsprechenden Fehlercode. Ein anderer Entwickler könnte dasselbe Problem als „Die Anwendung zeigt ständig die Daten von gestern an“ beschreiben. Eine nützliche Wissenssuche sollte beide Anfragen bewältigen können.

Lexikalische Suche ist wertvoll, wenn die genaue Schreibweise Informationen enthält. Semantische Suche kann verschiedene Beschreibungen derselben Idee miteinander verbinden. Die Kombination beider Methoden gibt jeder Methode die Möglichkeit, Beweise zu finden, die die andere übersehen hat.

Die Entscheidung zur Gestaltung bestimmt, wo diese Kombination stattfindet.

Geben Sie jedem Suchmechanismus Zugang zum Korpus

Nehmen wir an, die semantische Suche liefert zwanzig Kandidaten, die anschließend von einem lexikalischen Bewertungsalgorithmus sortiert werden. Dadurch kann die Reihenfolge verbessert werden, doch eine exakte Übereinstimmung außerhalb der ursprünglichen zwanzig bleibt unsichtbar.

Um ein breiteres Spektrum an Kandidaten abzudecken, sollten beide Suchmethoden auf dem zugelassenen Korpus angewendet und ihre Ergebnisse zusammengeführt werden. In beiden Verfahren müssen dieselben Kriterien und Filter für die Eignung der Quellen verwendet werden. Ein Dokument, das aufgrund unklarer Identität ausgeschlossen wurde, sollte nicht über den zweiten Suchmechanismus erneut berücksichtigt werden.

Dies baut direkt auf dem Quellenverzeichnis auf: Die Suche sollte anhand von Beweismitteln durchgeführt werden, die Sie zur Verwendung bereit sind.

Führen Sie die Ranglisten zusammen, bevor Sie eine Bewertungsmethode entwickeln

Ein BM25-Score sowie ein Kosinusähnlichkeitswert beschreiben unterschiedliche Berechnungsmethoden. Ihr direktes Addieren ergibt zwar eine Zahl, doch diese hat keine automatische Interpretation als kombinierte Relevanz.

Die rekursive Rangfusionsmethode bietet eine einfache Grundlage. Jede gerankte Liste liefert einen Wert, der von der Position des Kandidaten abhängt:

fused_score(document) = sum(1 / (c + rank_in_list))

Die Ranglisten beginnen bei eins. Eine Liste trägt nichts zu einem Dokument bei, das sie nicht abgerufen hat. Die positive Konstante c bestimmt, wie stark sich der Beitrag zwischen den Positionen ändert.

Der Vorteil ist die operative Einfachheit: Die Zusammenführung erfordert nicht, dass sich die zugrunde liegenden Bewertungsskalen überschneiden. Der Nachteil ist, dass dabei die Größe der Bewertung ignoriert wird. Zwei benachbarte Ergebnisse erhalten ähnliche Beiträge, selbst wenn ein Abfrageverfahren sie als sehr unterschiedlich eingestuft hat.

Bewahren Sie die Konstanten sowie die Anzahl der Kandidaten in der Konfiguration auf und bewerten Sie sie anschließend. Es handelt sich dabei um Designentscheidungen, keine Garantien für Relevanz.

Deduplizieren Sie nach Identität, nicht nach Titel

Zwei Abfrageverfahren können denselben Datensatz zurückgeben. Führen Sie die Zusammenführung dieses Datensatzes anhand seines stabilen Identifikators durch, sodass beide Ränge zu einem einzigen Kandidaten beitragen. Zählen Sie ihn nicht als zwei unabhängige Beweismittel.

Titel sind schwache Identifikatoren. Verschiedene Artikel können denselben Titel haben, und ein Artikel kann seinen Titel ändern. Eine nützliche Chunk-Schlüsselstruktur beinhaltet die Quellenidentität, die Inhaltsversion sowie den Standort des Chunks.

Ebenso sollten genaue Doppelgänger von nahegelegenen Chunks derselben Kategorie unterschieden werden. Letztere mögen später zusammengeführt werden müssen, wie in „Evidence-Preserving Chunking“ erläutert.

Testen Sie die Abfruchtypen getrennt voneinander

Verwenden Sie mindestens drei Gruppen von Fragen: genaue Identifikatoren, konzeptionelle Beschreibungen sowie Mischformen beider. Vergleichen Sie die reine lexikalische Suche, die reine semantische Suche sowie das kombinierte Ergebnis.

Überprüfen Sie zunächst, ob die relevanten Beweismittel den Kandidatenpool erreichen, bevor Sie sich auf die Qualität der Antworten konzentrieren. Wenn die Fusion konzeptionellen Abfragen hilft, aber genauen Abfragen mit Fehlercodes schadet, kann der Gesamtdurchschnitt eine wichtige Verschlechterung verbergen.

Eine kleine technische Bibliothek kann bereits mit einer lexikalischen Suche gute Ergebnisse liefern. Fügen Sie eine semantische Suche hinzu, wenn die gemessenen Fehlsuchvorgänge dies rechtfertigen. Die Beibehaltung einer lexikalischen Grundlage macht außerdem den Nutzen der zusätzlichen Mechanismen sichtbar.

Eine nützliche Kurzliste an die nachfolgenden Schritte weiterleiten

Fusion erzeugt eine Kurzliste, keine faktische Beurteilung. Ein hochrangiges Dokument kann dennoch veraltet, unvollständig oder für eine wichtige Kriterium in der Frage irrelevant sein.

In der nächsten Phase kann man die Kandidaten mithilfe eines stärkeren Relevanzsignals neu ranken. Doch keine spätere Ranking-Phase kann Beweise retten, die nie in die Kurzliste aufgenommen wurden. Messen Sie zunächst die Abdeckung der Kandidaten; andernfalls optimieren Sie möglicherweise die Reihenfolge des falschen Materials.