WikiDer > Informationsrückgewinnung
Informationsabruf (IR) ist auf der Suche nach Information in Dokumenten, zu Dokumenten selbst, zu Metadaten Beschreibung der Dokumente und der Suche innerhalb Datenbanken, zu Text, Audio, Bildern oder Daten. Die Bedingungen Datenabruf, Dokumentenabruf, Informationsrückgewinnung, und Textabruf werden oft synonym verwendet, obwohl sie jeweils ihre eigene Literatur, Theorie, Praxis und Technologien haben.
Der Begriff "Information Retrieval" stammt von Calvin Mooers 1948-50.
Modelle

Bei der Informationsbeschaffung werden verschiedene (mathematische) Modelle gewöhnt an Unterlagen und Anfragen zu repräsentieren. Die Basismodelle sind der Boolean, der Wahrscheinlichkeitsrechnung und der Vektorraummodell.
Vektorräume
Im Vektorraummodell ist a Sammlung Unterlagen als Sammlung vertreten Vektoren in einem hochdimensionalen Raum wie folgt.
Zunächst ist jedes Dokument auf eine Sammlung reduziert Begriffe mit entsprechenden absoluten Häufigkeiten. In der Regel sind Begriffe die Wörter, die im Dokument erscheinen, nachdem gängige Wörter wie . entfernt wurden das, es, vor dem usw. (die 'Stoppwörter'). Das resultierende Sack voller Worte wird durch Anwendung von Gewichtungsfunktionen in einen Vektor umgewandelt in einem -dimensionaler Raum, wo die Gesamtzahl der Begriffe in allen Dokumenten von ist. Jeder eindeutige Begriff entspricht einer Dimension von ; der Wert in dieser Dimension wird durch Gewichtung der Frequenz von . Existiert ein Begriff in einem Dokument nicht, ist der Wert in der entsprechenden Dimension 0. Die Abfrage wird einem ähnlichen Prozess mit einem Vektor unterzogen als Ergebnis.
Die Gewichtung der Terme erfolgt in der Regel durch Normalisierung zum häufigsten Begriff im Dokument (Begriff Häufigkeit, tf) gefolgt von Division durch die Anzahl der Dokumente, die den Begriff enthalten (inverse Belegfrequenz, idf); diese Gewichtungsmethode heißt tf×idf. Es gibt viele Variationen dieses Schemas, und häufig verwenden Dokumente und Abfragen leicht unterschiedliche Formeln.
Dann eine Anfrage verwendet werden, um die Dokumente zu speichern im nach Entfernung oder Winkel von der am wenigsten relevanten zu den am wenigsten relevanten rangieren (abgeleitet von der Innenprodukt) zwischen den Vektoren und messen. Die Dokumente mit dem kleinsten Winkel zum Vektor werden als die relevantesten angenommen.
Auswertung
Messwerte
- Präzision (Präzision). Präzision ist das Verhältnis zwischen der Anzahl der relevanten Ergebnisse (Dokumente, Treffer) und der Gesamtzahl der vom System zurückgegebenen Ergebnisse.
- bei welchem ein ist die Anzahl der in der Ergebnisliste gefundenen relevanten Dokumente und B die Anzahl der irrelevanten Dokumente in der Ergebnisliste.
- Fangen (erinnern). Catch ist das Verhältnis zwischen der Anzahl der gefundenen relevanten Dokumente und der Gesamtzahl der möglichen relevanten Dokumente. Letzteres ist eine vorab erstellte „Wunschliste“, die oft als „Grundwahrheit“ oder „Goldstandard“ bezeichnet wird.
- bei welchem ein ist die Anzahl der relevanten Ergebnisse, die in der Ergebnisliste gefunden wurden und C die Gesamtzahl der relevanten Dokumente in der zu durchsuchenden Dokumentensammlung.
- Ausfallen. Das Gegenteil von Fangen; das Verhältnis zwischen der Anzahl der gefundenen irrelevanten Dokumente und allen irrelevanten Dokumenten in der Sammlung:
- bei welchem B ist die Anzahl der irrelevanten Dokumente in der Ergebnisliste und d die Gesamtzahl der irrelevanten Dokumente in der Dokumentensammlung.
- F-Maß. Das F-Maß ist der gewichtete Durchschnitt zwischen Precision und Catch.
- bei welchem p steht für Präzision und V für Fangen.
- Durchschnittliche Präzision (Durchschnittliche Präzision, AP). Precision und Catch basieren auf der gesamten Liste der gefundenen Dokumente. Einfach ausgedrückt werden die Genauigkeiten nach jedem relevanten Dokument aufsummiert und schließlich durch die Gesamtzahl der relevanten Dokumente geteilt, also:
- bei welchem r ist der Rang (Position des Dokuments in der wiederhergestellten Liste), Nein ist die Gesamtzahl der gefundenen Dokumente, randalieren() ist eine binäre Funktion (d. h. 1 für ein relevantes Dokument oder 0 für ein irrelevantes Dokument), P() ist die Genauigkeit für einen bestimmten Rang und C die Gesamtzahl der relevanten Dokumente in der Dokumentensammlung.
- Dann haben Sie die mittlere durchschnittliche Genauigkeit, die der Durchschnitt der mittleren Genauigkeiten für jede einzelne Abfrage ist.
- Präzision auf Rang
- mittlerer reziproker Rang
Evaluierungsplattformen
1992 hat das US-Verteidigungsministerium zusammen mit dem Nationales Institut für Standards und Technologie (NIST), die Text-Retrieval-Konferenz (TREC) als Teil des TIPSTER-Textprogramms. Das Ziel von TREC ist es, die erforderliche Infrastruktur bereitzustellen, um groß angelegte Evaluierungen von Methoden zum Abrufen von Texten zu unterstützen.
Im Jahr 2000 wurde ein europäisches Pendant zu TREC gegründet, das Sprachübergreifendes Bewertungsforum (NOTENSCHLÜSSEL).
Forschungsgruppen zur Informationsbeschaffung
- Zentrum für Intelligent Information Retrieval an der UMASS
- Information Retrieval am Language Technologies Institute, Carnegie Mellon University
- Informationsabruf bei Microsoft Research Cambridge
- PSU Forschungslabor für intelligente Systeme
- Information Retrieval Laboratory am Harbin Institute of Technology, China
- Informations- und Sprachverarbeitungssysteme der Universität Amsterdam
- Information Retrieval Group an der Université de Neuchâtel
- European CLEF Initiative, ehemals Cross-Language Evaluation Forum
Literatur
- Christopher D. Manning; Prabhakan Raghavan, Hinrich Schultze, Einführung in die Informationsbeschaffung. Cambridge University Press, USA (2009), S. 544. ISBN 9780521865715 .