← Indietro
EserciziDivisi per argomento

02 Relevance feedback

Divisi per argomento di Metodi per il ritrovamento dell'informazione per il corso di Informatica presso Università degli Studi di Bari Aldo Moro. Materiale proveniente dall’archivio storico Studwiz e classificato per la consultazione online.

Metodi per il ritrovamento dell'informazioneDivisi per argomento

Informazioni sul documento

Cosa trovi in questo materiale

Divisi per argomento di Metodi per il ritrovamento dell'informazione per il corso di Informatica presso Università degli Studi di Bari Aldo Moro. Materiale proveniente dall’archivio storico Studwiz e classificato per la consultazione online.

Qualità dell’importazione: il testo è stato estratto direttamente dal documento originale.

Contenuti estratti dal documento

Passaggi rappresentativi riconosciuti nelle diverse parti del materiale. Il testo completo resta presente nella pagina per la ricerca, mentre l’anteprima compatta rende più semplice la lettura.

Pagina 1

Esercizio sul relevance feedback Sia data la seguente matrice termini documenti contenente pesi TF-IDF non normalizzati: e la query q=(t1:1, t2:2) 1) Calcolare il ranking dei documenti rispetto alla query q utilizzando la similarità del coseno. 2) Assumendo che il terzo ed il quarto documento del ranking siano rilevanti e che il primo documento del ranking non sia invece rilevante, riformulare la query utilizzando l’algoritmo di Rocchio e ricalcolare il ranking dei documenti. Come primo passo calcolo le lunghezze dei documenti e della query per normalizzare i vettori sulla propria lunghezza. |𝑑1| = √0,82 + 1,22 + 0,72 = 1,603 |𝑑2| = √0,12 + 12 + 1,42 = 1,723 |𝑑3| = √0,22 + 3,22 + 0,92 = 3,330 |𝑑4| = √0,12 + 0,12 + 0,12 + 2,32 + 1,72 = 2,865 |𝑑5| = √22 + 22 + 12 = 3 |𝑞| = √12 + 22 = 2,236 Dunque la matrice termini documenti con pesi normalizzati è la seguente (rappresento anche la query) t1 t2 t3 t4 t5 t6 d1 0,499 0,749 0 0,437 0 0 d2 0,058 0,580 0,812 0 0 0 d3 0 0,060 0 0 0,961 0,270 d4 0,035 0,035 0,035 0 0,803 0,593 d5 0 0 0,667 0,667 0,333 0 q 0,447 0,894 0 0 0 0 Calcolo la similarità del coseno tra la query q e tutti i documenti. Riporto il calcolo esplicito solo per un singolo documento (calcolo solo il prodotto interno perché sto operando su vettori di lunghezza unitaria): t1 t2 t3 t4 t5 t6 d1 0,8 1,2 0 0,7 0 0 d2 0,1 1 1,4 0 0 0 d3 0 0,2 0 0 3,2 0,9 d4 0,1 0,1 0,1 0 2,3 1,7 d5 0 0 2 2 1 0 𝑐𝑜𝑠𝑖𝑚(𝑑1, 𝑞) = 0,499 ∗ 0,447 + 0,749 ∗ 0,894 = 0,893 𝑐𝑜𝑠𝑖𝑚(𝑑2, 𝑞) = 0,545 𝑐𝑜𝑠𝑖𝑚(𝑑3, 𝑞) = 0,054 𝑐𝑜𝑠𝑖𝑚(𝑑4, 𝑞) = 0,047 𝑐𝑜𝑠𝑖𝑚(𝑑5, 𝑞) = 0 (𝑛𝑒𝑠𝑠𝑢𝑛 𝑡𝑒𝑟𝑚𝑖𝑛𝑒 𝑖𝑛 𝑐𝑜𝑚𝑢𝑛𝑒 𝑐𝑜𝑛 𝑙𝑎 𝑞𝑢𝑒𝑟𝑦) Il ranking dei documenti rispetto alla query q è il seguente: d1, d2, d3, d4, d5 Assumiamo che l’utente fornisca del feedback ed indichi d3 e d4 rilevanti, mentre d1 non rilevante. Calcolo il centroide dei…

Anteprima

Prima pagina del documento.

Prima pagina: 02 Relevance feedback