← Indietro
EsamePrimo parzialeTesto d’esame

20131120

Primo parziale di Metodi per il ritrovamento dell'informazione per il corso di Informatica presso Università degli Studi di Bari Aldo Moro. Materiale proveniente dall’archivio storico Studwiz e classificato per la consultazione online.

Metodi per il ritrovamento dell'informazionePrimo parziale

Informazioni sul documento

Cosa trovi in questo materiale

Primo parziale di Metodi per il ritrovamento dell'informazione per il corso di Informatica presso Università degli Studi di Bari Aldo Moro. Materiale proveniente dall’archivio storico Studwiz e classificato per la consultazione online.

Qualità dell’importazione: il testo è stato estratto direttamente dal documento originale.

Contenuti estratti dal documento

Passaggi rappresentativi riconosciuti nelle diverse parti del materiale. Il testo completo resta presente nella pagina per la ricerca, mentre l’anteprima compatta rende più semplice la lettura.

Pagina 1

Prima prova in itinere di METODI PER IL RITROVAMENTO DELL’INFORMAZIONE C.d.L. in Informatica - A.A. 2013-14 Docente: P. Lops 20 Novembre 2013 (DURATA: 2 ore) Nome e Cognome : ___________________________________________ Matricola : ___________________________________________ 1) Sia data la seguente collezione di tre documenti: D1 = “free car and free park” D2 = “park and ride” D3 = “free meal and ride ride ride” a) Fornire la rappresentazione dei documenti sotto forma di bag -of-words, rimuovendo le eventuali stopwords (PUNTI 3) b) Costruire l'indice invertito della collezione (PUNTI 3) c) Calcolare la rappresentazione TF-IDF per i 3 documenti (usare il sublinear TF scaling) (PUNTI 3) d) Utilizzando la similarità del coseno, definire quale documento tra D2 e D3 è il più simile al documento D1 (PUNTI 3) 2) Descrivere il processo di modifica delle query basato sul metodo del relevance feedback (PUNTI 10) 3) Sia q una query i cui documenti rilevanti nella collezione sono 5. Siano S1 ed S2 due sistemi che riportano i seguenti primi 10 risultati in risposta alla query q. R indica che un documento è rilevante, N indica che il documento è non rilevante (il risultato più a sinistra è il top della lista). S1: RNRNNRNNRR S2: NRNNRRRNNN Calcolare l’accuratezza dei due sistemi per la query q, utilizzando le seguenti metriche, fornendone anche una breve descrizione: a) P@1, P@5, P@10, R-precision (PUNTI 4) b) Average Precision (PUNTI 4) c) Facoltativo: Riportare la curva di precisione-richiamo per la query q per il sistema S1 (PUNTI 3)

Anteprima

Prima pagina del documento.

Prima pagina: 20131120