← Indietro
EsamePrimo parzialeTesto d’esame

20161125

Primo parziale di Metodi per il ritrovamento dell'informazione per il corso di Informatica presso Università degli Studi di Bari Aldo Moro. Materiale proveniente dall’archivio storico Studwiz e classificato per la consultazione online.

Metodi per il ritrovamento dell'informazionePrimo parziale

Informazioni sul documento

Cosa trovi in questo materiale

Primo parziale di Metodi per il ritrovamento dell'informazione per il corso di Informatica presso Università degli Studi di Bari Aldo Moro. Materiale proveniente dall’archivio storico Studwiz e classificato per la consultazione online.

Qualità dell’importazione: il testo è stato estratto direttamente dal documento originale.

Contenuti estratti dal documento

Passaggi rappresentativi riconosciuti nelle diverse parti del materiale. Il testo completo resta presente nella pagina per la ricerca, mentre l’anteprima compatta rende più semplice la lettura.

Pagina 1

I prova in itinere di METODI PER LA GESTIONE DELLA CONOSCENZA (25/11/2016) C.d.L. in Informatica e Tecn. Per la Prod. del Software - A.A. 2016-17 - Docente: P. Lops Nome e Cognome: _____________________________ Matricola: _______________ 1) Siano dati l’insieme delle categorie C = {c1, c2, c3} e una collezione di 100 documenti. a) Costruire un classificatore bayesiano per C, addestrandolo sul seguente training set TR: TR = {<D1,c1>, <D2,c1>, <D3,c2>, <D4,c2>, <D5,c3>} dove per ogni documento si riporta di seguito l’elenco delle parole in esso presenti, con le relative occorrenze: D1={T1:2, T2:3, T4:4} D2={T1:1, T3:2} D3={T2:1, T4:2} D4={T2:2, T5:4} D5={T3:7, T5:2} NB: illustrare chiaramente tutte le fasi di costruzione del classificatore (PUNTI 6) b) Determinare la classe di appartenenza del seguente documento d={T3:4,T6:2} (PUNTI 2) 2) Siano dati i seguenti documenti e la query Q rappresentati come vettori di pesi TF -IDF non normalizzati: T1 T2 T3 T4 T5 T6 D1 2 2 0 0 0 0 D2 0 0 1 2 3 0 D3 2 1 0 2 0 0 D4 5 1 0 0 2 0 Q 0 0 3 4 0 0 a) Calcolare il ranking dei documenti rispetto alla query Q utilizzando la similarità del coseno. (PUNTI 3) b) Assumendo che D1 e D2 siano rilevanti, mentre D3 non sia invece rilevante, riformulare la query utilizzando l’algoritmo di Rocchio (utilizzare α=0.75 e β=0.25). (PUNTI 5) 3) Sia q una query che ha 5 documenti rilevanti nella collezione. Supponiamo che un algoritmo di ritrovamento applicato a q riporti il seguente ranking Rq: D1 D3 D5 D7 D9 D4 Supponiamo che D1, D7 e D9 siano documenti rilevanti per q a) Calcolare Precision, Recall ed Average Precision per q, fornendo anche una descrizione formale delle metriche (PUNTI 4) b) Supponendo di avere dei giudizi di rilevanza non binari, e assumendo che D1 e D9 abbiano un grado di rilevanza…

Anteprima

Prima pagina del documento.

Prima pagina: 20161125