Back
ExamFull examExam paper onlyItalian

20170704

Study material for Metodi per il ritrovamento dell'informazione, shared by the Studwiz community and reviewed by moderators.

Metodi per il ritrovamento dell'informazioneFull exam

Document information

What's included in this study material

Study material for Metodi per il ritrovamento dell'informazione, shared by the Studwiz community and reviewed by moderators.

Import quality: text was extracted directly from the original document.

Extracted content from the document

Representative passages recognised in different parts of the material. The full extracted text remains available to search, while this compact preview makes the page easier to read.

Page 1

Prova scritta di METODI PER LA GESTIONE DELLA CONOSCENZA C.d.L. in Informatica e Tecn. per la Prod. del Software - A.A. 2016-17 Docente: P. Lops - 4 Luglio 2017 Nome e Cognome: ________________________________________ Matricola: ___________ 1) Siano dati l’insieme delle categorie C={c1,c2} e una collezione di 100 documenti definiti sul vocabolario V = {T1, T2, T3, T4, T5, T6}. Costruire un classificatore bayesiano per C, addestrandolo sul seguente training set TR: TR = {<D1,c1>, <D2,c2>, <D3,c1>, <D4,c2>, <D5,c1>} dove per ogni documento si riporta di seguito l’elenco delle parole con le relative occorrenze: T1 T2 T3 T4 T5 T6 D1 2 3 0 4 0 0 D2 1 0 2 0 0 0 D3 0 1 0 2 0 0 D4 0 2 0 0 4 0 D5 1 1 4 1 2 0 NB: illustrare chiaramente tutte le fasi di costruzione del classificatore. (PUNTI 8) 2) Dati i documenti D1, D2 e D3 e la query Q rappresentati come vettori di pesi TF -IDF non normalizzati: T1 T2 T3 T4 T5 T6 D1 2 2 0 0 0 0 D2 0 0 1 2 3 0 D3 5 1 0 0 2 0 Q 0 0 3 4 0 0 a) Calcolare il ranking dei documenti rispetto alla query Q utilizzando la similarità del coseno. (PUNTI 3) b) Assumendo che D1 e D2 siano rilevanti, mentre D3 non sia invece rilevante, riformulare la query utilizzando l’algoritmo di Rocchio (utilizzare α=0.75 e β=0.25). (PUNTI 5) 3) Illustrare in maniera sintetica il problema della overspecialization (sovraspecializzazione) dei content-based recommender systems (PUNTI 5) 4) Sia q una query che ha 5 documenti rilevanti nella collezione. Supponiamo che un algoritmo di ritrovamento applicato a q riporti il seguente ranking Rq: D1 D5 D3 D7 D9 D4 Supponiamo che D1, D7 e D9 siano documenti rilevanti per q a) Calcolare Precision ed Average Precision per q, fornendo anche una descrizione formale delle metriche (PUNTI 4) b) Supponendo di avere dei giudizi di rilevanza…

Preview

First page of the document.

First page: 20170704