Back
ExamFull examExam paper onlyItalian

20140211

Study material for Metodi per il ritrovamento dell'informazione, shared by the Studwiz community and reviewed by moderators.

Metodi per il ritrovamento dell'informazioneFull exam

Document information

What's included in this study material

Study material for Metodi per il ritrovamento dell'informazione, shared by the Studwiz community and reviewed by moderators.

Import quality: text was extracted directly from the original document.

Extracted content from the document

Representative passages recognised in different parts of the material. The full extracted text remains available to search, while this compact preview makes the page easier to read.

Page 1

Prova scritta di METODI PER IL RITROVAMENTO DELL’INFORMAZIONE C.d.L. in Informatica - A.A. 2013-14 Docente: P. Lops 11 Febbraio 2014 (DURATA: 90 minuti) Nome e Cognome : ___________________________________________ Matricola : ___________________________________________ 1) Siano dati i seguenti documenti estratti da una collezione di 100 documenti: D1 = “T1 T2 T1 T3” D2 = “T3 T4” D3 = “T1 T5 T4 T4” a) Fornire la rappresentazione dei documenti sotto forma di bag-of-words (PUNTI 2) b) Costruire l'indice invertito della collezione (PUNTI 2) c) Calcolare la rappresentazione TF-IDF per i 3 documenti ( usare il numero di occorrenze non normalizzato per il TF) (PUNTI 3) d) Utilizzando la similarità del coseno, definire quale documento tra D2 e D3 è il più simile al documento D1 (PUNTI 3) 2) Siano dati l’insieme delle categorie C = {c 1, c 2} e una collezione di documenti definiti sul vocabolario V = {T1, T2, T3, T4, T5}. Costruire un classificatore bayesiano per C, addestrandolo sul seguente training set TR: TR = {<d1,c1>, <d2,c1>, <d3,c1>, <d4,c2>} dove per ogni documento d j si riporta di seguito l’elenco delle parole in esso presenti, con le relative occorrenze: d1={T1:2, T2:3} d2={T1:1, T3:2} d3={T2:1, T4:2} d4={T1:1, T2:2} NB: illustrare chiaramente tutte le fasi di costruzione del classificatore (PUNTI 7) Determinare la classe di appartenenza del documento dx={T2:1, T5:2} (PUNTI 3) 3) Descrivere la metrica nDCG (normalized Discounted Cumulative Gain) per la valutazione dei sistemi di Information Retrieval, discutendo ne i principi, ed esplicitandone il processo di calcolo. (PUNTI 10)

Preview

First page of the document.

First page: 20140211