← Back
ExamFull examExam paper onlyItalian

22 01 10

Study material for Modelli e Analisi dei Dati, shared by the Studwiz community and reviewed by moderators.

Modelli e Analisi dei DatiFull exam

Document information

What's included in this study material

Study material for Modelli e Analisi dei Dati, shared by the Studwiz community and reviewed by moderators.

Import quality: text was extracted directly from the original document.

Extracted content from the document

Representative passages recognised in different parts of the material. The full extracted text remains available to search, while this compact preview makes the page easier to read.

Page 1

Data mining Cognome e Nome ______________________ Matricola ___________ 22.01.10 1. Si fornisca la distinzione tra metodi di clustering gerarchici e di partizione, e si illustri brevemente l’algoritmo delle k-medie. 2. L’indice di entropia e l’indice di Gini rappresentano due criteri di separazione negli alberi di classificazione. Quale altro impiego può essere fatto di questi due indicatori? 3. Si descrivano i metodi filter e wrapper per la selezione degli attributi di un dataset, indicandone anche i principali pregi e difetti. Data mining 22.01.10 4. Si descriva il diagramma di guadagnato cumulato. Si consideri il seguente diagramma. Quale dei due modelli di classificazione scegliereste? Perché? 5. Dopo aver applicato l’algoritmo Apriori si scopre che la regola forte {Fumatore} => {Asma} ha un lift minore di 1. Quale conclusione si può trarre circa l’attendibilità di questa regola? 6. Il diagramma box-and-whisker relativo all’attributo “colesterolo” per un campione di pazienti si presenta nella seguente forma. L’attributo “colesterolo” è utilie per la selezione dei pazienti cui rivolgere una campagna di prevenzione? Perché? Modello A Modello B colesterolo 150 200 250 300 350 400 classe 0: pazienti che hanno avuto un infarto classe 1: pazienti che non hanno avuto un infarto Data mining 22.01.10 7. Dato il seguente diagramma di silhouette, si fornisca una valutazione circa la bontà del modello di clustering motivando la risposta. Quali altri indicatori si possono impiegare per misurare la qualità di un modello di clustering? 8. Si illustri il concetto di minimizzazione del rischio strutturale nei metodi support vector machines. Si formuli il modello di ottimizzazione per determinare l’iperpiano ottimo di separazione nel caso di un dataset non linearmente separabile,…

Preview

First page of the document.

First page: 22 01 10