Document information
- University
- Politecnico di Milano
- Degree programme
- Computer Engineering
- Subject
- Soft Computing
- Material language
- Italian
- Classification
- Exercises · Complete set
- Original format
- Text
- Searchable text
Study material for Soft Computing, shared by the Studwiz community and reviewed by moderators.
Study material for Soft Computing, shared by the Studwiz community and reviewed by moderators.
Import quality: text was extracted directly from the original document.
Representative passages recognised in different parts of the material. The full extracted text remains available to search, while this compact preview makes the page easier to read.
Reinforcement Learning esercizi Reinforcement Learning La maratona Trovare affitto Primo appuntamento TORCS Washing machine Note: Dopo averne mostrato questi esercizi al Bonarini è emerso che 1)tutto è chiaramente più prolisso di quello che si riesce a fare in esame 2)le riflessioni sulla topologia del modello sono superflue anche se penso possano essere utili per ragionare in termini di MDP rispetto a che risultati ci si aspetta dall’ apprendimento 3) il docente ha avuto periodi molto creativi rispetto ai temi d’ esame La maratona Si progetti un sistema di apprendimento per rinforzo in grado di apprendere la strategia migliore per affrontare positivamente una maratona (circa 42 Km di corsa). Considerare le grandezze ritenute significative per un approccio semplificato. Modellare il problema, specificando gli stati, le azioni possibili (che saranno in grado di far passare l’agente da uno stato all’altro), e una funzione di rinforzo. Motivare la scelta di un opportuno algoritmo di distribuzione del rinforzo per questa applicazione, data la modellizzazione scelta. Definizione di stato si prenderà per stato la tupla <x,d> dove: x è un intero associato alla posizione sul percorso con una granularità di 50 metri d in {no,poco,medio,molto} rappresenta il dolore e la stanchezza fisica percepiti dall attleta La definizione di x è motivata dalla mia personale esperienza (pur non essendo un maratoneta) : correndo penso spesso a quanto manca alla fine del percorso con una granularità simile. Azioni a in {sosta,camminare,marciare,correre,scatto} Topologia del modello considerando l' ordinamento su A basato sulla velocità attesa sosta<camminare<marciare<correre<scatto e un ordinamento su D no<poco<medio<molto il modello puo essere desciritto come segue: un azione a conduce da uno…
First page of the document.