FB18 Elektrotechnik und Informationstechnik · Angeboten in SoSe 2026
Für diesen Kurs wurden noch keine Noten gemeldet.
Notenverteilungen kommen herein, sobald jemand, der den Kurs belegt hat, den Notenspiegel mit installierter TUPlan-Erweiterung öffnet.
Noch keine Bewertungen — mach den Anfang.
Deine Bewertung hängt an einer zufälligen ID in diesem Browser. Kein Konto, nichts, was dich identifiziert.
Überblick über Wahrscheinlichkeitstheorie Markov-Eigenschaft und Markov-Entscheidungsprozesse Das Problem des Mehrarmigen Banditen (MAB) und das vollständige Reinforcement Learning (RL) Problem Taxonomie von MAB-Problemen (z.B. stochastische Rewards vs. adversarial Rewards, kontext-abhängige MAB) Algorithmen für MAB-Probleme (z.B. Upper Confidence Interval (UCB), Epsilon-Greedy, SoftMax, LinUCB) und ihre Anwendung in cyber-physischen Systemen Grundlagen der Dynamischen Programmierung und Bellman-Gleichungen Taxonomie der Lösungsansätze für das vollständige RL-Problem (z.B. Temporal-Difference Learning, Policy Gradient und Actor-Critic) Algorithmen für das vollständige RL-Problem (z.B. Q-Learning, SARSA, Policy Gradient, Actor-Critic) und ihre Anwendung in cyber-physischen Systemen Lineare Funktionsapproximation Nicht-Lineare Funktionsapproximation
Termine, Räume und Angaben stammen aus TUCaN und können veraltet sein. Falsche Angabe melden