Logo des Repositoriums
  • English
  • Deutsch
Anmelden
Keine TU-ID? Klicken Sie hier für mehr Informationen.
  1. Startseite
  2. Publikationen
  3. Publikationen der Technischen Universität Darmstadt
  4. Erstveröffentlichungen
  5. Learning from Imperfect Human Input in Interactive Machine Learning
 
  • Details
2025
Erstveröffentlichung
Dissertation
Verlagsversion

Learning from Imperfect Human Input in Interactive Machine Learning

File(s)
Download
Hauptpublikation
Learning_from_Imperfect_Human_Input_in_Interactive_Machine_Learning__2_.pdf
Urheberrechtlich geschützt
Format: Adobe PDF
Size: 32.3 MB
TUDa URI
tuda/12136
URN
urn:nbn:de:tuda-tuprints-278337
DOI
10.26083/tuprints-00027833
Autor:innen
Kempf, Lisa Katharina ORCID 0009-0004-0950-5184
Kurzbeschreibung (Abstract)

From early childhood, humans collect a lifetime of experiences and are, therefore, a valuable source of knowledge. Learning from human teachers in robotics can enable the transfer of this prior knowledge to the robot by providing input, i.e., in the form of task demonstrations, advice, or feedback on robotic actions. This way, instead of being limited to a pre-defined set of programmed skills, a robot’s skill set can be extended and personalized by a human user. Involving humans in the learning process and adapting the robot’s skill set to the respective wishes and needs of the user can additionally enable learning from non-experts and increase the acceptance of intelligent robots. However, in real application scenarios in everyday life or industry with inexperienced users, this user input is prone to error, as these complex environments exhibit a high degree of uncertainty, and users often have to make decisions based on limited information. To enable learning from humans in these real, unstructured environments, it is crucial to detect and handle erroneous or imperfect human input and develop methods that allow robots to leverage and exploit input from human teachers despite its flawed nature. This work approaches learning from imperfect human input from three different angles. First, we analyze human behavioral data corresponding to human uncertainty with the goal of detecting uncertain user input. Existing studies already point to a correlation between human uncertainty and the correctness of responses. This uncertainty is communicated verbally and non-verbally when interacting with another human. Humans are surprisingly good at assessing this communicated uncertainty and use this information to evaluate the content of conversations. We propose a model that recognizes human uncertainty in a similar way based on multi-modal behavioral data, such as speech, eye and head movements, response time, and facial behavior. In contrast to existing methods in the literature, we here focus on multi-modal behavioral cues related to self-reported human uncertainty in human-robot interactions with the goal of learning a human uncertainty classifier applicable in HRI settings as a potential indicator for incorrect human input. In experiments with human participants, we collected multi-modal behavioral data in decision-making tasks with uncertainty and analyze behavioral differences between human-human interactions and human-robot interactions. Evaluations of our developed multi-modal human uncertainty classifier trained on the collected dataset show that it significantly outperforms third-person annotators in accuracy and F1 score. While humans report feeling less observed when responding to a robot compared to a human, behavioral differences did not significantly affect the performance of our proposed uncertainty classification. Second, we consider learning from sub-optimal human input in the context of Interactive Reinforcement Learning (IRL). Classical Reinforcement Learning enables intelligent agents such as robots to learn new skills by maximizing rewards through interaction with the environment and performing appropriate actions. Human input in the form of feedback on actions or direct action advice in IRL can accelerate learning by benefiting from prior human knowledge of actions and the environment. Related methods often simulate these inputs and assume their optimality. Moreover, most approaches that account for inaccurate advice compute trust in human action advice independent of a state. In reality, however, a high degree of uncertainty or limited understanding of the task can result in incorrect human input. In particular, human input might be inaccurate only in some states while still being useful in others. Therefore, we present LUNAA, an IRL method that enables learning from partially incorrect human action advice by computing a state-dependent measure of trust in human advice. This allows LUNAA to discard incorrect advice for particular states while still profiting from correct advice in other states. Here, we combine three different indicators for potentially incorrect human action advice. Since human uncertainty is related to answer correctness, as described above, we consider behavioral cues related to human uncertainty as one indicator. We combine this human uncertainty estimate with the consistency of action advice and a reward-based indicator retrospective optimality. The resulting trust measure determines whether the human action advice is accepted. In addition, we propose LUNAA-TIP which extends the proposed LUNAA approach by introducing state-dependent trust measures in the policy in addition to the state-dependent trust in human advice. This allows LUNAA-TIP to distinguish between states with a high policy certainty, e.g., based on a high number of state visits, and states with a low certainty where it might be more beneficial to follow human advice. Moreover, LUNAA-TIP utilizes a real-time implementation of the previously proposed multi-modal human uncertainty classifier based on behavioral cues as an indicator for unreliable human action advice. Evaluations in gridworld environments with simulated advice show that LUNAA and LUNAA-TIP outperform a state-independent baseline without a computation of trust in human advice and the policy. In addition, LUNAA-TIP outperforms LUNAA confirming the benefit of an additional state-dependent trust in the policy. In robotic experiments with advice from human participants, we confirm the usefulness of behavioral cues related to human uncertainty as an indicator for unreliable advice and show that LUNAA-TIP is more robust to incorrect human advice compared to a state-independent computation of trust in the policy. Third, we look at Learning from Demonstration (LfD), particularly learning robotic skills in the form of Behavior Trees (BTs) from a potentially incomplete small set of human video demonstrations. Behavior Trees are a possible representation of robot capabilities that map a state to an action. They are characterized by a high modality, reactivity, and high interpretability and are, therefore, a well-suited skill representation for LfD approaches. Demonstrating a task is a very natural way of teaching for a human instructor and inspired by how humans can learn by observing and imitating others. In human-robot interactions, this type of learning from human demonstrations is particularly suitable for non-experts as it requires no prior knowledge and is less time-consuming compared to other BT-based LfD approaches that require a step-by-step specification of necessary actions. We, therefore, automatically learn a Behavior Tree with action conditions from a limited number of human video demonstrations. In contrast to existing methods, we automatically compute continuous pre- and post-conditions based on visual features and use these to build a reactive BT. While this teaching approach is very intuitive and requires only a few task demonstrations, learning from this small set of natural and potentially sub-optimal demonstrations poses additional challenges. In a preliminary study, we therefore investigate how non-experts demonstrate tasks and vary the demonstrations. We identify three common failure cases of a BT learned from only a few potentially incomplete demonstrations. The pre- and post-conditions allow the robot to recognize these failure cases during the execution of the BT and to resolve them by interacting with the human user. Here, the robot explicitly asks for additional input and improves or extends the initial BT and learned action conditions accordingly. In contrast to existing methods, in this way failure cases caused by imperfect or incomplete demonstrations can be interactively resolved, and repeating the entire teaching process is not necessary. We evaluate the method in a sorting task with a robot arm and human participants and show that it is possible to learn a reactive BT from just a few video demonstrations and to interactively resolve failure cases during runtime. In summary, this thesis contributes methods to detect, learn from, and overcome problems arising from imperfect human input. We show that taking into account the sub-optimality of human input enables a more effective exploitation of the potential of human input and improves learning in the context of Lf D and IRL. The contributed methods and robotic experiments with participants with mostly little to no robotic experience provide insights into the nature of human input and challenges but also opportunities when learning from human teachers for future work.

Sprache
Englisch
Alternativtitel
Lernen von unvollkommenen menschlichen Eingaben im interaktiven Maschinellen Lernen
Alternatives Abstract

Von früher Kindheit an sammeln wir Menschen Erfahrungen und Wissen, was uns zu einer wertvollen Wissensquelle macht. In der Robotik kann das Lernen von menschlichen Lehrern die Übertragung dieses Vorwissens auf den Roboter ermöglichen, zum Beispiel in Form von Demonstrationen von Fähigkeiten, Aktionsvorschlägen oder Feedback zu Roboteraktionen. Auf diese Weise sind die Fähigkeiten eines Roboters nicht auf einen vorprogrammierten Satz von Fertigkeiten beschränkt, sondern können von einem menschlichen Nutzer erweitert und personalisiert werden. Die Einbindung des Menschen in den Lernprozess und die Anpassung der Fähigkeiten des Roboters an die jeweiligen Wünsche und Bedürfnisse des Nutzers kann zudem die Akzeptanz intelligenter Roboter erhöhen und es auch Nutzern ohne Robotik-Erfahrung ermöglichen, Robotern etwas beizubringen. In realen Anwendungsszenarien im Alltag oder in der Industrie sind diese Nutzereingaben von Nichtexperten jedoch oft fehleranfällig, da diese komplexen, unstrukturierten Umgebungen ein hohes Maß an Unsicherheit aufweisen und der Nutzer Entscheidungen auf Basis begrenzter Informationen treffen muss. Um Roboter in die Lage zu versetzen, in diesen realen, unstrukturierten Umgebungen von Menschen zu lernen, ist es wichtig, fehlerhafte menschliche Eingaben zu erkennen und Methoden zu entwickeln, die es Robotern ermöglichen, Eingaben von menschlichen Lehrern trotz ihrer Fehlerhaftigkeit optimal zu nutzen. Diese Arbeit nähert sich dem Lernen von suboptimalen, menschlichen Nutzereingaben von drei unterschiedlichen Seiten. Zunächst betrachten wir Verhaltensdaten im Zusammenhang mit menschlicher Unsicherheit mit dem Ziel, unsichere Nutzereingaben zu erkennen. In der Literatur weisen bereits einige Arbeiten auf einen Zusammenhang zwischen menschlicher Unsicherheit und der Richtigkeit von Antworten hin. Diese Unsicherheit wird in der Interaktion mit einem Gegenüber verbal sowie non-verbal kommuniziert. Menschen sind erstaunlich gut darin, dieses kommunizierte Unsicherheit abzuschätzen und darauf basierend den Gesprächsinhalt zu bewerten. Es wird daher eine Methode vorgestellt, die menschliche Unsicherheit auf ähnliche Weise basierend auf multi-modalen Verhaltensdaten wie Sprache, Kopf- und Augenbewegungen, Reaktionszeiten und Gesichtsausdrücken erkennt. Im Gegensatz zu existierenden Methoden fokussieren wir uns hier auf menschliche Entscheidungsunsicherheit, die einer Entscheidung zwischen verschiedenen Optionen zugeordnet werden kann. Das Ziel ist hier eine menschliche Unsicherheitserkennung, die in Mensch-Roboter Interaktionen als potentieller Indikator für fehlerhafte Nutzereingaben eingesetzt werden kann. In Experimenten mit menschlichen Versuchspersonen werden Verhaltensdaten in einer Aufgabe mit Unsicherheit aufgenommen, um verschiedene multi-modale Modelle zur Unsicherheitserkennung auf diesen Daten zu trainieren. Außerdem werden Unterschiede im Verhalten zwischen Mensch-Mensch-Interaktionen und Mensch-Roboter-Interaktionen analysiert. Das entwickelte Modell zur menschlichen Unsicherheitserkennung, das auf dem multi-modalen Datensatz trainiert wurde, erzielt eine signifikant höhere Genauigkeit und F1 score als Datenannotationen von Drittpersonen. Während Menschen berichten sich in der Interaktion mit einem Roboter weniger beobachtet zu fühlen als mit einem Menschen, haben die Verhaltensunterschiede keinen signifikanten Einfluss auf die Leistung der von uns vorgeschlagenen Unsicherheitsklassifizierung. Zweitens betrachten wir Lernen von suboptimalen Nutzereingaben im Zusammenhang des interaktiven verstärkenden Lernens. Traditionelles verstärkendes Lernen ermöglicht intelligenten Agenten wie zum Beispiel Robotern das Erlernen neuer Fähigkeiten, indem mögliche Belohnungen durch die Interaktion mit der Umgebung und dem Ausführen geeigneter Aktionen maximiert werden. Es hat sich gezeigt, dass menschliche Eingaben in Form von Feedback auf durchgeführte Aktionen oder direkte Aktionsvorschläge das Lernen beschleunigen können, da so vom menschlichen Vorwissen über Aktionen und die Umgebung profitiert werden kann. Für die meisten Methoden in der Literatur werden diese Eingaben jedoch simuliert und deren Optimalität angenommen. Zudem errechnen die meisten Methoden, die inakkturate Aktionsvorschläge berücksichtigen, eine Vertrauensgröße unabhängig der jeweiligen Situation. In der Realität hingegen kann eine hohe Unsicherheit oder ein eingeschränktes Verständnis der Aufgabe zu fehlerhaften menschlichen Eingaben führen. Zudem können menschliche Eingaben nur in manchen Situationen inkorrekt sein während sie in anderen Situationen nützlich sind. Daher stellen wir LUNAA vor, eine Methode, die das verstärkende Lernen von situationsbedingt fehlerhaften Eingaben ermöglicht, indem eine situationsbedingte Größe für das Vertrauen in menschliche Eingaben berechnet wird. Das erlaubt es LUNAA inkorrekte Eingaben in bestimmten Situationen zu verwerfen und trotzdem noch von korrekten Eingaben in anderen Situationen zu profitieren. Hierzu werden drei unterschiedliche Indikatoren für potentiell fehlerhafte Aktionsvorschläge berechnet. Da menschliche Unsicherheit wie oben beschrieben ein Indikator für potentiell fehlerhaften Input sein kann, betrachten wir Verhaltensmuster, die auf Unsicherheit hindeuten. Diese Unsicherheitsschätzung kombinieren wir mit der Konsistenz der Aktionsvorschläge sowie einem Indikator basierend auf Belohnungen. Die resultierende Vertrauensgröße bestimmt, ob der Aktionsvorschlag des Menschen übernommen wird. Darüber hinaus stellen wir die Methode LUNAA-TIP vor, die den vorgeschlagenen LUNAA Algorithmus um eine situationsbedingte Vertrauensgröße in die Policy des Roboters erweitert zusätzlich zu der situationsbedingten Vertrauensgröße in die menschlichen Aktionsvorschläge. Das erlaubt es LUNAA-TIP zwischen Situationen mit einer hohen Sicherheit der Policy, zum Beispiel aufgrund einer hohen Anzahl an Zustandsbesuchen, und Situationen mit einer geringen Sicherheit zu unterscheiden, in denen es vorteilhafter sein könnte, den menschlichen Vorschlägen zu folgen. Zudem nutzt LUNAA-TIP eine Echtzeit-Implementierung des zuvor vorgeschlagenen multi-modalen Modells zur menschlichen Unsicherheitserkennung basierend auf Verhaltensdaten als einen Indikator für unzuverlässige Aktionsvorschläge. Evaluationen in Gridworld-Umgebungen mit simulierten Aktionsvorschlägen zeigen, dass LUNAA und LUNAA-TIP schneller lernen als eine vergleichbare Methode ohne situationsbedingte Vertrauensgrößen in die Policy und menschliche Aktionsvorschläge. Zudem schneidet LUNAA-TIP besser ab als LUNAA, was den Nutzen der zusätzlichen situationsbedingten Vertrauensgröße in die Policy bestätigt. In Robotik-Experimenten mit Aktionsvorschlägen von menschlichen Versuchspersonen zeigen wir den Nutzen von Verhaltensdaten im Zusammenhang mit menschlicher Unsicherheit als Indikator für unzuverlässige Aktionsvorschläge und die Robustheit von LUNAA-TIP gegenüber falschen menschlichen Aktionsvorschlägen im Vergleich mit einer situations-unabhängigen Berechnung einer Vertrauensgröße in die Policy. Drittens betrachten wir Lernen von Demonstrationen (LfD) im Zusammenhang des Lernens von Roboterfähigkeiten in Form von Behavior Trees von einem kleinen, unvollständigen Satz menschlicher Videodemonstrationen. Behavior Trees sind eine Repräsentationsform für Roboterfähigkeiten, die einen Zustand auf eine Aktion abbildet. Sie zeichnen sich durch eine hohe Modalität, Reaktivität und leichte Verständlichkeit aus und sind daher eine geeignete Repräsentationsform für das Lernen von Demonstrationen. Das Demonstrieren einer Aufgabe ist eine sehr natürliche Art und Weise, einer anderen Person etwas beizubringen und inspiriert davon, wie wir Menschen lernen, indem wir andere beobachten und imitieren. In Mensch-Roboter-Interaktionen ist diese Art des Lernens von Videodemonstrationen daher für Nichtexperten besonders geeignet und weniger zeitintensiv im Vergleich zu anderen LfD Ansätzen zum Lernen von Behavior Trees, die eine schrittweise Spezifizierung notwendiger Aktionen erfordern. Wir lernen daher automatisch einen Behavior Tree mit pre- und post-Konditionen für Aktionen von einer begrenzten Anzahl von menschlichen Videodemonstrationen. Im Gegensatz zu existierenden Methoden berechnen wir kontinuierliche pre- und post-Konditionen automatisch anhand visueller Merkmale und nutzen diese, um einen reaktiven BT zu lernen. Der vorgestellte Ansatz ist zwar sehr intutiv und benötigt nur wenige Demonstrationen einer Aufgabe, jedoch bringt das Lernen von nur wenigen natürlichen und potentiell sub-optimalen Demonstrationen Herausforderungen mit sich. In einer Vorstudie untersuchen wir daher, wie Nichtexperten Aufgaben demonstrieren und die Demonstrationen variieren, und identifizieren drei häufig auftretende Fehlerfälle eines BTs, der von nur wenigen und potentiell unvollständigen Demonstrationen gelernt wurde. Die pre- und post-Konditionen erlauben es diese Fehlerfälle während der Ausführung des BTs durch den Roboter zu erkennen und durch Interaktion mit dem Menschen und der gezielten Abfrage von zusätzlichen Eingaben zu lösen. Dies geschieht, indem der BT verbessert und gegebenenfalls erweitert wird und die gelernten pre- und post-Konditionen angepasst werden. Im Gegensatz zu existierenden Methoden können Fehlerfälle aufgrund von unvollständigen Demonstrationen so interaktiv gelöst werden, ohne den kompletten Lernprozess zu wiederholen. Wir evaluieren die Methode in einer Sortieraufgabe mit einem Roboterarm und menschlichen Versuchspersonen und zeigen, dass es möglich ist, einen reaktiven BT von nur wenigen Videodemonstrationen zu lernen und Fehlerfälle interaktiv zu lösen.

Fachbereich/-gebiet
Zentrale Einrichtungen > Centre for Cognitive Science (CCS)
DDC
000 Allgemeines, Informatik, Informationswissenschaft > 004 Informatik
Institution
Technische Universität Darmstadt
Ort
Darmstadt
Datum der mündlichen Prüfung
20.03.2025
Gutachter:innen
Koert, Dorothea
dos Santos Carvalho Leite, Iolanda
Chalvatzaki, Georgia
Handelt es sich um eine kumulative Dissertation?
Nein
Name der Gradverleihenden Institution
Technische Universität Darmstadt
Ort der Gradverleihenden Institution
Darmstadt
PPN
531212300

  • TUprints Leitlinien
  • Cookie-Einstellungen
  • Impressum
  • Datenschutzbestimmungen
  • Webseitenanalyse
Diese Webseite wird von der Universitäts- und Landesbibliothek Darmstadt (ULB) betrieben.