Intermittierende Verstärkung

Warum Erwartung Verhalten so hartnäckig machen kann
Intermittierende Verstärkung gehört zu den grundlegenden Phänomenen der operanten Lerntheorie und gleichzeitig zu den Konzepten, die im Hundetraining erstaunlich häufig missverstanden werden.
[In der Blog-Übersicht wird hier ein Weiterlesen-Link angezeigt]
Gemeint ist zunächst etwas recht Nüchternes: Ein bereits gelerntes Verhalten wird nicht bei jeder Ausführung verstärkt.
Der Verstärker tritt nur bei einem Teil der Verhaltensereignisse auf. Wann er verfügbar wird, kann dabei nach unterschiedlichen Regeln bestimmt sein, beispielsweise nach einer bestimmten Anzahl von Reaktionen, nach Zeitintervallen oder variabel und für den Hund mehr oder weniger schwer vorhersagbar.¹
Das klingt unspektakulär.
Lernpsychologisch kann diese Veränderung der Verstärkerkontingenz jedoch erhebliche Auswirkungen darauf haben, wie häufig, ausdauernd und löschungsresistent ein Verhalten gezeigt wird. Genau deshalb begegnen wir intermittierender Verstärkung nicht nur im geplanten Training, sondern sehr häufig dort, wo Menschen überhaupt nicht bewusst trainieren.
- Der Hund springt zehnmal am Menschen hoch und wird neunmal ignoriert. Beim zehnten Mal beugt sich jemand zu ihm herunter.
- Der Hund fiept beim Öffnen der Terrassentür. Manchmal wartet der Mensch, manchmal öffnet er sofort.
- Der Hund zieht zur interessanten Geruchsstelle. Meist wird er gestoppt, gelegentlich kommt er trotzdem dort an.
- Oder der Hund fordert den Ball ein. Mehrfach passiert nichts und irgendwann fliegt er doch.
Aus Sicht des lernenden Hundes kann jedes dieser Ereignisse bedeuten: Dieses Verhalten lohnt sich nicht immer. Aber manchmal. Und genau dieses manchmal kann ausgesprochen bedeutsam sein.
An dieser Stelle entsteht häufig eine begriffliche Verwechslung.
Wenn auf ein Verhalten einmal kein Verstärker folgt, handelt es sich nicht automatisch um negative Strafe. Negative Strafe bedeutet in der operanten Konditionierung, dass als Konsequenz eines Verhaltens ein appetitiver, also für das Individuum angenehmer oder erstrebenswerter Reiz entfernt oder dessen Zugang verhindert wird und dadurch die zukünftige Auftretenswahrscheinlichkeit dieses Verhaltens sinkt.
Entscheidend sind also zwei Dinge: Etwas Angenehmes wird entzogen oder der Zugang dazu beendet und das vorausgehende Verhalten wird dadurch langfristig seltener. Ein klassisches Beispiel wäre ein Hund, der während eines sozialen Spiels grob in die Kleidung seines Menschen beißt. Der Mensch beendet daraufhin unmittelbar das Spiel. Wenn das Beißen dadurch künftig abnimmt, erfüllt diese Konsequenz funktional die Definition negativer Strafe.
Bei intermittierender Verstärkung geschieht etwas anderes.
Ein Verhalten befindet sich weiterhin unter Verstärkung, nur eben nicht mehr bei jedem Auftreten. Das bloße Ausbleiben eines erwarteten Verstärkers ist deshalb zunächst eine Nichtverstärkung beziehungsweise Verstärkerauslassung. Ob daraus negative Strafe, Extinktion, Frustration oder lediglich ein Bestandteil eines intermittierenden Verstärkungsplans wird, hängt von der jeweiligen Kontingenz und ihrer Wirkung auf das Verhalten ab. Diese Unterscheidung ist keine akademische Wortklauberei. Sie entscheidet darüber, welcher Lernprozess tatsächlich stattfindet.
In der klassischen operanten Lerntheorie werden unterschiedliche Verstärkungspläne beschrieben.
Ferster und Skinner systematisierten diese bereits Mitte des 20. Jahrhunderts ausführlich.¹ Bei kontinuierlicher Verstärkung wird nahezu jede korrekte Reaktion verstärkt. Bei einer festen Quotenverstärkung erfolgt die Verstärkung nach einer bestimmten Anzahl von Reaktionen, bei einer variablen Quotenverstärkung schwankt diese Anzahl um einen Durchschnittswert. Feste Intervallverstärkung bedeutet, dass nach Ablauf eines bestimmten Zeitintervalls die nächste entsprechende Reaktion verstärkt werden kann, während bei variabler Intervallverstärkung auch die Zeitspanne bis zur nächsten Verstärkung variiert.
Für das praktische Hundetraining bedeutet das: „Nicht jedes Mal belohnen“ ist noch keine präzise Beschreibung eines Trainingsplans. Entscheidend ist, nach welcher Regel Verstärkung verfügbar wird und ob der Hund diese Regel erkennen kann. Ein sauber aufgebautes variables Verstärkungsschema ist etwas anderes als ein Mensch, der völlig inkonsequent und zufällig einmal belohnt und einmal nicht.
Ein bekanntes Phänomen der Lernpsychologie ist der sogenannte Partial Reinforcement Extinction Effect, kurz PREE.
Damit wird beschrieben, dass unter bestimmten experimentellen Bedingungen ein Verhalten nach vorheriger partieller beziehungsweise intermittierender Verstärkung während einer anschließenden Extinktionsphase länger bestehen bleiben kann als Verhalten, das zuvor kontinuierlich verstärkt wurde.² Der Hund hat gewissermaßen gelernt: Dass der Verstärker diesmal nicht kommt, bedeutet noch lange nicht, dass er grundsätzlich nicht mehr kommt.
Und genau darin liegt die praktische Bedeutung.
Ein kontinuierlich verstärktes Verhalten erzeugt eine relativ eindeutige Erfahrung: Verhalten → Verstärker. Bleibt dieser Verstärker plötzlich wiederholt aus, verändert sich die bisherige Vorhersage deutlich. Ein intermittierend verstärktes Verhalten hat dagegen bereits eine andere Lerngeschichte: Verhalten → manchmal Verstärker, manchmal nicht. Ein einzelner erfolgloser Versuch liefert deshalb wesentlich weniger Information darüber, ob sich weiteres Verhalten lohnt.
Das Individuum versucht es weiter. Und möglicherweise noch einmal. Und noch einmal.
Genau deshalb können unabsichtlich intermittierend verstärkte Verhaltensweisen ausgesprochen hartnäckig werden. Der Hund, der 15 Minuten lang vor seinem Menschen steht und ihn anstarrt, hat möglicherweise nicht gelernt, dass Starren immer zum Erfolg führt. Vielleicht hat er gelernt, dass ausdauerndes Starren irgendwann Erfolg haben kann. Das ist lernpsychologisch ein erheblicher Unterschied.
Gerade im Hundetraining wird der Partial Reinforcement Extinction Effect gelegentlich so dargestellt, als würde jedes Verhalten durch gelegentliche Verstärkung automatisch „unkaputtbar“.
So einfach ist es nicht.
Die Widerstandsfähigkeit eines Verhaltens hängt unter anderem von der Verstärkungsgeschichte, der Art und Qualität des Verstärkers, der Häufigkeit des Verhaltens, dem verwendeten Verstärkungsplan, konkurrierenden Verstärkern, motivationalen Bedingungen und dem Kontext ab.² ³ Auch experimentell findet sich der PREE nicht unter sämtlichen Bedingungen gleichermaßen.
Die korrektere Aussage lautet deshalb: Intermittierende Verstärkung kann die Persistenz eines Verhaltens unter Nichtverstärkung erheblich erhöhen.
Nicht: Intermittierend verstärktes Verhalten ist grundsätzlich unlöschbar.
Damit kommen wir zu einem zweiten entscheidenden Mechanismus: der Erwartung.
Lernen bedeutet nicht lediglich, dass ein Organismus mechanisch Verbindungen zwischen Verhalten und Konsequenzen abspeichert. Lernende Organismen bilden Vorhersagen. Wenn bestimmte Signale zuverlässig eine relevante Konsequenz ankündigen, verändert sich das Verhalten bereits vor dem Eintreten dieser Konsequenz.
Genau hier spielt das dopaminerge System eine wichtige Rolle.
Die klassischen Arbeiten von Schultz, Dayan und Montague zeigten, dass die Aktivität bestimmter dopaminerger Neuronen eng mit sogenannten Belohnungsvorhersagefehlern verbunden ist.⁴ Ein positiver Vorhersagefehler entsteht vereinfacht gesagt dann, wenn ein Ergebnis besser ausfällt als erwartet. Ein negativer Vorhersagefehler entsteht, wenn eine erwartete Belohnung ausbleibt oder geringer ausfällt als erwartet. Mit zunehmendem Lernen verschiebt sich die phasische dopaminerge Reaktion teilweise von der Belohnung selbst auf den Hinweisreiz, der die Belohnung zuverlässig vorhersagt.⁴ ⁵
Der Hund reagiert also nicht erst dann, wenn der Ball fliegt.
Schon ganz andere Reize können Bedeutung erhalten:
- der Griff in die Jackentasche,
- das Betreten einer bestimmten Wiese,
- die Körperhaltung des Menschen,
- die Hand am Ball,
- der Anblick des Ballwerfers,
- eine bestimmte Bewegung
- oder ein bestimmtes Ritual.
Diese Reize kündigen an: Gleich könnte etwas passieren.
Die Bezeichnung Dopamin als „Glückshormon“ ist neurobiologisch viel zu grob.
Ebenso wäre es allerdings zu einfach, Dopamin ausschließlich als „Erwartungsbotenstoff“ zu bezeichnen. Dopaminerge Systeme sind an einer Vielzahl von Prozessen beteiligt, darunter Motivation, Lernen, Handlungsselektion, Anreizbewertung und der Verarbeitung von Belohnungsvorhersagefehlern.⁴ ⁵ ⁶ Besonders interessant ist dabei die Verarbeitung von Unsicherheit.
Fiorillo, Tobler und Schultz konnten zeigen, dass dopaminerge Neuronen nicht nur auf Belohnungswahrscheinlichkeit reagieren, sondern auch Informationen über Unsicherheit abbilden. Besonders hoch ist statistische Unsicherheit dort, wo eine Belohnung ungefähr gleich wahrscheinlich eintreten oder ausbleiben kann.⁵ Das bedeutet nicht, dass zufälliges Belohnen grundsätzlich „mehr Dopamin macht“. Es bedeutet aber, dass unsichere Belohnungssituationen neuronal anders verarbeitet werden als vollständig vorhersehbare. Und genau diese Unsicherheit kann Aufmerksamkeit, Erwartung und Verhaltenspersistenz beeinflussen.
Das lässt sich im Alltag hervorragend beobachten.
Nehmen wir einen Hund, der Ballspielen sehr attraktiv findet und nach einiger Zeit muss gar kein Ball mehr fliegen. Der Hund reagiert bereits auf Vorläuferreize.
- Der Mensch läuft zum Schrank.
- Er zieht die Balljacke an.
- Er steckt die Hand in die Tasche.
- Er betritt die Wiese.
- Er greift zum Ball.
Der Hund verändert möglicherweise Körperhaltung, Muskeltonus, Blickverhalten und Bewegungsmuster lange bevor irgendein Ball geworfen wurde.
Der relevante Lernprozess besteht also längst nicht mehr nur aus:
Ball fliegt → Hund rennt.
Vielmehr ist eine Kette konditionierter Hinweisreize entstanden:
Ort → Mensch → Bewegung → Ball → mögliche Bewegung des Balls → Hetzen → Packen → nächster Durchgang.
Das Erwartungssystem ist längst aktiv, bevor die eigentliche Handlung beginnt.
Die Ethologie beschreibt mit dem Begriff Appetenzverhalten Verhaltensweisen, die der Suche nach einer bestimmten biologisch relevanten Situation dienen.
- Das Tier sucht.
- Es orientiert sich.
- Es erkundet.
- Es verfolgt Hinweise.
- Es probiert Verhalten aus.
Das bedeutet: Motivation beginnt nicht erst mit dem Erreichen eines Ziels. Ein erheblicher Teil tierischen Verhaltens findet gerade auf dem Weg zum Ziel statt.
Panksepp fasste verwandte motivationale Prozesse später im Konzept des SEEKING-Systems zusammen und betonte die Bedeutung dopaminerger Netzwerke für exploratives, erwartungs- und annäherungsbezogenes Verhalten.⁷ Auch hier muss man mit Übertragungen vorsichtig sein. Solche Modelle erklären nicht jede konkrete Verhaltensweise eines einzelnen Hundes. Sie machen jedoch verständlich, weshalb Suche, Erwartung und Annäherung selbst hoch motivierend sein können.
Der Hund muss sein Ziel also nicht permanent erreichen, damit Verhalten bestehen bleibt., die Aussicht darauf kann genügen.
Beim Hund kommt ein weiterer Faktor hinzu.
Als Canide verfügt er über Bestandteile eines prädatorischen Verhaltensrepertoires. In der Literatur wird häufig eine motorische Sequenz beschrieben, die vereinfacht folgende Elemente enthalten kann:
**Orientieren → Fixieren → Anschleichen → Hetzen → Packen → Tötungsbiss → Zerlegen → Konsumieren.**⁸ ⁹
Beim Haushund ist diese Sequenz weder bei jedem Individuum vollständig noch bei allen Rassen gleichermaßen ausgeprägt. Domestikation und insbesondere funktionale Selektion haben einzelne Bestandteile verändert, verstärkt, abgeschwächt oder voneinander entkoppelt.⁸
Ein Border Collie zeigt beispielsweise andere Schwerpunkte innerhalb prädatorisch verwandter Bewegungsmuster als ein Retriever oder ein Sichtjäger und selbstverständlich ist ein geworfener Ball keine Beute. Trotzdem besitzt ein rasch bewegtes Objekt Eigenschaften, die orientierendes und verfolgungsbezogenes Verhalten auslösen können. Ein Ball kann dadurch gleichzeitig mehrere funktionale Systeme ansprechen: Orientierung, Bewegung, Verfolgung, soziale Interaktion, Erwartung, Besitz, Spiel und gegebenenfalls prädatorisch verwandte Bewegungsmuster.
Das macht ihn zu einem außerordentlich potenten Verstärker.
Die häufig zu lesende Behauptung, die Jagdsequenz komme beim Ballspiel „nie zum Abschluss“, ist zu pauschal. Ein Hund kann beim Ballspiel durchaus wesentliche Teile der Bewegungssequenz ausführen:
- orientieren,
- fixieren,
- starten,
- hetzen,
- packen
- und tragen.
Problematisch ist deshalb nicht zwangsläufig ein vermeintlich grundsätzlich „fehlender Abschluss“.
Interessanter ist etwas anderes: Die Sequenz kann innerhalb kurzer Zeit immer wieder neu gestartet werden.
- Ball fliegt.
- Hund hetzt.
- Hund packt.
- Ball kommt zurück.
- Kurze Pause.
- Erneute Erwartung.
- Ball fliegt erneut.
- Wieder Hetzen.
- Wieder Packen.
- Und wieder.
Dadurch kann eine ausgesprochen hohe Wiederholungsfrequenz hoch aktivierender Verhaltensbestandteile entstehen. Bei einem Hund, der dafür besonders empfänglich ist, kann bereits das Warten auf den nächsten Durchgang zunehmend mehr Raum einnehmen.
Auch beim Begriff „Balljunkie“ lohnt sich sprachliche Präzision.
„Balljunkie“ ist keine veterinärmedizinische oder verhaltensmedizinische Diagnose. Der Begriff beschreibt umgangssprachlich Hunde, bei denen ballbezogenes Verhalten einen auffällig hohen motivationalen Stellenwert angenommen hat.
Typisch können beispielsweise:
- starkes Fixieren des Balls,
- anhaltendes Einfordern,
- Schwierigkeiten beim Beenden des Spiels,
- Vokalisation,
- Zittern,
- starke motorische Unruhe,
- Anspringen,
- ständiges Suchen nach dem Ball,
- geringe Ansprechbarkeit auf andere Reize
- oder ein rasches Wiederhochfahren bei ballbezogenen Hinweisreizen sein.
Keines dieser Merkmale beweist für sich genommen eine „Sucht“.
Es wäre deshalb wissenschaftlich nicht gerechtfertigt, bei diesen Hunden von einer Dopaminsucht oder einer Dopaminüberhitzung zu sprechen. Solche Begriffe sind anschaulich, neurobiologisch aber nicht etabliert. Sehr wohl lässt sich dagegen erklären, wie Lernen, Erwartung, Verstärkung, hohe individuelle Motivation, Bewegungsreize und Erregung gemeinsam ein ausgesprochen persistentes Verhaltenssystem aufbauen können. Das ist bereits eindrucksvoll genug.
Wir brauchen dafür keine erfundene Neurobiologie.
Ein weiterer häufiger Denkfehler besteht darin, hohe Aktivierung automatisch mit positivem Wohlbefinden gleichzusetzen.
- Ein Hund rennt.
- Seine Pupillen sind weit.
- Er hechelt.
- Er fiept.
- Er springt.
- Er zittert.
- Er fordert den nächsten Wurf.
Und der Mensch sagt: „Schau doch, wie viel Spaß er hat!“
Vielleicht hat er Spaß.
Vielleicht befindet er sich aber gleichzeitig in sehr hoher physiologischer Aktivierung.
Beides schließt sich nicht aus.
Emotionale Valenz und physiologisches Arousal sind zwei unterschiedliche Dimensionen.
Ein Organismus kann positiv erregt, negativ erregt oder in einer Mischung verschiedener emotionaler Zustände hoch aktiviert sein. Deshalb lässt sich aus sichtbarer Erregung allein nicht zuverlässig ableiten, wie der Hund die Situation emotional bewertet.
Bei erhöhter Aktivierung können unter anderem sympathische Prozesse beteiligt sein. Herzfrequenz und Atmung können sich verändern. Katecholamine wie Adrenalin und Noradrenalin spielen bei akuter Aktivierung eine wichtige Rolle. Bei entsprechenden Belastungen kann außerdem die Hypothalamus-Hypophysen-Nebennierenrinden-Achse (HPA‑Achse) aktiviert werden, wodurch sich unter anderem die Cortisolkonzentration verändert.
Untersuchungen an Hunden zeigen, dass belastende Reize sowohl mit Veränderungen des Verhaltens als auch mit Veränderungen von Herzfrequenz und Speichelcortisol verbunden sein können.¹⁰ Aber auch hier gilt: Cortisol bedeutet nicht automatisch „schlechter Stress“. Cortisol ist Bestandteil einer normalen physiologischen Anpassungsreaktion. Einzelwerte lassen sich ohne Kontext kaum sinnvoll interpretieren.
Aus hoher Aktivität darf deshalb weder automatisch „Freude“ noch automatisch „Stressproblem“ abgeleitet werden.
Entscheidend ist immer das Gesamtbild.
- Wie schnell fährt der Hund hoch?
- Wie schnell kann er wieder herunterfahren?
- Kann er Verhalten unterbrechen?
- Kann er andere Reize wahrnehmen?
- Kann er sich vom Ball lösen?
- Kann er nach dem Spiel ruhen?
- Kann er Frustration bewältigen?
Besonders interessant wird es, wenn ein erwartetes Ereignis ausbleibt.
Ein Hund erwartet aufgrund seiner Lerngeschichte eine Konsequenz. Dann tritt sie nicht ein. Diese Verstärkerauslassung kann Frustration erzeugen. Die klassische Frustrationstheorie von Amsel beschäftigt sich genau mit solchen Situationen und ihrer Bedeutung für Persistenz und Lernen.²
Auch beim Haushund gibt es inzwischen empirische Hinweise darauf, dass Belohnungsauslassung und frustrierende Situationen messbare Verhaltensänderungen hervorrufen können. Bentosela und Kolleginnen untersuchten beispielsweise bei Hunden ein zuvor verstärktes Blickverhalten gegenüber Menschen.
Bei Verstärkerauslassung und Extinktion veränderte sich das Verhalten der Hunde deutlich.³
Neuere Untersuchungen zur Frustrationsneigung von Haushunden zeigen außerdem Zusammenhänge zwischen erhöhter Frustrationsneigung und Verhaltensweisen wie Vokalisieren oder Vorwärtsspringen sowie teilweise Veränderungen des Speichelcortisols.¹¹ Frustration beim Hund ist also kein rein menschlich hineininterpretiertes Konzept. Sie lässt sich verhaltensbiologisch untersuchen.
Ein Hund, der gelernt hat, dass ein Verstärker nur gelegentlich verfügbar ist, erlebt Nichtverstärkung nicht zwangsläufig als Signal dafür, dass „das Spiel vorbei“ ist. Sie kann stattdessen Bestandteil der bekannten Situation sein.
Das erzeugt eine interessante Dynamik: Erwartung → Verhalten → kein Verstärker → weiteres Verhalten → vielleicht Verstärker.
Genau dadurch kann Nichtverstärkung paradoxerweise mit hoher Persistenz einhergehen.
- Der Hund bricht nicht ab.
- Er versucht mehr.
- Er versucht intensiver.
- Oder er variiert sein Verhalten.
Das kennen Hundehalter aus zahllosen Alltagssituationen.
- Der Hund stupst.
- Keine Reaktion.
- Er stupst stärker.
- Keine Reaktion.
- Er fiept.
- Keine Reaktion.
- Er bellt.
- Der Mensch gibt nach.
Aus menschlicher Sicht hat der Hund „so lange genervt, bis er seinen Willen bekommen hat“. Aus lernpsychologischer Sicht hat möglicherweise etwas anderes stattgefunden: Ausdauer und Verhaltensintensivierung wurden erfolgreich verstärkt.
Genau hier entstehen viele sogenannte Verhaltensprobleme.
Intermittierende Verstärkung ist keineswegs nur ein Werkzeug professioneller Trainer. Sie entsteht jeden Tag unabsichtlich.
- Beim Anspringen.
- Beim Betteln.
- Beim Ziehen.
- Beim Fordern von Aufmerksamkeit.
- Beim Bellen an Türen.
- Beim Hinterherlaufen.
- Beim Einfordern von Spielen.
- Beim Kratzen.
- Beim Aufreiten.
- Beim Fixieren.
- Beim Ballfordern.
Der Mensch denkt: „Ich gebe doch fast nie nach.“ Der Hund lernt: „Fast nie ist nicht nie.“ Und manchmal reicht genau das.
Ein weiterer wichtiger Punkt ist, dass Extinktion nicht Vergessen bedeutet.
Wenn ein Verhalten unter Extinktionsbedingungen seltener wird, ist die ursprüngliche Lernerfahrung nicht einfach aus dem Gehirn gelöscht. Moderne Lernmodelle verstehen Extinktion vielmehr als neues Lernen, das mit dem ursprünglichen Lernen konkurriert.
Der Hund lernt nicht: Dieses Verhalten hat niemals funktioniert.
Er lernt eher: Unter diesen Bedingungen funktioniert dieses Verhalten derzeit nicht mehr.
Deshalb können bereits scheinbar verschwundene Verhaltensweisen wieder auftreten.
Beispielsweise bei Kontextwechsel, erneuter Verstärkung, großer zeitlicher Distanz, hoher Motivation oder veränderten Umweltbedingungen. Das ist einer der Gründe, weshalb „einfach konsequent ignorieren“ in vielen praktischen Fällen ein erstaunlich schlechter Trainingsplan ist.
Wird ein zuvor zuverlässig verstärktes Verhalten plötzlich nicht mehr verstärkt, kann es zunächst zu einer vorübergehenden Zunahme von Häufigkeit, Intensität oder Variabilität kommen.
Der Hund probiert mehr.
- Lauter.
- Länger.
- Anders.
- Aus einem leisen Fiepen wird vielleicht Bellen.
- Aus Stupsen wird Pföteln.
- Aus Anschauen wird Anspringen.
Diese vorübergehende Intensivierung wird häufig als Extinktionsburst bezeichnet.
Menschen brechen genau an dieser Stelle häufig ab. Sie denken: Jetzt wird es ja noch schlimmer. Und geben dem Hund den gewünschten Verstärker. Lernpsychologisch kann das außerordentlich wirkungsvoll sein. Denn der Hund hat gerade gelernt: Nicht das erste Verhalten war erfolgreich. Intensiveres Verhalten war erfolgreich. Damit können wir unbeabsichtigt genau jene Eskalation verstärken, die wir eigentlich reduzieren wollten.
Ein hoch aktivierter Hund kann selbstverständlich weiterhin lernen. Die verbreitete Aussage, bei hoher Erregung sei „der präfrontale Cortex ausgeschaltet“, wäre neurobiologisch zu simpel. Richtig ist jedoch, dass starke Stress- und Erregungszustände kognitive Kontrollprozesse beeinträchtigen können.
Die Forschung zur präfrontalen Funktion zeigt über verschiedene Säugetierarten hinweg, dass starke Stressbelastung Funktionen beeinträchtigen kann, die mit Arbeitsgedächtnis, flexibler Verhaltenssteuerung und Top-down-Kontrolle verbunden sind.¹² Diese Forschung stammt überwiegend nicht aus Untersuchungen an Haushunden und darf deshalb nicht eins zu eins auf jede Trainingssituation übertragen werden. Die praktische Schlussfolgerung ist dennoch sinnvoll: Ein Hund, der bereits maximal hochgefahren ist, befindet sich nicht automatisch im optimalen Zustand für anspruchsvolle Selbstkontrollaufgaben.
Das hat nichts mit moralischem Versagen zu tun. Und es ist auch nicht einfach „Ungehorsam“. Es ist eine Frage von Lernhistorie, Motivation, physiologischer Aktivierung und situativer Leistungsfähigkeit.
Gerade bei extrem ballmotivierten Hunden entsteht schnell folgende Trainingsidee:
- Der Hund soll den Ball sehen.
- Er soll maximal aufgeregt sein.
- Und dann soll er sitzen bleiben.
Das wird als Impulskontrolltraining bezeichnet. Das kann in bestimmten Trainingskonzepten sinnvoll eingesetzt werden. Aber man sollte sich fragen: Was trainiere ich eigentlich?
Wenn der Hund bei jedem Durchgang zunächst maximal hochgefahren wird und anschließend lange auf die Freigabe zum Hetzen wartet, kann genau diese Wartephase die Erwartung auf den Ball enorm in den Mittelpunkt rücken.
Dann trainieren wir möglicherweise hervorragend: Ball sehen → Spannung aufbauen → warten → Ball fliegt → Hund explodiert los. Das ist nicht automatisch Emotionsregulation.
Ein Hund kann äußerlich stillsitzen und innerlich hoch aktiviert sein. Ruheverhalten und Bewegungslosigkeit sind nicht dasselbe. Ein Hund kann sitzen und gleichzeitig starren, zittern, stark hecheln, hohen Muskeltonus zeigen, den Ball nicht aus den Augen lassen, auf kleinste Bewegungen reagieren und kaum ansprechbar sein. Formal erfüllt er vielleicht ein „Sitz“. Emotional befindet er sich aber weiterhin vollständig in der Erwartung des nächsten Wurfs.
Deshalb sollte Regulation nicht ausschließlich daran gemessen werden, ob der Hund Bewegung unterdrückt.
Interessanter sind Fragen wie:
- Kann er sich abwenden?
- Kann er schnüffeln?
- Kann er andere Umweltinformationen aufnehmen?
- Kann er Futter ruhig nehmen?
- Kann er eine Pause akzeptieren?
- Kann er nach Hause gehen, ohne permanent weitere Würfe einzufordern?
- Kann er schlafen?
Das beschreibt Regulation wesentlich besser als ein minutenlang gehaltenes Sitz vor einem Ball.
Aus den beschriebenen Mechanismen folgt keineswegs: Ballwerfen ist schädlich.
Viele Hunde spielen ausgesprochen gern mit geworfenen Objekten, ohne problematische Fixierung, chronische Übererregung oder auffällige Frustration zu entwickeln. Entscheidend sind unter anderem individuelle Prädisposition, Rasse und funktionale Selektion, Lerngeschichte, Häufigkeit, Dauer, Erregungsniveau, Vorhersagbarkeit, Pausengestaltung, körperliche Belastbarkeit, Alternativverhalten und Möglichkeiten zur Regulation.
Ein paar Würfe mit einem gut regulierbaren Hund sind etwas völlig anderes als 50 hoch repetitive Hetzsequenzen mit einem Hund, der bereits beim Anblick des Ballbeutels zittert und anschließend eine Stunde benötigt, um wieder zur Ruhe zu kommen. Nicht der Ball entscheidet. Der funktionale Zusammenhang entscheidet.
Problematisch wird es weniger dort, wo ein Hund einen Ball ausgesprochen attraktiv findet.
Interessanter wird es, wenn andere Verhaltensbereiche zunehmend verdrängt werden. Warnsignale können beispielsweise sein, dass der Hund Spaziergänge permanent nach Ball oder Werfbewegungen scannt, die Balltasche über längere Zeit fixiert, freie Exploration deutlich abnimmt, Schnüffeln oder Sozialverhalten an Bedeutung verlieren, das Spiel sich nur schwer beenden lässt, der Hund starke Vokalisation oder motorische Unruhe bei Nichtverfügbarkeit zeigt, schon ballbezogene Hinweisreize massive Aktivierung auslösen, der Hund nach dem Spiel schlecht in Ruhe findet, stereotyp weitere Wiederholungen fordert oder andere Verstärker in der Situation deutlich an Wert verlieren.
Dann sollte nicht gefragt werden: „Wie bekomme ich mehr Gehorsam am Ball?“ Sondern: „Welche Funktion hat diese Aktivität inzwischen für diesen Hund und welche Lernprozesse halten sie aufrecht?“
Wer vermeiden möchte, dass Ballspiel einen unverhältnismäßig großen Stellenwert erhält, muss den Ball nicht grundsätzlich verbannen. Aber man kann das Spiel anders gestalten. Weniger repetitive Hetzsequenzen erzeugen eine andere Dynamik als zehn Minuten permanentes Werfen. Der Ball kann außerdem Bestandteil von Suchaufgaben werden. Er kann versteckt werden, der Hund kann warten, während der Mensch ihn auslegt, oder über Geruch suchen. Damit verändert sich die motorische und emotionale Qualität der Aufgabe.
Auch Variabilität spielt eine Rolle.
Ein Spaziergang sollte nicht ausschließlich aus Erwartung auf den nächsten Ballwurf bestehen. Exploration, Schnüffeln, soziale Interaktion, freie Bewegung und Ruhe dürfen Raum behalten. Klare Anfangs- und Endsignale können helfen, Erwartung zeitlich einzugrenzen. Und Regulation sollte nicht mit bloßer Bewegungskontrolle verwechselt werden. Nicht minutenlanges Sitzen vor dem Ball ist das zentrale Ziel, sondern ein Hund, der zwischen Aktivität und Ruhe wechseln kann.
Bei einem bereits stark ballfixierten Hund führt bloßer Entzug nicht automatisch zum Ziel. Wird ein hochgradig etablierter Verstärker plötzlich vollständig entfernt, können zunächst ausgeprägte Such-, Forderungs- oder Frustrationsreaktionen auftreten. Das ist lernpsychologisch nicht überraschend. Sinnvoller ist häufig ein systematischer Umbau des gesamten Kontextes.
Ballbezogene Hinweisreize können reduziert werden, indem der Ball nicht permanent sichtbar herumgetragen wird. Hocherregende Wiederholungen können verringert werden. Weniger Hetzen, weniger schnelle Serien. Gleichzeitig können alternative Verstärker aufgebaut werden, beispielsweise Geruchssuche, Exploration, soziale Verstärkung oder andere individuell wertvolle Aktivitäten. Ruhe sollte nicht erzwungen, sondern ermöglicht werden. Abstand zum auslösenden Kontext, echte Pausen und physiologisches Herunterfahren sind dabei ebenso wichtig wie klare Start- und Endrituale.
Auch Frustration kann dosiert trainiert werden, allerdings nicht durch permanente Überforderung, sondern über kleinschrittig bewältigbare Situationen. Gleichzeitig muss sich die Erwartung verändern. Nicht jede Wiese, jede Handbewegung oder jede Jackentasche soll weiterhin automatisch „gleich fliegt der Ball“ bedeuten.
Frustrationstoleranz bedeutet deshalb auch nicht, einen Hund möglichst häufig zu frustrieren. Ein Hund lernt Regulation nicht, indem er permanent über seine Regulationsfähigkeit hinaus belastet wird. Sinnvolles Lernen findet in einem Bereich statt, in dem das Individuum die Situation noch verarbeiten und erfolgreich bewältigen kann.
Das gilt gerade für Hunde, die bei Verstärkerauslassung bereits starke Reaktionen zeigen. Frustrationstoleranz bedeutet nicht: Du musst aushalten, bis du aufgibst. Sondern eher: Du kannst erleben, dass etwas nicht sofort verfügbar ist, ohne dass dein gesamtes Verhaltenssystem eskaliert. Das ist ein erheblicher Unterschied.
Intermittierende Verstärkung ist damit weder gut noch schlecht.
Sie ist zunächst ein Lernprinzip. Gezielt eingesetzt kann sie sinnvoll sein. Ein gut gelerntes Verhalten muss im Alltag selbstverständlich nicht lebenslang für jede einzelne Ausführung mit einem Futterstück beantwortet werden. Problematisch wird intermittierende Verstärkung vor allem dann, wenn sie unbeabsichtigt Verhalten stabilisiert, das der Mensch eigentlich reduzieren möchte.
- Der Hund zieht. Manchmal kommt er trotzdem ans Ziel.
- Der Hund fordert. Irgendwann wird doch gespielt.
- Der Hund bellt. Nach zehn Minuten öffnet jemand die Tür.
- Der Hund springt hoch. Der fünfte Besucher streichelt ihn begeistert.
Und dann sagen Menschen: „Er weiß doch eigentlich, dass er das nicht soll.“
NEIN.
Vielleicht weiß er etwas völlig anderes.
Vielleicht hat seine Umwelt ihm sehr zuverlässig beigebracht: Ausdauer lohnt sich.
Der wichtigste Lehrer des Hundes ist sein Mensch, der konsequenteste aber bleibt seine Umwelt und die Umwelt trainiert immer mit.
Gutes Training besteht deshalb nicht darin, Verstärkung möglichst schnell abzubauen.
Es besteht darin, Verstärkung gezielt zu steuern. Ein neues Verhalten benötigt zunächst Klarheit. Der Hund muss verstehen können, welches Verhalten sich lohnt, unter welchen Bedingungen, welches Signal es ankündigt und wann es beendet ist.
Erst wenn Verhalten ausreichend gelernt ist, kann die Verstärkung sinnvoll variiert werden. Dabei sollte Verstärkung nicht einfach „zufällig vergessen“ werden. Sie kann differenzierter werden.
- Einmal Futter.
- Einmal Freigabe.
- Einmal Zugang zur Umwelt.
- Einmal soziale Interaktion.
- Einmal Bewegung.
- Einmal Schnüffeln.
Der entscheidende Punkt bleibt: Verstärkung ist das, was Verhalten erhält. Nicht das, was der Mensch Belohnung nennt.
Intermittierende Verstärkung zeigt damit eindrucksvoll, weshalb Verhalten nicht allein dadurch verstanden werden kann, dass wir betrachten, was nach einer einzelnen Handlung passiert. Wir müssen die gesamte Lerngeschichte betrachten.
Ein Verhalten kann gerade deshalb ausgesprochen hartnäckig werden, weil es nicht jedes Mal erfolgreich war. Unsichere Verstärkung kann Erwartung erhalten. Verstärkerauslassung kann Frustration erzeugen. Konditionierte Hinweisreize können Motivation lange vor dem eigentlichen Verstärker aktivieren.
Bei hoch attraktiven Bewegungsreizen wie einem Ball können zusätzlich Spiel, Hetzen, motorische Aktivität und prädatorisch verwandte Verhaltensbestandteile zusammenwirken. Das erklärt, warum manche Hunde bereits auf die Möglichkeit eines Ballwurfs intensiver reagieren als auf den Ball selbst.
Aber wir brauchen dafür weder die Vorstellung eines „Dopaminrausches“ noch die Behauptung, jeder ballbegeisterte Hund sei süchtig. Die tatsächliche Lernbiologie ist differenzierter. Und gerade deshalb ist sie so spannend.
Nicht jede Belohnung macht Verhalten stark. Nicht jedes Ausbleiben einer Belohnung macht Verhalten schwach. Manchmal ist es gerade die Möglichkeit, dass es sich beim nächsten Mal lohnen könnte, die Verhalten erstaunlich lange am Leben hält.
Herzlich, kritisch, hundverliebt,
eure Petra Wiesmeth
Bildhinweis: Bild mit KI erstellt.
Glossar
Appetenzverhalten: Such-, Orientierungs- und Annäherungsverhalten, das auf das Erreichen einer biologisch oder individuell relevanten Situation ausgerichtet ist.
Arousal: Physiologischer und verhaltensbezogener Aktivierungsgrad eines Organismus. Hohe Aktivierung sagt allein noch nichts darüber aus, ob eine Situation positiv oder negativ erlebt wird.
Belohnungsvorhersagefehler / Reward Prediction Error: Differenz zwischen erwarteter und tatsächlich eingetretener Belohnung. Dopaminerge Neuronen sind wesentlich an der Verarbeitung solcher Vorhersagefehler beteiligt.
Dopamin: Neurotransmitter, der unter anderem an Motivation, Lernen, Handlungsselektion, Anreizverarbeitung und Belohnungsvorhersage beteiligt ist. Die populäre Bezeichnung als „Glückshormon“ greift zu kurz.
Dopaminerges System: Netzwerk von Nervenzellen, die Dopamin als Neurotransmitter verwenden. Es ist unter anderem an Motivation, Belohnungsverarbeitung, Lernen, Handlungssteuerung und Bewegung beteiligt. Wichtige dopaminerge Zellgruppen liegen vor allem in der Substantia nigra und im ventralen Tegmentum des Mittelhirns. Im Zusammenhang mit Lernen spielt das dopaminerge System insbesondere bei Erwartung, Anreizbewertung und Belohnungsvorhersagefehlern eine wichtige Rolle.
Extinktion: Lernprozess, bei dem ein zuvor verstärktes Verhalten unter veränderten Bedingungen nicht mehr verstärkt wird und dadurch typischerweise abnimmt. Die ursprüngliche Lernerfahrung wird dabei nicht einfach gelöscht.
Extinktionsburst: Vorübergehende Zunahme von Häufigkeit, Intensität oder Variabilität eines zuvor verstärkten Verhaltens zu Beginn einer Extinktionsphase.
Frustration: Negativer emotionaler Zustand, der unter anderem entstehen kann, wenn der Zugang zu einem erwarteten oder angestrebten Ziel verhindert wird.
Hypothalamus‑Hypophysen‑Nebennierenrinden‑Achse (HPA‑Achse): Ist ein zentraler neuroendokriner Stressregelkreis, der über CRH (Hypothalamus), ACTH (Hypophyse) und Cortisol (Nebennierenrinde) die Stressantwort des Körpers steuert.
Intermittierende Verstärkung: Verstärkung eines Verhaltens bei einem Teil, aber nicht bei allen Verhaltensereignissen.
Negative Strafe / SP−: Entzug beziehungsweise Verlust eines angenehmen Reizes als Konsequenz eines Verhaltens, wodurch dieses Verhalten zukünftig seltener auftritt.
Partial Reinforcement Extinction Effect, PREE: Unter bestimmten Bedingungen erhöhte Widerstandsfähigkeit eines zuvor intermittierend verstärkten Verhaltens gegenüber anschließender Extinktion.
Prädatorische Motorsequenz: Funktional miteinander verbundene Verhaltensbestandteile des Beutefangverhaltens. Beim Haushund unterscheiden sich Ausprägung und Vollständigkeit individuell und rassebedingt erheblich.
SEEKING-System: Eines der sieben primären emotional-motivationalen Systeme im Konzept der Affective Neuroscience nach Jaak Panksepp. Es ist wesentlich an Exploration, Suche, Annäherung, Neugier und erwartungsorientiertem Verhalten beteiligt. Dopaminerge Netzwerke spielen dabei eine zentrale Rolle. Das SEEKING-System unterstützt Tiere dabei, ihre Umwelt aktiv zu erkunden, Informationen zu gewinnen und auf potenziell relevante Ziele oder Verstärker hinzuarbeiten. Es ist damit auch für Lernprozesse bedeutsam, insbesondere dort, wo selbstständiges Erkunden, Problemlösen und verstärkerorientiertes Verhalten gefragt sind.
Verstärker: Eine Konsequenz, durch die die zukünftige Auftretenswahrscheinlichkeit eines Verhaltens zunimmt oder erhalten bleibt. Ob etwas verstärkend wirkt, wird durch seine Wirkung auf das Verhalten bestimmt, nicht durch die Absicht des Menschen.
Verstärkerauslassung: Ausbleiben eines erwarteten Verstärkers. Dies ist nicht automatisch mit negativer Strafe gleichzusetzen.
Literatur
¹ Ferster, C. B., & Skinner, B. F. (1957). Schedules of reinforcement. Appleton-Century-Crofts.
² Amsel, A. (1992). Frustration theory: An analysis of dispositional learning and memory. Cambridge University Press. https://doi.org/10.1017/CBO9780511665561
³ Bentosela, M., Barrera, G., Jakovcevic, A., Elgier, A. M., & Mustaca, A. E. (2008). Effect of reinforcement, reinforcer omission and extinction on a communicative response in domestic dogs (Canis familiaris). Behavioural Processes, 78(3), 464–469. https://doi.org/10.1016/j.beproc.2008.03.004
⁴ Schultz, W., Dayan, P., & Montague, P. R. (1997). A neural substrate of prediction and reward. Science, 275(5306), 1593–1599. https://doi.org/10.1126/science.275.5306.1593
⁵ Fiorillo, C. D., Tobler, P. N., & Schultz, W. (2003). Discrete coding of reward probability and uncertainty by dopamine neurons. Science, 299(5614), 1898–1902. https://doi.org/10.1126/science.1077349
⁶ Schultz, W. (2016). Dopamine reward prediction-error signalling: A two-component response. Nature Reviews Neuroscience, 17(3), 183–195. https://doi.org/10.1038/nrn.2015.26
⁷ Panksepp, J. (1998). Affective neuroscience: The foundations of human and animal emotions. Oxford University Press.
⁸ Coppinger, R., & Feinstein, M. (2015). How dogs work. University of Chicago Press.
⁹ Howell, T. J., & Bennett, P. C. (2020). Preventing predatory behaviour in greyhounds retired from the racing industry: Expert opinions collected using a survey and interviews. Applied Animal Behaviour Science, 226, 104988.
¹⁰ Beerda, B., Schilder, M. B. H., van Hooff, J. A. R. A. M., de Vries, H. W., & Mol, J. A. (1998). Behavioural, saliva cortisol and heart rate responses to different types of stimuli in dogs. Applied Animal Behaviour Science, 58(3–4), 365–381. https://doi.org/10.1016/S0168-1591(97)00145-7
¹¹ McPeake, K. J., Collins, L. M., Zulch, H., & Mills, D. S. (2021). Behavioural and physiological correlates of the Canine Frustration Questionnaire. Animals, 11(12), 3346. https://doi.org/10.3390/ani11123346
¹² Arnsten, A. F. T. (2009). Stress signalling pathways that impair prefrontal cortex structure and function. Nature Reviews Neuroscience, 10(6), 410–422. https://doi.org/10.1038/nrn2648
#hundewissen #hundetrainer #hundeliebe #hund #ernährungsassistenthund #canislogisch #hundewelten #groomer
Fotos: (c)Petra Wiesmeth - Diese Abbildungen wurde mit Unterstützung künstlicher Intelligenz erstellt.
Das Kleingedruckte: Sie können jederzeit und ohne meine Erlaubnis auf diesen Artikel verlinken oder ihn auf Facebook teilen. Jegliche Vervielfältigung oder Nachveröffentlichung, ob in elektronischer Form oder im Druck, ist untersagt und kann allenfalls ausnahmsweise mit meinem schriftlich eingeholten und erteilten Einverständnis erfolgen. Zuwiderhandlungen werden juristisch verfolgt. Genehmigte Nachveröffentlichungen müssen den jeweiligen Artikel völlig unverändert lassen, also ohne Weglassungen, Hinzufügungen oder Hervorhebungen. Eine Umwandlung in andere Dateiformate wie PDF ist nicht gestattet. In Printmedien sind dem Artikel die vollständigen Quellenangaben beizufügen, bei Online-Nachveröffentlichung ist zusätzlich ein anklickbarer Link auf den Original-Artikel nötig.
CanisLogisch® ist als Wortmarke markenrechtlich (DPMA) geschützt.