Begriff
Variable Belohnung
Nicht die sichere Belohnung hält dich bei einer Sache, sondern die mögliche. Ein Prinzip aus den Taubenlaboren der 1950er-Jahre, das jeden Spielautomaten und jeden Feed antreibt.
Von Norbert Hofmann · Aktualisiert am · 6 Min. Lesezeit
- Englisch
- variable reward, intermittent reinforcement, variable ratio schedule
- Deutsch
- variable Belohnung, intermittierende Verstärkung, variabler Quotenplan
- Auch bekannt als
- Variable Verstärkung, Intermittierende Verstärkung, Variable Ratio Schedule, Slot-Machine-Effekt
- Herkunft
- Aus der Lernpsychologie; systematisch beschrieben 1957 von Charles Ferster und B. F. Skinner in „Schedules of Reinforcement“.
Kurz gesagt
- Variable Belohnung heißt: Ein Verhalten wird unregelmäßig und unvorhersehbar belohnt - wie am Spielautomaten, nicht wie am Getränkeautomaten.
- Ferster und Skinner zeigten 1957, dass dieses Muster die höchste Reaktionsrate und die größte Löschungsresistenz erzeugt: Man macht am längsten weiter, auch wenn nichts mehr kommt.
- Im Feed steckt das Muster in Infinite Scroll, Pull-to-Refresh, Benachrichtigungen und Likes - nicht geplant, aber ausgelesen, weil es Nutzung erzeugt.
- Doomscrolling ist variable Belohnung mit umgekehrtem Vorzeichen: Die gesuchte Belohnung ist die Auflösung, und sie kommt fast nie.
Was variable Belohnung bedeutet
Variable Belohnung ist ein Muster, bei dem ein Verhalten nicht jedes Mal belohnt wird, sondern unregelmäßig - manchmal nach zwei Versuchen, manchmal nach zwanzig, nie vorhersehbar. Es ist das Gegenteil des Getränkeautomaten, der bei jedem Münzeinwurf zuverlässig eine Dose liefert. Und es ist genau das Prinzip des Spielautomaten, der bei jedem Hebelzug vielleicht etwas liefert.
Die Verhaltensforschung nennt das einen variablen Quotenplan (variable ratio schedule) der Verstärkung. Das klingt technisch, beschreibt aber etwas, das jeder kennt: Nicht die sichere Belohnung hält uns am zuverlässigsten bei einer Sache, sondern die mögliche.
Woher das Konzept kommt
Das Prinzip stammt aus den Laboren des amerikanischen Psychologen B. F. Skinner. Zusammen mit Charles Ferster veröffentlichte er 1957 das Buch „Schedules of Reinforcement“, in dem systematisch untersucht wurde, wie verschiedene Belohnungsmuster das Verhalten von Tauben und Ratten prägen. Die Tiere drückten Hebel oder pickten auf Scheiben, und die Forscher variierten, wann Futter kam: nach jeder Reaktion, nach jeder fünften, nach unregelmäßigen Abständen, nach unregelmäßigen Anzahlen.
Der Befund, der bis heute jedes Lehrbuch prägt: Der variable Quotenplan - Belohnung nach einer zufälligen, im Mittel aber festen Anzahl von Reaktionen - erzeugt die höchste und gleichmäßigste Reaktionsrate. Die Tiere arbeiteten schneller und pausenloser als unter jedem anderen Muster. Und sie hörten am spätesten auf, wenn die Belohnung ganz ausblieb. Dieser zweite Befund heißt Löschungsresistenz: Ein Verhalten, das immer belohnt wurde, wird schnell aufgegeben, sobald die Belohnung wegfällt, weil der Unterschied sofort auffällt. Ein Verhalten, das nur manchmal belohnt wurde, wird lange fortgesetzt, weil das Ausbleiben der Belohnung zum Muster gehört. Die Taube kann nicht wissen, ob das Futter für immer weg ist oder nur gerade nicht kommt.
Warum es funktioniert
Der Mechanismus liegt in der Ungewissheit. Bei einer sicheren Belohnung ist der interessante Moment vorbei, sobald man das Muster kennt. Bei einer variablen Belohnung ist jeder einzelne Versuch offen - er könnte der sein, der sich auszahlt. Das Gehirn reagiert auf diese Offenheit stärker als auf die Belohnung selbst. Die Erwartung ist der Reiz, nicht das Ergebnis.
Deshalb sind Spielautomaten der Prototyp: Jeder Hebelzug ist eine Frage, deren Antwort erst nach dem Ziehen kommt. Die Kulturanthropologin Natasha Dow Schüll hat in ihrem Buch „Addiction by Design“ beschrieben, wie die Automatenindustrie dieses Prinzip über Jahrzehnte verfeinert hat. Der Vergleich zwischen Spielautomat und Smartphone, den der Designethiker Tristan Harris 2016 populär gemacht hat, ist deshalb kein rhetorischer Trick, sondern eine strukturelle Beobachtung: Beide sind um denselben Verstärkungsplan herum gebaut.
Wo das Muster im Feed steckt
Ein Feed ist ein variabler Quotenplan mit sehr hoher Frequenz. Jedes Element, das nach oben rutscht, ist ein Versuch. Die meisten sind belanglos. Gelegentlich kommt etwas, das fesselt - eine Eilmeldung, ein Beitrag von jemandem, den man mag, etwas Lustiges, etwas Empörendes. Wann das nächste kommt, weiß niemand. Das Muster steckt in mehreren Elementen gleichzeitig:
- Infinite Scroll: Jeder Wisch ist ein Hebelzug, und der Feed hat kein Ende.
- Pull-to-Refresh: Die Ziehgeste ist der Hebel im Wortsinn - man zieht und wartet, was kommt.
- Benachrichtigungen: Jedes Aufleuchten des Bildschirms könnte wichtig sein oder nicht.
- Likes und Reaktionen: Ob ein Beitrag ankommt, zeigt sich unregelmäßig und tröpfchenweise.
Keines dieser Elemente wurde ursprünglich mit Skinner im Hinterkopf gebaut. Aber alle, die geblieben sind, folgen seinem Muster - weil Elemente, die es nicht tun, weniger Nutzung erzeugen und deshalb aussortiert werden. Das Muster setzt sich durch, auch ohne dass jemand es plant.
Was das mit Doomscrolling zu tun hat
Doomscrolling ist variable Belohnung mit umgekehrtem Vorzeichen. Die „Belohnung“, nach der du suchst, ist die Auflösung - die Information, die die Lage erklärt, einordnet oder beendet. Sie kommt selten, unvorhersehbar, und meistens kommt stattdessen etwas, das die Unsicherheit vergrößert. Das ändert nichts am Mechanismus: Solange die nächste Einheit die erlösende sein könnte, hält die Ungewissheit das Scrollen aufrecht. Die Löschungsresistenz erklärt, warum du auch dann weiterscrollst, wenn seit einer Stunde nichts Neues kam: Das Ausbleiben gehört zum Muster. Wie diese Suche nach dem Ende des Tunnels im Detail funktioniert, steht im Text Warum du nicht aufhören kannst.
Was sich daraus ableiten lässt
Gegen einen variablen Quotenplan hilft keine Willenskraft, weil er genau darauf gebaut ist, Willenskraft zu überdauern. Was hilft, ist die Reduktion der Versuche: weniger Hebelzüge, nicht mehr Disziplin pro Hebelzug. Das heißt konkret: Benachrichtigungen aus, feste Zeiten statt ständiger Verfügbarkeit, der Feed nicht auf dem Nachttisch. Skinners Tauben hörten nicht auf zu picken, weil sie sich zusammenrissen. Sie hörten auf, wenn die Scheibe nicht mehr da war.
Häufige Fragen
Ist variable Belohnung dasselbe wie ein Dopamin-Kick?
Nicht ganz. Variable Belohnung beschreibt das Verhaltensmuster, das Skinner beobachtet hat, ohne Aussage über das Gehirn. Die Neurowissenschaft hat später gezeigt, dass Dopamin vor allem auf die Erwartung einer Belohnung reagiert, nicht auf die Belohnung selbst - was gut zum Muster passt. Aber die populäre Rede vom Dopamin-Kick ist meist ungenau; mehr dazu im Text zum Dopamin-Detox.
Nutzen Plattformen variable Belohnung absichtlich?
Teils, teils. Einige Elemente wurden bewusst nach diesem Prinzip gestaltet - Insider haben das in Interviews bestätigt. Andere sind zufällig entstanden und geblieben, weil sie Nutzung erzeugen. Für die Wirkung ist die Absicht egal: Ein Muster, das Verhalten aufrechterhält, setzt sich in einem System durch, das auf Nutzungszeit optimiert, ob jemand es plant oder nicht.
Warum scrolle ich weiter, obwohl seit einer Stunde nichts Interessantes kam?
Das ist die Löschungsresistenz: Bei unregelmäßiger Belohnung gehört das Ausbleiben zum Muster, und du kannst nicht unterscheiden, ob gerade nichts kommt oder nie mehr etwas kommt. Skinners Tauben pickten unter diesem Muster am längsten weiter, nachdem das Futter ausgeblieben war. Der Feed nutzt denselben Effekt.
Quellen
- Ferster, C. B. & Skinner, B. F. (1957): Schedules of Reinforcement. New York: Appleton-Century-Crofts.
- Simply Psychology: Schedules of Reinforcement in Psychology (Überblick zu variablen Quotenplänen und Löschungsresistenz).
- Harris, T. (2016): How Technology is Hijacking Your Mind - from a Magician and Google Design Ethicist. Medium.
- Schüll, N. D. (2012): Addiction by Design: Machine Gambling in Las Vegas. Princeton University Press.