Mittwoch, 18. Juni 2014

Brasilien wird Weltmeister?! Prognosen für die Weltmeisterschaft 2014 in Brasilien



Während in Brasilien die ersten Vorrundenspiele der Weltmeisterschaft 2014 laufen wollen wir einen Blick hinter Prognosen von Fußballspielen und insbesondere der diesjährigen Weltmeisterschaft werfen. Wie gut sind Fußballspiele vorherzusagen, welche Methoden schneiden erfolgreich ab? Eine unvollständige Literaturübersicht ohne eigene Daten. Dafür mit einer subjektiven Bewertung der Stärken und Schwächen der einzelnen Prognosen.

Banken wie Commerzbank oder Goldman Sachs, Zeitungen wie das Handelsblatt in Kooperation mit Beratungen wie Deloitte, und auch Forscher und Statistiker aus Deutschland, Österreich und den USA haben es gewagt, eine Prognose für die aktuelle Fußballweltmeisterschaft zu modellieren. Die meisten Studien sehen dabei Brasilien vor Argentinien, Deutschland und Spanien vorne.

Commerzbank, Deloitte und Goldman Sachs und gehen dabei mit ähnlichen Methoden vor, sie stützen sich vor allem auf das Elo-Ranking welches aus dem Schachspiel für die Bewertung von Fußballmannschaften übertragen wurde. Für die Deloitte und Handelsblattprognose liegen aber kaum Informationen vor, weshalb wir uns im Folgenden auf die Prognose der beiden Banken beschränken werden. Daneben wollen wir im Anschluss drei Prognosen von Statistikern und Wissenschaftlern näher beleuchten.

Zunächst ist es aber wichtig zu wissen, wie das Elo-Bewertungssystem funktioniert, welches für Nationalmannschaften aber auch für Fußballvereine existiert. Elo ist ein Versuch die relativen Fähigkeiten von unterschiedlichen Mannschaften zu erfassen und basiert auf den Ergebnissen von früheren Spielen dieser Mannschaft. Hierbei wird jedoch im Gegensatz zur Bundesliga oder zur WM Gruppenphase keine feste Punktzahl für ein Sieg oder ein Unentschieden gegeben. Der Gewinn oder Verlust an Punkten errechnet sich aus der Differenz von Elo-Werten der beiden Mannschaften im direkten Vergleich. Siege oder Unentschieden gegen stärkere Teams gehen also positiver in die Wertung ein, wohingegen einem schwächeren Team bei der ohnehin erwarteten Niederlage nicht so viele Punkte abgezogen werden. Nach jedem Spiel werden die Elo-Werte der beiden Teams aktualisiert, abhängig davon welches Team besser oder schlechter abschneidet als man anhand der Elo-Werte im Voraus erwarten würde. Ein Elo-Ranking kann sich nur auf Sieg / Unentschieden / Niederlage beziehen, oder auch die Tordifferenz berücksichtigen. Eines der größeren Probleme anhand des Elo-Rankings ist es gute Startwerte für die Qualität von Mannschaften zu finden, insbesondere falls nur wenige relevante Spiele gespielt wurden. Hvattum und Arntzen (2010) beschreiben die Verwendung von Elo-Rankings im Fußball näher und testen die Vorhersagefähigkeit dieses Bewertungssystems im Vergleich mit anderen Methoden. Hierbei schneiden Wettquoten etwas besser ab, ein Ergebnis welches auch Leitner, Zeileis und Hornik (2010) bestätigen. Insgesamt kann man aber meiner Ansicht nach festhalten, dass das Elo-Rating etabliert und als ausreichend solide bezeichnet werden kann.

Zurück zu den Prognosen der beiden Banken. Neben dem Elo-Ranking spielen in beiden Prognosen auch frühere Spiele eine wichtige Rolle und es wird auch jeweils der Heim- bzw. Kontinentalvorteil einer Weltmeisterschaft hinzugezogen. Goldman Sachs berechnet dabei Regressionskoeffizient aus allen Spielen seit 1960 sowie die erzielten Tore und Gegentore der letzten 10 bzw. 5 internationalen Pflichtspiele. Dazu kommen noch historische Weltmeisterschaftsergebnisse, aber nur für die sieben Nationen, Argentinien, Brasilien, Deutschland, England, Frankreich, Italien, Niederlande und Spanien. Die Commerzbank verwendet die erzielten Punkte in den letzten 20 Weltmeisterschaften als zusätzliche erklärende Variable. Der Heim- und Kontinentalvorteil wird bei Goldman Sachs ebenfalls aus historischen Daten (seit 1960) berechnet, während die Commerzbank diese ad hoc festlegt.
Die Goldman Sachs Analyse scheint allgemein etwas ausgearbeiteter, und ist auch detaillierter beschrieben. Sie verwenden eine Monte-Carlo Simulation, die wir auch zur Berechnung der wahrscheinlichen Gegner der dt. Mannschaften im diesjährigen UEFA Champions League  Achtelfinale verwendet haben und modellieren direkt die Tore mit Hilfe einer Poisson-Verteilung, die ihre Probleme besitzt (siehe z.B. Bittner et al., 2007), aber hierfür wohl angemessen erscheint. Bei der Commerzbank Prognose ist nicht im Detail beschrieben, wie sie die Wahrscheinlichkeiten berechnen, aber vermutlich wird dies ähnlich erfolgt sein. 

Was mich persönlich bei der Commerzbank Prognose irritiert ist die Aufnahme einer Variable, die den letztjährigen Weltmeister beschreibt, weil „aus statistischer Sicht sinkt […] die Wahrscheinlichkeit, dass der aktuelle Weltmeister das kommende Turnier gewinnt“. Sehen wir mal von der geringen Stichprobengröße ab, ist das für mich ein typisches Beispiel von „Regression to the Mean“ welches vermutlich auch den Finalverlierer betrifft, und kein Effekt von geringerer Motivation durch den Gewinn der Weltmeisterschaft beschreibt. Also warum wird das nicht für alle Mannschaften modelliert.

Bei der Goldman Sachs Prognose wundert mich wiederum die hohe Wahrscheinlichkeit, die sie für den Gewinn durch Brasilien errechnen (48,5%). Bei 32 Teams, eine fast 50%-Chance zu gewinnen? Das erscheint mir persönlich sehr hoch. Auf Platz 2 bis 4 folgen Argentinien, Deutschland und Spanien mit ähnlichen Prognosewerten in Höhe von 14%, 11% und 10%. Die Commerzbank sieht dagegen für Brasilien mit einer Chance von 1 zu 10 (10,3%) minimal vor Spanien (10,2%), Deutschland (10,0%), Argentinien (8,8%) und Niederlande (8,5%). Eine deutliche Diskrepanz.

Ein Hauptproblem beider Studien liegt für mich in unterschiedlichen Gründen. Erstens in der Gewichtung von früheren und heutigen Spielen. Wie repräsentativ sind Spiele von 1960 (für die Goldman Sachs Prognose) bzw. von 1994 (für Commerzbank) für heutige Partien? Hier sehe ich große Probleme bei der Modellierung über lange Zeiträume. Zweitens, die Berechnung des Heimvorteils ist für mich in beiden Studien hochproblematisch. Der Heimvorteil hat über die Zeit stark abgenommen, in der Bundesliga wie auch in anderen Ligen oder bei internationalen Spielen (siehe die Diskussion der fivethirtyeight.com Prognose weiter unten). Die Stichprobengröße ist natürlich relativ gering, und beide Studien überzeugen mich nicht, wie sie den Heimvorteil modellieren. Die Goldman Sachs Prognose nimmt zeitkonstante Heimvorteile und zeitkonstante mannschaftsspezifische Kontinentalvorteile. Die Prognose von Commerzbank weist auf den Rückgang des Heimvorteils hin, verwendet aber einfach einen „Heimvorteil-Einheitskoeffizienten“, wobei nicht näher eingegangen wird, wie dieser sich berechnet. 

Eine ganz andere Vorgehensweise nimmt die akademische Studie von Achim Zeileis, Christoph Leitner und Kurt Hornik (2014), die zum wiederholten Male (z.B. nach der UEFA Europameisterschaft 2008 und der FIFA Weltmeisterschaft 2010) Wettquoten verwenden. Sie aggregieren die Quoten von 22 Wettanbietern und nutzen diese ebenfalls für eine Monte-Carlo Simulation. In einer früheren Studie haben diese Autoren gezeigt, dass sie damit die Europameisterschaft 2008 besser vorhersagen können als mit einem (einfachen) Elo-Ranking. Die Autoren sehen, wie beide vorherigen Prognosen, ebenfalls Brasilien vorne. Die Wahrscheinlichkeit für einen Weltmeistersieg Brasiliens liegt bei 22,5% und damit zwischen den Gewinnwahrscheinlichkeiten der beiden anderen Studien. Auf Platz 2-4 folgen wie bei der Prognose von Goldman Sachs Argentinien, Deutschland und Spanien mit 16%, 13% und 12%. Die Studie gefällt mir gut, die Wahrscheinlichkeit für einen Sieg Brasiliens ist hoch, immerhin fast ein Viertel, aber vielleicht nicht unrealistisch hoch. Die Autoren weisen auch auf eine hohe positive Korrelation der aus den Quoten abgeleiten Siegwahrscheinlichkeiten im direkten Vergleich mit der FIFA–Rangliste und (noch etwas deutlicher) mit dem Elo-Ranking. 

Der Ansatz der Studie ist interessant und theoretisch gut begründet, denn schließlich haben zwei Ökonomen dieses Jahr den Nobelpreis gewonnen, die sich mit der Effizienz von Märkten auseinander gesetzt haben (und ein Dritter, der die ökonometrische Analyse stark weiterentwickelt hat). Aber ich bin etwas skeptisch, ob in den Wettquoten wirklich alle Informationen eingespeist sind. Meine eigenen Analysen der internationalen Spiele der letzten Jahre zeigt statistisch hochsignifikante Korrelationen der Elo-Werte beider Teams mit den erzielten Toren kontrolliert um die Wettquoten (die ebenfalls hochsignifikant sind). Es gibt auch unter wissenschaftlichen Studien Indizien, dass neben den Wettquoten weitere Informationen ausgenutzt werden können, z.B. Constantinou and Fenton (2012). In Zukunft wäre es schön zu sehen, ob es ein Informationsgewinn gibt, falls weitere Variablen wie das Elo-Ranking verwendet werden würden, und falls ja, wie groß dieser aussehen würde. Der Vergleich mit der Elo-Methode, die die Autoren in Leitner et al. (2010) angewandt haben, ignoriert Unentschieden und modelliert keine Tordifferenzen. Aber etwas gravierender ist vielleicht der folgende Punkt, ich zweifele etwas an der Annahme, dass der Gewinn des Anbieters pro Team konstant ist (damit man aus den Quoten auf die zugrundeliegenden Wahrscheinlichkeiten schließen kann), ein Gegenargument hierfür könnte ein mögliches Ausnutzen des Favorite-longshot bias sein (siehe zum Beispiel Direr, 2013). Hier hätte ich mir eine etwas ausführliche Begründung der Annahme gewünscht, oder zumindest eine Diskussion der Auswirkungen falls die Annahme nicht gilt. Allerdings ist das natürlich einfach gesagt, und schwierig zu modellieren. Alles in allem aber eine interessante Studie, die für mich die Frage aufwirft, ob es sich überhaupt lohnt, sich mit einer komplexen Prognose zu beschäftigen. 

Eine Prognose, die mir von der Beschreibung her gefällt, stammt von Nate Silver im US-Blog www.fivethirtyeight.com, einem amerikanischen Statistiker, der durch Baseball- und US-Wahlkampfprognosen bekannt geworden ist.  In seiner Prognose verwendet er Länderspiele der letzten vier Jahre und verbindet dies mit Spielerdaten der Kader. Für alle Spieler in den größeren Ligen analysieren sie Gewinnquoten mit und ohne Einsatz eines Spielers (zumindest verstehe ich deren Beschreibung in diesem Sinne). Damit guckt er sich auch Freundschaftsspiele an, zumindest falls der Kader in einem solchen Spiel ähnlich ist zu dem in Pflichtspielen. Separat wird auf die Offensive und Defensive modelliert, um bessere Ergebnisprognosen zu erhalten. Ferner geht er detailliert auf dem Heimvorteil ein und hat ausführliche Analysen angewandt in denen er herausfindet, dass Ost-West-Reisen statistisch relevanter sind als Nord-Süd-Reisen. Der Grund liegt hier vermutlich im Jet-Lag durch Zeitverschiebungen. Auch bestätigt er die Abnahme des Heimvorteils über die Zeit und verwendet daher für dessen Berechnung nur Spiele seit 2006. Nichtsdestotrotz findet er, ähnlich zur Goldman Sachs Prognose, eine Chance von 1 zu 2 (45,2%), dass Brasilien Weltmeister wird, gefolgt von der bereits bekannten Rangfolge Argentinien (13%), Deutschland (11%) und Spanien (8%). Auch hier gilt natürlich meine Verwunderung über diese hohe Wahrscheinlichkeit für den sechsten Titel von Brasilien.

Die letzte Studie, die wir vorstellen wollen, stammt von den drei deutschen Sozialwissenschaftlern Jürgen Gerhards, Michael Mutz und Gert G. Wagner, die Marktwertdaten von transfermarkt.de verwenden. Die Autoren machen im Gegensatz zu den anderen Studien keine Simulation und geben daher keine Wahrscheinlichkeit für unterschiedliche Mannschaften an. Sie sehen als einzige Studie nicht Brasilien als wahrscheinlichsten Sieger an, sondern tippen auf Spanien, da diese Mannschaft den höchsten Kaderwert besitzt. Demnach erzielt Spanien im Finale gegen Deutschland ihren zweiten Weltmeistertitel während Brasilien und Argentinien im Halbfinale ausscheiden. Die Autoren weisen darauf hin, dass "Einfachheit [...] ein zentrales Gütekriterium von Wissenschaft" ist. Dem kann ich nur zustimmen, komplexe Modelle lassen deren Probleme oft schlechter einschätzen und mögen vielleicht vergangene Spiele mehr oder weniger perfekt vorhersagen, ihre Prognosefähigkeit für neue Daten kann aber sehr schlecht sein. Trotzdem schätze ich das einfache Modell als ausbaufähig ein. Marktwerte sind nicht das perfekte Kriterium, da natürlich auch Faktoren wie die Werbewirksamkeit hier eine Rolle spielen, so dass es vielleicht sinnvoll wäre weitere Variablen wie Wettquoten oder Elo-Rankings hinzuzufügen, was aber natürlich zu mehr Komplexität führt. Auch könnte man die Marktwerte des Kaders genauer analysieren, um potenzielle Schwächen wie das Fehlen eines erfahrenen Linksverteidigers zu beleuchten (dies war meine Idee für einen Algorithmus den ich aber aus Zeitmangel nicht umsetzen konnte). Zumindest eine grobe Aufteilung in Offensive und Defensive wie bei fivethirtyeight.com könnte vielleicht hilfreich sein.

Zusammenfassend sehen wir unterschiedliche Prognosen, die unterschiedliche Methoden anwenden, und fast alle Brasilien als Sieger sehen vor Argentinien, Deutschland und Spanien (teilweise in anderer Reihenfolge). Als Datengrundlagen verwenden diese Studien Elo-Rankings, Wettquoten, Marktwerte oder Spielerdaten mit Verknüpfung zu Ligaspielen. Eine große Herausforderung stellt dabei die Quantifizierung des Heimvorteils für Brasilien und eines Kontinentalvorteils für die übrigen südamerikanischen Mannschaften dar. Eine verwandte Schwierigkeit liegt im Abwägen welche Spiele man als Datengrundlage hinzuzieht, so dass ausreichend historische Spiele zur Verfügung stehen, Prognosen aber nicht auf längst vergangenen Kadern beruhen. Verwendet man auch Freundschaftsspiele, und wie stellt man sicher, dass ausreichend Spiele zwischen Kandidaten für den Weltmeisterschaftssieg vorhanden sind?

Empirisch sind die Prognosen schwer zu vergleichen und zu bewerten. Leider konnte ich meist keinen Hinweis finden, wo man selbst die verwendeten Daten bzw. die Skripte herunterladen kann. Die Datengrundlagen variieren stark und dies macht den Vergleich der historischen Prognosefähigkeit schwierig. Auch gibt es keine generelle vereinbarte loss function, die uns sagt, wie man z.B. richtige Tendenzen gegenüber komplett falschen Tipps bewertet, und die wir bei jedem Tippspiel definieren (wohl ein generelles Problem in der Literatur). Das macht auch die retrospektive Bewertung in einigen Wochen schwierig.

Für meine Tippspiele habe ich mit einem geringen Zeitbudget Elo-Rankings zusammen mit Wettquoten und mannschaftsspezifischen Effekten ("random effects") verwendet, um die geschossenen Tore zu simulieren. Nach den ersten Spieltagen liege ich damit in den Tippspielen, zu denen ich eingeladen wurde, relativ weit zurück. Die nicht-ganzzahligen Toreprognosen scheinen dabei gut zu funktionen (wenn man mal z.B. von Spanien gegen Niederlande 1:5 absieht), aber es ist mir nur schlecht gelungen von den prognostizierten Toren, zum Beispiel 1,1 vs 0,9 bei Elfenbeinküste gegen Japan (Ausgang 2:1) auf Sieg für eine Mannschaft bzw. Unentschieden zu tippen. Auch könnte ich mir vorstellen, dass eine separate Modellierung für Offensive und Defensive genauere Torprognosen, und damit auch bessere Endprognosen, liefern könnte. Sehr viel besser kann man die Frage der Prognostizierbarkeit von Fußballspielen aber sicher in Ligawettbewerben wie der Bundesliga beantworten.

PS: Ein Beispiel für eine Methode zur Berechnung der Stärke einzelner Spieler beschreibt die Webseite www.goalimpact.com, die die Tordifferenz einer Mannschaft (auf Minutenbasis) in Abhängig von der Aufstellung analysiert. Die genauen Details des Algorithmus sind leider nicht veröffentlicht, aber in der Beschreibung heißt es, dass hier, unter Berücksichtigung von Gegner, Mitspielern und Heimvorteil, die durchschnittliche Tordifferenz einer Mannschaft mit oder ohne Einsatz eines Spielers berechnet, wobei auch Einwechselspieler berücksichtigt werden. Ein interessanter Ansatz, ich bin gespannt zu sehen, ob man mit solchen Ansätzen bessere Prognosen erhalten kann.


Prognosen und Studien im Text:

Commerzbank Economic Research. Economic Insight - Das schöne Spiel: Die Ökonomie der Fußball WM 2014. 4. Juni 2014.
Fivethirtyeight.com. It’s Brazil’s World Cup to Lose.
Gerhards, Jürgen, Michael Mutz, and Gert G. Wagner. Spannung bis zum Abpfiff – Die Prognose des Fußballweltmeisters ist schwieriger als bei der letzten WM. DIW Wochenbericht 24/2014.
Goldman Sachs. The World Cup and Economics 2014.

Samstag, 26. April 2014

Toreverteilung Bundesliga 1963-2012

Im letzten Post haben wir uns mit dem Heimvorteil und dessen Entwicklung über die Zeit beschäftigt. Hier wollen wir uns dieser Analyse direkt anschließen, indem wir die Trends einzelner Ergebnisse in der Bundesliga untersuchen.
Die folgende Grafik zeigt die relative Häufigkeit unterschiedlicher Spielausgänge in der Bundesliga von der Spielzeit 1963/1964 bis zur Winterpause 2013/2014 und beruht auf 15.394 Spielen. In den Spalten sieht man dabei die erzielten Tore der Heimmannschaft, in den Spalten die Tore der Auswärtsmannschaft. Unentschieden sind auf der Diagonalen zu finden, während Siege der Heimmannschaft unterhalb der Diagonale zu finden sind, und Siege des Gastteams oberhalb der Diagonalen:

Das häufigste Ergebnis ist mit Abstand ein 1:1, das in 11,6% aller Spiele aufgetreten ist. Insgesamt enden aber nur 25,8% aller Spiele mit einem Unentschieden. Diese Zahl erhält man aus der obigen Grafik, wenn man alle Zahlen auf der Diagonale aufsummiert. Wie im letzten Post festgestellt wurde, enden 51,2% aller Bundesligapartien mit einem Sieg der Heimmannschaft (die Summe unter der Diagonale). Es ist hier deutlich ersichtlich, dass Heimsiege häufiger auftreten als Auswärtssiege. Die zweit-, dritt- und vierthäufigsten Ergebnisse sind Siege der Heimmannschaft mit 2:1, 1:0 und 2:0. Ein Auswärtssieg ist unter den acht häufigsten Ergebnissen gar nicht zu finden, was leichter ersichtlich ist, wenn man obige Tabelle nach Häufigkeit der Ergebnisse sortiert. Allerdings ist hier zu beachten, dass der Heimvorteil über die Zeit zurückgegangen ist und die langjährigen Häufigkeiten nicht unbedingt der Anordnung der letzten Jahre entspricht, aber mehr dazu weiter unten:

In der folgenden Grafik haben wir die durchschnittliche Zahl der Tore der Heim- und Auswärtsmannschaft über alle Bundesligaspielzeiten abgebildet. Hier sieht man deutlich den Rückgang des Heimvorteils. Schossen Heimmannschaft in der Bundesliga bis Anfang der 1980er Jahre im Durchschnitt noch fast 2,1 Tore, so ist dies Ende der 80er Jahre auf 1,7 Tore pro Spiel zurückgegangen. Interessant ist besonders, dass der Rückgang innerhalb von relativ wenigen Spielzeiten in den 80er passiert ist. Die Gründe hierfür sind vermutlich taktische Umstellungen hin zu einem defensiveren Spiel.

Bei den Auswärtsmannschaften sehen wir dagegen keinen deutlichen Trend. Die durchschnittliche Anzahl der Tore geht bis etwa 2002/2003 sehr leicht zurück, seitdem jedoch wieder etwas hinauf. Der letzte Anstieg ist auch statistisch signifikant (auf dem 5%-Niveau).

Insgesamt haben sich hierdurch die durchschnittliche Anzahl der Heim- und der Auswärtstore deutlich angenähert. In der letzten Bundesligaspielzeit 2012/2013 schossen Heimmannschaften im Durchschnitt 1.59 Tore und Auswärtsmannschaften 1.34 Tore. Der Unterschied ist weiterhin ebenfalls statistisch signifikant (auf dem 5%-Niveau, wobei hier die Abhängigkeit beider Variable nicht betrachtet wurde).


Es stellt sich natürlich die Frage, ob die beobachteten Veränderungen durch einzelne bestimmte Ergebnisse geprägt sind, oder ob sie die Trends allgemein über die einzelnen Ergebnisse hinaus entwickelt haben. Im Folgenden zeigen wir die durchschnittlichen Ergebnisse für je zehn der ersten 50 Spielzeiten der Bundesliga auf.

Auf die Entwicklung einzelner Ergebnisse wollen wir nun genauer eingehen, um zu sehen, ob die Entwicklung der Heimtore zum Beispiel durch hohe Siege bestimmt wird. Auch für Unentschieden und Auswärtssiege analysieren wir die Entwicklung einzelner Ergebnisse, denn hier könnten gegenläufige Entwicklungen zu einem stabilen Gesamtbildführen.

Die Entwicklung der einzelnen Ergebnisse analysieren wir mit Hilfe von nicht-parametrischen Regressionsmethoden, die es flexibler erlauben, die Veränderungen über die Zeit darzustellen, als das mit Hilfe von linearen Regressionsmodellen möglich ist. Das "np"-Packet in der Statistik-Programmiersprache R erlaubt, eine einfache Implementierung von nicht-parametrischen Kernel Regressionsmodellen.
Wir verwenden hierbei in allen folgenden Analyse eine feste Bandbreite (von 2.5), um die Vergleichbarkeit zu erleichtern. Beginnen wir mit dem Heimsiegen. In der folgenden Grafik seht ihr die Entwicklung unterschiedlicher Ergebnisse von Heimsiegen über die Zeit, wobei wir alle Ergebnisse mit 3 oder mehr Punkten zusammengefasst haben. (3+1):1 steht damit für 3:1, 4:1, 5:1 und so weiter, während (3++):(3+) Ausgänge wie 4:3, 5:3, 5:4 ... umfassen. Um die gelbe Kurve für (3+:2) herum haben wir die durchschnittlichen Ergebnisse pro Saison eingetragen, so dass man erkennen kann, wie die nicht-parametrischen Kurven im Vergleich zu den zugrundeliegenden Daten verlaufen.

Die Grafik für die Heimsiege zeigt, dass trotz des Rückgangs des Heimvorteils, häufige Spielausgänge wie 2:0 (grün) und 1:0 (blau) gleichwahrscheinlich geblieben sind. Der häufigste Ausgang eines Heimsieges in Form von 2:1 (rot) ging anteilsmäßig an allen Spielen lange Zeit zurück, von Ende der 1960er bis Anfang der 1990er, ist seitdem jedoch wieder etwas häufiger zu sehen. Diese Siege der Heimmannschaft, die mit weniger Tore erreicht werden, können den allgemeinen Trend also nicht erklären. Zurückzugehen scheinen dagegen insbesondere hohe Heimsiege wie 3:1, 3:0, 3:2 (und höher) sowie Spiele in denen die Heimmannschaft letztendlich trotz vieler Gegentore gewinnt wie 4:3 (braun). Es sind also die Kantersiege und hohe Spielausgänge, die wir seltener sehen. Dies spiegelt sich natürlich in der durchschnittlichen Zahl der erzielten Heimtore wieder, wie wir es weiter oben gesehen haben.

Als nächstes gucken wir uns die Entwicklung der Unentschieden an. (3+):(3+) steht hierbei für 3:3, 4:4 oder 5:5. Ein 5:5 ist übrigens zwei mal aufgetreten, am 6. Spieltag der Saison 1973/1974 im Spiel Schalke 04 gegen Bayern München und am 13. Spieltag der folgenden Saison in der Begegnung Eintracht Frankfurt gegen VfB Stuttgart. Die unterschiedlichen Ausgänge der Unentschieden laufen relativ parallel, insgesamt ist der Anteil der Unentschieden stabil, wobei erkennbar ist, dass die Zunahme der Unentschieden Ende der 1980er insbesondere durch torarme 0:0 (blau) und 1:1 (rot) getrieben ist, während 2:2 (grün) und höhere Unentschiede (3+):(3+) sich über die Zeit kaum verändert haben. Nach der Einführung der 3-Punkte-Regel ist dieser Anstieg aber langfristig wieder zurückgegangen. Zur Illustration haben wir unter die geglättete Kurve der 1:1 auch die Durchschnitte pro Saison eingezeichnet.

Bei den Auswärtssiegen haben wir festgestellt, dass deren Anteil seit Anfang der 2000er leicht angestiegen ist. In der folgenden Grafik sieht der Anstieg von Auswärtssiegen aufgrund des feineren Maßstabs (die y-Achse endet hier bei 8%) deutlich ausgeprägter aus, wobei auch leicht zu erkennen ist, dass der Anteil der Auswärtssiege insbesondere in den letzten Jahrzehnten angestiegen ist. Hohe Spielausgänge wie 2:(3+) (gelb) sind dabei auch nicht erkennbar zurückgegangen, im Gegensatz zu den Heimsiegen wie wir es weiter oben festgestellt haben. Nur sehr torreiche Partien, die mit einer Heimniederlage enden, wie 3:4 sieht man heutzutage seltener, waren aber auch früher sehr selten. Der Heimvorteil geht eindeutig zurück, und dies bei ganz unterschiedlichen Spielausgängen.


Samstag, 5. April 2014

Der Heimvorteil: Klarer Trend über die Zeit



Ein bekanntes Phänomen beim Fußball ist der "Heimvorteil". Nationalmannschaften scheiden bei Weltmeisterschaften zu Hause oft relativ erfolgreich ab. In der Champions League und im European Cup drücken Spieler und Trainer die Daumen, dass sie das Rückspiel doch bitte im eigenen Stadion antreten dürfen, und auch in der Bundesliga sehen wir einen beachtlichen (statistischen) Vorteil der Heimmannschaft gegenüber dem Team, dass auswärts antretten muss.

Im langjährigen Durschnitt von 1963/1964 bis zur Winterpause der Saison 2013/2014 sehen wir, dass die Heimmannschaft 51,2% aller Bundesligapiele gewinnen konnte (in 15.394 Spielen), aber nur in 22,9% aller Spiele konnte sich das Auswärtsteam durchsetzen. Dies hat ganz unterschiedliche Gründe: Die Fans spielen natürlich eine große Rolle, die Schiedsrichter bevorteilen die Heimmannschaft (und werden ebenfalls durch die Fans beeinflusst; siehe Dohmen, 2008), die Anreise mag ein Grund sein oder die Kenntniss des eigenen Platzes. Skarupke (2000) hat den Heimvorteil, sowie mögliche Gründe dafür, auch in einem wissenschaftlichen Arbeitspapier untersucht.

Aber wie hat sich der Heimvorteil über die Zeit entwickelt? Die folgende Grafik zeigt die durchschnittliche Anzahl der Heimsiege pro Saison und weist auf einen klaren Trend hin: Die Bedeutung des Heimvorteils hat nach den 1970er über die Zeit abgenommen. Der Rückgang war besonders deutlich von Ende der 70er bis zum Ende der 80er Jahre, hat sich aber seitdem weiter fortgesetzt. In der folgenden Grafik ist der Anteil der Siege an allen Spielen zu sehen:

Ein sehr ähnliches Bild ergibt sich, wenn man nur die Spiele betrachtet, die ohne Unentschieden geendet sind:

Die 3-Punkte-Regel hat hier anscheinend nur einen geringen Einfluss. Die durchschnittliche Anzahl an Heimsiegen in den Jahren vor und nach der Umstellung der Zählweise ist sehr ähnlich. Aber selbst seit der Einführung zur Saison 1995/1996 scheint die Bedeutung weiter abzunehmen. 


Zur Einfachheit haben wir im Folgenden die ersten 50 Jahre der Bundesliga in fünf Dekaden unterteilt und uns die durchschnittliche Anzahl der Spiele angeguckt, in denen die Heimmannschaft gewonnen hat. Hier sieht man deutlich, dass in den letzten zehn Jahren die durchschnittliche Zahl an Heimsiegen mit 45,7% deutlich unter der langfristigen Quote von 51,2% lag. Bis zur Winterpause lag der Anteil an Heimsiegen übrigens bei 46,7%. Der Fernsehsender ntv hat über diese Entwicklung geschrieben, dass der Heimvorteil kein Vorteil mehr sei, aber das stimmt nicht, auch in der ersten Häfte der Saison 2013/2014 gewann die Heimmannschaft noch deutlich häufiger, denn der Anteil der Auswärtssiegen lag nur bei 30,3. Dies entspricht im Durchschnitt 1,63 Punkten für die Heimmannaschaft gegenüber 1,14 Punkten für die Gäste, in statistisch signifikanter Unterschied.

Damit geht die Frage einher, ob der Rückgang des Heimvorteils durch mehr Unentschieden oder durch mehr Auswärtssiege kompensiert wurde. Im Folgenden gucken wir uns zunächst die Anzahl der Auswärtssiege an.

Hier ist ebenfalls ein klarer Trend zu mehr Auswärtssiegen zu erkennen, der gegenläufig zur Entwicklung der Heimsiege verläuft. Dieser Trend ist leichter zu erkennen, da er die Schwankungen um die Trendkurve geringer sind. Legen wir eine quadratische Funktion durch die durchschnittliche Anzahl der Heimsiege pro Saison, so erklärt diese Funktion 85% der Varianz der Unterschiede (das Bestimmtheitsmaß) in der Auswärtssiegquote über die unterschiedlichen Spielzeiten der Bundesliga, aber „nur“ 54% der Varianz der Heimsiegquote über die unterschiedlichen Saisons.


Was könnten die Gründen für den Rückgang des Heimvorteil sein? Ein Grund mag sein, dass die Anreisen komfortabler geworden sind, und die Auswärtsspieler heutzutage entsprechend weniger erschöpft sind. Aber auch die Schiedsrichterausbildung wird heute professioneller ablaufen als vor einigen Jahren, und dies könnte dazu beitragen, dass die Schiedsrichter fairer entscheiden, und weniger durch das Heimpublikum beeinflusst werden. Auch die verbesserten Trainingsmöglichkeiten könnten ein Grund sein, Spielfeldgrößen unterscheiden sich teilweise relativ deutlich, und heutzutage stehen den Vereinen teilweise Plätze unterschiedlicher Größe zur Verfügung.

Als letztes zeigen wir noch die Entwicklung der Unentschieden, allgemein enden in der Bundesliga knapp unter 26% aller Spiele mit einem Unentschieden (bis zur Winterpause waren dies 23% der Spiele in der Saison 2013/2014):

Bei der Entwicklung der Unentschieden ist kein allgemeiner Trend zu erkennen. Deutlich ist aber der Anstieg der Unentschieden ab Mitte der 1980er Jahre, der zur Einführung der 3-Punkte-Regel geführt hat. Akademische Studien wie zum Beispiel Dilger und Geyer (2007) bzw. Dilger und Geyer (2009) haben daraufhin untersucht, inwiefern die 3-Punkte-Regel ursächlich dazu beigetragen hat, die Anzahl der Unentschieden zu senken. Die oben genannten Studie kommen, dabei zum Ergebnis, dass die 3-Punkte-Regel tatsächlich erfolgreich war, Unentschieden zu verringern. Das Ergebnis wird allerdings von Strauß et al. (2009) angezweifelt.

Sieht man sich die Entwicklung an, so scheint es schwer festzustellen, ob der Anstieg Mitte der 1980er nur ein temporäres Phänomen war, oder tatsächlich durch die 3-Punkte-Regel gestoppt werden konnte. Aber vielleicht werden wir uns mit der Fragestellung in einem zukünftigen Post beschäftigen.

Der Heimvorteil ist, wie wir in das in der Einleitung angedeutet haben, ein internationales Phänomen. Obwohl das Ausmaß des Heimvorteils historisch zwischen den europäische Ligen sehr unterschiedlich war, verläuft die Entwicklung des Heimvorteils in den großen in Europa sehr ähnlich. Dies wird in zwei lesenswerten Artikeln bei ClubElo.com beschrieben. Die Bundesliga ist übrigens nicht besonders auffällig, in der Vergangenheit war der Heimvorteil in Spanien größer und in England niedriger als hierzulande. Heutzutage ist dagegen die Größe des Heimvorteils in Europa sehr ähnlich:
ClubElo.com "Home Field Advantage per Country"
ClubElo.com "The mysterious decline of home advantage"


Daten: Bundesliga Spiele 1963/1964 - Winterpause 2013/2014

Weitere Informationen:
Bring, Johan, and Marcus Thuresson. "Three points for a win in soccer: Is it fair?." Chance 24.3 (2011): 47-53.
Dilger, Alexander, and Hannah Geyer. "Theoretische und empirische Analyse der Drei-Punkte-Regel." Sport und Gesellschaft 3 (2007).
Dilger, Alexander, and Hannah Geyer. "Are three points for a win really better than two? A comparison of German soccer league and cup games." Journal of Sports Economics 10.3 (2009): 305-318.
Dohmen, Thomas J. "The influence of social forces: Evidence from the behavior of football referees." Economic Inquiry 46.3 (2008): 411-424.
Skarupke, Robert. "Quantifizierung des Heimvorteils im deutschen Profifußball: Eine empirische Untersuchung für die 1. Fußball-Bundesliga". (August 2000) (2000).
Strauß, B., N. Hagemann, and F. Loffing. "Die Drei-Punkte-Regel in der deutschen 1. Fußballbundesliga und der Anteil unentschiedener Spiele." Sportwissenschaft 39.1 (2009): 16-22.