Die letzte Studie, die wir vorstellen wollen, stammt von den drei deutschen Sozialwissenschaftlern Jürgen Gerhards, Michael Mutz und Gert G. Wagner, die Marktwertdaten von transfermarkt.de verwenden. Die Autoren machen im Gegensatz zu den anderen Studien keine Simulation und geben daher keine Wahrscheinlichkeit für unterschiedliche Mannschaften an. Sie sehen als einzige Studie nicht Brasilien als wahrscheinlichsten Sieger an, sondern tippen auf Spanien, da diese Mannschaft den höchsten Kaderwert besitzt. Demnach erzielt Spanien im Finale gegen Deutschland ihren zweiten Weltmeistertitel während Brasilien und Argentinien im Halbfinale ausscheiden. Die Autoren weisen darauf hin, dass "Einfachheit [...] ein zentrales Gütekriterium von Wissenschaft" ist. Dem kann ich nur zustimmen, komplexe Modelle lassen deren Probleme oft schlechter einschätzen und mögen vielleicht vergangene Spiele mehr oder weniger perfekt vorhersagen, ihre Prognosefähigkeit für neue Daten kann aber sehr schlecht sein. Trotzdem schätze ich das einfache Modell als ausbaufähig ein. Marktwerte sind nicht das perfekte Kriterium, da natürlich auch Faktoren wie die Werbewirksamkeit hier eine Rolle spielen, so dass es vielleicht sinnvoll wäre weitere Variablen wie Wettquoten oder Elo-Rankings hinzuzufügen, was aber natürlich zu mehr Komplexität führt. Auch könnte man die Marktwerte des Kaders genauer analysieren, um potenzielle Schwächen wie das Fehlen eines erfahrenen Linksverteidigers zu beleuchten (dies war meine Idee für einen Algorithmus den ich aber aus Zeitmangel nicht umsetzen konnte). Zumindest eine grobe Aufteilung in Offensive und Defensive wie bei fivethirtyeight.com könnte vielleicht hilfreich sein.
Zusammenfassend sehen wir unterschiedliche Prognosen, die unterschiedliche Methoden anwenden, und fast alle Brasilien als Sieger sehen vor Argentinien, Deutschland und Spanien (teilweise in anderer Reihenfolge). Als Datengrundlagen verwenden diese Studien Elo-Rankings, Wettquoten, Marktwerte oder Spielerdaten mit Verknüpfung zu Ligaspielen. Eine große Herausforderung stellt dabei die Quantifizierung des Heimvorteils für Brasilien und eines Kontinentalvorteils für die übrigen südamerikanischen Mannschaften dar. Eine verwandte Schwierigkeit liegt im Abwägen welche Spiele man als Datengrundlage hinzuzieht, so dass ausreichend historische Spiele zur Verfügung stehen, Prognosen aber nicht auf längst vergangenen Kadern beruhen. Verwendet man auch Freundschaftsspiele, und wie stellt man sicher, dass ausreichend Spiele zwischen Kandidaten für den Weltmeisterschaftssieg vorhanden sind?
Empirisch sind die Prognosen schwer zu vergleichen und zu bewerten. Leider konnte ich meist keinen Hinweis finden, wo man selbst die verwendeten Daten bzw. die Skripte herunterladen kann. Die Datengrundlagen variieren stark und dies macht den Vergleich der historischen Prognosefähigkeit schwierig. Auch gibt es keine generelle vereinbarte loss function, die uns sagt, wie man z.B. richtige Tendenzen gegenüber komplett falschen Tipps bewertet, und die wir bei jedem Tippspiel definieren (wohl ein generelles Problem in der Literatur). Das macht auch die retrospektive Bewertung in einigen Wochen schwierig.
Für meine Tippspiele habe ich mit einem geringen Zeitbudget Elo-Rankings zusammen mit Wettquoten und mannschaftsspezifischen Effekten ("random effects") verwendet, um die geschossenen Tore zu simulieren. Nach den ersten Spieltagen liege ich damit in den Tippspielen, zu denen ich eingeladen wurde, relativ weit zurück. Die nicht-ganzzahligen Toreprognosen scheinen dabei gut zu funktionen (wenn man mal z.B. von Spanien gegen Niederlande 1:5 absieht), aber es ist mir nur schlecht gelungen von den prognostizierten Toren, zum Beispiel 1,1 vs 0,9 bei Elfenbeinküste gegen Japan (Ausgang 2:1) auf Sieg für eine Mannschaft bzw. Unentschieden zu tippen. Auch könnte ich mir vorstellen, dass eine separate Modellierung für Offensive und Defensive genauere Torprognosen, und damit auch bessere Endprognosen, liefern könnte. Sehr viel besser kann man die Frage der Prognostizierbarkeit von Fußballspielen aber sicher in Ligawettbewerben wie der Bundesliga beantworten.
PS: Ein Beispiel für eine Methode zur Berechnung der Stärke einzelner Spieler beschreibt die Webseite www.goalimpact.com, die die Tordifferenz einer Mannschaft (auf Minutenbasis) in Abhängig von der Aufstellung analysiert. Die genauen Details des Algorithmus sind leider nicht veröffentlicht, aber in der Beschreibung heißt es, dass hier, unter Berücksichtigung von Gegner, Mitspielern und Heimvorteil, die durchschnittliche Tordifferenz einer Mannschaft mit oder ohne Einsatz eines Spielers berechnet, wobei auch Einwechselspieler berücksichtigt werden. Ein interessanter Ansatz, ich bin gespannt zu sehen, ob man mit solchen Ansätzen bessere Prognosen erhalten kann.
Prognosen und Studien im Text:
Commerzbank Economic Research. Economic Insight - Das schöne Spiel: Die Ökonomie der Fußball WM 2014. 4. Juni 2014.
Fivethirtyeight.com. It’s Brazil’s World Cup to Lose.
Gerhards, Jürgen, Michael Mutz, and Gert G. Wagner. Spannung bis zum Abpfiff – Die Prognose des Fußballweltmeisters ist schwieriger als bei der letzten WM. DIW Wochenbericht 24/2014.
Goldman Sachs. The World Cup and Economics 2014.












