Was das Nachprüfen mit publizierten Zahlen getan hat, je Feld
Fünf Felder, vier verschiedene Größen, keine gemeinsame Skala. Wer Ihnen einen einheitlichen Korrekturfaktor verkauft, hat eine Statistik aus fremden Bedingungen gebaut.
| Feld | Was getan wurde | Was mit den publizierten Zahlen geschah | Welche Größe das ist |
|---|---|---|---|
| Psychologie: 100 Studien, drei Journale | Nachgemessen mit hoher Power und, wo verfügbar, Originalmaterialien | Replikationseffekte im Schnitt halb so groß wie die Originale; 97 Prozent der Originale signifikant. Von den Replikationen: 36 Prozent signifikant, 47 Prozent der Originaleffekte im 95-Prozent-Konfidenzintervall der Replikation, 39 Prozent als repliziert eingestuft, 68 Prozent signifikant bei kombinierter Evidenz | Effektstärken-Verhältnis plus vier Erfolgsmaße – die Autoren berichten bewusst vier, damit kein Einzelurteil existiert |
| Laborökonomie: 18 Studien, zwei Spitzenjournale | Nachgemessen mit mindestens 90 Prozent Power, nach vorab festgelegten Plänen | Replizierte Effektstärken im Schnitt 66 Prozent des Originals; 61 Prozent signifikant in der Originalrichtung; vier weitere Replikationsindikatoren: 67 bis 78 Prozent | Effektstärken-Verhältnis und Bestehensquoten – Schwund unter Idealbedingungen, an denen fast nichts verändert wurde |
| Die meistzitierte klinische Forschung: 49 untersuchte Studien | Gegen spätere, größere oder besser kontrollierte Studien gehalten | Von den 45, die der Aufsatz zählt: 7 widerlegt (16 Prozent), 7 anfangs stärker als das, was folgte (16 Prozent), 20 repliziert (44 Prozent), 11 nie ernsthaft nachgeprüft (24 Prozent) | Urteilszählung über berühmte Befunde – ausgewählt nach Ruhm, keine Basisrate. Die meisten wurden nie umgestoßen |
| Präklinische Krebsforschung | Unabhängige Wiederholung publizierter Experimente | Medianer Replikationseffekt 85 Prozent kleiner als das Original; 92 Prozent der Replikationseffekte fielen kleiner aus | Das Extrem der Spannweite, im Feld, das kommerziellen Lesern am fernsten liegt |
| Nudges: publizierte Stichprobe gegen Praxis | Vollzählung der 126 Studien zweier US-Einheiten, gegen eine Stichprobe aus zwei Metaanalysen | 8,7 Prozentpunkte in der publizierten Stichprobe; 1,4 über alles Durchgeführte; rund 70 Prozent der Lücke werden selektiver Publikation bei geringer Power zugeschrieben | Eine selektierte Stichprobe gegen einen ehrlichen Nenner – kein Abschlagsfaktor |
Bei breiten Tabellen horizontal wischen oder scrollen.
Referenz & Evidenz
Quelle: Open Science Collaboration (2015), Science 349(6251), aac4716, Abstract; Camerer et al. (2016), Science 351(6280), 1433–1436, Abstract; Ioannidis (2005), JAMA 294(2), 218–228; Errington et al. (2021), eLife 10:e71601; DellaVigna & Linos (2020), NBER Working Paper No. 27594, Abstract. Jede Zeile berichtet eine andere Größe; eine gemeinsame Skala existiert nicht – genau das ist der Befund.
Jede Zeile ist eine geprüfte Aussage aus dem Prüfregister des Journals, beim Build aus dem Register aufgelöst. Das Register wird auf Englisch geführt.
- B Ninety-seven percent of the originals were significant: "ninety sevenpercent of original studies had significant results p 05", against "thirty six percent of replications" Open Science Collaboration (2015), abstract ·
OSC15-C1 - B The headline, verbatim: "Replication effects were half the magnitude of original effects", over a set the authors describe as "We conducted replications of 100 experimental and correlational studies published in three psychology journals" Open Science Collaboration (2015), abstract ·
OSC15-C2 - B The original-side figure in the abstract's own words: "Ninety-seven percent of original studies had statistically significant results" Open Science Collaboration (2015), abstract ·
OSC15-C3 - B Four measures, not one, and they disagree: "thirty six percent of replications had significant results", "47 of original effect sizes were in the 95 confidence interval of the replication effect size", "39 of effects were subjectively rated to have replicated the original result", and combining both "left 68 with statistically significant effects" Open Science Collaboration (2015), abstract ·
OSC15-C4 - B The average replicated size, in the authors' words: "on average, the replicated effect size is 66% of the original", in a set where "we replicated 18 studies published in the American Economic Review and the Quarterly Journal of Economics between 2011 and 2014" Camerer et al. (2016), abstract ·
CAMERER16-C1 - B The direction test, verbatim: "We found a significant effect in the same direction as in the original study for 11 replications (61%)" Camerer et al. (2016), abstract ·
CAMERER16-C2 - B The design, and it is the reason the result carries: "they all have a statistical power of at least 90% to detect the original effect size at the 5% significance level" Camerer et al. (2016), abstract ·
CAMERER16-C3 - B The other indicators, in the abstract's own words: "The replicability rate varies between 67% and 78% for four additional replicability indicators" Camerer et al. (2016), abstract ·
CAMERER16-C4 - B The counts, verbatim from the abstract: "Of 49 highly cited original clinical research studies, 45 claimed that the inter"vention was effective, of which "7 (16%) were contradicted by subsequent studies, 7 others (16%) had found effects that were stronger than those of subsequent studies", while 20 "(44%) were replicated, and 11 (24%) remained largely unchallenged" Ioannidis (2005), JAMA abstract and results ·
IOANNIDIS05J-C1 - B The design contrast, verbatim: five of six highly "cited nonrandomized studies had been contradicted or had found stronger effects vs 9 of 39 randomized controlled trials" Ioannidis (2005), JAMA abstract and results ·
IOANNIDIS05J-C2 - A The size comparison, verbatim: "the median effect size in the replications was 85% smaller than the median effect size in the original experiments" Errington et al. (2021), eLife, results ·
ERRINGTON21-C1 - A The direction of nearly all of them: "92% of replication effect sizes were smaller than the original" Errington et al. (2021), eLife, results ·
ERRINGTON21-C2 - A The published-sample figure, verbatim: "an 8.7 percentage point take-up effect, which is a 33.4% increase over the average control", where "the average impact of a nudge is very large" DellaVigna & Linos (2022), Econometrica 90(1), 81–116, abstract ·
DELLAVIGNA22-C1 - A The decomposition, verbatim: "selective publication in the Academic Journals sample, exacerbated by low statistical power, explains about 70 percent of the difference in effect sizes between the two samples. Different nudge characteristics account for most of the residual difference." A model result, never a raw measurement DellaVigna & Linos (2022), Econometrica 90(1), 81–116, abstract ·
DELLAVIGNA22-C2 - A The at-scale average, verbatim: "still sizable and highly statistically significant, but smaller at 1.4 percentage points, an 8.0% increase" DellaVigna & Linos (2022), Econometrica 90(1), 81–116, abstract ·
DELLAVIGNA22-C3 - A The census, verbatim: "We assemble a unique data set of 126 RCTs covering 23 million individuals, including all trials run by two of the largest Nudge Units in the United States" DellaVigna & Linos (2022), Econometrica 90(1), 81–116, abstract ·
DELLAVIGNA22-C4
Prüfgrade: A, gegen die gedruckte Seite der Primärquelle geprüft · B, Primärquelle, nur Textebene · C, belastbare Sekundärquelle · D, berichtet.
Verwandte Abbildungen
-
Spezifikationsblatt für kausale Aussagen
Aus dem Beitrag Ein Uplift braucht zuerst eine Spezifikation
-
Das synthetische Rekonstruktions-Arbeitsblatt
Aus dem Beitrag Was ist Reproduzierbarkeit? Kann eine andere Person das Ergebnis rekonstruieren?
-
Drei Fragen, bevor eine Zahl in die Entscheidung einzieht
Aus dem Beitrag Evidenz statt Anekdote – was eine Zahl überstanden haben muss.