← Alle Abbildungen

Tabelle Tabelle 1 Aus der Forschung

Was das Nachprüfen mit publizierten Zahlen getan hat, je Feld

Fünf Felder, vier verschiedene Größen, keine gemeinsame Skala. Wer Ihnen einen einheitlichen Korrekturfaktor verkauft, hat eine Statistik aus fremden Bedingungen gebaut.

FeldWas getan wurdeWas mit den publizierten Zahlen geschahWelche Größe das ist
Psychologie: 100 Studien, drei JournaleNachgemessen mit hoher Power und, wo verfügbar, OriginalmaterialienReplikationseffekte im Schnitt halb so groß wie die Originale; 97 Prozent der Originale signifikant. Von den Replikationen: 36 Prozent signifikant, 47 Prozent der Originaleffekte im 95-Prozent-Konfidenzintervall der Replikation, 39 Prozent als repliziert eingestuft, 68 Prozent signifikant bei kombinierter EvidenzEffektstärken-Verhältnis plus vier Erfolgsmaße – die Autoren berichten bewusst vier, damit kein Einzelurteil existiert
Laborökonomie: 18 Studien, zwei SpitzenjournaleNachgemessen mit mindestens 90 Prozent Power, nach vorab festgelegten PlänenReplizierte Effektstärken im Schnitt 66 Prozent des Originals; 61 Prozent signifikant in der Originalrichtung; vier weitere Replikationsindikatoren: 67 bis 78 ProzentEffektstärken-Verhältnis und Bestehensquoten – Schwund unter Idealbedingungen, an denen fast nichts verändert wurde
Die meistzitierte klinische Forschung: 49 untersuchte StudienGegen spätere, größere oder besser kontrollierte Studien gehaltenVon den 45, die der Aufsatz zählt: 7 widerlegt (16 Prozent), 7 anfangs stärker als das, was folgte (16 Prozent), 20 repliziert (44 Prozent), 11 nie ernsthaft nachgeprüft (24 Prozent)Urteilszählung über berühmte Befunde – ausgewählt nach Ruhm, keine Basisrate. Die meisten wurden nie umgestoßen
Präklinische KrebsforschungUnabhängige Wiederholung publizierter ExperimenteMedianer Replikationseffekt 85 Prozent kleiner als das Original; 92 Prozent der Replikationseffekte fielen kleiner ausDas Extrem der Spannweite, im Feld, das kommerziellen Lesern am fernsten liegt
Nudges: publizierte Stichprobe gegen PraxisVollzählung der 126 Studien zweier US-Einheiten, gegen eine Stichprobe aus zwei Metaanalysen8,7 Prozentpunkte in der publizierten Stichprobe; 1,4 über alles Durchgeführte; rund 70 Prozent der Lücke werden selektiver Publikation bei geringer Power zugeschriebenEine selektierte Stichprobe gegen einen ehrlichen Nenner – kein Abschlagsfaktor

Bei breiten Tabellen horizontal wischen oder scrollen.

Zitieren Einbetten

Referenz & Evidenz

Quelle: Open Science Collaboration (2015), Science 349(6251), aac4716, Abstract; Camerer et al. (2016), Science 351(6280), 1433–1436, Abstract; Ioannidis (2005), JAMA 294(2), 218–228; Errington et al. (2021), eLife 10:e71601; DellaVigna & Linos (2020), NBER Working Paper No. 27594, Abstract. Jede Zeile berichtet eine andere Größe; eine gemeinsame Skala existiert nicht – genau das ist der Befund.

Jede Zeile ist eine geprüfte Aussage aus dem Prüfregister des Journals, beim Build aus dem Register aufgelöst. Das Register wird auf Englisch geführt.

  • B Ninety-seven percent of the originals were significant: "ninety sevenpercent of original studies had significant results p 05", against "thirty six percent of replications" Open Science Collaboration (2015), abstract · OSC15-C1
  • B The headline, verbatim: "Replication effects were half the magnitude of original effects", over a set the authors describe as "We conducted replications of 100 experimental and correlational studies published in three psychology journals" Open Science Collaboration (2015), abstract · OSC15-C2
  • B The original-side figure in the abstract's own words: "Ninety-seven percent of original studies had statistically significant results" Open Science Collaboration (2015), abstract · OSC15-C3
  • B Four measures, not one, and they disagree: "thirty six percent of replications had significant results", "47 of original effect sizes were in the 95 confidence interval of the replication effect size", "39 of effects were subjectively rated to have replicated the original result", and combining both "left 68 with statistically significant effects" Open Science Collaboration (2015), abstract · OSC15-C4
  • B The average replicated size, in the authors' words: "on average, the replicated effect size is 66% of the original", in a set where "we replicated 18 studies published in the American Economic Review and the Quarterly Journal of Economics between 2011 and 2014" Camerer et al. (2016), abstract · CAMERER16-C1
  • B The direction test, verbatim: "We found a significant effect in the same direction as in the original study for 11 replications (61%)" Camerer et al. (2016), abstract · CAMERER16-C2
  • B The design, and it is the reason the result carries: "they all have a statistical power of at least 90% to detect the original effect size at the 5% significance level" Camerer et al. (2016), abstract · CAMERER16-C3
  • B The other indicators, in the abstract's own words: "The replicability rate varies between 67% and 78% for four additional replicability indicators" Camerer et al. (2016), abstract · CAMERER16-C4
  • B The counts, verbatim from the abstract: "Of 49 highly cited original clinical research studies, 45 claimed that the inter"vention was effective, of which "7 (16%) were contradicted by subsequent studies, 7 others (16%) had found effects that were stronger than those of subsequent studies", while 20 "(44%) were replicated, and 11 (24%) remained largely unchallenged" Ioannidis (2005), JAMA abstract and results · IOANNIDIS05J-C1
  • B The design contrast, verbatim: five of six highly "cited nonrandomized studies had been contradicted or had found stronger effects vs 9 of 39 randomized controlled trials" Ioannidis (2005), JAMA abstract and results · IOANNIDIS05J-C2
  • A The size comparison, verbatim: "the median effect size in the replications was 85% smaller than the median effect size in the original experiments" Errington et al. (2021), eLife, results · ERRINGTON21-C1
  • A The direction of nearly all of them: "92% of replication effect sizes were smaller than the original" Errington et al. (2021), eLife, results · ERRINGTON21-C2
  • A The published-sample figure, verbatim: "an 8.7 percentage point take-up effect, which is a 33.4% increase over the average control", where "the average impact of a nudge is very large" DellaVigna & Linos (2022), Econometrica 90(1), 81–116, abstract · DELLAVIGNA22-C1
  • A The decomposition, verbatim: "selective publication in the Academic Journals sample, exacerbated by low statistical power, explains about 70 percent of the difference in effect sizes between the two samples. Different nudge characteristics account for most of the residual difference." A model result, never a raw measurement DellaVigna & Linos (2022), Econometrica 90(1), 81–116, abstract · DELLAVIGNA22-C2
  • A The at-scale average, verbatim: "still sizable and highly statistically significant, but smaller at 1.4 percentage points, an 8.0% increase" DellaVigna & Linos (2022), Econometrica 90(1), 81–116, abstract · DELLAVIGNA22-C3
  • A The census, verbatim: "We assemble a unique data set of 126 RCTs covering 23 million individuals, including all trials run by two of the largest Nudge Units in the United States" DellaVigna & Linos (2022), Econometrica 90(1), 81–116, abstract · DELLAVIGNA22-C4

Prüfgrade: A, gegen die gedruckte Seite der Primärquelle geprüft · B, Primärquelle, nur Textebene · C, belastbare Sekundärquelle · D, berichtet.