Dies ist die Ergänzung zu unserer Methode der Evidenzbewertung. Die andere Seite erklärt die Stufen, die wir jeder Aussage zuordnen; diese hier gibt Ihnen die Werkzeuge an die Hand, um jede Studie – einschließlich unserer eigenen – zu überprüfen.
Sie benötigen keine Statistikkenntnisse, um dies gut zu machen. Die meisten relevanten Fehler stammen von einer kleinen Anzahl von Vorgehensweisen, die leicht erkennbar sind, sobald jemand darauf hinweist.
Eine Studie beschreibt, was einer bestimmten Gruppe von Menschen widerfuhr, auf eine bestimmte Weise gemessen, von Forschenden mit bestimmten Fragen und bestimmten Geldgebern. Eine gut zu lesen läuft auf vier Fragen hinaus: wer daran teilnahm, was tatsächlich gemessen wurde, wie sicher die Zahlen sind, und ob die genannte Schlussfolgerung zum zugrunde liegenden Befund passt. Dieselben vier funktionieren bei fast allem, von einer zweizeiligen Pressemitteilung bis zu einem 30-seitigen Fachartikel.
Wir bewerten jede Behauptung auf dieser Seite mit einem von vier Labels: Stark, Mäßig, Aufkommend oder Vorläufig, dargelegt in wie wir Evidenz bewerten. Die untenstehenden Werkzeuge sind, wie Sie die Studie hinter jedem Label prüfen, unsere eingeschlossen.
Die Evidenzleiter
Das Design einer Studie sagt Ihnen ungefähr, wie sehr Sie ihr vertrauen sollten, bevor Sie auch nur eine einzige Zahl lesen. Fünf grobe Designs sitzen auf einer Leiter, vom schwächsten unten bis zum stärksten oben.
Unten steht der Fallbericht, oder eine Fallserie einer Handvoll Patientinnen und Patienten: eine Person, die eine Behandlung erhielt und der es gut oder schlecht erging. Das ist eine Anekdote. Sie kann eine Frage aufwerfen, die eine Studie wert ist. Sie kann keine klären, weil es niemanden gibt, mit dem man die Patientin oder den Patienten vergleichen könnte.
Als Nächstes kommen Beobachtungsstudien, bei denen Forschende Menschen beobachten, die etwas bereits tun oder nicht tun. Eine Querschnittsbefragung ist eine Momentaufnahme eines Zeitpunkts. Eine Fall-Kontroll-Studie beginnt bei Menschen, die ein Ergebnis haben, und blickt zurück. Eine Kohortenstudie verfolgt eine Gruppe vorwärts, manchmal über 10 oder 20 Jahre. Diese können zeigen, dass zwei Messgrößen gemeinsam steigen und fallen, wie stark messen, und einen Dosis-Wirkungs-Zusammenhang aufzeigen. Sie können nicht zeigen, dass das eine das andere verursacht hat, weil sich die Menschen, die die Sache tun, von jenen, die es nicht tun, in hundert anderen Dingen unterscheiden.
Die randomisierte kontrollierte Studie ist das Werkzeug, das gebaut wurde, um Confounding zu beheben. Menschen per Zufall Behandlung oder Kontrolle zuzuteilen macht die beiden Gruppen im Schnitt gleich, bekannte Faktoren wie unbekannte gleichermaßen, sodass ein anschließender Unterschied vernünftigerweise der Behandlung zugeschrieben werden kann. Verblindung, bei der weder Patientin oder Patient noch die bewertende Person wissen, wer was erhielt, verhindert, dass Erwartung das Ergebnis formt.
Oben sammelt eine systematische Übersichtsarbeit jede Studie zu einer Frage und bewertet sie zusammen; eine Metaanalyse poolt ihre Zahlen zu einer Schätzung. Gut gemacht ist das das Zuverlässigste, was wir haben. Auf einem Haufen schwacher Studien gemacht, ist es ein ordentlicher Durchschnitt schwacher Studien, nicht stärker als das, was hineinging.
Die Leiter gibt Ihnen einen Ausgangswert und nicht mehr. Eine große, saubere Kohorte kann eine kleine, schlampige randomisierte Studie mit 30 Menschen überwiegen. Das Design setzt Ihre Erwartung; die Methoden sagen Ihnen, ob eine Studie ihr gerecht wird.
Korrelation ist nicht Ursache
Jahrelang schien Kaffeetrinken mit Lungenkrebs verbunden, bis Forschende bemerkten, dass die Kaffeetrinkerinnen und -trinker jener Zeit auch weit mehr rauchten. Das ist der Fehler hinter den meisten schlechten Gesundheitsschlagzeilen, und er hat zwei Formen.
Die erste ist Confounding, bei dem ein dritter Faktor beide Dinge zugleich antreibt. Eisverkäufe und Ertrinkungsfälle steigen nur gemeinsam, weil beide im Sommer zunehmen. Hormontherapie ist die teure Version: Jahrelang wirkte sie in Beobachtungsdaten herzschützend, weil die Frauen, die sie nahmen, von vornherein gesünder und wohlhabender waren, ein Muster namens Healthy-User-Bias. Die anschließenden randomisierten Studien fanden überhaupt keinen Schutz.
Die zweite Form ist umgekehrte Kausalität, bei der der Pfeil in die andere Richtung zeigt. Menschen in frühen Krankheitsstadien bewegen sich oft weniger, sodass „Sitzen ist mit Krankheit verbunden“ die Krankheit sein kann, die das Sitzen verursacht, mit umgekehrtem wahren Pfeil.
Randomisierung durchbricht beide Fallen, weshalb die Leiter Studien über Kohorten stellt. Aber bei vielen wichtigen Fragen sind Beobachtungsdaten alles, was es je geben wird, weil es grausam oder unmöglich wäre, Menschen zu randomisieren. Vier Anzeichen machen dann eine kausale Lesart glaubwürdiger: ein klarer Dosis-Wirkungs-Zusammenhang, die Ursache, die vor der Wirkung eintrifft, ein plausibler biologischer Mechanismus und dasselbe Ergebnis, das über verschiedene Populationen hinweg auftaucht. Keines allein ist entscheidend. Zusammen ist das, wie sorgfältige Menschen über Ursachen nachdenken, die sie nicht randomisieren können.
Relatives versus absolutes Risiko
Eine Zahl irrt mehr Lesende in die Irre als jede andere auf einer Gesundheitsseite: eine Risikoreduktion, die ohne ihre Basislinie berichtet wird. Nehmen Sie ein Medikament, das Ihr Risiko für ein bestimmtes Ereignis über ein Jahr von 2 von 1,000 auf 1 von 1,000 senkt. Dasselbe Ergebnis kann auf zwei Arten geschrieben werden:
- Als relative Risikoreduktion: Das Medikament halbiert Ihr Risiko, eine Reduktion um 50 %.
- Als absolute Risikoreduktion: Ihr Risiko sinkt um 1 von 1,000, oder 0.1 Prozentpunkte.
Ein dritter Weg sagt dasselbe klarer: die Number Needed to Treat, hier 1,000. Tausend Menschen nehmen das Medikament ein Jahr lang, damit einer von ihnen das Ereignis vermeidet; die anderen 999 bekommen nur die Nebenwirkungen und die Rechnung. Ihr Spiegelbild ist die Number Needed to Harm.
Relative Zahlen sind unvollständig, weil sie das Ausgangsrisiko verbergen. Ein 50%iger Rückgang von einer winzigen Basislinie ist eine winzige Veränderung; ein 50%iger Rückgang von einer großen Basislinie ist eine große.
Wenn Sie eine Prozentreduktion sehen, stellen Sie jedes Mal zwei Fragen: Reduktion von welcher Basislinie aus, und wie sieht die Veränderung in schlichten Zahlen aus?
Statistische versus reale Bedeutsamkeit
Der p-Wert beantwortet eine enge Frage, und Lesende verwechseln ihn routinemäßig mit einer größeren. Wenn die Behandlung wirklich nichts bewirkte, wie oft würde ein mindestens so extremes Ergebnis rein durch Zufall auftauchen, das ist alles, was er berichtet. Ein p unter 0.05 ist eine Konvention, eine Linie, die jemand gezogen hat, keine Wahrheitsschwelle. Er gibt nicht die Wahrscheinlichkeit an, dass der Befund echt ist oder dass die Hypothese stimmt. Eine Studie kann 0.05 unterschreiten und trotzdem ein Zufallstreffer sein, besonders eine kleine, die viele Dinge maß und das einzige Ergebnis berichtete, das die Linie überschritt.
Das Konfidenzintervall ist nützlicher, weil es die gesamte Spanne der Effekte zeigt, mit denen die Daten vereinbar sind. Ein enges Intervall bedeutet eine präzise Schätzung; ein weites Intervall bedeutet, dass die Studie Ihnen wenig sagen kann. Wenn das Intervall „keinen Effekt“ einschließt, bleibt das Ergebnis unsicher, egal wie der p-Wert ausfällt. Bevorzugen Sie jedes Mal das Intervall gegenüber einem nackten p.
Statistische Signifikanz und reale Bedeutsamkeit gehen häufiger getrennte Wege, als Schlagzeilen zugeben. Eine Studie mit 50,000 Menschen kann einen Blutdruckabfall von einem halben Punkt wasserdicht nachweisen, und beides zusammen ist nutzlos, weil keine Patientin und kein Patient einen halben Punkt spüren würde. Ein wirklich nützlicher Effekt kann in die andere Richtung entgleiten, indem er in einer zu kleinen Studie die Signifikanz verfehlt. Dieses Verfehlen spiegelt die Größe der Studie wider; es beweist nicht, dass der Effekt verschwunden ist. Fragen Sie, welche Effektgröße für eine Person tatsächlich zählen würde, und prüfen Sie dann, ob die Studie einen so großen Effekt fand, bevor Sie ihren p-Wert prüfen.
Surrogate versus Endpunkte
Medikamente, die die unregelmäßigen Herzschläge nach einem Herzinfarkt unterdrückten, sollten Leben retten. Schließlich gegen den Tod selbst getestet, erhöhten sie ihn. Der Herzschlag, den sie korrigierten, war ein Surrogat, ein Labormarker, der für den Endpunkt stand, den wirklich jemanden interessiert.
Surrogate sind überall; fünf gängige sind LDL-Cholesterin für Herzinfarkte, Blutdruck für Schlaganfälle, Tumorschrumpfung für Überleben, Knochendichte für Frakturen und HbA1c für die Komplikationen von Diabetes. Sie sind attraktiv, weil sie sich in Wochen bewegen und wenig kosten, wo die echten Endpunkte Jahre brauchen.
Den Marker zu bewegen bewegt nicht immer den Endpunkt, und kann ihn in die falsche Richtung bewegen. Manche Krebsmedikamente schrumpfen einen Tumor auf einem Scan, ohne jemals Menschen länger leben oder sich besser fühlen zu lassen. Wenn also eine Studie ein Surrogat berichtet, behandeln Sie es als vielversprechenden Hinweis, und stellen Sie dann die echte Frage: Hat jemand gemessen, wie es den Patientinnen und Patienten erging, wie lange sie lebten, wie sie sich fühlten, ob die Fraktur oder der Herzinfarkt jemals eintrat?
Wer untersucht wurde, und wer bezahlt hat
Ein Ergebnis, gemessen bei 2,315 finnischen Männern, ist solide für finnische Männer und eine offene Frage für alle anderen. Zwei Studien können identische Zahlen berichten und trotzdem sehr unterschiedliches Vertrauen verdienen, ganz je nach Kleingedrucktem.
Kleine Studien sind verrauscht. Ein dramatisches Ergebnis bei 12 Menschen ist ein Grund, eine größere Studie durchzuführen, kein Grund, Ihr Verhalten zu ändern.
Wer an der Studie teilnahm, entscheidet, für wen die Studie gilt. Ein Befund, gemessen bei jungen gesunden Männern, oder in einem Land, oder über ein enges Altersband, überträgt sich möglicherweise nicht auf Sie. Ein Großteil der Bewegungs- und Physiologieforschung ist stark männerlastig, und diese Schieflage wird unsichtbar, sobald eine einzelne Zahl zitiert und weiterzitiert wird. Deshalb kennzeichnen unsere eigenen Aussagen das Geschlecht, in dem sie gemessen wurden. Übertragbarkeit ist eine Frage, die Sie stellen müssen; eine Studie nennt ihre eigenen Grenzen selten von sich aus.
Eine Studie, die ihren Hauptendpunkt und ihren Analyseplan im Voraus festlegte und dann genau das berichtete, ist weit schwerer zu frisieren als eine, die 10 Dinge maß und Ihnen von den zwei erzählte, die funktionierten. Achten Sie auf ein vorregistriertes Protokoll.
Die veröffentlichten Studien sind eine verzerrte Stichprobe der tatsächlich durchgeführten Studien. Studien, die nichts finden, bleiben oft unveröffentlicht, sodass die veröffentlichte Bilanz positiv verzerrt ist, bevor Sie auch nur ein Wort gelesen haben. Eine systematische Übersichtsarbeit, die über die Fachzeitschriften hinaus Studienregister durchsuchte, ist die teilweise Abhilfe.
Industriefinanzierung disqualifiziert nicht, und viel exzellente Forschung wird von den Unternehmen bezahlt, die das Produkt herstellen. Es ist ein Grund, die Methoden genauer zu lesen, zu prüfen, wer die Endpunkte und die Vergleichsgruppe wählte, und das Ergebnis neben unabhängiger Arbeit abzuwägen.
Ein Ergebnis bei Mäusen, oder bei Zellen in einer Schale, ist ein Grund, eine Studie am Menschen durchzuführen, und nicht mehr. Die meisten Befunde, die bei einer Maus beeindruckend aussehen, reproduzieren sich beim Menschen nie.
Sie können meist verfolgen, wie ein bescheidenes Papier zu einer lauten Schlagzeile wird. Die Schlagzeile kommt aus einer Pressemitteilung, die Pressemitteilung aus dem Abstract, und das Abstract ist oft der schmeichelhafteste Teil des gesamten Dokuments.
The Research & Studies
Everything here is based on the research we have collected and checked, sorted into groups and ordered with the strongest evidence first. Click any claim to open the studies behind it.
Evidence And Methods
Abstracts von etwa 58 % nicht signifikanter Studien lesen sich dennoch positiv
Forschende sammelten 72 Studien, bei denen das Hauptergebnis keine statistische Signifikanz erreichte, das heißt, die Behandlung hatte die Vergleichsgruppe nicht eindeutig übertroffen. Bei den meisten davon war der Abstract, der Teil, den fast jeder liest, dennoch so formuliert, dass es klang, als hätte die Behandlung gewirkt.
Boutron und Kollegen prüften im Dezember 2006 indexierte Studien und identifizierten 72 randomisierte Parallelgruppenstudien mit einem statistisch nicht signifikanten primären Endpunkt. Bewerter klassifizierten Spin, definiert als Berichterstattung, die den Nutzen der Behandlung trotz des nicht signifikanten Ergebnisses betont. Spin trat im Ergebnisabschnitt des Abstracts bei 37.5 % der Berichte auf und im Schlussfolgerungsabschnitt des Abstracts bei 58.3 %, wobei die Schlussfolgerungen im Haupttext ähnlich oder häufiger betroffen waren. Das Abstract ist der Teil, den die meisten Leser sehen, und oft der einzige, sodass eine optimistische Formulierung prägt, wie eine Nullstudie in Erinnerung bleibt.
Who this may not transfer to:This is a finding about how trials get written up, not a health effect, so it applies whenever you read a study, not to any one group of people.
Lesen Sie den primären Endpunkt und dessen Ergebnis, bevor Sie die Schlussfolgerung lesen. Hat sich der vorab festgelegte Hauptendpunkt nicht verändert, die Schlussfolgerung aber optimistisch klingt, stützt sich dieser Satz meist auf einen sekundären Befund oder eine Untergruppe. Vertrauen Sie der Zahl, nicht den Adjektiven.
The study · 1
Boutron et al., reporting and interpretation of randomized trials with statistically nonsignificant results for primary outcomes · JAMA 2010;303(20):2058-64
Fachzeitschriften zeigten 94 % der Antidepressiva-Studien als positiv; die Daten der FDA zeigten 51 %
Aufsichtsbehörden verfügten über die Ergebnisse von 74 Antidepressiva-Studien. Fast jede Studie mit einem guten Ergebnis wurde veröffentlicht, während die meisten Studien mit einem schlechten Ergebnis nie veröffentlicht oder so dargestellt wurden, dass sie besser aussahen, als sie waren. Wer nur die Fachzeitschriften läse, würde denken, fast jede Studie sei erfolgreich gewesen; der vollständige Datensatz zeigte, dass es etwa die Hälfte war.
Turner und Kollegen verglichen 74 zwischen 1987 und 2004 bei der US-amerikanischen Food and Drug Administration registrierte Antidepressiva-Studien mit dem, was in die veröffentlichte Literatur gelangte. Von 38 Studien, die die FDA als positiv einstufte, wurden 37 veröffentlicht. Von 36 Studien mit negativen oder fragwürdigen Ergebnissen wurden 22 gar nicht veröffentlicht, und 11 wurden in einer Form veröffentlicht, die ein positives Ergebnis vermittelte. Der veröffentlichte Datensatz zeigte daher 94 % der Studien als positiv gegenüber 51 % bei der FDA, und die Effektstärken in der Fachliteratur lagen etwa 32 % höher als die des vollständigen FDA-Datensatzes, wobei einzelne Medikamente zwischen 11 % und 69 % überhöht dargestellt wurden.
Who this may not transfer to:This is a finding about which trials reach the published record, not a health effect, so it applies whenever you rely on the literature, not to any one group of people.
Eine einzelne veröffentlichte positive Studie klärt für sich genommen wenig, da die gescheiterten Studien möglicherweise schlicht fehlen. Bevorzugen Sie einen systematischen Review, der Studienregister durchsucht hat, nicht nur Fachzeitschriften, und prüfen Sie, ob der Endpunkt vor Studienbeginn vorregistriert wurde.
The study · 1
Turner et al., selective publication of antidepressant trials and its influence on apparent efficacy · N Engl J Med 2008;358(3):252-60
Die Darstellung als relatives Risiko lässt denselben Nutzen größer erscheinen als das absolute Risiko
Sagt man Menschen, eine Tablette halbiere ihr Risiko, sind sie ihr gegenüber aufgeschlossener, als wenn man ihnen sagt, sie senke ihr Risiko von 2 auf 1,000 auf 1 auf 1,000, obwohl es sich um dieselbe Tatsache handelt. Die größer klingende relative Zahl beeinflusst die Entscheidung stärker.
Covey fasste experimentelle Studien zusammen, die Teilnehmern denselben Behandlungsnutzen in unterschiedlichen numerischen Formaten präsentierten. Die relative Risikoreduktion erzeugte durchgängig höhere Wirksamkeitsbewertungen und eine größere Bereitschaft, eine Behandlung zu nutzen oder zu empfehlen, als die absolute Risikoreduktion oder die Number Needed to Treat, und zwar bei Laien, Studierenden und Ärzten gleichermaßen. Der Befund betrifft, wie ein Format die Wahrnehmung lenkt, nicht welches Format korrekt ist: Die absolute Zahl und die Number Needed to Treat enthalten das Ausgangsrisiko, das die relative Zahl auslässt.
Who this may not transfer to:This is a finding about how risk numbers steer perception, not a health effect, so it applies whenever you meet a percentage reduction, not to any one group of people.
Wenn Sie auf eine prozentuale Reduktion stoßen, fragen Sie jedes Mal zwei Dinge: Reduktion von welchem Ausgangsrisiko, und wie groß ist die Veränderung in einfachen Zahlen. Ist das Ausgangsrisiko klein, kann eine große relative Reduktion eine unbedeutende absolute Reduktion sein.
The study · 1
Covey, a meta-analysis of the effects of presenting treatment benefits in different formats · Med Decis Making 2007;27(5):638-54
Fragen an jede Studie
Führen Sie jede Studie, Schlagzeile oder Pressemitteilung durch dieselben sieben Fragen. Neunzig Sekunden reichen, um sie zu prüfen, und die Antworten sagen Ihnen, ob der Befund einen genaueren Blick verdient.
Häufige Fragen
Was ist die einzige nützlichste Frage, die man zu einer Studie stellen kann?
Ob die untersuchte Gruppe Ihnen ähnelt, und ob das, was gemessen wurde, das ist, was Ihnen wichtig ist. Ein großer Effekt auf einen Surrogatmarker bei Menschen, die Ihnen nicht ähneln, leitet Ihre Entscheidung weniger als ein bescheidener Effekt auf einen echten Endpunkt bei Menschen, die Ihre Situation teilen. Relevanz kommt vor Design und Statistik.
Warum ist „halbiert Ihr Risiko“ irreführend?
Weil es das Ausgangsrisiko verbirgt. Ein Risiko von 2 von 1,000 zu halbieren rettet eine Person pro 1,000 Behandelten; ein Risiko von 1 von 3 zu halbieren ist enorm. Die relative Zahl liest sich in beiden Fällen gleich und sagt Ihnen allein fast nichts. Wandeln Sie sie in die absolute Veränderung um, und wo möglich, in die Number Needed to Treat.
Klärt eine einzelne Studie jemals etwas?
Selten. Ein Befund verdient Vertrauen, wenn er sich über verschiedene Gruppen und verschiedene Forschungsteams hinweg wiederholt. Eine gute systematische Übersichtsarbeit prüft genau das. Eine einzelne Studie, wie groß auch immer, ist ein Datenpunkt. Seien Sie am vorsichtigsten bei einer einzelnen kleinen Studie, die einen großen Bestand früherer Arbeit umstößt; das ist öfter Rauschen als Revolution.
Ist eine Studie an Mäusen oder Zellen wertlos?
Nein, aber sie beantwortet eine andere Frage. Tier- und Laborarbeit ist, wie Forschende Mechanismen finden und entscheiden, was es wert ist, am Menschen getestet zu werden. Sie weist auf eine lohnende Humanstudie hin. Die meisten beeindruckenden Ergebnisse bei Mäusen reproduzieren sich nicht beim Menschen, lesen Sie also „bei Mäusen“ in einer Schlagzeile als Signal, dass die Humanevidenz noch aussteht.
Wie erkenne ich einen echten Befund von einer aufgeblasenen Schlagzeile?
Achten Sie auf die Anzeichen einer Behauptung, die über ihre Evidenz hinausgeht. „Verknüpft mit“ oder „assoziiert mit“ markiert meist Beobachtungsdaten, die keine Ursächlichkeit belegen können. Eine relative Zahl kommt ohne eine absolute daneben. Ein Surrogatmarker wird berichtet, als wäre er ein Endpunkt. Die Stichprobe ist klein. Und „kann“ trägt den gesamten ersten Satz. Wenn sich mehrere dieser Anzeichen in einer Schlagzeile häufen, suchen Sie die Studie und lesen Sie den primären Endpunkt selbst.
Explore Related
Other pages this one connects to, by the evidence they share, the outcomes they touch, and the ground they cover.
All 3 registered claim citations independently checked and cross-referenced.
Thomas Dehli, Founder & Editor, Sacred Lotus
Sacred Lotus has published Chinese medicine reference material since 2001. Integrative pages are held to the same standard as the herb and formula library: cite the source, grade the claim at its real strength, and say where the research has not looked. This page is educational and it is not medical advice. Last updated 10. August 2026.