Methodik & Transparenz
Wie wir Evidenz bewerten
Dieses Portal trennt bewusst drei Dinge voneinander: den Typ einer Quelle, die Sicherheit einer konkreten Fachaussage und das klinische Risiko des Inhalts. Eine hochrangige Studienart garantiert nicht automatisch eine hohe Aussage-Sicherheit; umgekehrt kann ein Konsensusdokument für eine Definition maßgeblich sein, obwohl es keine Interventionsstudie ist.
1. Evidenzklasse A–F: Was für eine Quelle liegt vor?
Die Evidenzklasse beschreibt primär Studiendesign und Quellenart. Sie ist eine interne Orientierung, angelehnt an etablierte Evidenzhierarchien wie die JBI Levels of Evidence. JBI weist ausdrücklich darauf hin, dass eine solche Hierarchie die kritische Bewertung und klinische Einordnung nicht ersetzt.
| Klasse | Quellenart | Typische Beispiele |
|---|---|---|
| A | Systematische Evidenzsynthese oder evidenzbasierte Leitlinie mit strukturierter Recherche und Bewertung | Systematischer Review, Meta-Analyse, evidenzbasierte Leitlinie |
| B | Randomisierte oder robuste prospektiv kontrollierte Interventionsstudie | RCT, kontrollierte prospektive Studie |
| C | Prospektive Beobachtungsstudie oder nicht randomisierte kontrollierte Studie | Kohortenstudie, kontrollierte Beobachtungsstudie |
| D | Retrospektive, querschnittliche oder deskriptive Beobachtungsdaten | Querschnitt, Fall-Kontroll-Studie, Fallserie |
| E | Konsensus, narrative Fachübersicht oder fachliches Diskussionspapier | S2k-Konsensusleitlinie, Rome-Konsensus, narrativer Review |
| F | Nicht systematisch geprüfte oder indirekte Sekundärquelle | Meinungsbeitrag, Hypothesenpapier, nicht fachbegutachtete Webquelle |
Wichtig: Klasse A bedeutet nicht automatisch „Aussage bewiesen“. Eine Meta-Analyse kann ausschließlich schwache oder stark biasgefährdete Beobachtungsstudien zusammenfassen. Ebenso kann eine Klasse-E-Quelle für eine aktuelle diagnostische Definition maßgeblich sein. Die Klasse wird deshalb niemals allein als Qualitätsurteil verwendet.
2. Certainty: Wie sicher ist die konkrete Aussage?
Für Fachaussagen verwenden wir die vier Stufen hoch, moderat, niedrig und sehr niedrig; wenn eine belastbare Bewertung nicht möglich ist, bleibt die Einstufung unklar. Die Logik ist an GRADE angelehnt. Berücksichtigt werden insbesondere Risiko für Bias, Inkonsistenz, Indirektheit, statistische Unpräzision und Publikationsbias. Wo sinnvoll, werden außerdem große Effekte, Dosis-Wirkungs-Beziehungen und plausible Restkonfundierung berücksichtigt.
Wir bezeichnen diese portalinterne Bewertung ausdrücklich als GRADE-inspiriert, nicht als formale GRADE-Bewertung, sofern nicht eine vollständige outcome-spezifische GRADE-Aufarbeitung durchgeführt wurde. GRADE bewertet die Sicherheit grundsätzlich auf Ebene eines Evidenzkörpers zu einem konkreten Outcome, nicht als pauschales Qualitätslabel für eine einzelne Studie.
3. Risikoklassen R0–R4: Wie streng muss geprüft werden?
| Klasse | Bedeutung | Review-Gate |
|---|---|---|
| R0 | Rein beschreibend, terminologisch oder organisatorisch | Redaktionelle Prüfung |
| R1 | Geringe klinische Relevanz; keine diagnostische oder therapeutische Empfehlung | Quellen- und Evidenzcheck vor Veröffentlichung |
| R2 | Gesundheitlich relevante Aussage oder praktische Empfehlung | Evidenzcheck; klinische Prüfung erforderlich, wenn Handlung, Diagnostik oder Behandlung berührt werden |
| R3 | Klinisch sensible Aussage, Differenzialdiagnostik oder relevante Abgrenzung | Fachliche/klinische Prüfung verpflichtend |
| R4 | Sicherheitskritischer Inhalt oder Red Flag | Fachliche/klinische Prüfung verpflichtend; aktuelle Primärleitlinie oder gleichwertige Referenz erforderlich |
4. Formulierungsregeln
- Assoziation ist keine Kausalität. Beobachtungsdaten werden als Zusammenhang beschrieben, nicht als Beweis einer Wirkung.
- „Kein signifikanter Unterschied“ ist nicht automatisch „kein Effekt“. Konfidenzintervalle und Präzision werden mitgedacht.
- Population und Zeitraum bleiben sichtbar. Daten aus älteren Kindern werden nicht ohne Begründung auf Neugeborene übertragen.
- Definition und Wirksamkeit werden getrennt. Ein Konsensus kann eine Definition festlegen, ohne einen gesundheitlichen Nutzen zu beweisen.
- Unsicherheit wird ausdrücklich genannt. Fehlende Evidenz wird nicht in eine Empfehlung umgedeutet.
- Produkt- und Interessenkonflikte werden transparent dokumentiert.
5. Review- und Aktualisierungslogik
Jeder Fachartikel besitzt einen Review-Status, ein Datum der letzten Prüfung und – abhängig vom Risiko – ein nächstes Prüfdatum. Als maximale interne Intervalle gelten derzeit: R0/R1 bis 24 Monate, R2 bis 12 Monate, R3/R4 bis 6 Monate. Neue Leitlinien, neue diagnostische Kriterien oder für eine Kernaussage relevante neue Studien lösen unabhängig davon eine vorgezogene Prüfung aus.
Methodische Referenzen
- GRADE Working Group – Certainty of Evidence und Bewertungsdomänen.
- GRADE Book: Overview of the GRADE approach – aktualisierte methodische Übersicht.
- JBI Levels of Evidence – Einordnung von Studiendesigns und ausdrücklicher Hinweis, dass Hierarchien kritische Bewertung nicht ersetzen.
Stand dieser Methodik: 27. September 2026. Die Systematik wird weiterentwickelt, wenn sich der wissenschaftliche Standard oder die Anforderungen des Portals ändern.