Methodik & Transparenz

Wie wir Evidenz bewerten

Dieses Portal trennt bewusst drei Dinge voneinander: den Typ einer Quelle, die Sicherheit einer konkreten Fachaussage und das klinische Risiko des Inhalts. Eine hochrangige Studienart garantiert nicht automatisch eine hohe Aussage-Sicherheit; umgekehrt kann ein Konsensusdokument für eine Definition maßgeblich sein, obwohl es keine Interventionsstudie ist.

1. Evidenzklasse A–F: Was für eine Quelle liegt vor?

Die Evidenzklasse beschreibt primär Studiendesign und Quellenart. Sie ist eine interne Orientierung, angelehnt an etablierte Evidenzhierarchien wie die JBI Levels of Evidence. JBI weist ausdrücklich darauf hin, dass eine solche Hierarchie die kritische Bewertung und klinische Einordnung nicht ersetzt.

KlasseQuellenartTypische Beispiele
ASystematische Evidenzsynthese oder evidenzbasierte Leitlinie mit strukturierter Recherche und BewertungSystematischer Review, Meta-Analyse, evidenzbasierte Leitlinie
BRandomisierte oder robuste prospektiv kontrollierte InterventionsstudieRCT, kontrollierte prospektive Studie
CProspektive Beobachtungsstudie oder nicht randomisierte kontrollierte StudieKohortenstudie, kontrollierte Beobachtungsstudie
DRetrospektive, querschnittliche oder deskriptive BeobachtungsdatenQuerschnitt, Fall-Kontroll-Studie, Fallserie
EKonsensus, narrative Fachübersicht oder fachliches DiskussionspapierS2k-Konsensusleitlinie, Rome-Konsensus, narrativer Review
FNicht systematisch geprüfte oder indirekte SekundärquelleMeinungsbeitrag, Hypothesenpapier, nicht fachbegutachtete Webquelle

Wichtig: Klasse A bedeutet nicht automatisch „Aussage bewiesen“. Eine Meta-Analyse kann ausschließlich schwache oder stark biasgefährdete Beobachtungsstudien zusammenfassen. Ebenso kann eine Klasse-E-Quelle für eine aktuelle diagnostische Definition maßgeblich sein. Die Klasse wird deshalb niemals allein als Qualitätsurteil verwendet.

2. Certainty: Wie sicher ist die konkrete Aussage?

Für Fachaussagen verwenden wir die vier Stufen hoch, moderat, niedrig und sehr niedrig; wenn eine belastbare Bewertung nicht möglich ist, bleibt die Einstufung unklar. Die Logik ist an GRADE angelehnt. Berücksichtigt werden insbesondere Risiko für Bias, Inkonsistenz, Indirektheit, statistische Unpräzision und Publikationsbias. Wo sinnvoll, werden außerdem große Effekte, Dosis-Wirkungs-Beziehungen und plausible Restkonfundierung berücksichtigt.

Wir bezeichnen diese portalinterne Bewertung ausdrücklich als GRADE-inspiriert, nicht als formale GRADE-Bewertung, sofern nicht eine vollständige outcome-spezifische GRADE-Aufarbeitung durchgeführt wurde. GRADE bewertet die Sicherheit grundsätzlich auf Ebene eines Evidenzkörpers zu einem konkreten Outcome, nicht als pauschales Qualitätslabel für eine einzelne Studie.

3. Risikoklassen R0–R4: Wie streng muss geprüft werden?

KlasseBedeutungReview-Gate
R0Rein beschreibend, terminologisch oder organisatorischRedaktionelle Prüfung
R1Geringe klinische Relevanz; keine diagnostische oder therapeutische EmpfehlungQuellen- und Evidenzcheck vor Veröffentlichung
R2Gesundheitlich relevante Aussage oder praktische EmpfehlungEvidenzcheck; klinische Prüfung erforderlich, wenn Handlung, Diagnostik oder Behandlung berührt werden
R3Klinisch sensible Aussage, Differenzialdiagnostik oder relevante AbgrenzungFachliche/klinische Prüfung verpflichtend
R4Sicherheitskritischer Inhalt oder Red FlagFachliche/klinische Prüfung verpflichtend; aktuelle Primärleitlinie oder gleichwertige Referenz erforderlich

4. Formulierungsregeln

  • Assoziation ist keine Kausalität. Beobachtungsdaten werden als Zusammenhang beschrieben, nicht als Beweis einer Wirkung.
  • „Kein signifikanter Unterschied“ ist nicht automatisch „kein Effekt“. Konfidenzintervalle und Präzision werden mitgedacht.
  • Population und Zeitraum bleiben sichtbar. Daten aus älteren Kindern werden nicht ohne Begründung auf Neugeborene übertragen.
  • Definition und Wirksamkeit werden getrennt. Ein Konsensus kann eine Definition festlegen, ohne einen gesundheitlichen Nutzen zu beweisen.
  • Unsicherheit wird ausdrücklich genannt. Fehlende Evidenz wird nicht in eine Empfehlung umgedeutet.
  • Produkt- und Interessenkonflikte werden transparent dokumentiert.

5. Review- und Aktualisierungslogik

Jeder Fachartikel besitzt einen Review-Status, ein Datum der letzten Prüfung und – abhängig vom Risiko – ein nächstes Prüfdatum. Als maximale interne Intervalle gelten derzeit: R0/R1 bis 24 Monate, R2 bis 12 Monate, R3/R4 bis 6 Monate. Neue Leitlinien, neue diagnostische Kriterien oder für eine Kernaussage relevante neue Studien lösen unabhängig davon eine vorgezogene Prüfung aus.

Methodische Referenzen

Stand dieser Methodik: 27. September 2026. Die Systematik wird weiterentwickelt, wenn sich der wissenschaftliche Standard oder die Anforderungen des Portals ändern.