Mediconomics – für individuelle CRO-Lösungen.

Glossar

False Discovery Rate und k-FWER

False Discovery Rate und k-FWER sind Fehlermaße für Situationen, in denen viele Nullhypothesen gleichzeitig geprüft werden. Die False Discovery Rate begrenzt den erwarteten Anteil fälschlich zurückgewiesener Hypothesen unter allen Zurückweisungen. Die k-FWER begrenzt dagegen die Wahrscheinlichkeit, mindestens k falsche Zurückweisungen zu treffen. Beide erlauben andere Fehlerziele als die familienbezogene Fehlerrate, die bereits einen einzigen Fehlalarm in der gesamten Hypothesenfamilie kontrolliert.

Zwei Fehlerraten mit unterschiedlicher Aussage

Die False Discovery Rate bezieht sich auf die Zusammensetzung der positiven Befunde. Werden zehn Hypothesen zurückgewiesen, beschreibt sie den erwarteten Anteil, der davon falsch positiv ist; bei keiner Zurückweisung wird der zugehörige Anteil definitionsgemäß als null behandelt. Sie ist damit besonders auf eine Liste entdeckter Signale ausgerichtet und nicht auf die Wahrscheinlichkeit eines Fehlers in einer einzelnen Studie insgesamt.

Bei der k-FWER wird vorab festgelegt, wie viele falsche Zurückweisungen noch toleriert werden, bevor ein Fehlerereignis vorliegt. Für k gleich eins entspricht sie der gewöhnlichen FWER. Für ein größeres k kann die Prozedur mehr wahre Effekte entdecken, weil nicht jede einzelne falsche Zurückweisung ausgeschlossen werden muss. Der Wert von k ist daher eine fachliche Festlegung zum Umgang mit mehreren möglichen Fehlalarmen und keine aus den Daten abzuleitende Optimierung.

Einsatz bei breiten Hypothesenfamilien

Bei explorativen Biomarkeranalysen oder umfangreichen Sicherheitsauswertungen entstehen oft große Familien von Fragen, deren Ergebnisse als Signale weiter untersucht werden sollen. Eine FDR- oder k-FWER-Kontrolle kann dort das Verhältnis von Signalfindung und Fehlalarmen strukturieren, ohne jeden einzelnen Fund als endgültigen Wirksamkeitsnachweis zu behandeln. Welche Hypothesen zur Familie gehören, welche Abhängigkeiten vorliegen und welches Verfahren verwendet wird, muss vor der Auswertung definiert werden.

Die Verfahren liefern keine Erlaubnis, aus einer langen Liste statistischer Befunde selektiv klinische Wirksamkeit abzuleiten. Biologische Plausibilität, Messqualität, Vorabdefinition und externe Bestätigung bleiben für einen Biomarker relevant. Bei Sicherheitsdaten ist außerdem zu unterscheiden, ob die Analyse ein unerwartetes Muster erkennen soll oder ob eine konkrete Risikohypothese mit einer eigenen konfirmatorischen Aussage geprüft wird.

Abhängigkeiten zwischen Tests sind für die Auswahl einer konkreten Prozedur wesentlich. Manche FDR-Verfahren setzen bestimmte Abhängigkeitsstrukturen voraus, während die von Lehmann und Romano beschriebenen k-FWER-Ansätze ohne Annahmen über die Abhängigkeit der einzelnen p-Werte konstruiert wurden. Die Stichprobendaten selbst beweisen nicht, dass die für ein gewähltes Korrekturverfahren benötigte Struktur vorliegt.

Abgrenzung: nicht für den konfirmatorischen Primärendpunkt

False Discovery Rate und k-FWER sind weniger streng als die klassische familienbezogene Fehlerrate, sofern mehr als ein Fehler toleriert wird. Sie passen deshalb nicht ohne besondere Rechtfertigung zum konfirmatorischen Primärendpunkt, dessen positive Aussage in der Regel keinen vermeidbaren Fehlalarm zulassen soll. Die EMA-Leitlinie zu Multiplizität betont, dass unzureichende Kontrolle multipler Prüfungen zu nicht gestützten Wirksamkeitsaussagen führen kann.

Auch die beiden Maße sind nicht austauschbar. Eine kontrollierte FDR sagt nichts unmittelbar darüber aus, wie wahrscheinlich mindestens zwei falsche Befunde sind; umgekehrt beschreibt eine k-FWER nicht den erwarteten falschen Anteil innerhalb der gemeldeten Treffer. Der gewählte Maßstab muss daher zur Aussage passen: Priorisierung einer Trefferliste erfordert eine andere Fehlerbeschreibung als das Begrenzen einer bestimmten Anzahl unrichtiger Entscheidungen.

Bedeutung für klinische Studien

In einem Studienprotokoll sollten Hypothesenfamilien für genomische Marker, zahlreiche Laborparameter oder vordefinierte Sicherheitssignale getrennt aufgeführt werden. Der SAP muss angeben, ob FDR oder k-FWER kontrolliert wird, wie p-Werte sortiert oder schrittweise verarbeitet werden und ob die Resultate explorativ bleiben. Auswertungen dürfen nicht nachträglich durch das Weglassen unerwünschter Hypothesen aus der Familie günstiger gemacht werden.

Tabellen für die Ergebnisdarstellung sollten die Anzahl aller geprüften Hypothesen, die zurückgewiesenen Hypothesen und das angewandte Fehlermaß benennen. Dadurch wird verhindert, dass eine Auswahl positiver Marker wie eine vollständige Auswertung wirkt, obwohl sie nur den vordefinierten Entdeckungsprozess abbildet.

Full-Service-CROs wie Mediconomics unterstützen bei FDR- und k-FWER-Analysen durch die Dokumentation der Hypothesenfamilien, die Auswahl und Programmierung der vorab vereinbarten Mehrfachtestprozedur, die Prüfung der resultierenden Listen und die Kennzeichnung explorativer Ergebnisse im Tabellen-, Listen- und Figurenplan. So bleibt erkennbar, ob ein positiver Befund ein Signal für weitere Prüfung oder Teil eines konfirmatorischen Nachweises ist.

Häufig gestellte Fragen (FAQ)

Ist die FDR die Wahrscheinlichkeit, dass ein einzelner positiver Befund falsch ist?

Nein. Sie ist ein Erwartungswert über wiederholte Anwendungen des Verfahrens und bezieht sich auf den Anteil falscher Zurückweisungen in der gesamten Menge der Zurückweisungen. Sie ist keine posteriorische Fehlerwahrscheinlichkeit für einen bestimmten Biomarker.

Warum steht vor k-FWER ein „k“?

Das k bezeichnet die Anzahl falscher Zurückweisungen, ab der ein Fehlerereignis gezählt wird. Eine Kontrolle der 2-FWER begrenzt somit die Wahrscheinlichkeit von mindestens zwei falschen Ablehnungen und ist weniger restriktiv als die Kontrolle von bereits einem Fehlalarm.

Können FDR und k-FWER in derselben Studie vorkommen?

Ja, sofern sie für getrennte, vorab beschriebene Hypothesenfamilien oder Analyseziele verwendet werden. Der SAP muss transparent machen, welches Maß zu welcher Auswertung gehört; ein einzelnes Ergebnis darf nicht je nach gewünschter Aussage mit wechselndem Fehlermaß bewertet werden.

Regulatorische Referenzen

  • EMA/CHMP/44762/2017, Guideline on multiplicity issues in clinical trials – beschreibt das Risiko nicht gestützter positiver Schlussfolgerungen.
  • ICH E9, Statistical Principles for Clinical Trials – fordert eine vorab geplante statistische Auswertung.
  • ICH E3, Structure and Content of Clinical Study Reports – ordnet die transparente Darstellung statistischer Ergebnisse ein.

Seite medizinisch geprüft von: Dr. Richard Smith (6. Oktober 2026)

Nach oben scrollen