Friedman- und Iman-Davenport-Tests mit exakten p-Werten, Durchschnittsränge, die Nemenyi-kritische Differenz und das klassische CD-Diagramm mit Cliquen — plus optionales Bonferroni-Dunn-Overlay gegen ein Kontrollmodell.
Ausführung
Dieses Tool ausführen
Fülle das Formular aus, starte das Tool und prüfe das Ergebnis an einem Ort.
Beispiele
Beispiele zu diesem Tool
Verwandt
Mit verwandten Tools und Themen fortfahren
Leitfaden zur Tool-Nutzung
Erfahren Sie, wann dieses Tool passt, was es unterstützt und wie Nutzer es anwenden.
Wichtige Fakten
Kategorie
Data Analysis
Eingabetypen
textarea, select, text
Ausgabetyp
html
Sample-Abdeckung
4
API bereit
Ja
Überblick
Der Nemenyi Critical-Difference- & Friedman-Rang-Plotter führt statistische Modellvergleiche über mehrere Datensätze nach dem Demšar-Standard durch, berechnet Friedman- und Iman-Davenport-Tests und visualisiert signifikante Leistungsunterschiede in einem klassischen Critical-Difference-Diagramm (CD-Diagramm).
Wann verwenden
Wenn mehrere Machine-Learning-Modelle oder Algorithmen über mehrere Benchmark-Datensätze hinweg statistisch robust verglichen werden sollen.
Wenn geprüft werden muss, ob Unterschiede zwischen Modellen nach dem Friedman- oder Iman-Davenport-Test statistisch signifikant sind.
Wenn ein publizierbares CD-Diagramm mit Nemenyi-Cliquen oder einem Bonferroni-Dunn-Vergleich gegen ein Kontrollmodell benötigt wird.
So funktioniert es
1Geben Sie die Leistungsmatrix als CSV- oder Tabellendaten mit Datensätzen in den Zeilen und Modellnamen in den Spalten ein.
2Wählen Sie die Metrik-Richtung ('Höher ist besser' für z. B. Accuracy/AUC oder 'Niedriger ist besser' für Fehler/RMSE), das Signifikanzniveau α sowie das Post-hoc-Verfahren (Nemenyi oder Bonferroni-Dunn).
3Das Tool berechnet die Durchschnittsränge, führt den Friedman- sowie den Iman-Davenport-Test durch und ermittelt die kritische Differenz (CD).
4Sie erhalten eine Rangtabelle, Signifikanzwerte und ein interaktives HTML-CD-Diagramm, das homogene Cliquen verbindet.
Anwendungsfälle
Vergleich von Klassifikationsalgorithmen (z. B. XGBoost, Random Forest, SVM) über mehrere Benchmark-Datensätze anhand von Accuracy oder F1-Score.
Evaluation von Regressionsmodellen anhand von RMSE oder MAE mit automatischer Anpassung der Ranking-Richtung.
Benchmark-Validierung in wissenschaftlichen Publikationen mit Bonferroni-Dunn-Test gegen ein etabliertes Basismodell.
Beispiele
1. Vergleich von vier Klassifikatoren über Benchmark-Datensätze
Data Scientist
Hintergrund
Für ein Forschungspapier werden vier Klassifikationsmodelle auf 12 verschiedenen Datensätzen evaluiert.
Aufgabe
Es muss statistisch nachgewiesen werden, ob AdaBoost signifikant besser abschneidet als SVM, kNN und C4.5.
Verwendung
Fügen Sie die Genauigkeitsmatrix ein, wählen Sie 'Höher ist besser (Accuracy, AUC)', α = 0.05 und das Post-hoc-Verfahren 'Nemenyi (alle Paare)'.
Das Tool gibt Friedman- und Iman-Davenport-p-Werte aus, berechnet die kritische Differenz von 0.957 und erzeugt das CD-Diagramm mit einer SVM-kNN-Clique.
2. Baseline-Vergleich von Regressionsmodellen mit Fehlerwerten
ML Engineer
Hintergrund
Ein Team testet zwei neue Modellvarianten gegen die bestehende Produktions-Baseline auf acht Testdatensätzen.
Aufgabe
Prüfen, ob ChallengerA oder ChallengerB den RMSE der Baseline statistisch signifikant senken.
Verwendung
FAQ
Was zeigt das Critical-Difference-Diagramm (CD-Diagramm)?
Es visualisiert die Durchschnittsränge aller Modelle auf einer Achse und verbindet Algorithmen ohne statistisch signifikanten Unterschied mit horizontalen Cliquen-Linien.
Wann sollte Bonferroni-Dunn statt Nemenyi gewählt werden?
Bonferroni-Dunn eignet sich, wenn ein festes Kontrollmodell (Baseline) mit mehreren Herausforderern verglichen wird, statt alle Paare untereinander zu testen.
Wie wirkt sich die Einstellung 'Metrik-Richtung' auf die Ränge aus?
Bei 'Höher ist besser' erhält der höchste Score Rang 1, bei 'Niedriger ist besser' (z. B. RMSE) erhält der niedrigste Wert Rang 1.
Was unterscheidet den Iman-Davenport- vom Friedman-Test?
Der Iman-Davenport-Test ist eine F-Verteilungs-Korrektur des Friedman-Chi-Quadrat-Tests, die bei typischen Benchmark-Größen weniger konservativ ist.
Geben Sie die RMSE-Tabelle ein, setzen Sie die Metrik-Richtung auf 'Niedriger ist besser', wählen Sie 'Bonferroni-Dunn (gegen Kontrolle)' und tragen Sie 'Baseline' als Kontrollmodell ein.
Die Ränge werden invertiert sortiert, und das Bonferroni-Dunn-Diagramm bestätigt, dass beide Challenger-Modelle die Baseline signifikant übertreffen.
Ein kommagetrennter Textblock, bei dem die erste Spalte den Datensatznamen enthält und die weiteren Spalten die jeweiligen Modellbewertungen darstellen.