Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

4
Wie kann eine zufällige Korrelationsmatrix erzeugt werden, die ungefähr normalverteilte nicht diagonale Einträge mit gegebener Standardabweichung aufweist?
Ich möchte eine zufällige Korrelationsmatrix erzeugen, so dass die Verteilung ihrer nicht diagonalen Elemente ungefähr aussieht normal . Wie kann ich es tun? Die Motivation ist dies. Für einen Satz von Zeitreihendaten sieht die Korrelationsverteilung oft ziemlich normal aus. Ich möchte viele "normale" Korrelationsmatrizen generieren, um die allgemeine Situation darzustellen …

2
Gibt es eine Möglichkeit, eine Vorhersage aus einem zufälligen Waldmodell zu erklären?
Angenommen, ich habe ein prädiktives Klassifizierungsmodell, das auf einer zufälligen Gesamtstruktur basiert (unter Verwendung des randomForest-Pakets in R). Ich möchte es so einrichten, dass Endbenutzer ein Element angeben können, für das eine Vorhersage generiert werden soll, und es wird eine Klassifizierungswahrscheinlichkeit ausgegeben. Bisher kein Problem. Aber es wäre nützlich / …

3
Messung der nichtlinearen Abhängigkeit
Die Kovarianz zwischen zwei Zufallsvariablen definiert ein Maß dafür, wie eng sie linear miteinander verbunden sind. Was aber, wenn die gemeinsame Verteilung kreisförmig ist? Sicher gibt es Struktur in der Verteilung. Wie wird diese Struktur extrahiert?

4
Was bedeutet es für eine Studie, überlastet zu sein?
Was bedeutet es für eine Studie, überlastet zu sein? Mein Eindruck ist, dass Ihre Stichproben so groß sind, dass Sie winzige Effektgrößen erkennen können. Diese Effektgrößen sind möglicherweise so klein, dass sie eher auf geringfügige Verzerrungen im Stichprobenprozess zurückzuführen sind als auf einen (nicht unbedingt direkten) Kausalzusammenhang zwischen den Variablen. …

2
Wie wähle ich die Anzahl der Komponenten für die Analyse unabhängiger Komponenten aus?
Da keine guten A-priori-Vermutungen über die Anzahl der in der Analyse unabhängiger Komponenten anzufordernden Komponenten vorliegen, möchte ich einen Auswahlprozess automatisieren. Ich denke, dass ein vernünftiges Kriterium die Zahl sein könnte, die den globalen Beweis für die Korrelation zwischen den berechneten Komponenten minimiert. Hier ist der Pseudocode dieses Ansatzes: for …
11 ica 

1
Abdeckungswahrscheinlichkeiten des grundlegenden Bootstrap-Konfidenzintervalls
Ich habe die folgende Frage für einen Kurs, an dem ich arbeite: Führen Sie eine Monte-Carlo-Studie durch, um die Abdeckungswahrscheinlichkeiten des normalen Standard-Bootstrap-Konfidenzintervalls und des grundlegenden Bootstrap-Konfidenzintervalls abzuschätzen. Stichprobe aus einer normalen Population und Überprüfung der empirischen Abdeckungsraten für den Stichprobenmittelwert. Die Abdeckungswahrscheinlichkeiten für das normale Standard-Bootstrap-CI sind einfach: n …

4
Vergleich logistischer Regressionskoeffizienten modellübergreifend?
Ich habe ein Logit-Modell entwickelt, das auf sechs verschiedene Sätze von Querschnittsdaten angewendet werden kann. Ich versuche herauszufinden, ob sich die inhaltliche Wirkung einer bestimmten unabhängigen Variablen (IV) auf die abhängige Variable (DV) ändert, die zu unterschiedlichen Zeiten und im Laufe der Zeit nach anderen Erklärungen sucht. Meine Fragen sind: …
11 logistic  spss 



3
Was ist der Unterschied zwischen Z-Scores und p-Werten?
In Netzwerkmotivalgorithmen scheint es durchaus üblich zu sein, beide a zurückzugeben p-Wert als auch einen Z-Score für eine Statistik zurückzugeben: "Das Eingabenetzwerk enthält X Kopien des Untergraphen G". Ein Untergraph gilt als Motiv, wenn er erfüllt p-Wert <A, Z-Score> B und X> C für einige benutzerdefinierte (oder Community-definierte) A, B …

2
Wie zeichnet man ein Interaktionsdiagramm mit Konfidenzintervallen?
Meine Versuche: Ich konnte keine Konfidenzintervalle erreichen interaction.plot() und andererseits würde plotmeans()aus dem Paket 'gplot' nicht zwei Diagramme angezeigt. Außerdem konnte ich keine zwei plotmeans()Diagramme übereinander platzieren, da die Achsen standardmäßig unterschiedlich sind. Ich hatte einige Erfolge mit plotCI()dem Paket 'gplot' und der Überlagerung von zwei Graphen, aber die Übereinstimmung …

1
Die Stichprobengröße ist erforderlich, um zu bestimmen, welche Anzeige die höchste Klickrate aufweist
Ich bin von Beruf Software-Designer und arbeite an einem Projekt für einen Kunden. Ich möchte sicherstellen, dass meine Analyse statistisch fundiert ist. Beachten Sie Folgendes: Wir haben n Anzeigen (n <10) und möchten einfach wissen, welche Anzeige die beste Leistung erbringt. Unser Ad-Server wird zufällig eine dieser Anzeigen schalten. Erfolg …

4
Beschriften von Boxplots in R.
Gesperrt . Diese Frage und ihre Antworten sind gesperrt, da die Frage nicht zum Thema gehört, aber historische Bedeutung hat. Derzeit werden keine neuen Antworten oder Interaktionen akzeptiert. Ich muss ein Boxplot ohne Achsen erstellen und es dem aktuellen Plot (ROC-Kurve) hinzufügen, aber ich muss dem Boxplot weitere Textinformationen hinzufügen: …
11 r  boxplot 



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.