Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Kann ich mit Kolmogorov-Smirnov zwei empirische Verteilungen vergleichen?
Ist es in Ordnung, mit dem Kolmogorov-Smirnov-Anpassungstest zwei empirische Verteilungen zu vergleichen, um festzustellen, ob sie aus derselben zugrunde liegenden Verteilung stammen, anstatt eine empirische Verteilung mit einer vorgegebenen Referenzverteilung zu vergleichen? Lassen Sie mich versuchen, dies anders zu stellen. Ich sammle N Proben von einer Verteilung an einem Ort. …

4
Clustering von 1D-Daten
Ich habe einen Datensatz, ich möchte Cluster auf diesen Daten basierend auf nur einer Variablen erstellen (es fehlen keine Werte). Ich möchte 3 Cluster basierend auf dieser einen Variablen erstellen. Welcher Clustering-Algorithmus soll verwendet werden, k-means, EM, DBSCAN usw.? Meine Hauptfrage ist, unter welchen Umständen sollte ich k-means über EM …
16 clustering 

2
Wann kombinieren wir Dimensionsreduktion mit Clustering?
Ich versuche, Clustering auf Dokumentebene durchzuführen. Ich habe die Term-Document-Frequenzmatrix konstruiert und versuche, diese hochdimensionalen Vektoren mit k-Mitteln zu clustern. Anstatt direkt zu clustern, habe ich zuerst die LSA-Singularvektorzerlegung (Latent Semantic Analysis) angewendet, um die U, S, Vt-Matrizen zu erhalten, eine geeignete Schwelle unter Verwendung des Geröllplots ausgewählt und Clusterbildung …

2
Was genau bedeutet es, Daten zu bündeln?
Ich dachte, dass "Daten bündeln" einfach das Kombinieren von Daten bedeutet, die zuvor in Kategorien unterteilt waren ... im Wesentlichen, die Kategorien zu ignorieren und den Datensatz zu einem riesigen "Datenpool" zu machen. Ich denke, das ist mehr eine Frage der Terminologie als der Anwendung von Statistiken. Zum Beispiel: Ich …



3
Große, kluge Einsätze machen
Ich habe versucht, einen Algorithmus zu programmieren, der Wetten in 1X2-Spielen (gewichtet) vorschlägt. Grundsätzlich hat jedes Spiel eine Reihe von Spielen (Heim- gegen Auswärtsteams): 1: Heimsiege X: zeichnen 2: auswärts gewinnt Für jede Übereinstimmung und jedes Symbol ( 1, Xund 2) werde ich einen Prozentsatz zuweisen, der die Wahrscheinlichkeit angibt, …


2
Ist es empfehlenswert, Ihre Daten in einer Regression mit Panel- / Längsschnittdaten zu standardisieren?
Im Allgemeinen standardisiere ich meine unabhängigen Variablen in Regressionen, um die Koeffizienten richtig zu vergleichen (auf diese Weise haben sie die gleichen Einheiten: Standardabweichungen). Bei Panel- / Längsschnittdaten bin ich mir jedoch nicht sicher, wie ich meine Daten standardisieren soll, insbesondere wenn ich ein hierarchisches Modell schätze. Um zu sehen, …

5
Wie sollte man bei der Klassifizierung mit zufälligen Wäldern in R die unausgeglichenen Klassengrößen anpassen?
Ich erkunde verschiedene Klassifizierungsmethoden für ein Projekt, an dem ich arbeite, und bin daran interessiert, Random Forests auszuprobieren. Ich versuche mich weiterzubilden und würde mich über jede Hilfe durch die CV-Community freuen. Ich habe meine Daten in Trainings- / Test-Sets aufgeteilt. Durch Experimente mit zufälligen Gesamtstrukturen in R (mit dem …

2
Bewertung der Zuverlässigkeit eines Fragebogens: Dimensionalität, problematische Elemente und Verwendung von Alpha, Lambda6 oder einem anderen Index?
Ich analysiere die Ergebnisse von Teilnehmern, die an einem Experiment teilgenommen haben. Ich möchte die Zuverlässigkeit meines Fragebogens einschätzen, der sich aus 6 Elementen zusammensetzt, um die Einstellung der Teilnehmer zu einem Produkt einzuschätzen. Ich habe Cronbachs Alpha berechnet, indem ich alle Elemente als eine einzige Skala (Alpha war ungefähr …

11
Wie fange ich an und lerne R?
Ich habe mehrmals versucht, es "alleine zu machen" - aber mit begrenztem Erfolg. Ich bin ein gelegentlicher SPSS-Benutzer und habe einige SAS-Erfahrungen. Würde mich über einen oder zwei Zeiger von jemandem freuen, der einen ähnlichen Hintergrund hat und jetzt R verwendet.
16 r  references 


1
Intuitive Erklärung des Beitrags zur Summe zweier normalverteilter Zufallsvariablen
Wenn ich zwei normalverteilte unabhängige Zufallsvariablen und mit den Bedeutungen und und den Standardabweichungen und und feststelle, dass , dann gilt (vorausgesetzt, ich habe keine Fehler gemacht) die bedingte Verteilung von und denen sind auch normal mit den Mitteln und Standardabweichung XXXYYYμXμX\mu_XμYμY\mu_YσXσX\sigma_XσYσY\sigma_YX+Y=cX+Y=cX+Y=cXXXYYYcccμX|c=μX+(c−μX−μY)σ2Xσ2X+σ2YμX|c=μX+(c−μX−μY)σX2σX2+σY2\mu_{X|c} = \mu_X + (c - \mu_X - \mu_Y)\frac{ …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.