Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Seltsame Korrelationen in den SVD-Ergebnissen von Zufallsdaten; Haben sie eine mathematische Erklärung oder handelt es sich um einen LAPACK-Fehler?
Ich beobachte ein sehr seltsames Verhalten beim SVD-Ergebnis von Zufallsdaten, das ich sowohl in Matlab als auch in R reproduzieren kann. Es scheint ein numerisches Problem in der LAPACK-Bibliothek zu sein. ist es? Ich ziehe Proben aus dem dimensionalen Gaußschen mit dem Mittelwert Null und der Identitätskovarianz: . Ich setze …

4
Warum sind gemischte Daten ein Problem für euklidische Clustering-Algorithmen?
Die meisten klassischen Algorithmen für Clustering und Dimensionsreduktion (hierarchisches Clustering, Hauptkomponentenanalyse, k-Means, selbstorganisierende Karten ...) wurden speziell für numerische Daten entwickelt und ihre Eingabedaten werden als Punkte in einem euklidischen Raum betrachtet. Dies ist natürlich ein Problem, da es sich bei vielen Fragen aus der Praxis um gemischte Daten handelt: …




2
Woher kommt in der einfachen linearen Regression die Formel für die Varianz der Residuen?
Nach einem von mir verwendeten Text lautet die Formel für die Varianz des ithithi^{th} -Rests wie folgt: σ2(1−1n−(xi−x¯¯¯)2Sxx)σ2(1−1n−(xi−x¯)2Sxx)\sigma^2\left ( 1-\frac{1}{n}-\frac{(x_{i}-\overline{x})^2}{S_{xx}} \right ) Das finde ich schwer zu glauben , da die ithithi^{th} Rest die Differenz zwischen dem ist ithithi^{th} beobachteten Wert und dem ithithi^{th} ausgestattet Wert; Wenn man die Varianz …

3
Bedeutung von 'Anzahl der Parameter' in AIC
Bei der Berechnung von AIC AIC=2k−2lnLAIC=2k−2lnLAIC = 2k - 2 ln L k bedeutet "Anzahl der Parameter". Aber was zählt als Parameter? So zum Beispiel im Modell y=ax+by=ax+by = ax + b Werden a und b immer als Parameter gezählt? Was ist, wenn mir der Wert des Abschnitts egal ist, …
21 aic 



2
Wie gruppiere ich Zeitreihen?
Ich habe eine Frage zur Clusteranalyse. Es gibt 3000 Unternehmen, die nach ihrem Stromverbrauch über 5 Jahre gruppiert werden müssen. Jedes Unternehmen hat Werte für jede Stunde während 5 Jahren. Ich würde gerne herausfinden, ob einige Unternehmen über den Zeitraum die gleiche Nutzungsstärke aufweisen. Die Ergebnisse sollten für die tägliche …

2
Wenn k-means Clustering eine Form der Gaußschen Mischungsmodellierung ist, kann es verwendet werden, wenn die Daten nicht normal sind?
Ich lese Bishop über den EM-Algorithmus für GMM und die Beziehung zwischen GMM und k-means. In diesem Buch heißt es, dass k-means eine schwer zuzuordnende Version von GMM ist. Ich frage mich, ob dies bedeutet, dass ich k-means nicht verwenden kann (oder zumindest nicht verwenden kann), wenn die Daten, die …

1
Zwei Möglichkeiten zur Verwendung von Bootstrap zum Schätzen des Konfidenzintervalls von Koeffizienten in der Regression
Ich wende ein lineares Modell auf meine Daten an: yich= β0+ β1xich+ ϵich,ϵich∼ N( 0 , σ2) .yich=β0+β1xich+ϵich,ϵich∼N(0,σ2). y_{i}=\beta_{0}+\beta_{1}x_{i}+\epsilon_{i}, \quad\epsilon_{i} \sim N(0,\sigma^{2}). Ich möchte das Konfidenzintervall (CI) der Koeffizienten ( , ) mit der Bootstrap-Methode schätzen . Es gibt zwei Möglichkeiten, wie ich die Bootstrap-Methode anwenden kann: β 1β0β0\beta_{0}β1β1\beta_{1} Gepaarten …

3
Wie berechnet man die Anpassungsgüte in glm (R)?
Diese Frage wurde von Stack Overflow migriert, da sie bei Cross Validated beantwortet werden kann. Vor 6 Jahren migriert . Ich habe das folgende Ergebnis aus der Ausführung der glm-Funktion. Wie kann ich die folgenden Werte interpretieren: Nullabweichung Restabweichung AIC Haben sie etwas mit der guten Passform zu tun? Kann …

1
Welche Funktion könnte ein Kernel haben?
Im Kontext von maschinellem Lernen und Mustererkennung gibt es ein Konzept namens Kernel Trick . Bei Problemen, bei denen ich gefragt werde, ob eine Funktion eine Kernelfunktion sein kann oder nicht, was genau soll ich tun? Sollte ich zuerst prüfen, ob sie die Form der drei oder vier Kernfunktionen wie …

2
Natürliche Interpretation für LDA-Hyperparameter
Kann jemand erklären, was die natürliche Interpretation für LDA-Hyperparameter ist? ALPHAund BETAsind Parameter von Dirichlet-Verteilungen für (pro Dokument) Themen- bzw. (pro Thema) Wortverteilungen. Kann jemand erklären, was es bedeutet, größere Werte dieser Hyperparameter gegenüber kleineren Werten zu wählen? Bedeutet das, dass vorher in Bezug auf die thematische Sparsamkeit in Dokumenten …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.