Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

4
Wie projiziert man einen neuen Vektor auf den PCA-Raum?
Nach der Durchführung der Hauptkomponentenanalyse (PCA) möchte ich einen neuen Vektor auf den PCA-Raum projizieren (dh seine Koordinaten im PCA-Koordinatensystem finden). Ich habe PCA in R-Sprache mit berechnet prcomp. Jetzt sollte ich meinen Vektor mit der PCA-Rotationsmatrix multiplizieren können. Sollen die Hauptkomponenten in dieser Matrix in Zeilen oder Spalten angeordnet …
21 r  pca  r  variance  heteroscedasticity  misspecification  distributions  time-series  data-visualization  modeling  histogram  kolmogorov-smirnov  negative-binomial  likelihood-ratio  econometrics  panel-data  categorical-data  scales  survey  distributions  pdf  histogram  correlation  algorithms  r  gpu  parallel-computing  approximation  mean  median  references  sample-size  normality-assumption  central-limit-theorem  rule-of-thumb  confidence-interval  estimation  mixed-model  psychometrics  random-effects-model  hypothesis-testing  sample-size  dataset  large-data  regression  standard-deviation  variance  approximation  hypothesis-testing  variance  central-limit-theorem  kernel-trick  kernel-smoothing  error  sampling  hypothesis-testing  normality-assumption  philosophical  confidence-interval  modeling  model-selection  experiment-design  hypothesis-testing  statistical-significance  power  asymptotics  information-retrieval  anova  multiple-comparisons  ancova  classification  clustering  factor-analysis  psychometrics  r  sampling  expectation-maximization  markov-process  r  data-visualization  correlation  regression  statistical-significance  degrees-of-freedom  experiment-design  r  regression  curve-fitting  change-point  loess  machine-learning  classification  self-study  monte-carlo  markov-process  references  mathematical-statistics  data-visualization  python  cart  boosting  regression  classification  robust  cart  survey  binomial  psychometrics  likert  psychology  asymptotics  multinomial 

2
Warnung "Modell konnte nicht konvergieren" in lmer ()
Mit dem folgenden Datensatz wollte ich sehen, ob sich die Reaktion (Wirkung) in Bezug auf Standorte, Jahreszeit, Dauer und deren Wechselwirkungen ändert. In einigen Online-Foren zu Statistiken wurde empfohlen, mit Modellen mit linearen gemischten Effekten fortzufahren. Das Problem besteht jedoch darin, dass ich in den folgenden Jahreszeiten kaum die Chance …

2
Welche Intuition steckt dahinter, Vollständigkeit in einer Statistik als unmöglich zu definieren, um daraus einen unverzerrten Schätzer von
In der klassischen Statistik gibt es die Definition, dass eine Statistik TTT eines Datensatzes y1, … , Yny1,…,yny_1, \ldots, y_n für einen Parameter θθ\theta als vollständig definiert ist. Es ist unmöglich, daraus nichttrivial einen unverzerrten Schätzer von 000 zu bilden . Das heißt, hat die einzige Möglichkeit , Eh ( …

4
Kann jemand das Konzept einer „Summe von Zufallsvariablen“ klarstellen?
In meiner Wahrscheinlichkeitsklasse werden ständig die Begriffe "Summen von Zufallsvariablen" verwendet. Ich bin jedoch nicht sicher, was das genau bedeutet. Sprechen wir über die Summe mehrerer Realisierungen aus einer Zufallsvariablen? Wenn ja, ergibt das nicht eine einzige Zahl? Wie führt uns eine Summe von zufälligen Variablenrealisierungen zu einer Distribution oder …


7
RMSE vs. Bestimmungskoeffizient
Ich evaluiere ein physikalisches Modell und möchte wissen, welche der Methoden ich hier anwenden soll (zwischen RMSE und Bestimmungskoeffizient R2) Das Problem ist wie folgt: Ich habe eine Funktion, die Vorhersagen für den Eingabewert x ausgibt, . Ich habe auch die tatsächliche Beobachtung für diesen Wert, den ich .yx¯¯¯¯¯=f(x)yx¯=f(x)\overline{y_x}= f(x)yxyxy_x …
21 error 

11
Wie kann die Ergebnisverteilung für mehrere Würfel einfach ermittelt werden?
Ich möchte die Wahrscheinlichkeitsverteilung für die Summe einer Kombination von Würfeln berechnen. Ich erinnere mich, dass die Wahrscheinlichkeit von die Anzahl der Kombinationen ist, die diese Anzahl über die Gesamtanzahl der Kombinationen summieren (vorausgesetzt, die Würfel haben eine gleichmäßige Verteilung). Was sind die Formeln für Die Anzahl der Kombinationen insgesamt …
21 probability  dice 

4
Warum ist die Softmax-Ausgabe kein gutes Unsicherheitsmaß für Deep Learning-Modelle?
Ich arbeite seit einiger Zeit mit Convolutional Neural Networks (CNNs), hauptsächlich mit Bilddaten für die semantische Segmentierung / Instanzsegmentierung. Ich habe mir den Softmax der Netzwerkausgabe oft als "Heatmap" vorgestellt, um zu sehen, wie hoch die Aktivierungen pro Pixel für eine bestimmte Klasse sind. Ich habe niedrige Aktivierungen als "unsicher" …

1
Löschen Sie eine der Spalten, wenn Sie One-Hot-Codierung verwenden
Ich verstehe, dass maschinelles Lernen ein Problem darstellen kann, wenn Ihr Dataset stark korrelierte Features aufweist, da diese dieselben Informationen effektiv codieren. Kürzlich hat jemand darauf hingewiesen, dass Sie beim einmaligen Codieren einer kategorialen Variablen korrelierte Features erhalten, sodass Sie eine davon als "Referenz" ablegen sollten. Wenn Sie beispielsweise das …

4
So erstellen Sie eine beliebige Kovarianzmatrix
Zum Beispiel ist Rdie MASS::mvrnorm()Funktion in nützlich, um Daten zu generieren, um verschiedene Dinge in der Statistik zu demonstrieren. Ein obligatorisches SigmaArgument ist eine symmetrische Matrix, die die Kovarianzmatrix der Variablen angibt. Wie würde ich eine symmetrische Matrix mit beliebigen Einträgen erstellen ?n × nn×nn\times n

2
Kann PCA für Zeitreihendaten angewendet werden?
Ich verstehe, dass die Hauptkomponentenanalyse (PCA) grundsätzlich für Querschnittsdaten angewendet werden kann. Kann PCA effektiv für Zeitreihendaten verwendet werden, indem Jahr als Zeitreihenvariable angegeben wird und PCA normal ausgeführt wird? Ich habe festgestellt, dass dynamisches PCA für Paneldaten funktioniert und die Codierung in Stata für Paneldaten und nicht für Zeitreihen …
21 time-series  pca 

2
Warum wird die Softmax-Funktion verwendet, um Wahrscheinlichkeiten zu berechnen, obwohl wir jeden Wert durch die Summe des Vektors teilen können?
Durch Anwenden der Softmax-Funktion auf einen Vektor werden "Wahrscheinlichkeiten" und Werte zwischen 000 und . 111 Wir können aber auch jeden Wert durch die Summe der Vektoren dividieren, wodurch Wahrscheinlichkeiten und Werte zwischen000 und .111 Ich habe die Antwort hier gelesen , aber es heißt, dass der Grund darin liegt, …



1
lme () und lmer () liefern widersprüchliche Ergebnisse
Ich habe mit Daten gearbeitet, die Probleme mit wiederholten Messungen haben. Dabei habe ich ein sehr unterschiedliches Verhalten zwischen lme()und unter lmer()Verwendung meiner Testdaten festgestellt und möchte wissen warum. Der von mir erstellte gefälschte Datensatz enthält Größen- und Gewichtsmessungen für 10 Probanden, die jeweils zweimal durchgeführt wurden. Ich habe die …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.