Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Diskrete einheitliche Zufallsvariable (?), Die alle rationalen Werte in einem geschlossenen Intervall aufnimmt
Ich hatte gerade eine (intellektuelle) Panikattacke. Eine stetige Zufallsvariable, die in einem geschlossenen Intervall einer Uniform folgt U(a,b)U(a,b)U(a,b): ein bekanntes statistisches Konzept. Ein durchgehendes, einheitliches RV, das Unterstützung über die erweiterten Realzahlen (halb oder ganz) hat: kein richtiges RV, sondern ein grundlegendes Bayes'sches Konzept für ein unangemessenes vorheriges, nützliches und …


1
MLE des Positionsparameters in einer Cauchy-Verteilung
Nach der Zentrierung können die beiden Messungen x und −x als unabhängige Beobachtungen aus einer Cauchy-Verteilung mit Wahrscheinlichkeitsdichtefunktion angenommen werden: f(x:θ)=f(x:θ)=f(x :\theta) = 1π(1+(x−θ)2)1π(1+(x−θ)2)1\over\pi (1+(x-\theta)^2) ,−∞&lt;x&lt;∞,−∞&lt;x&lt;∞, -∞ < x < ∞ Zeigen Sie, dass, wenn x2≤1x2≤1x^2≤ 1 der MLE von θθ\theta 0 ist, aber wenn x2&gt;1x2&gt;1x^2>1 es zwei MLE von …

2
Verwenden von Nachbarinformationen bei der Eingabe von Daten oder Finden von Off-Daten (in R)
Ich habe einen Datensatz mit der Annahme, dass die nächsten Nachbarn die besten Prädiktoren sind. Nur ein perfektes Beispiel für einen Zwei-Wege-Gradienten, der Angenommen, wir haben einen Fall, in dem nur wenige Werte fehlen, und wir können dies auf der Grundlage von Nachbarn und Trends leicht vorhersagen. Entsprechende Datenmatrix in …



3
Welche Kriterien müssen erfüllt sein, um auf einen „Deckeneffekt“ schließen zu können?
Nach der SAGE Encyclopedia of Social Science Forschungsmethoden … [a] Der Obergrenzeneffekt tritt auf, wenn eine Kennzahl eine bestimmte Obergrenze für potenzielle Reaktionen besitzt und eine große Konzentration von Teilnehmern bei oder nahe dieser Obergrenze punktet. Die Skalendämpfung ist ein methodisches Problem, das auftritt, wenn die Varianz auf diese Weise …

2
Kausalität in der Mikroökonometrie versus Granger-Kausalität in der Zeitreihenökonometrie
Ich verstehe die Kausalität, wie sie in der Mikroökonomie verwendet wird (insbesondere IV oder Regressionsdiskontinuitätsdesign), und auch die Granger-Kausalität, wie sie in der Zeitreihenökonometrie verwendet wird. Wie verhalte ich mich zueinander? Ich habe zum Beispiel gesehen, dass beide Ansätze für Paneldaten verwendet werden ( , ). Jede Bezugnahme auf die …

3
Zufällige Gesamtstruktur aus mehrstufigen / hierarchisch strukturierten Daten
Ich bin ziemlich neu im maschinellen Lernen, in CART-Techniken und ähnlichem, und ich hoffe, dass meine Naivität nicht zu offensichtlich ist. Wie geht Random Forest mit mehrstufigen / hierarchischen Datenstrukturen um (z. B. wenn eine Interaktion über mehrere Ebenen von Interesse ist)? Das heißt, Datensätze mit Analyseeinheiten auf mehreren hierarchischen …

1
Wie werden PCA-Ladungen interpretiert?
Beim Lesen über PCA bin ich auf die folgende Erklärung gestoßen: Angenommen, wir haben einen Datensatz, in dem jeder Datenpunkt die Ergebnisse eines einzelnen Schülers in einem Mathematiktest, einem Physiktest, einem Leseverständnistest und einem Vokabeltest darstellt. Wir finden die ersten beiden Hauptkomponenten, die 90% der Variabilität in den Daten erfassen …
13 pca 

3
Standardabweichung mehrerer Messungen mit Unsicherheiten
Ich habe zwei 2 Stunden GPS-Daten mit einer Abtastrate von 1 Hz (7200 Messungen). Die Daten werden in der Form gegeben (X,Xσ,Y,Yσ,Z,Zσ)(X,Xσ,Y,Yσ,Z,Zσ)(X, X_\sigma, Y, Y_\sigma, Z, Z_\sigma) , wobei NσNσN_\sigma ist die Messunsicherheit. Wenn ich den Mittelwert aller Messungen nehme (z. B. den durchschnittlichen Z-Wert dieser zwei Stunden), wie hoch …

4
Warum sind alle bekannten Distributionen unimodal?
Ich kenne keine multimodalen Distributionen. Warum sind alle bekannten Distributionen unimodal? Gibt es eine "berühmte" Distribution, die mehr als einen Modus hat? Natürlich sind Verteilungsmischungen oft multimodal, aber ich würde gerne wissen, ob es "Nicht-Mischungs" -Verteilungen gibt, die mehr als einen Modus haben.


1
Stand der Technik bei der Deduplizierung
Was sind die neuesten Methoden bei der Deduplizierung von Datensätzen? Die Deduplizierung wird manchmal auch als Datensatzverknüpfung, Entitätsauflösung, Identitätsauflösung, Zusammenführen / Löschen bezeichnet. Ich kenne zum Beispiel CBLOCK [1]. Ich würde mich freuen, wenn die Antworten auch Verweise auf vorhandene Software enthalten würden, die die Methoden implementiert. Ich weiß zum …

1
Wie skaliert man neue Beobachtungen, um Vorhersagen zu treffen, wenn das Modell mit skalierten Daten ausgestattet wurde?
Ich verstehe das Konzept der Skalierung der Datenmatrix zur Verwendung in einem linearen Regressionsmodell. In R könnten Sie beispielsweise Folgendes verwenden: scaled.data &lt;- scale(data, scale=TRUE) Meine einzige Frage ist, für neue Beobachtungen, für die ich die Ausgabewerte vorhersagen möchte, wie sie richtig skaliert werden. Wäre es scaled.new &lt;- (new - …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.