Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Was ist der beste Weg, um die Differenz-in-Differenz-Regression (Mehrperiodenregression) zu visualisieren?
Was ist der beste Weg, um Unterschiede für die binäre und kontinuierliche Behandlung zu visualisieren? Regressiere ich die Ergebnisvariable auf dem Kontrollsatz, schließe aber die Behandlungsvariable aus und zeichne die Residuen in jeder Gruppe (binärer Fall)? Gibt es eine Möglichkeit, die "Dynamik" des ATE-Parameters über die Zeit zu sehen? Ich …

1
Visualisierung von PCA in R: Datenpunkte, Eigenvektoren, Projektionen, Vertrauensellipse
Ich habe einen Datensatz von 17 Personen, Rang 77 Aussagen. Ich möchte Hauptkomponenten auf einer transponierten Korrelationsmatrix von Korrelationen zwischen Personen (als Variablen) über Aussagen (als Fälle) extrahieren . Ich weiß, es ist seltsam, es heißt Q-Methodik . Ich möchte veranschaulichen, wie PCA in diesem Zusammenhang funktioniert, indem ich Eigenwerte …

1
Mechanik hinter Abweichung von der Zufallsverteilung
Das System, an dem wir arbeiten, ist biologisch, insbesondere die Verteilung programmierter DNA-Schadensereignisse über ein Chromosom. Dies kann als 1D-Array (das Chromosom) betrachtet werden, über das Punkte ausgewählt werden können (Orte mit absichtlicher Schädigung). Wir haben die Positionen dieser Ereignisse experimentell kartiert und zunächst gefragt, ob sie zu einer zufälligen …

4
Regressionsentwicklungsländer: BIP-Wachstum oder BIP
Für meine Masterarbeit möchte ich grundsätzlich herausfinden, warum Entwicklungsländer stagnieren. Neben theoretischen Aspekten möchte ich auch eine Regression vornehmen. Ich möchte das BIP oder das BIP-Wachstum als abhängige Variable von vielen unabhängigen Variablen wie der Amtszeit des Staatsoberhauptes, der Lebenserwartung, der Einschränkung der Arbeitszeit, der Alphabetisierung von Erwachsenen und dem …

1
Warum hat Lucene IDF eine scheinbar zusätzliche +1?
Aus den Lucene-Dokumenten IDF = 1 + log( numDocsdocFreq + 1)IDF=1+log⁡(numDocsdocFreq+1)\text{IDF} = 1 + \log\left(\frac{\text{numDocs}}{\text{docFreq}+1}\right) In anderen Referenzen (z. B. Wikipedia ) wird IDF normalerweise als oder , um ein Tauchen um 0 zu vermeiden.Log( numDocsdocFreq)log⁡(numDocsdocFreq)\log\left(\frac{\text{numDocs}}{\text{docFreq}}\right)Log( numDocsdocFreq + 1)log⁡(numDocsdocFreq+1)\log\left(\frac{\text{numDocs}}{\text{docFreq}+1}\right) Mir ist auch klar, dass Lucene anstelle von zur Berechnung von …

1
Regularisierung und Projektion auf die
Ich versuche zu verstehen , wie Regularisierung in der Bezeichnung der Projektionen auf ein Werk l∗l∗l_* Kugel und euklidische Projektion auf die simplex. Ich bin mir nicht sicher, ob ich verstehe, was wir meinen, wenn wir den Gewichtsvektor auf die l1l1l_1 oder l2l2l_2 Bälle projizieren . Ich kann das Konzept …

2
Warum R im Quadrat melden?
Wenn das angepasste R-Quadrat dem R-Quadrat überlegen ist, warum meldet statistische Software dann weiterhin letzteres? Gibt es eine Situation, in der ein Forscher es vorziehen könnte, R-Quadrat anstelle von angepasstem R-Quadrat zu verwenden?

1
Effiziente Methode zur Berechnung der Abstände zwischen Schwerpunkten aus der Entfernungsmatrix
Lassen Sie uns eine quadratische symmetrische Matrix quadratischer euklidischer Abstände zwischen Punkten und einem Vektor mit einer Länge von , die die Cluster- oder Gruppenzugehörigkeit ( Cluster) der Punkte anzeigt ; Ein Cluster kann aus Punkt bestehen.D.D.\bf Dnnnnnnkkk≥ 1≥1\ge1 Was ist hier die effizienteste oder wirklich effizienteste (in Bezug auf …

4
Ist Nichtstationarität in Logit / Probit wichtig?
Ich möchte fragen - ich verwende logit, um zu untersuchen, ob einige Variablen das Risiko von Währungskrisen verbessern. Ich habe jährliche Daten aus dem Jahr 1980 für viele Länder (unausgeglichenes Panel), Dummy-Variable ist 1, wenn Währungskrisen begonnen haben (gemäß meiner Definition), andernfalls 0. Erklärende Variablen sind nach einigen Theorien wie …
8 logit  probit 

2
Wie verwendet man den Bayes-Satz mit einem kontinuierlichen Prior?
Wie kann ich die hintere Wahrscheinlichkeit berechnen, wenn mein Prior als kontinuierliche Wahrscheinlichkeitsverteilung modelliert wird, beispielsweise als Beta-Verteilung, die verzerrt ist, um meine Neigung zu bestimmten Modellen widerzuspiegeln? Die Herausforderung für mich besteht darin, die Wahrscheinlichkeit eines bestimmten Modells zu berechnen, da die kontinuierliche Verteilung nur Schätzungen für Intervalle liefert …
8 bayesian  prior 


1
Generieren von binomialen Zufallsvariablen mit gegebener Korrelation
Angenommen, ich weiß, wie unabhängige binomiale Zufallsvariablen generiert werden. Wie kann ich zwei Zufallsvariablen und so generieren, dassY X ∼ Bin ( 8 , 2XXXYYYX∼Bin(8,23),Y∼Bin(18,23) and Corr(X,Y)=0.5X∼Bin(8,23),Y∼Bin(18,23) and Corr(X,Y)=0.5X\sim \text{Bin}(8,\dfrac{2}{3}),\quad Y\sim \text{Bin}(18,\dfrac{2}{3})\ \text{ and }\ \text{Corr}(X,Y)=0.5 Ich dachte daran, die Tatsache zu nutzen, dass und unabhängig sind, wobei aber ich …


2
Welche ökonometrischen Modelle können verwendet werden, um Sicherheitsrenditen + ARIMA / GARCH-Fragen vorherzusagen?
Ich versuche, eine Diplomarbeit zu schreiben, in der ich die Vorhersagekraft eines bestimmten ökonometrischen Modells für eine bestimmte finanzielle Zeitreihe teste. Ich brauche einen Rat, wie ich das machen soll. Um die Dinge in einen Zusammenhang zu bringen, habe ich mich größtenteils mit Ökonometrie befasst. Der einzige Kurs, den ich …

1
Modell des maschinellen Lernens „exportieren“ aus R.
Ich kann klassische ML-Modelle auf traditionellen Trainings- / Testsätzen in R erstellen und implementieren, aber was ist, wenn ein Partner dieses Modell erhalten möchte, um sein eigenes (jede Art von) System zu implementieren? Das Speichern und Senden der R-Modell-Struktur hilft natürlich nicht weiter. und herauszufinden, dass der Vorhersagemechanismus auch in …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.