Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Suche nach einer Möglichkeit, Zufallszahlen für diese Verteilung zu simulieren
Ich versuche, ein Programm in R zu schreiben, das Pseudozufallszahlen aus einer Verteilung mit der kumulativen Verteilungsfunktion simuliert: F(x)=1−exp(−ax−bp+1xp+1),x≥0F(x)=1−exp⁡(−ax−bp+1xp+1),x≥0F(x)= 1-\exp \left(-ax-\frac{b}{p+1}x^{p+1}\right), \quad x \geq 0 wobeia,b>0,p∈(0,1)a,b>0,p∈(0,1)a,b>0, p \in (0,1) Ich habe versucht, die inverse Transformation abzutasten, aber die inverse scheint analytisch nicht lösbar zu sein. Ich würde mich freuen, wenn …

2
FPR (False Positive Rate) vs FDR (False Discovery Rate)
Das folgende Zitat stammt aus dem berühmten Forschungsbericht Statistical Meaning für genomweite Studien von Storey & Tibshirani (2003): Zum Beispiel bedeutet eine falsch-positive Rate von 5%, dass im Durchschnitt 5% der wirklich null Merkmale in der Studie als signifikant bezeichnet werden. Eine FDR (False Discovery Rate) von 5% bedeutet, dass …


9
Überanpassung und Unteranpassung
Ich habe einige Nachforschungen über Über- und Unteranpassung angestellt und ich habe verstanden, was sie genau sind, aber ich kann die Gründe nicht finden. Was sind die Hauptgründe für Über- und Unterausstattung? Warum treten diese beiden Probleme beim Trainieren eines Modells auf?

4
Ist die alltägliche Wahrscheinlichkeit nur ein Weg, mit dem Unbekannten umzugehen (hier nicht von Quantenphysik zu sprechen)?
In der Alltagswahrscheinlichkeit (nicht der Quantenphysik) scheinen Wahrscheinlichkeiten eigentlich nur ein Ersatz für ein Unbekanntes zu sein. Nehmen Sie zum Beispiel einen Münzwurf. Wir sagen, es ist "zufällig", eine 50% ige Änderung des Kopfes und eine 50% ige Chance auf Schwänze. Wenn ich jedoch die Dichte, Größe und Form der …


3
Grundlegendes zum input_shape-Parameter in LSTM mit Keras
Ich versuche das in der Keras-Dokumentation beschriebene Beispiel mit dem Namen "Stacked LSTM for Sequence Classification" (siehe Code unten) zu verwenden und kann den input_shapeParameter im Kontext meiner Daten nicht herausfinden . Ich habe als Eingabe eine Matrix von Sequenzen von 25 möglichen ganzen Zahlen in einem aufgefüllten Folge maximaler …
20 lstm  keras  shape  dimensions 

5
Ein Beispiel, bei dem das Wahrscheinlichkeitsprinzip * wirklich * wichtig ist?
Gibt es ein Beispiel, bei dem zwei verschiedene verteidigungsfähige Tests mit proportionalen Wahrscheinlichkeiten zu deutlich unterschiedlichen (und gleichermaßen verteidigungsfähigen) Schlussfolgerungen führen würden, beispielsweise wenn die p-Werte um Größenordnungen voneinander entfernt sind, die Potenz zu Alternativen jedoch ähnlich ist? Alle Beispiele, die ich sehe, sind sehr dumm und vergleichen ein Binom …


1
Von Bayes'schen Netzen zu neuronalen Netzen: Wie multivariate Regression in ein Netzwerk mit mehreren Ausgängen übertragen werden kann
Ich habe es mit einem Bayesian Hierarchical Linear Model zu tun , hier das Netzwerk, das es beschreibt. YYY für den täglichen Verkauf eines Produkts in einem Supermarkt (beobachtet). XXX ist eine bekannte Matrix von Regressoren, einschließlich Preisen, Werbeaktionen, Wochentagen, Wetter, Feiertagen. 1SSS ist der unbekannte latente Lagerbestand jedes Produkts, …


1
Gibt es eine intuitive Erklärung dafür, warum logistische Regression für einen perfekten Trennungsfall nicht funktioniert? Und warum wird es durch das Hinzufügen von Regularisierung behoben?
Wir haben viele gute Diskussionen über die perfekte Trennung in der logistischen Regression. So führte die logistische Regression in R zu einer perfekten Trennung (Hauck-Donner-Phänomen). Was jetzt? Das logistische Regressionsmodell konvergiert nicht . Ich persönlich glaube immer noch, dass es nicht intuitiv ist, warum es ein Problem sein wird und …

5
Annahmen der multiplen Regression: Wie unterscheidet sich die Normalitätsannahme von der Annahme der konstanten Varianz?
Ich habe gelesen, dass dies die Bedingungen für die Verwendung des multiplen Regressionsmodells sind: die Reste des Modells sind fast normal, Die Variabilität der Residuen ist nahezu konstant die Residuen sind unabhängig und Jede Variable ist linear mit dem Ergebnis verknüpft. Wie unterscheiden sich 1 und 2? Sie können einen …

1
Brüllen durch schrittweise Regression
Mir sind die Probleme der schrittweisen / vorwärts / rückwärts Auswahl in Regressionsmodellen gut bekannt. Es gibt zahlreiche Fälle, in denen Forscher die Methoden anprangern und auf bessere Alternativen hinweisen. Ich war gespannt, ob es Geschichten gibt, bei denen eine statistische Analyse vorliegt: hat schrittweise Regression verwendet; machte einige wichtige …

6
Vervollständigung einer 3x3-Korrelationsmatrix: Zwei Koeffizienten der drei angegebenen
Diese Frage wurde mir in einem Interview gestellt. Nehmen wir an, wir haben eine Korrelationsmatrix der Form ⎡⎣⎢10.60.80.61γ0.8γ1⎤⎦⎥[10,60.80,61γ0.8γ1]\begin{bmatrix}1&0.6&0.8\\0.6&1&\gamma\\0.8&\gamma&1\end{bmatrix} Angesichts dieser Korrelationsmatrix wurde ich gebeten, den Wert von Gamma zu ermitteln. Ich dachte, ich könnte etwas mit den Eigenwerten anfangen, da sie alle größer oder gleich 0 sein sollten. (Matrix sollte …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.