Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Schätzung der Populationsgröße anhand der Häufigkeit der Stichproben von Duplikaten und Unikaten
Es gibt einen Webservice, über den ich Informationen zu einem zufälligen Artikel anfordern kann. Für jede Anfrage hat jeder Artikel die gleiche Chance, zurückgeschickt zu werden. Ich kann weiterhin Artikel anfordern und die Anzahl der Duplikate und Unikate aufzeichnen. Wie kann ich diese Daten verwenden, um die Gesamtzahl der Artikel …

1
Ableiten der gesamten Streumatrix (innerhalb der Klasse + zwischen den Klassen)
Ich habe mit PCA- und LDA-Methoden herumgespielt und bin an einem Punkt festgefahren. Ich habe das Gefühl, dass es so einfach ist, dass ich es nicht sehen kann. Innerhalb-Klasse ( SWSWS_W ) und zwischen-Klasse ( SBSBS_B ) scatter Matrices ist definiert als: SW=∑i=1C∑t=1N(xit−μi)(xit−μi)TSW=∑i=1C∑t=1N(xti−μi)(xti−μi)T S_W = \sum_{i=1}^C\sum_{t=1}^N(x_t^i - \mu_i)(x_t^i - \mu_i)^T …


2
Modell zur Schätzung der Bevölkerungsdichte
Eine Datenbank mit (Bevölkerung, Fläche, Form) kann verwendet werden, um die Bevölkerungsdichte abzubilden, indem jeder Form ein konstanter Wert für Bevölkerung / Fläche zugewiesen wird (dies ist ein Polygon wie ein Zensusblock, ein Gebiet, eine Grafschaft, ein Bundesland usw.). Die Populationen sind jedoch normalerweise nicht gleichmäßig in ihren Polygonen verteilt. …

2
Erklären Sie die Modellanpassung in einfachem Englisch
Wenn ich über Methoden und Ergebnisse statistischer Analysen, insbesondere in der Epidemiologie, lese, höre ich sehr oft über die Anpassung oder Steuerung der Modelle. Wie würden Sie einem Nicht-Statistiker den Zweck davon erklären? Wie interpretieren Sie Ihre Ergebnisse nach der Steuerung für bestimmte Variablen? Ein kleiner Durchgang in Stata oder …

1
Wie wird die für die ANOVA-Wiederholungsmessung benötigte Probengröße bestimmt?
Ich brauche Hilfe bei ANOVA-Wiederholungsmessungen. Wir untersuchen die Auswirkungen einiger Eingriffe auf die Senkung der BSI-Rate (Blood Stream Infection) in einigen Stationen. Wir planen, die BSI-Rateninformationen monatlich zu erfassen, 12 Monate ohne Intervention zuerst, dann 12 Monate mit Intervention. Wir überlegen, entweder eine Zeitreihen- oder eine wiederholte ANOVA-Messung durchzuführen. Ich …


3
Wo ist die Bombe: Wie schätzt man die Wahrscheinlichkeit, gegebene Zeilen- und Spaltensummen?
Diese Frage ist von einem Minispiel von Pokemon Soulsilver inspiriert: Stellen Sie sich vor, in diesem 5x6-Bereich sind 15 Bomben versteckt (BEARBEITEN: maximal 1 Bombe / Zelle): Wie schätzen Sie die Wahrscheinlichkeit ein, eine Bombe auf einem bestimmten Feld zu finden, wenn man die Gesamtzahl der Zeilen / Spalten berücksichtigt? …

1
Gibt es eine Bayes'sche Interpretation für REML?
Gibt es eine Bayesianische Interpretation von REML? Meiner Intuition nach hat REML eine starke Ähnlichkeit mit sogenannten empirischen Bayes- Schätzverfahren, und ich frage mich, ob eine Art asymptotischer Äquivalenz (etwa unter einer geeigneten Klasse von Priors) nachgewiesen wurde. Sowohl empirische Bayes als auch REML scheinen als "kompromittierte" Schätzungsansätze zu gelten, …

2
Warum hat der L2-Normverlust eine eindeutige Lösung und der L1-Normverlust möglicherweise mehrere Lösungen?
http://www.chioka.in/differences-between-l1-and-l2-as-loss-function-and-regularization/ Wenn Sie oben in diesem Beitrag nachsehen, erwähnt der Verfasser, dass die L2-Norm eine eindeutige Lösung und die L1-Norm möglicherweise viele Lösungen enthält. Ich verstehe dies als Regularisierung, aber nicht als Verwendung der L1-Norm oder der L2-Norm in der Verlustfunktion. Wenn Sie sich Diagramme der Funktionen von skalarem x …

1
Oracle-Ungleichung: Grundsätzlich
Ich gehe ein Papier durch, das Orakel-Ungleichungen verwendet, um etwas zu beweisen, aber ich kann nicht verstehen, was es überhaupt versucht. Als ich online nach "Oracle Inequality" suchte, verwiesen mich einige Quellen auf den Artikel "Candes, Emmanuel J.". finden Sie hier https://statweb.stanford.edu/~candes/papers/NonlinearEstimation.pdf . Aber dieses Buch scheint mir zu schwer …


1
Sensitivitätsanalyse in tiefen neuronalen Netzen
Nach einer bereits beantworteten Frage ( Auslesen der Wichtigkeit von Einschicht-Feed-Forward- Netzen) suche ich nach Rückschlüssen auf die Relevanz von Eingaben in neuronalen Netzen. Angesichts eines tiefen Netzes, in dem die Rekonstruktion der Eingangsbedeutung durch Rückwärtsdurchlaufen der Schichten vom interessierenden Ausgangsknoten schwierig oder zeitaufwendig sein kann, habe ich mich gefragt, …


6
Mischen von Daten im Mini-Batch-Training des neuronalen Netzes
Beim Mini-Batch-Training eines neuronalen Netzwerks habe ich gehört, dass es eine wichtige Praxis ist, die Trainingsdaten vor jeder Epoche zu mischen. Kann jemand erklären, warum das Mischen in jeder Epoche hilft? In der Google-Suche habe ich die folgenden Antworten gefunden: Es hilft dem Training, sich schnell anzunähern Es verhindert jegliche …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.