Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


2
Verwenden Boosting-Techniken Abstimmungen wie jede andere Ensemble-Methode?
Können wir alle Ensemblemethoden durch Abstimmung verallgemeinern? Verwenden Boosting-Methoden auch Abstimmungen, um die schwachen Lernenden in das endgültige Modell zu bringen? Mein Verständnis der Technik: Boosting: Fügt kontinuierlich schwache Lernende hinzu, um die Datenpunkte zu verbessern, die nicht korrekt klassifiziert wurden. Ensemble-Technik: Verwendet mehrere Lernende, um eine bessere Vorhersage zu …

2
Anomalieerkennung in Zeitreihen
Ich bin ein Anfänger mit maschinellem Lernen (ich habe Ngs Kurs beendet), ich benutze Scikit-Learn in Python. Ich möchte den besten Weg finden, um Anomalien in unserem System zu erkennen. Wir haben laufende Ereignisse, die nach einem Zeitplan auftreten (alle paar Minuten / Stunden), und ich möchte erkennen, wenn etwas …

1
Drittes zentrales Moment einer Summe einer Zufallszahl von iid-Zufallsvariablen
Inspiriert von dieser Frage versuchte ich, einen Ausdruck für den dritten zentralen Moment einer Summe einer Zufallszahl von iid-Zufallsvariablen zu erhalten. Meine Frage ist, ob es richtig ist und wenn nicht, was falsch ist oder welche zusätzlichen Annahmen fehlen könnten. Insbesondere lassen Sie: S=∑1NXi,S=∑1NXi,S=\sum_1^N{X_i}, wobeiNNN eine nicht negative Zufallsvariable mit …


3
Wie kann ich
Angenommen, ist eine Zufallsprobe von einer kontinuierlichen Verteilungsfunktion . Sei unabhängig von den . Wie kann ich ?Y.1, … , Y.n + 1Y1,…,Yn+1Y_1,\dots,Y_{n+1}F.FFX.∼ U n i fo r m {1,…,n}X.∼U.nichfÖrm{1,…,n}}X\sim\mathrm{Uniform}\{1,\dots,n\}Y.ichY.ichY_iE.[ ∑X.i = 1ich{ Y.ich≤ Y.n + 1}}]]E.[∑ich=1X.ich{Y.ich≤Y.n+1}}]]\mathrm{E}\!\left[\sum _{i=1}^X I_{\{Y_i\leq Y_{n+1}\}}\right]


1
Codieren von kategorialen Merkmalen mit hoher Kardinalität (viele Kategorien), wenn sich die Merkmale in Bezug auf die Kardinalität stark unterscheiden
Ich habe Fragen zur Codierung kategorialer Features durchgesehen, konnte jedoch keine finden, die mein Problem diskutieren. Entschuldigung, wenn ich es verpasst habe. Nehmen wir an, wir haben einen Datensatz mit binären und nominalen Variablen von jeweils ungefähr gleicher Bedeutung. Die meisten Klassifizierer können sich nicht direkt mit kategorialen Typen befassen, …

1
Wie kann man Laien davon abhalten, ungenaue Schlussfolgerungen über ihre Daten zu ziehen?
Ich arbeite als Datenanalyst, hauptsächlich in SQL, und versorge interne Kunden mit Betriebsdaten. Ich mache selten statistische Analysen. In letzter Zeit kamen interne Kunden mit Daten aus schlecht gestalteten Projekten (keine Kontrollgruppe, keine geplante Methodik usw.) zu mir und baten mich, Daten zu ihren Ergebnissen zu analysieren, damit sie ihre …


3
Unterschiedliche Ergebnisse nach Neigungsbewertung in R.
Ich habe Prospensity Score Matching durchgeführt (in R mit dem R-Paket "Matchit"). Ich habe die Matching-Methode "nächster Nachbar" verwendet. Nach dem Matching verglich ich die Behandlung und die Kontrollgruppe hinsichtlich ihrer Ergebnisvariablen. Für diesen Vergleich habe ich t-Test verwendet. Ich entdeckte, dass sich nach jedem Matching-Verfahren die Ergebnisse des T-Tests …

2
Bayesianische nichtparametrische Antwort auf tiefes Lernen?
So wie ich es verstehe, führen tiefe neuronale Netze "Repräsentationslernen" durch, indem sie Merkmale zusammenfügen. Dies ermöglicht das Lernen sehr hochdimensionaler Strukturen in den Merkmalen. Natürlich handelt es sich um ein parametrisches Modell mit einer festen Anzahl von Parametern, daher besteht die übliche Einschränkung, dass die Komplexität des Modells möglicherweise …

1
Vorteile von SVM als Werkzeug zur Ziffernerkennung
Ich bin ziemlich neu in der Ziffernerkennung und habe festgestellt, dass viele Tutorials die SVM-Klassifizierung verwenden, zum Beispiel: http://hanzratech.in/2015/02/24/handwritten-digit-recognition-using-opencv-sklearn-and-python.html http://scikit-learn.org/stable/auto_examples/classification/plot_digits_classification.html Ich würde gerne wissen, ob es für dieses Tool (domänenspezifische) Vorteile gibt, verglichen mit z Deep Learning neuronale Netze Klassifizierung nach k-Mitteln Vielen Dank für jeden Kommentar. Klarstellung, warum SVM …


1
Bedingte Erwartung einer verkürzten RV-Ableitung, Gumbelverteilung (logistischer Unterschied)
Ich habe zwei Zufallsvariablen, die unabhängig und identisch verteilt sind, dh :ϵ1,ϵ0∼iidGumbel(μ,β)ϵ1,ϵ0∼iidGumbel(μ,β)\epsilon_{1}, \epsilon_{0} \overset{\text{iid}}{\sim} \text{Gumbel}(\mu,\beta) F(ϵ)=exp(−exp(−ϵ−μβ)),F(ϵ)=exp⁡(−exp⁡(−ϵ−μβ)),F(\epsilon) = \exp(-\exp(-\frac{\epsilon-\mu}{\beta})), f(ϵ)=1βexp(−(ϵ−μβ+exp(−ϵ−μβ))).f(ϵ)=1βexp⁡(−(ϵ−μβ+exp⁡(−ϵ−μβ))).f(\epsilon) = \dfrac{1}{\beta}\exp(-\left(\frac{\epsilon-\mu}{\beta}+\exp(-\frac{\epsilon-\mu}{\beta})\right)). Ich versuche zwei Größen zu berechnen: Eϵ1Eϵ0|ϵ1[c+ϵ1|c+ϵ1&gt;ϵ0]Eϵ1Eϵ0|ϵ1[c+ϵ1|c+ϵ1&gt;ϵ0]\mathbb{E}_{\epsilon_{1}}\mathbb{E}_{\epsilon_{0}|\epsilon_{1}}\left[c+\epsilon_{1}|c+\epsilon_{1}>\epsilon_{0}\right] Eϵ1Eϵ0|ϵ1[ϵ0|c+ϵ1&lt;ϵ0]Eϵ1Eϵ0|ϵ1[ϵ0|c+ϵ1&lt;ϵ0]\mathbb{E}_{\epsilon_{1}}\mathbb{E}_{\epsilon_{0}|\epsilon_{1}}\left[\epsilon_{0}|c+\epsilon_{1}<\epsilon_{0}\right] Ich komme zu einem Punkt, an dem ich eine Integration für etwas in der Form durchführen muss: eexeexe^{e^{x}} , das in …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.