Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


2
Alternative Entfernungsmetriken für zwei Zeitreihen
Ich habe Zeitreihendaten von verschiedenen Häusern. Angenommen, es handelt sich um Stromverbrauchsdaten. Jetzt möchte ich die Häuser nach einem ähnlichen Stromverbrauchsmuster gruppieren. Zu den verschiedenen Entfernungsmetriken, die ich mir vorstellen kann, um die Ähnlichkeit zu messen, gehören: Euklidische Entfernung DTW- Entfernung Frechet Entfernung Mit euklidischer Distanz fand ich einen Ausreißer …

1
Fisher Informationen für
Ich habe viele Leute gesehen, die die Delta-Methode verwendeten, um die asymptotische Verteilung von zu finden rrr, der Probenkorrelationskoeffizient für bivariate Normaldaten. Diese Verteilung ist gegeben durch n- -- -√( r - ρ )- -→D.N.( 0 ,( 1 -ρ2)2)n(r- -ρ)→D.N.(0,(1- -ρ2)2)\sqrt{n} \left( r-\rho \right) \xrightarrow{D} \mathcal{N} \left(0, \left(1-\rho^2\right)^2 \right) und …

2
Grundlegendes zu Gefahrenfunktionswerten über 1
Ich habe immer wieder Probleme beim Verständnis der Gefährdungsraten. Ich weiß zum Beispiel, dass eine Gefährdungsrate im engeren Sinne keine Wahrscheinlichkeit ist, und es wird immer wieder erwähnt, dass die Gefährdungsrate aus diesem Grund keine Obergrenze hat. Habe ich Recht, wenn ich verstehe, dass Gefahrenfunktionswerte als sofortige Ausfallraten interpretiert werden …

1
Warum sind alle Lasso-Koeffizienten in Modell 0.0?
Ich verwende from sklearn.linear_model import Lassoin Python 2.7.6 Ich habe ein Skript geschrieben, mit dem ich eine Lasso-Regression für meine Features (X) und meine Ziele (y) durchgeführt habe. Ich habe es schon einmal verwendet und es funktioniert. Ich verwende es für einen neuen Datensatz (völlig andere Art von Daten) und …

2
Wie kann Unsicherheit in die Vorhersage eines neuronalen Netzwerks übertragen werden?
Ich habe Eingaben , die Unsicherheiten gekannt haben . Ich benutze sie, um die Ausgaben in einem trainierten neuronalen Netzwerk vorherzusagen . Wie kann ich 1 Unsicherheiten bei meinen Vorhersagen erhalten?x1…xnx1…xnx_1\ldots x_n1σ1σ1\sigmaϵ1…ϵnϵ1…ϵn\epsilon_1 \ldots \epsilon_ny1…ymy1…ymy_1 \ldots y_mσσ\sigma Meine Idee ist es, jeden Eingang zufällig mit normalem Rauschen mit dem Mittelwert 0 …


2
Warum ist die von Breiman vorgeschlagene Metrik mit variabler Wichtigkeit nur für zufällige Wälder spezifisch?
Im Random Forest- Artikel beschreiben sie eine gute Möglichkeit, die Wichtigkeit einer Variablen zu messen: Nehmen Sie Ihre Validierungsdaten, messen Sie die Fehlerrate, permutieren Sie die Variable und messen Sie die Fehlerrate neu. Frage - warum ist diese Methode spezifisch für zufällige Wälder? Ich verstehe, dass wir in anderen Klassifikatoren …



3
Interpretation der Ausgabe von ctree {partykit} in R.
Datengenauigkeiten: Zitat ist eine Dummy-Variable Minuten zählen alle Minuten innerhalb eines Tages Temperatur ist die Temperatur Hier ist mein Code: ctree <- ctree(quotation ~ minute + temp, data = visitquot) print(ctree) Fitted party: [1] root | [2] minute <= 600 | | [3] minute <= 227 | | | [4] …

2
Entspricht der Mahalanobis-Abstand dem euklidischen Abstand in den PCA-gedrehten Daten?
Ich bin zu der Überzeugung gelangt (siehe hier und hier ), dass der Mahalanobis-Abstand dem euklidischen Abstand in den PCA-gedrehten Daten entspricht. Mit anderen Worten, multivariate normale DatenX.XX, die Mahalanobis Entfernung aller xxx's von einem bestimmten Punkt (sagen wir 00\mathbf{0}) sollte dem euklidischen Abstand der Einträge von entsprechen X.r o …

2
Wie werden Diagramme von k-nächsten Nachbarn erstellt? (zum Clustering)
Ich habe gesehen, dass es mehrere Clustering-Algorithmen gibt (zum Beispiel CHAMELEON oder sogar Spectral Clustering), die die Daten in einen gewichteten (oder manchmal ungewichteten) k-Nächsten-Nachbarn-Graphen konvertieren, basierend auf den Abständen zwischen Punkten / Beobachtungen / Zeilen und Ich habe mich gefragt, wie diese Grafiken generiert werden. Sind diese Grafiken gerichtet? …


5
Was ist Kalibrierung?
Was bedeutet es, Vermessungsgewichte zu kalibrieren? Was sind andere Definitionen der Kalibrierung in der Statistik? Ich habe gehört, dass es in verschiedenen Zusammenhängen verwendet wird, insbesondere bei der Risikoprognose (in Bezug darauf, ob die Gesamtzahl der vorhergesagten Ereignisse in einer Kohorte statistisch mit der beobachteten Anzahl von Ereignissen übereinstimmt). Gibt …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.