Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


2
Markov-Prozess nur in Abhängigkeit vom vorherigen Status
Ich möchte nur, dass jemand mein Verständnis bestätigt oder mir etwas fehlt. Die Definition eines Markov-Prozesses besagt, dass der nächste Schritt nur vom aktuellen Status und nicht von früheren Status abhängt. Nehmen wir also an, wir hatten einen Zustandsraum von a, b, c, d und gehen von a-> b-> c-> …

3
Unvoreingenommene Schätzung der Kovarianzmatrix für mehrfach zensierte Daten
Chemische Analysen von Umweltproben werden im Folgenden häufig an Meldegrenzen oder verschiedenen Nachweis- / Bestimmungsgrenzen zensiert. Letztere können variieren, normalerweise proportional zu den Werten anderer Variablen. Beispielsweise muss möglicherweise eine Probe mit einer hohen Konzentration einer Verbindung zur Analyse verdünnt werden, was zu einem proportionalen Aufpumpen der Zensurgrenzwerte für alle …

6
Graphentheorie - Analyse und Visualisierung
Ich bin nicht sicher, ob das Thema in das CrossValidated-Interesse eintritt. Du wirst es mir sagen. Ich muss einen Graphen studieren (aus der Graphentheorie ) dh. Ich habe eine bestimmte Anzahl von Punkten, die verbunden sind. Ich habe eine Tabelle mit allen Punkten und den Punkten, von denen jeder abhängig …



9
Wie finde ich heraus, welche Art von Verteilung diese Daten zu Ping-Antwortzeiten darstellt?
Ich habe einen realen Prozess abgetastet, Netzwerk-Ping-Zeiten. Die "Umlaufzeit" wird in Millisekunden gemessen. Die Ergebnisse werden in einem Histogramm aufgezeichnet: Ping-Zeiten haben einen Mindestwert, aber einen langen oberen Schwanz. Ich möchte wissen, um welche statistische Verteilung es sich handelt und wie man die Parameter abschätzt. Auch wenn es sich bei …





3
Klassifizierungs- / Bewertungsmetriken für stark unausgeglichene Daten
Ich beschäftige mich mit einem (kreditbewertungsähnlichen) Problem der Betrugserkennung. Insofern besteht ein sehr unausgewogenes Verhältnis zwischen betrügerischen und nicht betrügerischen Beobachtungen. http://blog.revolutionanalytics.com/2016/03/com_class_eval_metrics_r.html bietet einen hervorragenden Überblick über verschiedene Klassifizierungsmetriken. Precision and Recalloder kappabeide scheinen eine gute Wahl zu sein: Eine Möglichkeit, die Ergebnisse solcher Klassifikatoren zu rechtfertigen, besteht darin, sie …


2
Trennen alle Algorithmen für maschinelles Lernen Daten linear?
Ich bin ein Enthusiast des Programmierens und des maschinellen Lernens. Vor ein paar Monaten habe ich angefangen, maschinelles Lernen zu lernen. Wie viele andere, die keinen quantitativen wissenschaftlichen Hintergrund haben, habe ich mich auch mit ML befasst, indem ich an den Algorithmen und Datensätzen des weit verbreiteten ML-Pakets (Caret R) …

6
Wahrscheinlichkeit - Warum multiplizieren?
Ich beschäftige mich mit der Maximum-Likelihood-Schätzung und lese, dass die Likelihood-Funktion das Produkt der Wahrscheinlichkeiten jeder Variablen ist. Warum ist es das Produkt? Warum nicht die Summe? Ich habe versucht, auf Google zu suchen, finde aber keine aussagekräftigen Antworten. https://en.wikipedia.org/wiki/Maximum_likelihood

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.