Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Sprachmodellierung: Warum ist das Addieren von 1 so wichtig?
In vielen Anwendungen zur Verarbeitung natürlicher Sprache wie Rechtschreibkorrektur, maschinelle Übersetzung und Spracherkennung verwenden wir Sprachmodelle. Sprachmodelle werden normalerweise erstellt, indem gezählt wird, wie oft Wortfolgen (n-Gramm) in einem großen Korpus vorkommen, und die Anzahl normalisiert wird, um eine Wahrscheinlichkeit zu erstellen. Um unsichtbare n-Gramm zu berücksichtigen, verwenden wir Glättungsmethoden …

3
Unsicherheits- und Sensitivitätsanalyse
Ich habe folgendes Problem: Bei gegebenen Eingaben ( dimensionaler Vektor) von Skalaren, geordneten ganzen Zahlen und ungeordneten ganzen Zahlen (dh Beschriftungen) und einer oder mehreren Ausgaben möchte ich Folgendes schätzen:xxxnnnyyy Welche Eingänge erklären die Ausgänge am besten? Inwieweit Variationen eines Eingangs Variationen der Ausgänge implizieren. Dies soll mit der Unsicherheits- …



5
Ist 0 ein gültiger Wert in einer Likert-Skala?
Ich habe meine Pilotstudie zur Motivation des Sprachenlernens auf einer 6-Punkte-Likert-Skala durchgeführt, aber von 0 (stimme überhaupt nicht zu) bis 5 (stimme voll zu). Ich habe festgestellt, dass ein Kollege in seiner Umfrage 1 bis 6 verwendet hat. Werden meine berechneten Variablen (Summe und Mittelwert) dieselben sein, als hätte ich …

3
Multilabel logistische Regression
Gibt es eine Möglichkeit, mithilfe der logistischen Regression mehrfach beschriftete Daten zu klassifizieren? Mit mehrfach beschriftet meine ich Daten, die gleichzeitig zu mehreren Kategorien gehören können. Ich möchte diesen Ansatz verwenden, um einige biologische Daten zu klassifizieren.

1
Können wir basierend auf Faktorladungen (in der Faktoranalyse) Likert-Skalenelementen ungleiche Gewichte geben?
Nach dem Sammeln der Daten berechnen wir die Bewertung einer beliebigen Likert-Skala (summativ) (zuvor als Faktor in der Faktoranalyse identifiziert), indem wir die Bewertungen der einzelnen Elemente addieren (und möglicherweise die Summe durch die Anzahl der Elemente dividieren, um die durchschnittliche Bewertung zu erhalten). Bei dieser Berechnung gehen wir davon …


1
Müssen Eingaben in ein neuronales Netzwerk in [-1,1] sein?
Ich möchte eine Wettervorhersage mit Neuronalen Netzen erstellen. Alle Beispiele, die ich gesehen habe, verwendeten nur Werte [-1,1] als Eingabe. Ist es auch möglich, größere Werte (wie Luftdruck, Gradkalkius der letzten Tage, ...) als Eingaben zu verwenden und eine Zahl als Ausgabe zu erhalten? Vielen Dank

1
Ist die Homogenität der Proben eine Annahme der Regressionsanalyse?
Ich habe angenommen (dh ich glaube, ich wurde vor längerer Zeit unterrichtet, als ich mich erinnern kann), dass Regressionsanalysen davon ausgehen, dass eine Stichprobe homogen ist. Ist dies nicht der Fall, müssen Sie entweder Dummy-Variablen zum Code für die verschiedenen in der Stichprobe enthaltenen Gruppen hinzufügen oder eine ANCOVA durchführen, …


1
Was ist ein stationäres Gaußsches Feld?
Ich weiß, was ein Gaußsches Feld ist. Ich bin mir jedoch nicht ganz sicher, was unter stationär zu verstehen ist. Ich habe dieses stationäre Ding an vielen Orten wie stationären autoregressiven Prozessen usw. gesehen, weiß aber nicht wirklich, was unter stationär zu verstehen ist.

6
Online-Referenz zur Überprüfung des einführenden Statistikmaterials
Kann jemand eine gute Bewertungsreferenz (unbedingt kostenloses Online-PDF) vorschlagen, um Statistiken auf College-Ebene aufzufrischen? Ich schaue mir etwas an, das normalerweise einen ersten Kurs in Statistik abdeckt und idealerweise Folgendes abdeckt: Absolute Grundlagen (Mittelwert, Varianz etc.) Große Proben Vertrauensprüfung Hypothesentest (normal, t, chi, F) Lineare Regression / Korrelation Ich brauche …

3
Wie ist die Verteilung dieser Daten?
Ich habe die Daten erhalten, die Verteilung der Daten geplottet und die Funktion qqnorm verwendet, aber es scheint, dass sie keiner Normalverteilung folgt. Welche Verteilung sollte ich also verwenden, um die Daten zu beschreiben? Empirische kumulative Verteilungsfunktion

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.