Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Wie erhält man Entscheidungsgrenzen aus linearer SVM in R?
Ich benötige ein Paket, das mir die Gleichung für ein lineares SVM-Modell geben kann. Zur Zeit benutze ich e1071 wie folgt : library(e1071) m = svm(data, labels, type='C', kernel='linear', cost=cost, probability=FALSE, scale=scale) w = t(m$coefs) %*% data[m$index,] #Weight vector b = -model$rho #Offset Ich bin mir jedoch nicht sicher, wie …
9 r  svm  e1071 

1
Klassifizierung mit einem dominanten Prädiktor
Ich habe ein Klassifizierungsproblem ( Klasse) mit etwa 100 reellen Prädiktoren, von denen einer viel mehr Erklärungskraft zu haben scheint als jeder andere. Ich möchte näher auf die Auswirkungen der anderen Variablen eingehen. Standardtechniken des maschinellen Lernens (zufällige Wälder, SVMs usw.) scheinen jedoch von dem einen starken Prädiktor überflutet zu …

2
Stimmungsanalyse verstehen und anwenden
Mir wurde gerade ein Projekt zur Durchführung von Stimmungsanalysen für einige Dokumentensammlungen zugewiesen. Durch Googeln ist eine Menge sentimentaler Forschung aufgetaucht. Meine Fragen sind: Was sind die wichtigsten Methoden / Algorithmen für die Stimmungsanalyse im Bereich des maschinellen Lernens und der statistischen Analyse? Gibt es gut etablierte Ergebnisse? Gibt es …

1
Einfache Kombinations- / Wahrscheinlichkeitsfrage basierend auf Stringlänge und möglichen Zeichen
Unter der Annahme einer "vollständigen Zufälligkeit" und einer Zeichenfolge mit einer Länge von 20 Zeichen, wobei jedes Zeichen eines von 62 möglichen Zeichen sein kann: Wie viele Kombinationen sind insgesamt möglich? (Errate 20 hoch 62.) Wenn neue Zeichenfolgen nacheinander zufällig ausgewählt und zu einer Liste der bisher ausgewählten Zeichenfolgen hinzugefügt …

3
Korrelation zwischen Matrizen in R.
Ich habe Probleme bei der Verwendung der cor()und cor.test()Funktionen. Ich habe nur zwei Matrizen (nur numerische Werte und die gleiche Anzahl von Zeilen und Spalten) und ich möchte die Korrelationsnummer und den entsprechenden p-Wert haben. Wenn ich benutze, cor(matrix1, matrix2)erhalte ich die Korrelationskoeffizienten für alle Zellen. Ich möchte nur eine …
9 r  correlation 

1
Wie versteht man standardisierte Residuen in der Regressionsanalyse?
Gemäß der Regressionsanalyse anhand eines Beispiels ist das Residuum die Differenz zwischen der Antwort und dem vorhergesagten Wert. Dann wird gesagt, dass jedes Residuum eine andere Varianz aufweist, sodass standardisierte Residuen berücksichtigt werden müssen. Die Varianz gilt jedoch für eine Gruppe von Werten. Wie kann ein einzelner Wert eine Varianz …


1
Wie kann ich nachweisen, dass die Versuchsdaten der Verteilung mit schwerem Schwanz folgen?
Ich habe mehrere Testergebnisse der Serverantwortverzögerung. Nach unserer theoretischen Analyse sollte die Verzögerungsverteilung (die Wahrscheinlichkeitsverteilungsfunktion der Antwortverzögerung) ein schweres Verhalten aufweisen. Aber wie könnte ich beweisen, dass das Testergebnis einer Verteilung mit schwerem Schwanz folgt?

2
AUC in der ordinalen logistischen Regression
Ich verwende zwei Arten der logistischen Regression - eine ist die einfache Art für die binäre Klassifizierung und die andere ist die ordinale logistische Regression. Zur Berechnung der Genauigkeit der ersten habe ich eine Kreuzvalidierung verwendet, bei der ich die AUC für jede Falte berechnet und dann die mittlere AUC …


2
Wie führe ich eine Variablenauswahl für genetische Algorithmen in R für SVM-Eingabevariablen durch?
Ich verwende das Kernlab- Paket in R, um eine SVM zum Klassifizieren einiger Daten zu erstellen. Die SVM funktioniert insofern gut, als sie "Vorhersagen" für eine anständige Genauigkeit liefert. Meine Liste der Eingabevariablen ist jedoch größer als ich möchte, und ich bin mir nicht sicher, welche relative Bedeutung die verschiedenen …

3
Wie wende ich einen Koeffiziententerm für Faktoren und interaktive Terme in einer linearen Gleichung an?
Mit R habe ich ein lineares Modell für eine einzelne Antwortvariable aus einer Mischung von kontinuierlichen und diskreten Prädiktoren angepasst. Dies ist sehr einfach, aber ich habe Probleme zu verstehen, wie ein Koeffizient für einen diskreten Faktor funktioniert. Konzept: Natürlich wird der Koeffizient der stetigen Variablen 'x' in der Form …

4
In welcher Beziehung steht der erwartete Wert zu Mittelwert, Median usw. in einer nicht normalen Verteilung?
In welcher Beziehung steht der erwartete Wert einer kontinuierlichen Zufallsvariablen zu ihrem arithmetischen Mittel, Median usw. in einer nicht normalen Verteilung (z. B. Skew-Normal)? Ich interessiere mich für alle gängigen / interessanten Distributionen (z. B. logarithmische, einfache bi / multimodale Distributionen, alles andere, was seltsam und wunderbar ist). Ich suche …

2
Kreuzkorrelation gegen gegenseitige Information
Was ist der Unterschied zwischen Kreuzkorrelation und gegenseitiger Information? Welche Probleme können mit diesen Maßnahmen gelöst werden und wann ist es angebracht, sie übereinander anzuwenden? Danke für die Kommentare. Zur Verdeutlichung wird die Frage eher durch ein Interesse an der Bildanalyse als an der Zeitreihenanalyse ausgelöst, obwohl auch jede Aufklärung …

2
Entfernen Sie Duplikate aus dem Trainingssatz zur Klassifizierung
Nehmen wir an, ich habe eine Reihe von Zeilen für ein Klassifizierungsproblem: X1,...XN,YX1,...XN,YX_1, ... X_N, Y Wobei die Merkmale / Prädiktoren sind und die Klasse ist, zu der die Merkmalskombination der Zeile gehört.X1,...,XNX1,...,XNX_1, ..., X_NYYY Viele Feature-Kombinationen und ihre Klassen werden im Datensatz wiederholt, den ich zum Anpassen eines Klassifikators …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.