Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


6
Teoria grafów - analiza i wizualizacja
Nie jestem pewien, czy podmiot ten zainteresuje się CrossValidated. Powiesz mi Muszę przestudiować wykres (z teorii grafów ) tj. Mam pewną liczbę połączonych kropek. Mam tabelę ze wszystkimi kropkami i kropkami, od których każda jest zależna. (Mam też inną tabelę z implikacjami) Moje pytania brzmią: czy istnieje dobre oprogramowanie (lub …

1
Dlaczego funkcje R „princomp” i „prcomp” dają różne wartości własne?
Aby to odtworzyć, możesz użyć zestawu danych decathlon {FactoMineR}. Pytanie brzmi, dlaczego obliczone wartości własne różnią się od wartości macierzy kowariancji. Oto wartości własne przy użyciu princomp: > library(FactoMineR);data(decathlon) > pr <- princomp(decathlon[1:10], cor=F) > pr$sd^2 Comp.1 Comp.2 Comp.3 Comp.4 Comp.5 Comp.6 1.348073e+02 2.293556e+01 9.747263e+00 1.117215e+00 3.477705e-01 1.326819e-01 Comp.7 Comp.8 …
22 r  pca 


2
Proces Markowa tylko w zależności od poprzedniego stanu
Chciałbym tylko, aby ktoś potwierdził moje zrozumienie lub jeśli czegoś mi brakuje. Definicja procesu markowa mówi, że następny krok zależy tylko od aktualnego stanu, a nie od poprzednich stanów. Powiedzmy, że mieliśmy przestrzeń stanu a, b, c, d i przechodzimy od a-> b-> c-> d. Oznacza to, że przejście na …


1
Korekta testowania wielu hipotez z Benjamini-Hochberg, wartości p czy wartości q?
Biorąc pod uwagę listę wartości p wygenerowanych z niezależnych testów, posortowanych w porządku rosnącym, można zastosować procedurę Benjamini-Hochberga do wielokrotnej korekty testu . Dla każdej wartości p procedura Benjamini-Hochberg umożliwia obliczenie współczynnika fałszywego wykrywania (FDR) dla każdej z wartości p. Oznacza to, że w każdej „pozycji” na posortowanej liście wartości …

3
Bezstronna ocena macierzy kowariancji dla wielokrotnie cenzurowanych danych
Analizy chemiczne próbek środowiskowych są często cenzurowane poniżej limitów sprawozdawczych lub różnych limitów wykrywalności / ilościowych. Te ostatnie mogą się różnić, zwykle proporcjonalnie do wartości innych zmiennych. Na przykład, próbka o wysokim stężeniu jednego związku może wymagać rozcieńczenia do analizy, co spowoduje proporcjonalne zawyżenie limitów cenzury dla wszystkich innych związków …

6
Różnice grupowe dla pięciopunktowego elementu Likerta
W następstwie tego pytania : Wyobraź sobie, że chcesz sprawdzić różnice w tendencji centralnej między dwiema grupami (np. Mężczyznami i kobietami) w 5-punktowym elemencie Likerta (np. Zadowolenie z życia: niezadowolony z zadowolonego). Myślę, że test t byłby wystarczająco dokładny dla większości celów, ale że test ładowania początkowego różnic między średnimi …

9
Jak dowiedzieć się, jaki rodzaj dystrybucji reprezentuje te dane w czasach odpowiedzi ping?
Próbowałem procesu z rzeczywistego świata, czasy pingów w sieci. „Czas podróży w obie strony” jest mierzony w milisekundach. Wyniki wykreślono na histogramie: Czasy pingowania mają minimalną wartość, ale długi górny ogon. Chcę wiedzieć, co to jest rozkład statystyczny i jak oszacować jego parametry. Mimo że rozkład nie jest rozkładem normalnym, …





3
Wskaźniki klasyfikacji / oceny dla wysoce niezrównoważonych danych
Mam do czynienia z problemem wykrywania oszustw (podobnym do punktacji kredytowej). W związku z tym istnieje wysoce niezrównoważony stosunek między fałszywymi i nieuczciwymi obserwacjami. http://blog.revolutionanalytics.com/2016/03/com_class_eval_metrics_r.html zapewnia doskonały przegląd różnych wskaźników klasyfikacji. Precision and Recalllub kappaoba wydają się być dobrym wyborem: Jednym ze sposobów uzasadnienia wyników takich klasyfikatorów jest porównanie ich …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.