Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Zastosowanie środkowej wypolerowanej do wyboru funkcji
W artykule, który ostatnio czytałem, w sekcji analizy danych natknąłem się na następujący fragment: Tabela danych została następnie podzielona na tkanki i linie komórkowe, a dwie podtabele zostały oddzielnie wypolerowane mediany (wiersze i kolumny zostały iteracyjnie dostosowane do mediany 0) przed ponownym połączeniem w pojedynczą tabelę. W końcu wybraliśmy podzbiór …

2
Jak interpretować wyniki testu Breuscha-Pagana?
Na Rmożna przeprowadzić test Breuscha-Pagan heteroskedastyczności za pomocą ncvTestfunkcji caropakowania. Test Breuscha-Pagana jest rodzajem testu chi-kwadrat. Jak interpretować te wyniki: > require(car) > set.seed(100) > x1 = runif(100, -1, 1) > x2 = runif(100, -1, 1) > ncvTest(lm(x1 ~ x2)) Non-constant Variance Score Test Variance formula: ~ fitted.values Chisquare = …


1
Pomiar korelacji wyszkolonych sieci neuronowych
Trenuję sztuczną sieć neuronową (propagacja wsteczna, sprzężenie zwrotne) z niestandardowymi danymi rozproszonymi. Oprócz błędu średniej kwadratowej błędu literatura często sugeruje współczynnik korelacji Pearsona do oceny jakości trenowanej sieci. Ale czy współczynnik korelacji Pearsona jest rozsądny, jeśli dane treningowe nie są normalnie dystrybuowane? Czy nie byłoby bardziej rozsądne stosowanie miary korelacji …

1
Realizacja współczynnika częściowego wyznaczenia
Czy ktoś ma sugestie lub pakiety, które obliczą współczynnik częściowego określenia? Współczynnik częściowego wyznaczenia można zdefiniować jako procent zmienności, którego nie można wyjaśnić w modelu zredukowanym, ale można go wyjaśnić za pomocą predyktorów określonych w modelu pełnym (er). Ten współczynnik służy do uzyskania wglądu, czy jeden lub więcej dodatkowych predyktorów …
9 r  regression  anova 

2
Czy poprawnie określam swój model Lmer?
Przeszukałem Google i tę stronę i nadal jestem zdezorientowany co do funkcji lmer w bibliotece lme4. Mam dane zebrane z różnych oddziałów psychiatrycznych, które mają wielopoziomową strukturę. Aby uprościć, wybiorę dwie zmienne poziomu 2 i dwie zmienne poziomu 1, chociaż tak naprawdę mam kilka innych. Poziom 2 - WardSize [jest …

1
Efekt brzegowy w analizie wielu rozdzielczości falkowej
Jakie są metody minimalizacji efektu granic w rozkładzie falkowym? Używam R i pakietu wavelim . Znalazłem na przykład funkcję ?brick.wall ale Nie za bardzo używam tego, jak go używać. Nie jestem pewien, czy najlepszym rozwiązaniem jest usunięcie pewnego współczynnika. Czytałem gdzieś, że istnieją pewne falki, które nie są wszędzie takie …

4
Jak wyszukać procedurę statystyczną w języku R?
Czy istnieje pakiet R, strona internetowa lub polecenie, które pozwolą wyszukać określoną procedurę statystyczną, której pragną? Na przykład, jeśli chciałbym znaleźć pakiet z transformacją Box-Coxa, strona internetowa / pakiet / polecenie może zwrócić „MASS” i skierować mnie do boxcox()funkcji. Jest to dość proste z czymś takim jak Box-Cox, ale miałem …
9 r 

2
Pierwsze kroki z biclustering
Przeprowadziłem przypadkowe badania internetowe dotyczące biclusters. (Przeczytałem kilka razy artykuł na Wiki). Jak dotąd wydaje się, że istnieje kilka definicji lub standardowej terminologii. Zastanawiałem się, czy są jakieś standardowe gazety lub książki, które powinien przeczytać każdy, kto jest zainteresowany algorytmami znajdowania bullusterów. Czy można powiedzieć, jaki jest stan techniki w …



1
Zmienna kodowa w funkcji nlm ()
W R jest funkcja nlm (), która dokonuje minimalizacji funkcji f przy użyciu algorytmu Newtona-Raphsona. W szczególności funkcja ta generuje wartość kodu zmiennej zdefiniowanego następująco: zakoduj liczbę całkowitą wskazującą, dlaczego proces optymalizacji został zakończony. 1: gradient względny jest bliski zeru, prawdopodobnie obecny iterat jest rozwiązaniem. 2: kolejne iteracje w granicach …
9 r  minimum 

1
W jaki sposób test HSD Tukeya może być bardziej znaczący niż nieskorygowana wartość P t.test?
Przyszedłem przez post „ Post-hoc Parowe porównania dwukierunkowej ANOVA ” (odpowiadając na ten post ), który pokazuje, co następuje: dataTwoWayComparisons <- read.csv("http://www.dailyi.org/blogFiles/RTutorialSeries/dataset_ANOVA_TwoWayComparisons.csv") model1 <- aov(StressReduction~Treatment+Age, data =dataTwoWayComparisons) summary(model1) # Treatment is signif pairwise.t.test(dataTwoWayComparisons$StressReduction, dataTwoWayComparisons$Treatment, p.adj = "none") # no signif pair TukeyHSD(model1, "Treatment") # mental-medical is the signif pair. (Dane …

3
Jak mogę przyspieszyć obliczanie ustalonych efektów w GLMM?
Robię badanie symulacyjne, które wymaga oszacowań ładowania uzyskanych z uogólnionego liniowego modelu mieszanego (w rzeczywistości iloczyn dwóch oszacowań dla ustalonych efektów, jednego z GLMM i jednego z LMM). Prawidłowe wykonanie badania wymagałoby około 1000 symulacji z 1000 lub 1500 replikami ładowania początkowego za każdym razem. To zajmuje dużo czasu na …
9 r  mixed-model 

1
Jaka rozdzielczość czasowa dla testu istotności szeregów czasowych?
Potrzebuję wskazówek na temat odpowiedniego poziomu puli, aby użyć do testów różnicy średnich danych szeregów czasowych. Niepokoi mnie pseudo-replikacja czasowa i ofiarna, która wydaje się być napięta w przypadku tej aplikacji. Odnosi się to raczej do badania mensuralnego niż do eksperymentu manipulacyjnego. Rozważ ćwiczenie monitorowania : system czujników mierzy zawartość …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.