Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


6
Wielokoliniowość, gdy poszczególne regresje są znaczące, ale VIF są niskie
Mam 6 zmiennych ( ), których używam do przewidywania . Podczas przeprowadzania analizy danych najpierw wypróbowałem wielokrotną regresję liniową. Z tego tylko dwie zmienne były znaczące. Kiedy jednak przeprowadziłem regresję liniową, porównując każdą zmienną indywidualnie z wartością , wszystkie oprócz jednej były znaczące ( wszędzie od mniej niż 0,01 do …



2
Co stoi na przeszkodzie wykorzystywaniu pulsacyjnych sieci neuronowych w aplikacjach?
Pulsacyjne lub impulsowe sieci neuronowe zawierają więcej dynamiki błonowej neuronów biologicznych, gdzie impulsy przenoszą informacje do następnej warstwy. Neurony niekoniecznie muszą „strzelać” jednocześnie, tak jak na przykład w backpropie. Wydaje się jednak, że istnieją przeszkody w stosowaniu tych modeli w przypadku problemów z uczeniem maszynowym. Jakie konkretne problemy stoją na …

2
W jakim momencie n-gramy przynosi efekt przeciwny do zamierzonego?
Podczas przetwarzania języka naturalnego można wziąć korpus i ocenić prawdopodobieństwo wystąpienia następnego słowa w sekwencji n. n jest zwykle wybierane jako 2 lub 3 (bigramy i trygramy). Czy istnieje znany punkt, w którym śledzenie danych dla n-tego łańcucha staje się nieproduktywne, biorąc pod uwagę czas potrzebny do sklasyfikowania konkretnego korpusu …

2
Zmienne zależne od filogenetyki: ANOVA?
Rozumiem, że wyprowadzanie macierzy kowariancji z danych filogenetycznych w celu uzyskania dla dwóch zmiennych, na których dokonuje się regresji. Ale co się stanie, jeśli masz jedną zmienną ciągłą, która wcześniej była zależna od filogenezy, i jedną zmienną porządkową? Ten ostatni jest porządkowy, nie jestem pewien, jak powiązać to ze sposobem, …
13 anova  phylogeny 

1
Jaka jest prawdziwa odpowiedź na pytanie urodzinowe?
„Jak duża musi być klasa, aby prawdopodobieństwo znalezienia dwóch osób w te same urodziny co najmniej 50%?” Mam na Facebooku 360 znajomych i, zgodnie z oczekiwaniami, rozkład ich urodzin wcale nie jest jednolity. Mam jeden dzień z 9 przyjaciółmi na te same urodziny. (9 miesięcy po wielkich świętach i walentynkach …

2
Jaka jest poprawna procedura wyboru opóźnienia podczas wykonywania testu kointegracji Johansena?
Podczas wstępnego testowania testu kointegracji Johansena dla 2 serii czasowych (prosty przypadek) musisz zdecydować o opóźnieniu, którego chcesz użyć. Wykonanie testu dla różnych opóźnień zwraca różne wyniki: dla niektórych poziomów opóźnień hipotezę zerową można odrzucić, a dla innych nie. Moje pytanie brzmi: jaka jest właściwa metoda oparta na danych wejściowych, …


1
Obliczenia mocy / wielkość próbki do badania biomarkerów
Mamy potencjalny biomarker do przewidywania, czy pacjent ma raka, czy nie. Wynik testu biomarkera jest dodatni lub ujemny. Chcemy dowiedzieć się, jaką liczbę pacjentów należy zbadać, aby ustalić, czy ten biomarker jest dobrym predyktorem, czy nie. Z lektury w Internecie wydaje się, że najlepiej jest przyjrzeć się czułości (liczby przypadków) …
13 r  power 

5
Prawdopodobieństwo serii k sukcesów w sekwencji n prób Bernoulliego
Próbuję znaleźć prawdopodobieństwo prawidłowego wykonania 8 prób z rzędu w bloku 25 prób, masz 8 wszystkich bloków (z 25 prób), aby uzyskać 8 prób z rzędu. Prawdopodobieństwo, że jakakolwiek próba będzie poprawna w oparciu o zgadywanie, wynosi 1/3, po uzyskaniu poprawności 8 z rzędu bloki się zakończą (więc uzyskanie więcej …


2
Wybór modelu zagnieżdżonego
Zarówno test współczynnika wiarygodności, jak i AIC są narzędziami do wyboru między dwoma modelami i oba oparte są na prawdopodobieństwie logarytmicznym. Ale dlaczego test współczynnika prawdopodobieństwa nie może być użyty do wyboru między dwoma nie zagnieżdżonymi modelami, podczas gdy AIC może?


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.