Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Jak mogę uzyskać znaczącą ogólną ANOVA, ale bez istotnych różnic par w procedurze Tukeya?
Wystąpiłem z AN ANĄ R i dostałem znaczące różnice. Jednak podczas sprawdzania, które pary były znacząco różne za pomocą procedury Tukeya, nie dostałem żadnej z nich. Jak to możliwe? Oto kod: fit5_snow<- lm(Response ~ Stimulus, data=audio_snow) anova(fit5_snow) > anova(fit5_snow) Analysis of Variance Table Response: Response Df Sum Sq Mean Sq …

4
Wykorzystanie przesunięcia w modelu dwumianowym w celu uwzględnienia zwiększonej liczby pacjentów
Dwa powiązane ze mną pytania. Mam ramkę danych, która zawiera liczbę pacjentów w jednej kolumnie (zakres od 10 do 17 pacjentów) oraz 0 i 1 zera pokazujące, czy zdarzenie miało miejsce tego dnia. Używam modelu dwumianowego do regresji prawdopodobieństwa incydentu na liczbę pacjentów. Chciałbym jednak dostosować się do faktu, że …

2
Jak obliczyć zakłopotanie utrudnienia za pomocą Latent Dirichlet Allocation?
Jestem zdezorientowany, jak obliczyć zakłopotanie próby wstrzymania podczas wykonywania Latent Dirichlet Allocation (LDA). Dokumenty na ten temat wrócą nad tym, co sprawia, że ​​myślę, że brakuje mi czegoś oczywistego ... Zakłopotanie jest postrzegane jako dobra miara wydajności dla LDA. Chodzi o to, że trzymasz próbkę wstrzymania, trenujesz LDA na pozostałych …


1
Jak należy obliczyć standardowe błędy dla oszacowań modelu efektów mieszanych?
W szczególności, w jaki sposób należy obliczać standardowe błędy stałych efektów w liniowym modelu efektów mieszanych (w sensie częstym)? Doprowadzono mnie do przekonania, że ​​typowe szacunki ( ), takie jak te przedstawione w Laird i Ware [1982] dadzą SE, że są niedoszacowane pod względem wielkości, ponieważ szacowane składniki wariancji są …

5
Jakie skuteczne metody korelacji są rzeczywiście stosowane?
Planuję przeprowadzić badanie symulacyjne, w którym porównuję wydajność kilku solidnych technik korelacji z różnymi rozkładami (wypaczonymi, z wartościami odstającymi itp.). Przez solidne rozumiem idealny przypadek bycia odpornym na a) wypaczone rozkłady, b) wartości odstające i c) ciężkie ogony. Wraz z korelacją Pearsona jako punktem odniesienia, myślałem o uwzględnieniu następujących bardziej …

2
Zmienna ważność od GLMNET
Patrzę na użycie lasso jako metody wybierania cech i dopasowywania modelu predykcyjnego do celu binarnego. Poniżej znajduje się kod, z którym bawiłem się, aby wypróbować metodę ze znormalizowaną regresją logistyczną. Moje pytanie brzmi: otrzymuję grupę „znaczących” zmiennych, ale czy jestem w stanie uporządkować je w celu oszacowania względnej ważności każdej …


2
Dogłębne uczenie się a drzewa decyzyjne i metody wspomagające
Szukam prac lub tekstów, które porównują i omawiają (empirycznie lub teoretycznie): Pobudzanie i drzewa decyzyjne algorytmy takie jak lasy losowe lub adaboost i GentleBoost stosowane do drzew decyzyjnych. z Metody głębokiego uczenia, takie jak Ograniczone Maszyny Boltzmanna , Hierarchiczna Pamięć Czasowa , Splotowe Sieci Neuralne itp. Mówiąc dokładniej, czy ktoś …

4
W jaki sposób ramy bayesowskie są lepsze w interpretacji, gdy zwykle używamy nieinformacyjnych lub subiektywnych priorów?
Często argumentuje się, że szkielet bayesowski ma dużą przewagę interpretacyjną (nad częstokroć), ponieważ oblicza prawdopodobieństwo parametru na podstawie danych - zamiast jak w ramy dla częstych. Jak na razie dobrze.p ( x | θ )p ( θ | x )p(θ|x)p(\theta|x)p ( x | θ )p(x|θ)p(x|\theta) Ale całe równanie opiera się …


5
Klasyfikacja tekstu na dużą skalę
Chcę dokonać klasyfikacji na podstawie moich danych tekstowych. Mam 300 classes200 dokumentów szkoleniowych na klasę (więc 60000 documents in total), co może skutkować bardzo wysokimi wymiarami danych (być może szukamy ponad 1 milion wymiarów ). Chciałbym wykonać następujące kroki w przygotowaniu (aby dać ci wyobrażenie o moich wymaganiach): Konwertowanie każdego …




Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.