Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


2
Czy wariant jest taki sam jak wariant?
To jest moje pierwsze pytanie dotyczące Cross Validated tutaj, więc proszę o pomoc, nawet jeśli wydaje się to trywialne :-) Po pierwsze, pytanie może wynikać z różnic językowych lub może mieć prawdziwe braki w statystykach. Niemniej jednak oto: Czy w statystykach dotyczących populacji wariancja i wariancja są tymi samymi terminami? …


4
Pułapki w projekcie eksperymentalnym: unikanie martwych eksperymentów
Znalazłem ten cytat wiele razy: Skonsultowanie się ze statystykiem po zakończeniu eksperymentu często oznacza jedynie poproszenie go o przeprowadzenie sekcji zwłok. Może może powiedzieć, z czego umarł eksperyment. - Ronald Fisher (1938) Wydaje mi się być może trochę zarozumiały. Jedynymi przykładami, jakie kiedykolwiek znalazłem opisującymi, jak eksperymenty giną bez dobrego …


7
Czy korelacja jest równoważna asocjacji?
Mój profesor statystyki twierdzi, że słowo „korelacja” odnosi się ściśle do relacji liniowych między zmiennymi, podczas gdy słowo „powiązanie” odnosi się szeroko do każdego rodzaju relacji. Innymi słowy, twierdzi, że termin „korelacja nieliniowa” jest oksymoronem. Z tego, co mogę zrobić z tego rozdziału w artykule w Wikipedii na temat „ …

5
Co może spowodować pogorszenie wyników klasyfikatora przez PCA?
Mam klasyfikator, na którym przeprowadzam walidację krzyżową, wraz z około setką funkcji, które wybieram do przodu, aby znaleźć optymalne kombinacje funkcji. Porównuję to również z przeprowadzaniem tych samych eksperymentów z PCA, w których biorę potencjalne cechy, stosuję SVD, przekształcam oryginalne sygnały w nową przestrzeń współrzędnych i używam najlepszych funkcji w …

2
W modelu wielopoziomowym, jakie są praktyczne implikacje oszacowania w porównaniu z niedoszacowaniem parametrów korelacji efektu losowego?
W modelu wielopoziomowym, jakie są praktyczne i związane z interpretacją implikacje oszacowania w porównaniu z niedoszacowaniem parametrów korelacji efektu losowego? Praktycznym powodem pytania jest to, że w ramce Lmer w R nie ma zaimplementowanej metody szacowania wartości p za pomocą technik MCMC, gdy dokonuje się szacunków w modelu korelacji między …


4
Minimalna wielkość próby dla PCA lub FA, gdy głównym celem jest oszacowanie tylko kilku składników?
Jeśli mam zestaw danych z obserwacjami i zmiennymi (wymiarami), a na ogół jest mały ( ), a może być w zakresie od małego ( ) do być może znacznie większego ( ).nnnpppnnnn=12−16n=12−16n=12-16pppp=4−10p=4−10p = 4-10p=30−50p=30−50p= 30-50 Pamiętam, że dowiedziałem się, że powinno być znacznie większe niż , aby uruchomić analizę głównych …

3
Co powoduje nieciągłość w rozkładzie opublikowanych wartości p przy p <0,05?
W ostatnim artykule Masicampo i Lalande (ML) zgromadzili dużą liczbę wartości p opublikowanych w wielu różnych badaniach. Zaobserwowali ciekawy skok w histogramie wartości p bezpośrednio na kanonicznym poziomie krytycznym wynoszącym 5%. Na blogu prof. Wassermana znajduje się miła dyskusja na temat tego zjawiska ML: http://normaldeviate.wordpress.com/2012/08/16/p-values-gone-wild-and-multiscale-madness/ Na jego blogu znajdziesz histogram: …



5
Przykładowe raporty analizy mieszanych modeli z wykorzystaniem lmerów w biologii, psychologii i medycynie?
Ponieważ ogólną zgodą wydaje się być stosowanie modeli mieszanych lmer()w R zamiast klasycznej ANOVA (z często cytowanych powodów, takich jak niezrównoważone projekty, skrzyżowane efekty losowe itp.), Chciałbym spróbować z moimi danymi. Martwię się jednak, że będę w stanie „sprzedać” to podejście mojemu przełożonemu (który w końcu oczekuje klasycznej analizy z …

4
Generowanie atrakcyjnych wizualnie map ciepła gęstości w R.
Chociaż wiem, że istnieje szereg funkcji do generowania map ciepła w R, problem polega na tym, że nie jestem w stanie stworzyć atrakcyjnych wizualnie map. Na przykład poniższe zdjęcia to dobre przykłady map cieplnych, których chcę unikać. Pierwszy wyraźnie nie zawiera szczegółów, podczas gdy drugi (oparty na tych samych punktach) …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.