Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

6
Krótkie filmy online, które mogą pomóc w wykładzie dotyczącym statystyki
Podczas wykładu statystyki przydatne może być okazjonalne krótkie wideo. Moje pierwsze przemyślenia obejmowały: Animacje i wizualizacje pojęć statystycznych Historie dotyczące zastosowania określonej techniki Humorystyczne filmy mające związek z ideą statystyczną Wywiady ze statystykiem lub badaczem, który wykorzystuje statystyki Czy są jakieś filmy, których używasz podczas nauczania statystyki, lub które Twoim …

3
Jak symulować niestandardową analizę mocy modelu lm (za pomocą R)
W odpowiedzi na ostatnie pytania, które tu mieliśmy . Miałem nadzieję, że dowiem się, czy ktoś się zetknął lub może udostępnić kod R do wykonania niestandardowej analizy mocy na podstawie symulacji dla modelu liniowego? Później oczywiście chciałbym rozszerzyć go na bardziej złożone modele, ale wydaje mi się, że dobrze zacząć. …

1
Testujesz dwie niezależne próbki pod kątem zerowości tego samego skosu?
Jakie testy są dostępne do testowania dwóch niezależnych próbek pod kątem hipotezy zerowej, że pochodzą one z populacji o tym samym przekrzywieniu? Istnieje klasyczny test na 1 próbce dla tego, czy pochylenie jest równe stałej liczbie (test obejmuje szósty moment próbki!); czy istnieje proste tłumaczenie na test na 2 próbkach? …

4
Jak podsumować dane kategoryczne?
Mam problem z następującym problemem, który, mam nadzieję, jest łatwy dla statystyk (jestem programistą z pewnym doświadczeniem w statystyce). Muszę streścić odpowiedzi na ankietę (dla kierownictwa). Ankieta zawiera ponad 100 pytań, pogrupowanych w różne obszary (z około 5 do 10 pytań na obszar). Wszystkie odpowiedzi są kategoryczne (w skali porządkowej …

3
Wyrażaj odpowiedzi w kategoriach oryginalnych jednostek, w przekształconych danych Box-Cox
W przypadku niektórych pomiarów wyniki analizy są odpowiednio prezentowane w przekształconej skali. Jednak w większości przypadków pożądane jest przedstawienie wyników w oryginalnej skali pomiaru (w przeciwnym razie twoja praca będzie mniej lub bardziej bezwartościowa). Na przykład w przypadku danych transformowanych logami pojawia się problem z interpretacją w oryginalnej skali, ponieważ …

3
Używanie geometrii informacji do definiowania odległości i objętości… przydatne?
Natknąłem się na obszerną literaturę, która opowiada się za wykorzystaniem metryki Informacji Fishera jako naturalnej metryki lokalnej w przestrzeni rozkładów prawdopodobieństwa, a następnie integracji jej w celu określenia odległości i objętości. Ale czy te „zintegrowane” ilości są rzeczywiście przydatne do czegoś? Nie znalazłem teoretycznych uzasadnień i bardzo mało praktycznych zastosowań. …

5
Przetwarzanie poznawcze / interpretacja technik wizualizacji danych
Czy ktoś wie o badaniach, które badają skuteczność (zrozumiałość?) Różnych technik wizualizacji? Na przykład, jak szybko ludzie rozumieją jedną formę wizualizacji nad inną? Czy interaktywność z wizualizacją pomaga ludziom przywoływać dane? Wszystko w tym stylu. Przykładem wizualizacji mogą być: wykresy rozrzutu, wykresy, osie czasu, mapy, interfejsy interaktywne (takie jak współrzędne …


3
Liniowe modele efektów mieszanych
Często słyszałem, że modele LME są bardziej wiarygodne w analizie danych dokładności (tj. W eksperymentach psychologicznych), ponieważ mogą pracować z rozkładami dwumianowymi i innymi niestandardowymi rozkładami, których tradycyjne podejścia (np. ANOVA) nie mogą. Jakie są matematyczne podstawy modeli LME, które pozwalają im uwzględnić te inne rozkłady i jakie są niektóre …

4
Oprogramowanie do anonimizacji danych
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Czy ktoś wie o dobrym oprogramowaniu do anonimizacji danych? A może pakiet dla R, który anonimizuje dane? Oczywiście nie oczekując niemożliwej do anonimizacji anonimizacji - …
13 software 

5
Redukcja wymiarów SVD dla szeregów czasowych o różnej długości
Używam Singular Value Decomposition jako techniki redukcji wymiarowości. Biorąc pod uwagę Nwektory wymiaru D, ideą jest przedstawienie cech w przekształconej przestrzeni o nieskorelowanych wymiarach, która kondensuje większość informacji danych w wektorach własnych tej przestrzeni w malejącym porządku ważności. Teraz próbuję zastosować tę procedurę do danych szeregów czasowych. Problem polega na …

4
Oddzielenie dwóch populacji od próbki
Próbuję oddzielić dwie grupy wartości od jednego zestawu danych. Mogę założyć, że jedna z populacji jest normalnie rozmieszczona i ma co najmniej połowę wielkości próbki. Wartości drugiego są zarówno niższe, jak i wyższe niż wartości pierwszego (rozkład jest nieznany). Staram się znaleźć górne i dolne granice, które obejmowałyby normalnie rozłożoną …

2
Wykorzystanie analizy szeregów czasowych do analizy / przewidywania gwałtownych zachowań
To trochę nieporadne pytanie, ale mam poważne zainteresowanie odpowiedzią. Pracuję w szpitalu psychiatrycznym i mam trzy lata danych gromadzonych każdego dnia na każdym oddziale, dotyczących poziomu przemocy na tym oddziale. Oczywiście model, który pasuje do tych danych, jest modelem szeregów czasowych. Musiałem różnicować wyniki, aby były bardziej normalne. Dopasowuję model …

5
Kiedy używać wielu modeli do prognozowania?
To jest dość ogólne pytanie: Zazwyczaj stwierdziłem, że użycie wielu różnych modeli przewyższa jeden model, gdy próbuję przewidzieć szereg czasowy na podstawie próby. Czy są jakieś dobre dokumenty, które pokazują, że kombinacja modeli przewyższy pojedynczy model? Czy istnieją jakieś najlepsze praktyki dotyczące łączenia wielu modeli? Niektóre referencje: Hui Zoua, Yuhong …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.