Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Okresy w historii statystyki
Historię wielu dziedzin nauki można podzielić na niewielką liczbę przedziałów czasowych, które często zaczynają się od ważnego odkrycia. Ale nigdy nie widziałem czegoś podobnego na osi czasu statystyki. Oczywiście istnieje kilka ważnych dat, które można uznać za punkty wyjścia nowego okresu (Pascal + Fermat, Bayes, Pearson, Tukey, ...). Czy możemy …
18 history 

4
Jak wygenerować niecałkowitą liczbę kolejnych sukcesów Bernoulliego?
Dany: Moneta o nieznanym nastawieniu (Głowa).ppp Ściśle dodatni realny .a>0a>0a > 0 Problem: Wygeneruj losową zmienną Bernoulliego z odchyleniem .papap^{a} Czy ktoś wie jak to zrobić? Na przykład, gdy jest dodatnia, to można odwrócić monetę czasu i zobaczyć, czy wszystkie wyniki były Głowy: jeśli są one wtedy problem „0”, w …
18 sampling 

2
Czy teoria szacowania obiektywnego wariancji minimalnej wariancji jest zbyt mocno podkreślana w szkołach wyższych?
Ostatnio byłem bardzo zawstydzony, kiedy podałem mankietową odpowiedź na temat obiektywnych oszacowań minimalnej wariancji dla parametrów rozkładu jednolitego, które były całkowicie błędne. Na szczęście natychmiast zostałem poprawiony przez kardynała i Henry'ego, a Henry podał prawidłowe odpowiedzi dla OP . To mnie jednak zastanowiło. Teorii najlepszych obiektywnych estymatorów nauczyłem się w …

1
, Symulacja w okresie prognozy
Mam dane szeregów czasowych i użyłem jako modelu do dopasowania danych. jest wskaźnikiem zmienną losową, która jest albo 0 (gdy nie widzę rzadkie zdarzenie) lub 1 (gdy widzę rzadkie zjawisko). W oparciu o wcześniejsze obserwacje, które mam dla , mogę opracować model dla przy użyciu metodologii łańcucha Markowa o zmiennej …

2
Jaka jest wartość „
Jaka jest wartość podana w podsumowaniu modelu Coxpha w R? Na przykład,R2)R2R^2 Rsquare= 0.186 (max possible= 0.991 ) Głupio włączyłem go jako wartość a recenzent wskoczył na niego, mówiąc, że nie jest świadomy analogii statystyki z klasycznej regresji liniowej opracowanej dla modelu Coxa, a jeśli był, to proszę podać odniesienie. …

1
Czy obcięte liczby z generatora liczb losowych są nadal „losowe”?
Tutaj „obcięcie” oznacza zmniejszenie precyzji liczb losowych i nie obcinanie serii liczb losowych. Na przykład, jeśli mam liczb rzeczywistych losowych (narysowanych z dowolnego rozkładu, np. Normalnego, jednolitego itp.) Z dowolną precyzją i obcinam wszystkie liczby, aby w końcu otrzymać zestaw liczb, z których każda zawiera dokładnie 2 cyfry po przecinku. …

3
Jaka jest rola MDS we współczesnej statystyce?
Ostatnio natknąłem się na skalowanie wielowymiarowe. Staram się lepiej zrozumieć to narzędzie i jego rolę we współczesnej statystyce. Oto kilka pytań przewodnich: Na jakie pytania odpowiada? Którzy badacze są często zainteresowani jego użyciem? Czy istnieją inne techniki statystyczne, które wykonują podobne funkcje? Jaka teoria się wokół niej rozwija? Jak „MDS” …

5
Jakich statystyk podsumowujących używać ze zmiennymi jakościowymi lub jakościowymi?
Aby wyjaśnić, kiedy mam na myśli statystyki podsumowujące, mam na myśli średnią, zakresy mediany kwartylowej, wariancję, odchylenie standardowe. Czy podsumowując jednoznaczny , jakościowy lub jakościowy , biorąc pod uwagę zarówno przypadki nominalne, jak i porządkowe , sensowne jest znalezienie jego średniej, mediany, zakresów kwartylowych, wariancji i odchylenia standardowego? Jeśli tak, …

6
Nieszablonowe opcje analizy danych
Używam SAS profesjonalnie od prawie 5 lat. Mam go zainstalowanego na swoim laptopie i często muszę analizować zestawy danych z 1000-2 000 zmiennych i setkami tysięcy obserwacji. Szukałem alternatyw dla SAS, które pozwalają mi przeprowadzać analizy zbiorów danych o podobnych rozmiarach. Jestem ciekawy, co inni ludzie używają w takich sytuacjach. …
18 r  sas  large-data 

1
Model próbkowania danych crowdsourcowanych?
Pracuję nad otwartą aplikacją do badania zdrowia, planowaną do użycia w kraju rozwijającym się. Podstawową ideą jest to, że wywiady ankietowe są crowdsourcingowe - są one wykonywane przez niezorganizowanych wolontariuszy, którzy przesyłają dane formularzy z wywiadów, które przeprowadzili za pomocą urządzeń mobilnych, a każdej ankiecie towarzyszą dane GPS z lokalizacji …
18 sampling 


1
Testy post-hoc po Kruskal-Wallis: test Dunna czy Bonferroni poprawili testy Manna-Whitneya?
Mam pewną zmienną niegaussowską i muszę sprawdzić, czy istnieją znaczące różnice między wartościami tej zmiennej w 5 różnych grupach. Przeprowadziłem jednokierunkową analizę wariancji Kruskala-Wallisa (która okazała się znacząca), a następnie musiałem sprawdzić, które grupy są znacząco różne. Ponieważ grupy są w pewien sposób posortowane (wartości zmiennej w pierwszej grupie powinny …

6
Dlaczego statystyki są przydatne, gdy wiele rzeczy, które mają znaczenie, to rzeczy w jednym ujęciu?
Nie wiem, czy to tylko ja, ale ogólnie jestem bardzo sceptyczny wobec statystyk. Rozumiem to w grach w kości, pokerze itp. Bardzo małe, proste, głównie samodzielne powtarzane gry są w porządku. Na przykład moneta lądująca na krawędzi jest wystarczająco mała, aby zaakceptować prawdopodobieństwo, że lądujące główki lub reszki wynoszą ~ …


2
Dlaczego przetwarzanie języka naturalnego nie należy do dziedziny uczenia maszynowego? [Zamknięte]
W obecnej formie to pytanie nie pasuje do naszego formatu pytań i odpowiedzi. Oczekujemy, że odpowiedzi poparte będą faktami, referencjami lub wiedzą specjalistyczną, ale to pytanie prawdopodobnie będzie wymagało debaty, argumentów, ankiet lub rozszerzonej dyskusji. Jeśli uważasz, że to pytanie można poprawić i ewentualnie ponownie otworzyć, odwiedź centrum pomocy w …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.