Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Regresja dla modelu formy
Mam zestaw danych, który jest statystykami z internetowego forum dyskusyjnego. Patrzę na rozkład liczby odpowiedzi, których oczekuje się od tematu. W szczególności utworzyłem zestaw danych, który zawiera listę odpowiedzi na temat, a następnie liczbę tematów, które mają taką liczbę odpowiedzi. "num_replies","count" 0,627568 1,156371 2,151670 3,79094 4,59473 5,39895 6,30947 7,23329 8,18726 …


2
Korekta odchylenia w wariancji ważonej
Dla wariancji nieważonej istnieje wariancja próbki skorygowana o błąd systematyczny, gdy średnią oszacowano na podstawie tych samych danych: Var(X):=1Var ( X) : = 1n∑ja( xja- μ )2)Var(X): =1n∑ja(xja-μ)2)\text{Var}(X):=\frac{1}{n}\sum_i(x_i - \mu)^2Var ( X) := 1n -1∑ja(xja- E[ X] )2)Var(X): =1n-1∑ja(xja-mi[X])2)\text{Var}(X):=\frac{1}{n-1}\sum_i(x_i - E[X])^2 Patrzę na ważoną średnią i wariancję i zastanawiam się, …


3
Bezpieczne określanie wielkości próbki do testów A / B
Jestem inżynierem oprogramowania, który chce zbudować narzędzie do testowania A / B. Nie mam solidnych statystyk, ale przez ostatnie kilka dni sporo czytałem. Postępuję zgodnie z opisaną tutaj metodologią i streszczę odpowiednie punkty poniżej. Narzędzie pozwoli projektantom i ekspertom domeny skonfigurować witrynę internetową w celu podziału ruchu otrzymanego pod określonym …

3
Nadzorowane grupowanie lub klasyfikacja?
Drugie pytanie dotyczy tego, że w dyskusji gdzieś w Internecie mówiłem o „nadzorowanym klastrowaniu”, o ile wiem, klastrowanie nie jest nadzorowane, więc jakie jest dokładnie znaczenie „nadzorowanego klastrowania”? Jaka jest różnica w odniesieniu do „klasyfikacji”? Mówi o tym wiele linków: http://www.cs.uh.edu/docs/cosc/technical-reports/2005/05_10.pdf http://books.nips.cc/papers/files/nips23/NIPS2010_0427.pdf http://engr.case.edu/ray_soumya/mlrg/supervised_clustering_finley_joachims_icml05.pdf http://www.public.asu.edu/~kvanlehn/Stringent/PDF/05CICL_UP_DB_PWJ_KVL.pdf http://www.machinelearning.org/proceedings/icml2007/papers/366.pdf http://www.cs.cornell.edu/~tomf/publications/supervised_kmeans-08.pdf http://jmlr.csail.mit.edu/papers/volume6/daume05a/daume05a.pdf itp ...

1
Czy niespójne estymatory są kiedykolwiek preferowane?
Spójność jest oczywiście naturalnym i ważnym estymatorem nieruchomości, ale czy są sytuacje, w których lepiej byłoby zastosować niespójny estymator niż spójny? Mówiąc dokładniej, czy istnieją przykłady niespójnego estymatora, który przewyższa rozsądny spójny estymator dla wszystkich skończonych (w odniesieniu do jakiejś odpowiedniej funkcji straty)?nnn

3
Modelowanie regresji z nierówną wariancją
Chciałbym dopasować model liniowy (lm), w którym wariancja reszt jest wyraźnie zależna od zmiennej objaśniającej. Wiem, że to robię, używając glm z rodziną Gamma do modelowania wariancji, a następnie umieść odwrotność w wagach funkcji lm (przykład: http://nitro.biosci.arizona.edu/r/chapter31 .pdf ) Zastanawiałem się: Czy to jedyna technika? Jakie inne podejścia są istotne? …


4
Oczekiwana wartość logarytmu naturalnego
Wiem E(aX+b)=aE(X)+bE(aX+b)=aE(X)+bE(aX+b) = aE(X)+b z , b stałych, więc podane E ( X ) , to łatwo rozwiązać. Wiem również, że nie można tego zastosować, gdy jest to funkcja nieliniowa, jak w tym przypadku E ( 1 / X ) ≠ 1 / E ( X ) , i aby …

3
Stabilność modelu w przypadku dużego problemu , małego
Wprowadzenie: Mam zestaw danych z klasycznym „dużym problemem p, małym n”. Liczba dostępnych próbek n = 150, a liczba możliwych predyktorów p = 400. Wynik jest zmienną ciągłą. Chcę znaleźć najważniejsze „deskryptory”, tj. Te, które są najlepszymi kandydatami do wyjaśnienia wyniku i pomocy w zbudowaniu teorii. Po badaniach na ten …

4
Jak napisać formułę modelu liniowego ze 100 zmiennymi w języku R
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Czy istnieje prosty sposób w R na utworzenie regresji liniowej na modelu ze 100 parametrami w R? Powiedzmy, że mamy wektor Y z 10 wartościami …
22 r 


2
Jak dopasować zestaw danych do rozkładu Pareto w R?
Mieć, powiedzmy, następujące dane: 8232302 684531 116857 89724 82267 75988 63871 23718 1696 436 439 248 235 Potrzebujesz prostego sposobu dopasowania tego (i kilku innych zestawów danych) do dystrybucji Pareto. Idealnie byłoby wyprowadzić pasujące wartości teoretyczne, mniej idealnie parametry.

2
Jak należy porównywać i walidować modele efektów mieszanych?
Jak zwykle porównywane są (liniowe) modele efektów mieszanych? Wiem, że można zastosować testy współczynnika prawdopodobieństwa, ale to nie działa, jeśli jeden model nie jest „podzbiorem” drugiego, prawda? Czy oszacowanie modeli df jest zawsze proste? Szacowana liczba stałych efektów + liczba składników wariancji? Czy ignorujemy oszacowania efektów losowych? Co z walidacją? …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.