Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Prawdopodobieństwa pokrycia podstawowego przedziału ufności ładowania początkowego
Mam następujące pytanie do kursu, nad którym pracuję: Przeprowadź badanie Monte Carlo, aby oszacować prawdopodobieństwo pokrycia standardowego normalnego przedziału ufności bootstrapu i podstawowego przedziału ufności bootstrapu. Próbka z normalnej populacji i sprawdź empiryczne wskaźniki pokrycia dla średniej próby. Prawdopodobieństwa pokrycia dla standardowego normalnego CI bootstrap są łatwe: n = 1000; …

4
Co oznacza liniowa regresja liniowa?
W R, jeśli napiszę lm(a ~ b + c + b*c) czy nadal byłaby to regresja liniowa? Jak zrobić inne rodzaje regresji w R? Byłbym wdzięczny za jakieś zalecenia dotyczące podręczników lub samouczków?
11 r  regression 



4
Porównywanie współczynników regresji logistycznej między modelami?
Opracowałem model logit do zastosowania w sześciu różnych zestawach danych przekrojowych. Próbuję odkryć, czy nastąpiły zmiany w merytorycznym wpływie danej zmiennej niezależnej (IV) na zmienną zależną (DV) sterującą innymi wytłumaczeniami w różnych momentach i czasie. Moje pytania to: Jak ocenić zwiększony / zmniejszony rozmiar w związku między IV a DV? …
11 logistic  spss 

1
Wielkość próbki wymagana do ustalenia, który zestaw reklam ma najwyższy współczynnik klikalności
Z zawodu jestem projektantem oprogramowania i pracuję nad projektem dla klienta i chciałbym upewnić się, że moja analiza jest statystycznie wiarygodna. Zastanów się, co następuje: Mamy n reklam (n <10) i chcemy po prostu wiedzieć, która reklama jest najskuteczniejsza. Nasz serwer reklam losowo wyświetli jedną z tych reklam. Sukces polega …

2
Jak obsługiwać nieistniejące (nie brakujące) dane?
Nigdy tak naprawdę nie znalazłem żadnego dobrego tekstu ani przykładów na temat obsługi „nieistniejących” danych dla danych wejściowych do dowolnego rodzaju klasyfikatora. Dużo czytałem o brakujących danych, ale co można zrobić z danymi, które nie mogą istnieć lub nie istnieją w odniesieniu do danych wejściowych na wielu odmianach. Rozumiem, że …


3
Jak generować równomiernie rozmieszczone punkty w trójwymiarowej kulce?
Wysłałem poprzednie pytanie , jest to powiązane, ale myślę, że lepiej jest rozpocząć inny wątek. Tym razem zastanawiam się, jak wygenerować równomiernie rozmieszczone punkty w sferze jednostki 3-d oraz jak sprawdzić rozkład wizualnie i statystycznie? Nie widzę strategii tam zamieszczonych, które można by bezpośrednio przenieść na tę sytuację.

4
Oznaczanie wykresów pudełkowych w R.
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Muszę zbudować wykres pudełkowy bez żadnych osi i dodać go do bieżącego wykresu (krzywa ROC), ale muszę dodać więcej informacji tekstowych do wykresu pudełkowego: etykiety …
11 r  boxplot 

1
Analiza mocy do analizy przeżycia
Jeśli postawię hipotezę, że sygnatura genu pozwoli zidentyfikować osoby o niższym ryzyku nawrotu, to znaczy obniży się o 0,5 (współczynnik ryzyka 0,5), wskaźnik zdarzeń u 20% populacji i zamierzam użyć próbek z retrospektywnego badania kohortowego wielkość próby musi być dostosowana do nierównych liczb w dwóch hipotetycznych grupach? Na przykład za …

2
Jak obliczyć parametr regularyzacji w regresji grzbietu przy danych stopniach swobody i macierzy wejściowej?
Niech A będzie macierzą n × pn×pn \times p zmiennych niezależnych, a B będzie odpowiadającą macierzą wartości zależnych. Regresję kalenicy, że określenie parametrów tak, że: . Teraz pozwól [usv] = svd (A) i ukośny wpis „s”. definiujemy stopnie swobody (df) = . Regresja grzbietu zmniejsza współczynniki składników o niskiej wariancji, …




Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.