Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Stosowanie regresji logistycznej z niskim wskaźnikiem zdarzeń
Mam zestaw danych, w którym częstotliwość zdarzeń jest bardzo niska (40 000 z ). Stosuję w tym regresję logistyczną. Rozmawiałem z kimś, gdzie okazało się, że regresja logistyczna nie dałaby dobrej macierzy pomieszania w przypadku tak niskich danych o częstości zdarzeń. Ale z powodu problemu biznesowego i sposobu, w jaki …
15 logistic 

2
Jak obliczyć wariancję podziału zmiennych
Prowadzę eksperyment, w którym równolegle zbieram (niezależne) próbki, obliczam wariancję każdej grupy próbek, a teraz chcę połączyć wszystkie, aby znaleźć całkowitą wariancję wszystkich próbek. Trudno mi znaleźć na to pochodne, ponieważ nie jestem pewien terminologii. Myślę o tym jak o podziale jednego RV. Więc chcę znaleźć Var(X)Var(X)Var(X) z Var(X1)Var(X1)Var(X_1) , …
15 variance 

3
CDF podniesiony do władzy?
Jeśli FZFZF_Z jest CDF, wygląda na to, że FZ(z)αFZ(z)αF_Z(z)^\alpha ( α>0α>0\alpha \gt 0 ) również jest CDF. P: Czy to wynik standardowy? P: Czy istnieje dobry sposób na znalezienie funkcji ggg pomocą X≡g(Z)X≡g(Z)X \equiv g(Z) st FX(x)=FZ(z)αFX(x)=FZ(z)αF_X(x) = F_Z(z)^\alpha , gdzie x≡g(z)x≡g(z) x \equiv g(z) Zasadniczo mam w ręku inny …

3
Jak wykreślić dane wyjściowe klastrowania?
Próbowałem grupować zestaw danych (zestaw znaków) i otrzymałem 2 klastry. Chciałbym to przedstawić graficznie. Trochę zdezorientowany co do reprezentacji, ponieważ nie mam współrzędnych (x, y). Poszukuję również do tego celu MATLAB / Python. EDYTOWAĆ Myślę, że publikowanie danych wyjaśnia pytanie. Mam dwa klastry, które utworzyłem za pomocą klastrowania kmeans w …


2
Zrozumienie k lag w rozszerzonym teście Dickeya Fullera R.
Grałem z niektórymi jednostkowymi testami root w R i nie jestem do końca pewien, co zrobić z parametrem k lag. Użyłem rozszerzonego testu Dickeya Fullera i testu Philippsa Perrona z pakietu terser . Oczywiście domyślny parametr (dla ) zależy tylko od długości serii. Jeśli wybiorę inne wartości K , otrzymam …
15 r  time-series  trend 

1
Jaka jest dokładna definicja „przypadku Heywooda”?
Użyłem terminu „przypadek Heywooda” w sposób nieco nieformalny, aby odnieść się do sytuacji, w których online, „skończona odpowiedź” iteracyjnie zaktualizowana ocena wariancji stała się negatywna z powodu problemów z precyzją liczbową. (Korzystam z wariantu metody Welforda, aby dodawać dane i usuwać starsze dane). Miałem wrażenie, że odnosi się to do …



3
Kiedy używać GAM kontra GLM
Zdaję sobie sprawę, że może to być potencjalnie szerokie pytanie, ale zastanawiałem się, czy istnieją uogólnione założenia, które wskazują na użycie GAM (Uogólniony model addytywny) w stosunku do GLM (Uogólniony model liniowy)? Ktoś niedawno powiedział mi, że GAM należy używać tylko wtedy, gdy założę, że struktura danych jest „addytywna”, tj. …



2
Obliczanie przedziałów ufności dla regresji logistycznej
Korzystam z dwumianowej regresji logistycznej, aby określić, czy narażenie has_xlub ma has_ywpływ na prawdopodobieństwo kliknięcia przez użytkownika. Mój model jest następujący: fit = glm(formula = has_clicked ~ has_x + has_y, data=df, family = binomial()) To wynik z mojego modelu: Call: glm(formula = has_clicked ~ has_x + has_y, family = binomial(), …

4
Akceptacja hipotezy zerowej
To jest pytanie do dyskusji na temat skrzyżowania statystyki i innych nauk. Często napotykam ten sam problem: badacze w mojej dziedzinie twierdzą, że nie ma żadnego efektu, gdy wartość p jest nie mniejsza niż poziom istotności. Na początku często odpowiadałem, że nie tak działa testowanie hipotez. Biorąc pod uwagę, jak …

3
Metody obejścia problemu braku danych w uczeniu maszynowym
Praktycznie każda baza danych, w której chcemy przewidywać za pomocą algorytmów uczenia maszynowego, znajdzie brakujące wartości niektórych cech. Istnieje kilka podejść do rozwiązania tego problemu, aby wykluczyć linie, w których brakuje wartości, dopóki nie wypełnią się średnimi wartościami cech. Chciałbym zastosować nieco bardziej niezawodne podejście, które zasadniczo uruchomiłoby regresję (lub …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.