Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Używanie Adaboost z SVM do klasyfikacji
Wiem, że Adaboost próbuje wygenerować silny klasyfikator za pomocą liniowej kombinacji zestawu słabych klasyfikatorów. Jednak przeczytałem kilka artykułów sugerujących, że Adaboost i SVM działają harmonijnie (nawet jeśli SVM jest silnym klasyfikatorem) w pewnych warunkach i przypadkach . Nie jestem w stanie zrozumieć z perspektywy architektury i programowania, jak działają one …

5
Czy mogę przetestować hipotezę pod kątem wypaczania normalnych danych?
Mam zbiór danych, które pierwotnie uważałem za normalnie rozpowszechniane. Potem faktycznie na to spojrzałem i zdałem sobie sprawę, że tak nie jest, głównie dlatego, że dane są wypaczone, a także zrobiłem test Shapiro-Wilksa. Nadal chciałbym to przeanalizować metodami statystycznymi, dlatego chciałbym przetestować hipotezę dotyczącą normalności skośnej. Chciałbym więc wiedzieć, czy …

2
Czy istnieje coś takiego jak uczciwa śmierć?
Czy istnieje coś takiego jak uczciwa śmierć? Na kościach, gdzie liczba jest reprezentowana przez zgarniętą kropkę, to z pewnością robi różnicę? Czy ktoś przeprowadził jakieś badania? Zastanawiając się nad tym, dlaczego rzut monetą byłby sprawiedliwy? fizyka po każdej stronie jest zupełnie inna.
11 dice 

3
Jak znaleźć odchylenie standardowe próbki odchylenie standardowe od rozkładu normalnego?
Wybacz mi, że coś przeoczyłem. Jestem fizykiem z rozkładem (histogramem) skupionym wokół średniej wartości zbliżonej do rozkładu normalnego. Ważną dla mnie wartością jest odchylenie standardowe tej losowej zmiennej Gaussa. Jak miałbym spróbować znaleźć błąd w odchyleniu standardowym próbki? Mam wrażenie, że ma to związek z błędem na każdym bin w …

2
Czy rozkład Poissona jest stabilny i czy istnieją formuły inwersji dla MGF?
Po pierwsze, mam pytanie, czy rozkład Poissona jest „stabilny”, czy nie. Bardzo naiwnie (i nie jestem zbyt pewny co do „stabilnych” rozkładów), opracowałem rozkład liniowej kombinacji rozproszonych RV Poissona, używając iloczynu MGF. Wygląda na to, że dostaję kolejnego Poissona z parametrem równym liniowej kombinacji parametrów poszczególnych RV. Stwierdzam więc, że …

2
Znaczące predyktory stają się nieistotne w wielokrotnej regresji logistycznej
Kiedy analizuję moje zmienne w dwóch osobnych (jednoczynnikowych) modelach regresji logistycznej, otrzymuję: Predictor 1: B= 1.049, SE=.352, Exp(B)=2.85, 95% CI=(1.43, 5.69), p=.003 Constant: B=-0.434, SE=.217, Exp(B)=0.65, p=.046 Predictor 2: B= 1.379, SE=.386, Exp(B)=3.97, 95% CI=(1.86, 8.47), p<.001 Constant: B=-0.447, SE=.205, Exp(B)=0.64, p=.029 ale kiedy wprowadzę je do jednego modelu wielokrotnej …

1
Wybór modelu ABC
Zostało pokazane , że ABC wybór modelu z użyciem czynników Bayesa nie ma być zalecane ze względu na obecność błędu pochodzących z wykorzystaniem statystyk podsumowujących. Wniosek w tym artykule opiera się na badaniu zachowania popularnej metody aproksymacji współczynnika Bayesa (algorytm 2). Powszechnie wiadomo, że czynniki Bayesa to nie jedyny sposób …


3
Poprawianie nazw zmiennych w zbiorze danych
Dobre nazwy zmiennych to: a) krótki / łatwy do pisania, b) łatwe do zapamiętania, c) zrozumiałe / komunikatywne. Czy coś zapomniałem? Spójność jest na co zwrócić uwagę. Powiedziałbym, że spójne konwencje nazewnictwa przyczyniają się do powyższych cech. Spójność przyczynia się do (b) łatwości przypominania i (c) zrozumiałości, chociaż inne czynniki …

2
Okresy przewidywania i tolerancji
Mam kilka pytań dotyczących przedziałów prognoz i tolerancji. Najpierw ustalmy przedziały tolerancji: otrzymujemy poziom ufności, powiedzmy 90%, procent populacji do przechwycenia, powiedzmy 99%, i wielkość próby, powiedzmy 20. Rozkład prawdopodobieństwa jest znany, powiedzmy normalny dla wygody. Teraz, biorąc pod uwagę powyższe trzy liczby (90%, 99% i 20) oraz fakt, że …

2
Co to jest „Prior Information Unit”?
Czytałem Wagenmakers (2007) Praktyczne rozwiązanie wszechobecnego problemu wartości p . Intryguje mnie konwersja wartości BIC na czynniki i prawdopodobieństwa Bayesa. Jednak do tej pory nie rozumiem, czym dokładnie jest informacja o jednostce wcześniej . Byłbym wdzięczny za wyjaśnienia ze zdjęciami lub kod R do generowania zdjęć tego konkretnego przeora.





Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.