Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


3
Modele dwustopniowe: Różnica między modelami Heckmana (do radzenia sobie z wyborem próbek) i zmiennymi instrumentalnymi (do czynienia z endogennością)
Staram się omijać różnicę między wyborem próbki a endogennością, a tym samym tym, w jaki sposób modele Heckmana (radzenie sobie z selekcją próbek) różnią się od instrumentalnych regresji zmiennych (radzenie sobie z endogennością). Czy słuszne jest stwierdzenie, że wybór próbki jest specyficzną formą endogeniczności, w przypadku której zmienna endogeniczna jest …

1
Pearson VS Deviance Residuals w regresji logistycznej
Wiem, że znormalizowane pozostałości Pearson uzyskuje się w tradycyjny probabilistyczny sposób: ri=yi−πiπi(1−πi)−−−−−---√rja=yja-πjaπja(1-πja) r_i = \frac{y_i-\pi_i}{\sqrt{\pi_i(1-\pi_i)}} i Pozostałości dewiacji są uzyskiwane w bardziej statystyczny sposób (udział każdego punktu w prawdopodobieństwie): reja= sja- 2 [ yjalogπja^+(1−yi)log(1−πi)]−−−−−−−−−−−−−−−−−−−−−−−−−−√di=si−2[yilog⁡πi^+(1−yi)log⁡(1−πi)] d_i = s_i \sqrt{-2[y_i \log \hat{\pi_i} + (1 - y_i)\log(1-\pi_i)]} gdzie sisis_i = 1 jeśli yiyiy_i …


2
Po co logować transformację danych przed przeprowadzeniem analizy głównych składników?
Im podążam za tutorialem tutaj: http://www.r-bloggers.com/computing-and-visualizing-pca-in-r/, aby lepiej zrozumieć PCA. Samouczek używa zestawu danych Iris i stosuje transformację dziennika przed PCA: Zauważ, że w poniższym kodzie stosujemy transformację logarytmiczną do zmiennych ciągłych, zgodnie z sugestią [1], i ustawiamy centeri scalerównoważymy TRUEw wywołaniu prcompstandaryzacji zmiennych przed zastosowaniem PCA. Czy ktoś mógłby …


3
Dlaczego potrzebujemy ładowania początkowego?
Obecnie czytam „Wszystkie statystyki” Larry'ego Wassermana i zastanawia mnie coś, co napisał w rozdziale o szacowaniu funkcji statystycznych modeli nieparametrycznych. On napisał „Czasami możemy znaleźć szacowany błąd standardowy funkcji statystycznej, wykonując pewne obliczenia. Jednak w innych przypadkach nie jest oczywiste, jak oszacować błąd standardowy”. Chciałbym zaznaczyć, że w następnym rozdziale …

1
Integracja Metropolis-Hastings - dlaczego moja strategia nie działa?
Załóżmy, że mam funkcję , którą chcę zintegrować Oczywiście przy założeniu, że osiąga zero w punktach końcowych, brak wybuchów, fajna funkcja. Jednym ze sposobów, w jakie się bawiłem, jest użycie algorytmu Metropolis-Hastings do wygenerowania listy próbek z rozkładu proporcjonalnego do , w którym brakuje stałej normalizacyjnej który , a następnie …

3
Funkcja ETS (), jak uniknąć prognozy niezgodnej z danymi historycznymi?
Pracuję nad alogorytmem w R, aby zautomatyzować miesięczne obliczanie prognozy. Korzystam między innymi z funkcji ets () z pakietu prognozy do obliczania prognozy. Działa bardzo dobrze. Niestety, dla niektórych konkretnych szeregów czasowych wynik, który otrzymuję jest dziwny. Poniżej znajduje się kod, którego używam: train_ts<- ts(values, frequency=12) fit2<-ets(train_ts, model="ZZZ", damped=TRUE, alpha=NULL, …

3
tanh vs. sigmoid w sieci neuronowej
Z góry przepraszam za to, że wciąż przyspieszam. Próbuję zrozumieć zalety i wady używania tanh (mapa -1 do 1) vs. sigmoid (mapa 0 do 1) dla mojej funkcji aktywacji neuronu. Z mojego czytania zabrzmiało to jak drobna rzecz z marginalnymi różnicami. W praktyce dla moich problemów uważam, że sigmoid jest …

1
Czy komponenty PCA wielowymiarowych danych Gaussa są statystycznie niezależne?
Czy komponenty PCA (w analizie głównych komponentów) są statystycznie niezależne, jeśli nasze dane są zwykle dystrybuowane na wielu odmianach? Jeśli tak, jak można to wykazać / udowodnić? Pytam, ponieważ widziałem ten post , w którym pierwsza odpowiedź brzmi: PCA nie przyjmuje wyraźnego założenia Gaussa. Znajduje wektory własne, które maksymalizują wariancję …
16 pca  independence  svd 


2
Dlaczego miałoby się stosować „losowe” zaufanie lub wiarygodne przedziały?
Czytałem ostatnio artykuł, który zawierał przypadkowość w jego pewności i wiarygodnych odstępach czasu i zastanawiałem się, czy jest to standard (a jeśli tak, to dlaczego warto to robić). Aby ustawić notację, załóżmy, że nasze dane to i jesteśmy zainteresowani tworzeniem przedziałów dla parametru . Jestem przyzwyczajony do budowania przedziałów ufności …


2
Dla jakich rozkładów istnieje niezależny estymator zamknięty dla odchylenia standardowego?
Dla rozkładu normalnego istnieje obiektywny estymator odchylenia standardowego podany przez: σ^unbiased=Γ(n−12)Γ(n2)12∑k=1n(xi−x¯)2−−−−−−−−−−−−√σ^unbiased=Γ(n−12)Γ(n2)12∑k=1n(xi−x¯)2\hat{\sigma}_\text{unbiased} = \frac{\Gamma(\frac{n-1}{2})}{\Gamma(\frac{n}{2})} \sqrt{\frac{1}{2}\sum_{k=1}^n(x_i-\bar{x})^2} Powodem, dla którego ten wynik nie jest tak dobrze znany, wydaje się być fakt, że jest to w dużej mierze osobliwość, a nie sprawa wielkiego znaczenia . Dowód jest pokryty tym wątkiem ; wykorzystuje kluczową właściwość …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.