Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Od sieci bayesowskich po sieci neuronowe: w jaki sposób można zastosować regresję wielowymiarową do sieci z wieloma wyjściami
Mam do czynienia z bayesowskim hierarchicznym modelem liniowym , tutaj sieć go opisująca. YYY oznacza dzienną sprzedaż produktu w supermarkecie (zaobserwowano). XXX jest znaną matrycą regresorów, w tym cen, promocji, dnia tygodnia, pogody i świąt. S.S.S to nieznany ukryty poziom zapasów każdego produktu, który powoduje najwięcej problemów i który uważam …

1
Czy jest jakieś intuicyjne wyjaśnienie, dlaczego regresja logistyczna nie zadziała w przypadku idealnej separacji? A dlaczego dodanie uregulowania to naprawi?
Prowadzimy wiele dobrych dyskusji na temat idealnej separacji w regresji logistycznej. Takich jak regresja logistyczna w R doprowadziła do idealnej separacji (zjawisko Haucka-Donnera). Co teraz? a model regresji logistycznej nie jest zbieżny . Osobiście nadal uważam, że nie jest intuicyjne, dlaczego będzie to problem i dlaczego dodanie regularyzacji to rozwiąże. …

5
Założenia regresji wielokrotnej: czym różni się założenie normalności od założenia o stałej wariancji?
Przeczytałem, że są to warunki korzystania z modelu regresji wielokrotnej: reszty modelu są prawie normalne, zmienność reszt jest prawie stała reszty są niezależne i każda zmienna jest liniowo powiązana z wynikiem. Czym różnią się 1 i 2? Możesz go zobaczyć tutaj: Tak więc powyższy wykres mówi, że reszta, która wynosi …

1
Wycie spowodowane przez regresję stopniową
Doskonale zdaję sobie sprawę z problemów selekcji krokowej / do przodu / do tyłu w modelach regresji. Istnieje wiele przypadków badaczy potępiających metody i wskazujących na lepsze alternatywy. Byłem ciekawy, czy istnieją jakieś historie, w których analiza statystyczna: zastosował regresję stopniową; wyciągnął kilka ważnych wniosków na podstawie ostatecznego modelu wniosek …

6
Wypełnianie macierzy korelacji 3x3: dwa podane współczynniki
Zadano mi to pytanie w wywiadzie. Powiedzmy, że mamy macierz korelacji w postaci ⎡⎣⎢10.60.80.61γ0.8γ1⎤⎦⎥[10.60,80,61γ0,8γ1]\begin{bmatrix}1&0.6&0.8\\0.6&1&\gamma\\0.8&\gamma&1\end{bmatrix} Poproszono mnie o znalezienie wartości gamma, biorąc pod uwagę tę macierz korelacji. Pomyślałem, że mogę coś zrobić z wartościami własnymi, ponieważ wszystkie powinny być większe lub równe 0. (Macierz powinna być dodatnia półfinałowa) - ale nie …

2
Dowód, że statystyka F jest zgodna z rozkładem F.
W świetle tego pytania: Dowód, że współczynniki w modelu OLS są zgodne z rozkładem t z (nk) stopniami swobody Chciałbym zrozumieć, dlaczego F=(TSS−RSS)/(p−1)RSS/(n−p),F=(TSS−RSS)/(p−1)RSS/(n−p), F = \frac{(\text{TSS}-\text{RSS})/(p-1)}{\text{RSS}/(n-p)}, gdzie jest liczbą parametrów modelu, a n liczbą obserwacji, a TSS wariancja całkowita, RSS wariancja resztkowa, jest zgodna z rozkładem F_ {p-1, np} .n …

3
Czy poprawne statystyki w środowisku pracy?
Nie jestem pewien, do kogo należy to pytanie: Cross Validated lub The Workplace. Ale moje pytanie jest niejasno związane ze statystykami. To pytanie (lub chyba pytania) powstało podczas mojej pracy jako „stażysta w dziedzinie danych”. Budowałem ten model regresji liniowej i badałem wykres resztkowy. Widziałem wyraźny znak heteroskedastyczności. Pamiętam, że …
20 careers 

1
Czy można zaufać adaptacyjnej MCMC?
Czytam o adaptacyjnej MCMC (patrz np. Rozdział 4 Podręcznika Markov Chain Monte Carlo , red. Brooks i in., 2011; a także Andrieu i Thoms, 2008 ). Głównym rezultatem Robertsa i Rosenthala (2007) jest to, że jeśli schemat adaptacji spełnia znikający warunek adaptacji (plus pewna inna technika), adaptacyjna MCMC jest ergodyczna …

5
Rzuć kostką, aż wyląduje na dowolnej liczbie innej niż 4. Jakie jest prawdopodobieństwo, że wynik wynosi> 4?
Gracz otrzymuje uczciwą, sześcioboczną kostkę. Aby wygrać, musi rzucić liczbą większą niż 4 (tj. 5 lub 6). Jeśli wyrzuci 4, musi rzucić ponownie. Jakie są jej szanse na wygraną? Myślę, że prawdopodobieństwo wygranej można wyrazić rekurencyjnie jako:P(W)P(W)P(W) P(W)=P(r=5∪r=6)+P(r=4)⋅P(W)P(W)=P(r=5∪r=6)+P(r=4)⋅P(W) P(W) = P(r = 5 \cup r = 6) + P(r = …

1
Procesy gaussowskie w domenie falkowej: czym jest kowariancja?
Czytałem Maraun i wsp. , „Niestacjonarne procesy gaussowskie w domenie falkowej: synteza, szacowanie i znaczące testowanie” (2007), która definiuje klasę niestacjonarnych GP, które mogą być określone przez multiplikatory w domenie falkowej. Realizacja jednego takiego GP to: gdzie jest białym szumem, jest ciągłą transformacją falkową w odniesieniu do falki , jest …

3
Dlaczego AUC = 1 nawet klasyfikator błędnie zaklasyfikował połowę próbek?
Używam klasyfikatora, który zwraca prawdopodobieństwa. Aby obliczyć AUC, używam pakietu pROC R. Prawdopodobieństwa wyjściowe z klasyfikatora są następujące: probs=c(0.9865780, 0.9996340, 0.9516880, 0.9337157, 0.9778576, 0.8140116, 0.8971550, 0.8967585, 0.6322902, 0.7497237) probspokazuje prawdopodobieństwo zaliczenia do klasy „1”. Jak pokazano, klasyfikator sklasyfikował wszystkie próbki w klasie „1”. Prawdziwy wektor etykiety to: truel=c(1, 1, 1, …

1
Jak możemy symulować geometryczną mieszaninę?
Jeśli f1,…,fkf1,…,fkf_1,\ldots,f_k są znanymi gęstościami, z których mogę symulować, tj. Dla których dostępny jest algorytm. a jeśli iloczyn ∏i=1kfi(x)αiα1,…,αk>0∏i=1kfi(x)αiα1,…,αk>0\prod_{i=1}^k f_i(x)^{\alpha_i}\qquad \alpha_1,\ldots,\alpha_k>0 jest do zabudowy, istnieje ogólne podejście do symulacji z tego gęstości produktu, stosując symulator zfifif_i „s?


4
Jaka jest różnica między uczeniem się a wnioskowaniem?
Prace naukowe dotyczące uczenia maszynowego często traktują uczenie się i wnioskowanie jako dwa oddzielne zadania, ale nie jest dla mnie jasne, co to za rozróżnienie. Na przykład w tej książce wykorzystują statystyki bayesowskie do obu rodzajów zadań, ale nie stanowią motywacji do takiego rozróżnienia. Mam kilka niejasnych pomysłów, co to …

3
Czy w celu maksymalizacji szansy na prawidłowe odgadnięcie wyniku rzutu monetą zawsze powinienem wybierać najbardziej prawdopodobny wynik?
To nie jest praca domowa. Chciałbym zrozumieć, czy moja logika jest poprawna w przypadku tego prostego problemu dotyczącego statystyk. Powiedzmy, że mam dwustronną monetę, w której prawdopodobieństwo przewrócenia głowy wynosi a prawdopodobieństwo przewrócenia ogona wynosi . Załóżmy, że wszystkie rzuty mają niezależne prawdopodobieństwo. Teraz powiedzmy, że chcę zmaksymalizować moje szanse …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.