Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Bezzasadność w modelu przyczynowym Rubina - wyjaśnienie Laika
Wdrażając model przyczynowy Rubina, jednym z (niestabilnych) założeń, których potrzebujemy, jest nieuzasadnienie, co oznacza (Y(0),Y(1))⊥T|X(Y(0),Y(1))⊥T|X(Y(0),Y(1))\perp T|X Tam, gdzie LHS jest alternatywą, T to leczenie, a X to zmienne towarzyszące, które kontrolujemy. Zastanawiam się, jak to opisać osobie, która nie wie dużo o modelu przyczynowym Rubina. Rozumiem, dlaczego teoretycznie potrzebujemy tego …

2
Najlepsze praktyki kodowania funkcji jakościowych dla drzew decyzyjnych?
Podczas kodowania cech kategorycznych dla regresji liniowej obowiązuje zasada: liczba manekinów powinna być o jeden mniejsza niż całkowita liczba poziomów (aby uniknąć kolinearności). Czy istnieje podobna zasada dla drzew decyzyjnych (spakowane, wzmocnione)? Pytam o to, ponieważ standardową praktyką w Pythonie wydaje się być rozszerzanie npoziomów na nmanekiny (sklearny OneHotEncoderlub Pandy …

1
Znaczenie osi y na wykresie częściowej zależności losowego lasu
Korzystam z RandomForestpakietu R i nie rozumiem, jak interpretować wartości osi Y na ich wykresach częściowej zależności. Dokumenty pomocnicze stwierdzają, że wykres jest „graficznym przedstawieniem marginalnego wpływu zmiennej na prawdopodobieństwo klasowe”. Nadal jednak nie rozumiem, co dokładnie reprezentuje oś y. W szczególności, co oznaczają wartości ujemne? Co to znaczy mieć …

1
MCMC z algorytmem Metropolis-Hastings: wybór propozycji
Muszę wykonać symulację, aby ocenić całkę funkcji 3-parametrowej, mówimy , która ma bardzo skomplikowaną formułę. Poproszono o użycie metody MCMC w celu jej obliczenia i zaimplementowania algorytmu Metropolis-Hastings w celu wygenerowania wartości rozłożonych jako , i zasugerowano użycie 3 różnych normalnych jako rozkładu propozycji. Czytając kilka przykładów na ten temat, …





11
Czy rozkład, który jest normalny, ale mocno wypaczony, jest uważany za gaussowski?
Mam pytanie: jak myślisz, jak wygląda rozkład czasu spędzanego dziennie na YouTube? Moja odpowiedź jest taka, że ​​prawdopodobnie jest on zwykle rozłożony i mocno zniekształcony. Oczekuję, że istnieje jeden tryb, w którym większość użytkowników spędza średnio jakiś czas, a następnie długi prawy ogon, ponieważ niektórzy użytkownicy są przytłaczającymi użytkownikami zaawansowanymi. …

2
Różnica między szczeblami drugim i trzecim w Drabinie związku przyczynowego
W „Księdze powodu” Judei Pearl mówi o tym, co nazywa drabiną przyczynową, która jest zasadniczo hierarchią złożoną z różnych poziomów rozumowania przyczynowego. Najniższe dotyczy wzorców asocjacji w obserwowanych danych (np. Korelacja, prawdopodobieństwo warunkowe itp.), Następne skupiają się na interwencji (co się stanie, jeśli celowo zmienimy proces generowania danych w określony …
12 causality 

8
Jeśli wartość p wynosi dokładnie 1 (1,0000000), jakie limity przedziału ufności powinny być spełnione, aby hipoteza zerowa była prawdziwa? [Zamknięte]
Zamknięte . To pytanie wymaga szczegółów lub jasności . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Dodaj szczegóły i wyjaśnij problem, edytując ten post . Zamknięte 7 miesięcy temu . To jest pytanie czysto hipotetyczne. Bardzo częstym stwierdzeniem jest to, że nigdy nie jest prawdziwe, to tylko kwestia wielkości …

1
Jak pobierać próbki równomiernie z powierzchni hiper-elipsoidy (stała odległość Mahalanobisa)?
Czy w przypadku wielowymiarowym o wartościach rzeczywistych istnieje sposób, aby równomiernie próbkować punkty z powierzchni, na których odległość Mahalanobisa od średniej jest stała? EDYCJA: sprowadza się to do równomiernego pobierania próbek z powierzchni hiperlipsoidy, która spełnia równanie, (x−μ)TΣ−1(x−μ)=d2.(x−μ)TΣ−1(x−μ)=d2.(x-\mu)^T \Sigma^{-1}(x-\mu) = d^2. Mówiąc bardziej precyzyjnie, w „równomiernie”, to znaczy próbki, tak, …

1
Czy w przypadku uśredniania modelu GLM uśredniamy prognozy na skali łącza lub odpowiedzi?
Aby obliczyć prognozy uśrednione w modelu na skali odpowiedzi GLM, która jest „poprawna” i dlaczego? Obliczyć uśrednioną prognozę modelu na skali łącza, a następnie przekształcić wstecz do skali odpowiedzi, lub Wstecz przekształć prognozy do skali odpowiedzi, a następnie oblicz średnią modelową Prognozy są bliskie, ale nie równe, jeśli model jest …

1
Czy metaanaliza ilorazów szans jest w zasadzie beznadziejna?
W ostatnim artykule Norton i in. (2018) stwierdzają, że[1][1]^{[1]} Różnych ilorazów szans z tego samego badania nie można porównać, gdy modele statystyczne, które dają oszacowania ilorazu szans, mają różne zmienne objaśniające, ponieważ każdy model ma inny arbitralny współczynnik skalowania. Wielkości ilorazu szans z jednego badania nie można także porównać z …

1
Jakie jest znaczenie osi w t-SNE?
Obecnie próbuję owinąć głowę wokół matematyki t-SNE . Niestety, wciąż jest jedno pytanie, na które nie potrafię odpowiedzieć zadowalająco: Jakie jest rzeczywiste znaczenie osi na wykresie t-SNE? Gdybym miał przedstawić prezentację na ten temat lub zamieścić ją w jakiejkolwiek publikacji: Jak odpowiednio oznaczyć osie? PS: Czytam to pytanie Reddita, ale …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.