Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Techniki analizy wskaźników
Szukam porad i komentarzy dotyczących analizy wskaźników i stawek. W dziedzinie, w której pracuję, analiza wskaźników jest powszechna, ale przeczytałem kilka artykułów, które sugerują, że może to być problematyczne, myślę o: Kronmal, Richard A. 1993. Ponownie zbadano fałszywą korelację i błędność standardu współczynnika. Journal of Royal Statistics Society Series A …

2
Jak interpretować model probitowy w Stata?
Nie jestem pewien, jak interpretować tę regresję probitową, którą uruchomiłem na Stacie. Dane dotyczą zatwierdzenia pożyczki, a biała jest zmienną fikcyjną, która = 1, jeśli dana osoba była biała, lub = 0, jeśli dana osoba nie była. Bardzo pomocna byłaby jak to przeczytać. Najbardziej szukam tego, jak znaleźć szacunkowe prawdopodobieństwo …

2
regresja poissona a regresja logistyczna
Mam grupę pacjentów z różną długością okresu obserwacji. Do tej pory pomijam aspekt czasowy i po prostu muszę wymodelować wynikową chorobę / brak choroby. W tych badaniach zwykle przeprowadzam regresję logistyczną, ale inny mój kolega zapytał, czy regresja Poissona byłaby równie odpowiednia. Nie przepadam za poissonem i nie byłem pewien, …



2
Czy istnieje pakiet R dla ciągłych odpowiedzi binarnych wzdłuż czasu?
bildPakiet wydaje się być doskonały pakiet dla szeregowych odpowiedzi binarnych. Ale to na dyskretny czas. Chciałbym określić płynną funkcję czasu dla połączenia ilorazu szansy bieżącej odpowiedzi Y z odpowiedziami binarnymi zmierzonymi wcześniej lub przynajmniej wersją Markowa pierwszego rzędu. Uważam, że nazywa się to naprzemienną regresją logistyczną. Czy ktoś wie o …


2
Rozwiązania numeryczne dla stochastycznych równań różniczkowych w R: czy są jakieś?
Szukam ogólnego, czystego i szybkiego (tj. Przy użyciu procedur C ++) pakietu R do symulacji ścieżek z niejednorodnej dyfuzji nieliniowej, takiej jak (1) przy użyciu schematu Eulera-Maruyamy, schematu Milsteina (lub dowolnego innego). Jest to przeznaczone do osadzenia w większym kodzie szacunkowym i dlatego zasługuje na optymalizację. reXt= f( θ , …

1
Czy konieczne jest centrowanie podczas ładowania próbki?
Czytając o przybliżeniu rozkładu próbki, natknąłem się na nieparametryczną metodę ładowania początkowego. Najwyraźniej można zbliżyć się do rozkładu przez podział ˉ X * n - ˉ X n , gdzie ˉ X * n oznacza średnią próbkę z próbki uruchamiającego.X¯n- μX¯n−μ\bar{X}_n-\muX¯∗n- X¯nX¯n∗−X¯n\bar{X}_n^*-\bar{X}_nX¯∗nX¯n∗\bar{X}_n^* Moje pytanie brzmi zatem: czy potrzebuję centrowania? Po …

2
Jeśli p> n, lasso wybiera co najwyżej n zmiennych
Jedną z motywów elastycznej siatki było następujące ograniczenie LASSO: W przypadku lasso wybiera co najwyżej n zmiennych przed nasyceniem, ze względu na naturę problemu optymalizacji wypukłej. Wydaje się, że jest to cecha ograniczająca metodę wyboru zmiennych. Co więcej, lasso nie jest dobrze zdefiniowane, chyba że granica normy L1 współczynników jest …

1
Problem optymalizacji
Mój przyjaciel sprzedaje kkk modeli mikserów. Niektóre blendery są bardzo proste i tanie, inne są bardzo wyrafinowane i droższe. Jego dane obejmują, dla każdego miesiąca, ceny każdego miksera (które są przez niego ustalone) oraz liczbę sprzedanych jednostek dla każdego modelu. Aby ustanowić notację, zna przez miesiące j=1,…,nj=1,…,nj=1,\dots,n wektory (p1j,…,pkj)and(n1j,…,nkj),(p1j,…,pkj)and(n1j,…,nkj), (p_{1j},\dots,p_{kj}) …

1
Regresja liniowa i autokorelacja przestrzenna
Chcę przewidzieć wysokości drzew w określonym obszarze przy użyciu niektórych zmiennych uzyskanych za pomocą teledetekcji. Podobnie jak przybliżona biomasa itp. Najpierw chcę zastosować regresję liniową (wiem, że nie jest to najlepszy pomysł, ale jest to krok konieczny dla mojego projektu). Chciałem wiedzieć, jak źle wpływa na to autokorelacja przestrzenna i …

1
Czy bootstrapowanie jest prawidłową metodą oceny niepewności oszacowania mediany?
Ładowanie początkowe działa dobrze, aby uzyskać dostęp do niepewności w średniej wartości szacunkowej, ale pamiętam, że gdzieś czytałem, że ładowanie początkowe nie robi dobrej roboty w ocenie niepewności w oszacowaniach kwantylowych (szczególnie mediany). Nie pamiętam, gdzie to przeczytałem, i nie mogłem wiele znaleźć dzięki szybkiemu wyszukiwaniu w Google. Będziemy wdzięczni …


5
Odpowiednie techniki grupowania danych czasowych?
Mam dane czasowe częstotliwości aktywności. Chcę zidentyfikować klastry w danych, które wskazują różne okresy o podobnych poziomach aktywności. Idealnie chcę zidentyfikować klastry bez określania liczby klastrów a priori. Jakie są odpowiednie techniki klastrowania? Jeśli moje pytanie nie zawiera wystarczającej ilości informacji, aby odpowiedzieć, jakie informacje muszę podać, aby określić odpowiednie …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.