Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

6
Jaka jest różnica między skutecznością a skutecznością w określaniu korzyści terapii „A” pod warunkiem „B”?
Kontekst tego pytania mieści się w ramach zdrowia, tj. Patrząc na jedną lub więcej terapii w leczeniu stanu. Wygląda na to, że nawet szanowani badacze mylą pojęcia skuteczność i skuteczność , używając tych zamiennie. Jak można myśleć o skuteczności w porównaniu ze skutecznością w sposób, który pomoże usunąć zamieszanie? Jakiego …

2
Jak liczba połączeń może być gaussowska, jeśli nie może być ujemna?
Analizuję sieci społecznościowe (nie wirtualne) i obserwuję powiązania między ludźmi. Gdyby ktoś wybrał inną osobę, z którą mógłby się połączyć losowo, liczba połączeń w grupie osób byłaby rozłożona normalnie - przynajmniej zgodnie z książką, którą obecnie czytam. Skąd możemy wiedzieć, że rozkład jest Gaussa (normalny)? Istnieją inne rozkłady, takie jak …

4
Wygładzanie danych szeregów czasowych
Buduję aplikację na Androida, która rejestruje dane akcelerometru podczas snu, aby analizować trendy snu i opcjonalnie budzić użytkownika w pobliżu pożądanego czasu podczas snu lekkiego. Zbudowałem już komponent, który gromadzi i przechowuje dane, a także alarm. Nadal muszę stawić czoła bestii, wyświetlając i zapisując dane dotyczące snu w naprawdę znaczący …

2
Zamawianie szeregów czasowych do uczenia maszynowego
Po przeczytaniu jednej z „Porad badawczych” RJ Hyndmana na temat walidacji krzyżowej i szeregów czasowych wróciłem do mojego starego pytania, które spróbuję tutaj sformułować. Chodzi o to, że w problemach z klasyfikacją lub regresją kolejność danych nie jest ważna, a zatem można zastosować k- krotną walidację krzyżową. Z drugiej strony, …

5
Czy Matlab / oktawa lub R lepiej nadaje się do symulacji Monte Carlo?
Zacząłem robić Monte Carlo w R jako hobby, ale w końcu analityk finansowy doradził migrację do Matlaba. Jestem doświadczonym programistą. ale początkujący Monte Carlo. Chcę budować modele statyczne z analizą wrażliwości, później modele dynamiczne. Potrzebujesz dobrych bibliotek / algorytmów, które mnie poprowadzą. Wydaje mi się, że R ma doskonałe biblioteki …
14 r  matlab  monte-carlo 

3
Jak wykryć nadmierne dopasowanie modelu regresji?
Kiedy jesteś tym, który wykonuje tę pracę, mając świadomość tego, co robisz, masz poczucie, że nadmiernie dopasowujesz się do modelu. Po pierwsze, możesz śledzić trend lub pogorszenie w skorygowanym kwadracie R. modelu. Można również śledzić podobne pogorszenie wartości p współczynników regresji głównych zmiennych. Ale kiedy właśnie czytasz kogoś innego i …

2
Operacje trygonometryczne na odchyleniach standardowych
Dodawanie, odejmowanie, mnożenie i dzielenie normalnych zmiennych losowych są dobrze określone, ale co z operacjami trygonometrycznymi? Załóżmy na przykład, że próbuję znaleźć kąt trójkątnego klina (modelowanego jako trójkąt pod kątem prostym) z dwoma catheti o wymiarach d1d1d_1 i d2d2d_2 , oba opisane jako rozkłady normalne. Zarówno intuicja, jak i symulacja …

1
Jak zrobić piramidę wieku jak fabuła w R?
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Piramida wieku wygląda następująco: chciałbym zrobić coś podobnego, a mianowicie 2 wykresy słupkowe (nie histogramy) z tymi samymi kategoriami, obrócone pionowo i rozciągające się na …

2
Zarządzanie błędami w trasach GPS (ramy teoretyczne?)
Szukam odpowiedniej struktury teoretycznej lub specjalizacji, która pomogłaby mi zrozumieć, jak radzić sobie z błędami, które ma system GPS - szczególnie podczas obchodzenia się z trasami. Zasadniczo szukam wymagań dotyczących danych i wszelkich algorytmów, które pozwolą ustalić długość śladu. Odpowiedź musi być godna zaufania. Mój przyjaciel był dyrektorem wyścigu, który …
14 error  sampling 

3
Czy modele CART mogą być solidne?
Mój kolega z mojego biura powiedział mi dzisiaj: „Modele drzew nie są dobre, ponieważ przyłapują ich ekstremalne obserwacje”. Wyszukiwanie tutaj zaowocowało tym wątkiem, który zasadniczo obsługuje roszczenie. Co prowadzi mnie do pytania - w jakiej sytuacji model CART może być solidny i jak to pokazano?



2
Dlaczego oszacowanie błędu losowego OOB błędu lasu poprawia się, gdy liczba wybranych funkcji jest zmniejszana?
Stosuję algorytm losowego lasu jako klasyfikator w zestawie danych mikromacierzy, które są podzielone na dwie znane grupy z tysiącami funkcji. Po pierwszym uruchomieniu sprawdzam znaczenie funkcji i ponownie uruchamiam algorytm drzewa z 5, 10 i 20 najważniejszymi funkcjami. Uważam, że dla wszystkich funkcji, w pierwszej dziesiątce i 20, szacowany przez …

3
Pakiet R do regresji logistycznej o stałym efekcie
Poszukuję Rpakietu do szacowania współczynników modeli logit z indywidualnym efektem stałym (indywidualnym przechwytywaniem) za pomocą estymatora Chamberlain z 1980 roku. Jest często znany jako estymator logitów o ustalonym efekcie Chamberlain. Jest to klasyczny estymator, gdy mamy do czynienia z danymi panelu wyników binarnych (przynajmniej w ekonometrii), ale po prostu nie …

4
Działania następcze: w przypadku mieszanego wykresu ANOVA oszacowanych SE lub rzeczywistych SE?
Obecnie kończę pracę i natknąłem się na to pytanie z wczoraj, które skłoniło mnie do postawienia sobie tego samego pytania. Czy lepiej jest podać mojemu wykresowi rzeczywisty błąd standardowy z danych lub ten oszacowany na podstawie mojej ANOVA? Ponieważ pytanie z wczoraj było raczej niespecyficzne, a moje dość specyficzne, pomyślałem, …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.