Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


5
Czy Bayesianie twierdzą, że istnieją przypadki, w których ich podejście uogólnia się / pokrywa się z podejściem częstym?
Czy Bayesianie kiedykolwiek twierdzą, że ich podejście uogólnia podejście częstokroć częstokroć, ponieważ można zastosować nieinformacyjne priory i dlatego można odzyskać typową strukturę modelu częstokroć? Czy ktoś może skierować mnie do miejsca, w którym mogę przeczytać o tym argumencie, jeśli rzeczywiście jest on używany? EDYCJA: To pytanie może być sformułowane niezupełnie …

2
PCA i losowe lasy
W ostatnim konkursie Kaggle (ręcznie) zdefiniowałem 10 dodatkowych funkcji dla mojego zestawu treningowego, które następnie zostaną wykorzystane do wyszkolenia losowego klasyfikatora lasów. Postanowiłem uruchomić PCA w zestawie danych z nowymi funkcjami, aby zobaczyć, jak się ze sobą porównują. Odkryłem, że ~ 98% wariancji było przenoszone przez pierwszy składnik (pierwszy wektor …

3
SVD macierzy z brakującymi wartościami
Załóżmy, że mam macierz rekomendacji w stylu Netflix i chcę zbudować model, który przewiduje potencjalne przyszłe oceny filmów dla danego użytkownika. Stosując podejście Simona Funka, można by użyć stochastycznego spadku gradientu, aby zminimalizować normę Frobeniusa między pełną macierzą a macierzą element po elemencie * użytkownik-użytkownik w połączeniu z terminem regularyzacji …

2
Różnica między eksploracyjną i potwierdzającą analizą czynnikową w określaniu niezależności konstruktu
Badacze często używają dwóch miar, które mają bardzo podobne elementy i twierdzą, że mierzą różne rzeczy (np. „Zawsze martwię się, gdy jestem w pobliżu samochodów”; „Boję się samochodów”). Nazwijmy hipotetyczne miary miarą strachu przed samochodami i niepokojem ze skali samochodów. Interesuje mnie testowanie empiryczne, jeśli rzeczywiście oceniają różne konstrukcje utajone …

2
Jak zmniejszyć liczbę elementów za pomocą analizy czynnikowej, spójności wewnętrznej i teorii odpowiedzi na element w połączeniu?
Jestem w trakcie empirycznego opracowywania kwestionariusza i użyję dowolnych liczb w tym przykładzie do zilustrowania. Dla kontekstu opracowuję kwestionariusz psychologiczny mający na celu ocenę wzorców myślenia powszechnie identyfikowanych u osób z zaburzeniami lękowymi. Element może wyglądać tak: „Muszę wielokrotnie sprawdzać piekarnik, ponieważ nie jestem pewien, czy jest wyłączony ”. Mam …


1
Co to jest korekta uprzedzeń? [Zamknięte]
Zamknięte . To pytanie wymaga szczegółów lub jasności . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Dodaj szczegóły i wyjaśnij problem, edytując ten post . Zamknięte 4 lata temu . Widziałem wiele miejsc, w których mają zestawy danych wejściowych / wyjściowych, w których najpierw tworzą linię regresji liniowej, korygują …


2
Analiza resztkowa regresji logistycznej
To pytanie jest dość ogólne i wyczerpujące, ale proszę o wyrozumiałość. W mojej aplikacji mam wiele zestawów danych, z których każdy składa się z ~ 20 000 punktów danych z ~ 50 funkcjami i jedną zależną zmienną binarną. Usiłuję modelować zestawy danych przy użyciu regularnej regresji logistycznej (pakiet R glmnet …

1
Jak mogę zoptymalizować wydajność obliczeniową przy wielokrotnym dopasowywaniu złożonego modelu do dużego zestawu danych?
Mam problemy z wydajnością przy użyciu MCMCglmmpakietu w R do uruchomienia mieszanego modelu efektów. Kod wygląda następująco: MC1<-MCMCglmm(bull~1,random=~school,data=dt,family="categorical" , prior=list(R=list(V=1,fix=1), G=list(G1=list(V=1, nu=0))) , slice=T, nitt=iter, ,burnin=burn, verbose=F) Dane zawierają około 20 000 obserwacji i są skupione w około 200 szkołach. Usunąłem wszystkie nieużywane zmienne z ramki danych i usunąłem wszystkie …

1
Wykreślanie krzywej prawdopodobieństwa dla modelu logit z wieloma predyktorami
Mam następującą funkcję prawdopodobieństwa: Prob=11+e−zProb=11+e−z\text{Prob} = \frac{1}{1 + e^{-z}} gdzie z=B0+B1X1+⋯+BnXn.z=B0+B1X1+⋯+BnXn.z = B_0 + B_1X_1 + \dots + B_nX_n. Mój model wygląda Pr(Y=1)=11+exp(−[−3.92+0.014×(bid)])Pr(Y=1)=11+exp⁡(−[−3.92+0.014×(bid)])\Pr(Y=1) = \frac{1}{1 + \exp\left(-[-3.92 + 0.014\times(\text{bid})]\right)} Jest to wizualizowane za pomocą krzywej prawdopodobieństwa, która wygląda jak ta poniżej. Zastanawiam się nad dodaniem kilku zmiennych do mojego pierwotnego …

2
Jak symulować dane funkcjonalne?
Próbuję przetestować różne podejścia do analizy danych funkcjonalnych. Idealnie chciałbym przetestować zestaw podejść, jakie mam na symulowanych danych funkcjonalnych. Próbowałem wygenerować symulowany FD przy użyciu podejścia opartego na sumującym hałasie Gaussa (kod poniżej), ale uzyskane krzywe wyglądają o wiele za mocno w porównaniu do rzeczywistych . Zastanawiałem się, czy ktoś …

6
Jeśli użyjesz oceny punktowej, która maksymalizuje
Gdyby ktoś powiedział „Ta metoda wykorzystuje MLE do oszacowania punktowego parametru, który maksymalizuje , dlatego jest częsty; a ponadto nie jest bayesowski.”P ( x | θ )P(x|θ)\mathrm{P}(x|\theta) zgodziłbyś się? Aktualizacja w tle : Niedawno przeczytałem artykuł, który twierdzi, że jest częsty. Nie zgadzam się z ich twierdzeniem, w najlepszym razie …

2
Jak radzić sobie z efektem sufitu dzięki narzędziu pomiarowemu?
Zebrałem dane psychofizjologiczne mierzące zdolność badanych (dwóch grup) do postrzegania wibracji. Wibrująca sonda porusza się po skórze przy coraz mniejszych przemieszczeniach, a pacjent wskazuje, kiedy odczuwa wibrację. Niestety, przy wysokich częstotliwościach sonda może poruszać się tylko na niewielką odległość, a czasami największa odległość, na którą sonda może się poruszać, wciąż …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.