Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Przedziały ufności, gdy wielkość próbki jest bardzo duża
Moje pytanie można by sformułować jako „jak ocenić błąd próbkowania przy użyciu dużych zbiorów danych”, szczególnie w przypadku publikacji w czasopiśmie. Oto przykład ilustrujący wyzwanie. Z bardzo dużego zestawu danych (> 100 000 unikalnych pacjentów i ich przepisanych leków ze 100 szpitali) chciałem oszacować odsetek pacjentów przyjmujących określony lek. Uzyskanie …

1
Dlaczego modele efektów mieszanych rozwiązują zależność?
Powiedzmy, że interesuje nas, w jaki sposób na oceny egzaminów studenckich wpływa liczba godzin, które studenci studiują. Aby zbadać tę relację, możemy uruchomić następującą regresję liniową: egzamin. ocenyja= a + β1× godziny. Badaneja+ ejaegzamin. ocenyja=za+β1×godziny. badaneja+mija \text{exam.grades}_i = a + \beta_1 \times \text{hours.studied}_i + e_i Ale jeśli próbkujemy uczniów z …

1
Dlaczego dodanie efektu opóźnienia oznacza dewiację w bayesowskim modelu hierarchicznym?
Tło: Obecnie pracuję nad porównaniem różnych bayesowskich modeli hierarchicznych. Dane są liczbowymi miarami dobrostanu uczestnika i oraz czasu j . Mam około 1000 uczestników i 5 do 10 obserwacji na uczestnika.yI jyjajoty_{ij}jajaijotjotj Podobnie jak w przypadku większości podłużnych zestawów danych, spodziewam się, że zobaczę jakąś formę autokorelacji, w której obserwacje, …

1
Różnica między regresją logistyczną a maszynami wektorów wsparcia?
Wiem, że regresja logistyczna znajduje hiperpłaszczyznę, która oddziela próbki szkoleniowe. Wiem również, że maszyny wektorowe wsparcia znajdują hiperpłaszczyznę z maksymalnym marginesem. Moje pytanie: czy zatem różnica między regresją logistyczną (LR) a maszynami wektorów wsparcia (SVM) polega na tym, że LR znajduje jakąkolwiek hiperpłaszczyznę, która oddziela próbki szkoleniowe, podczas gdy SVM …

2
Różne wyniki z randomForest za pomocą karetki i podstawowego pakietu randomForest
Jestem trochę zdezorientowany: w jaki sposób wyniki wyszkolonego Modelu za pomocą karetki mogą różnić się od modelu w oryginalnym opakowaniu? Czytałem, czy wstępne przetwarzanie jest potrzebne przed prognozowaniem przy użyciu FinalModel z RandomForest z pakietem Caret? ale nie używam tutaj żadnego przetwarzania wstępnego. Trenowałem różne Losowe Lasy, używając pakietu Caret …

1
Kiedy mielibyśmy używać pędów i środkowego zamiast kwantyli i środkowej?
Nie mogę znaleźć definicji tantile ani medial na Wikipedii lub Wolfram Mathworld, ale następujące wyjaśnienie podano w Bílková, D. i Mala, I. (2012), „ Zastosowanie metody momentu L podczas modelowania rozkładu dochodów w Czechach ”, Austrian Journal of Statistics , 41 (2), 125–132. Przyśrodkowa jest wartością gantile 50%50%50\% (próbki), podobnie …

2
GLM: weryfikacja wyboru dystrybucji i funkcji łącza
Mam uogólniony model liniowy, który przyjmuje rozkład Gaussa i funkcję łączenia logów. Po dopasowaniu modelu sprawdzam wartości resztkowe: wykres QQ, wartości resztowe w stosunku do wartości przewidywanych, histogram reszt (potwierdzając, że należy zachować odpowiednią ostrożność). Wszystko wygląda dobrze. To wydaje mi się sugerować (dla mnie), że wybór rozkładu Gaussa był …

1
Od exp (współczynników) do ilorazu szans i ich interpretacji w regresji logistycznej z czynnikami
Przeprowadziłem liniową regresję akceptacji na studia w porównaniu z wynikami SAT i pochodzeniem rodzinnym / etnicznym. Dane są fikcyjne. Jest to kontynuacja wcześniejszego pytania, na które już udzielono odpowiedzi. Pytanie skupia się na zbieraniu i interpretacji ilorazów szans, gdy pomija się wyniki SAT dla uproszczenia. Zmienne to Accepted(0 lub 1) …
14 r  regression  logistic 

1
Ten sam sposób, inna wariancja
Załóżmy, że masz ośmiu biegaczy, którzy prowadzą wyścig; rozkład ich poszczególnych czasów pracy jest Normalny, a każdy ma średnio 111111 sekund, powiedzmy. Standardowe odchylenie dla biegacza pierwszego jest najmniejsze, dwa drugie najmniejsze, trzecie najmniejsze itd., A osiem największe. Mylą mnie dwa pytania: (1) Jakie jest prawdopodobieństwo, że pierwszy wygra z …

1
Czy jest jakaś różnica między szkoleniem stosu autokodera a dwuwarstwową siecią neuronową?
Powiedzmy, że piszę algorytm do budowy 2-warstwowego stosu samochodowego i 2-warstwowej sieci neuronowej. Czy są to te same rzeczy czy różnica? Rozumiem, że kiedy buduję autoencoder skumulowany, budowałem warstwa po warstwie. W przypadku sieci neuronowej zainicjowałbym wszystkie parametry w sieci, a następnie dla każdego punktu danych przekazałem ją przez sieć …

2
Procesy Dirichlet dla grupowania: jak radzić sobie z etykietami?
P: Jaki jest standardowy sposób klastrowania danych przy użyciu procesu Dirichleta? Podczas korzystania z Gibbs klastry próbkowania pojawiają się i znikają podczas próbkowania. Poza tym mamy problem z identyfikowalnością, ponieważ rozkład tylny jest niezmienny w przypadku etykietowania skupień. Dlatego nie możemy powiedzieć, który klaster jest użytkownikiem, a raczej, że dwóch …

2
Najlepsze sugerowane podręczniki na temat ponownego próbkowania Bootstrap?
Chciałem tylko zapytać, które według ciebie są najlepsze dostępne książki na temat bootstrapu. Rozumiem przez to niekoniecznie tylko ten napisany przez jego twórców. Czy możesz wskazać, który podręcznik jest dla Ciebie najlepszy dla bootstrapu, który spełnia następujące kryteria? Podstawa filozoficzna / epistemologiczna techniki, która wymienia dziedzinę stosowalności, mocne i słabe …

2
Pytania dotyczące Q-Learning z wykorzystaniem sieci neuronowych
Wdrożyłem Q-Learning zgodnie z opisem w http://web.cs.swarthmore.edu/~meeden/cs81/s12/papers/MarkStevePaper.pdf W celu ok. Q (S, A) Używam struktury sieci neuronowej, jak poniżej, Aktywacja Sigmoid Wejścia, liczba wejść + 1 dla neuronów akcji (wszystkie wejścia skalowane 0-1) Wyjścia, pojedyncze wyjście. Wartość Q N liczba M ukrytych warstw. Metoda eksploracji losowa 0 <rand () <propExplore …


1
W jaki sposób „podstawowe twierdzenie analizy czynnikowej” stosuje się do PCA lub jak definiuje się ładunki PCA?
Obecnie przeglądam zestaw slajdów, który mam do „analizy czynnikowej” (o ile wiem, PCA). Wywodzi się w nim „podstawowe twierdzenie analizy czynnikowej”, które twierdzi, że macierz korelacji danych przechodzących do analizy ( ) można odzyskać za pomocą macierzy ładunków czynnikowych ( ):RR\bf RAA\bf A R=AA⊤R=AA⊤\bf R = AA^\top To mnie jednak …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.