Moje pytanie można by sformułować jako „jak ocenić błąd próbkowania przy użyciu dużych zbiorów danych”, szczególnie w przypadku publikacji w czasopiśmie. Oto przykład ilustrujący wyzwanie. Z bardzo dużego zestawu danych (> 100 000 unikalnych pacjentów i ich przepisanych leków ze 100 szpitali) chciałem oszacować odsetek pacjentów przyjmujących określony lek. Uzyskanie …
Powiedzmy, że interesuje nas, w jaki sposób na oceny egzaminów studenckich wpływa liczba godzin, które studenci studiują. Aby zbadać tę relację, możemy uruchomić następującą regresję liniową: egzamin. ocenyja= a + β1× godziny. Badaneja+ ejaegzamin. ocenyja=za+β1×godziny. badaneja+mija \text{exam.grades}_i = a + \beta_1 \times \text{hours.studied}_i + e_i Ale jeśli próbkujemy uczniów z …
Tło: Obecnie pracuję nad porównaniem różnych bayesowskich modeli hierarchicznych. Dane są liczbowymi miarami dobrostanu uczestnika i oraz czasu j . Mam około 1000 uczestników i 5 do 10 obserwacji na uczestnika.yI jyjajoty_{ij}jajaijotjotj Podobnie jak w przypadku większości podłużnych zestawów danych, spodziewam się, że zobaczę jakąś formę autokorelacji, w której obserwacje, …
Wiem, że regresja logistyczna znajduje hiperpłaszczyznę, która oddziela próbki szkoleniowe. Wiem również, że maszyny wektorowe wsparcia znajdują hiperpłaszczyznę z maksymalnym marginesem. Moje pytanie: czy zatem różnica między regresją logistyczną (LR) a maszynami wektorów wsparcia (SVM) polega na tym, że LR znajduje jakąkolwiek hiperpłaszczyznę, która oddziela próbki szkoleniowe, podczas gdy SVM …
Jestem trochę zdezorientowany: w jaki sposób wyniki wyszkolonego Modelu za pomocą karetki mogą różnić się od modelu w oryginalnym opakowaniu? Czytałem, czy wstępne przetwarzanie jest potrzebne przed prognozowaniem przy użyciu FinalModel z RandomForest z pakietem Caret? ale nie używam tutaj żadnego przetwarzania wstępnego. Trenowałem różne Losowe Lasy, używając pakietu Caret …
Nie mogę znaleźć definicji tantile ani medial na Wikipedii lub Wolfram Mathworld, ale następujące wyjaśnienie podano w Bílková, D. i Mala, I. (2012), „ Zastosowanie metody momentu L podczas modelowania rozkładu dochodów w Czechach ”, Austrian Journal of Statistics , 41 (2), 125–132. Przyśrodkowa jest wartością gantile 50%50%50\% (próbki), podobnie …
Mam uogólniony model liniowy, który przyjmuje rozkład Gaussa i funkcję łączenia logów. Po dopasowaniu modelu sprawdzam wartości resztkowe: wykres QQ, wartości resztowe w stosunku do wartości przewidywanych, histogram reszt (potwierdzając, że należy zachować odpowiednią ostrożność). Wszystko wygląda dobrze. To wydaje mi się sugerować (dla mnie), że wybór rozkładu Gaussa był …
Przeprowadziłem liniową regresję akceptacji na studia w porównaniu z wynikami SAT i pochodzeniem rodzinnym / etnicznym. Dane są fikcyjne. Jest to kontynuacja wcześniejszego pytania, na które już udzielono odpowiedzi. Pytanie skupia się na zbieraniu i interpretacji ilorazów szans, gdy pomija się wyniki SAT dla uproszczenia. Zmienne to Accepted(0 lub 1) …
Załóżmy, że masz ośmiu biegaczy, którzy prowadzą wyścig; rozkład ich poszczególnych czasów pracy jest Normalny, a każdy ma średnio 111111 sekund, powiedzmy. Standardowe odchylenie dla biegacza pierwszego jest najmniejsze, dwa drugie najmniejsze, trzecie najmniejsze itd., A osiem największe. Mylą mnie dwa pytania: (1) Jakie jest prawdopodobieństwo, że pierwszy wygra z …
Powiedzmy, że piszę algorytm do budowy 2-warstwowego stosu samochodowego i 2-warstwowej sieci neuronowej. Czy są to te same rzeczy czy różnica? Rozumiem, że kiedy buduję autoencoder skumulowany, budowałem warstwa po warstwie. W przypadku sieci neuronowej zainicjowałbym wszystkie parametry w sieci, a następnie dla każdego punktu danych przekazałem ją przez sieć …
P: Jaki jest standardowy sposób klastrowania danych przy użyciu procesu Dirichleta? Podczas korzystania z Gibbs klastry próbkowania pojawiają się i znikają podczas próbkowania. Poza tym mamy problem z identyfikowalnością, ponieważ rozkład tylny jest niezmienny w przypadku etykietowania skupień. Dlatego nie możemy powiedzieć, który klaster jest użytkownikiem, a raczej, że dwóch …
Chciałem tylko zapytać, które według ciebie są najlepsze dostępne książki na temat bootstrapu. Rozumiem przez to niekoniecznie tylko ten napisany przez jego twórców. Czy możesz wskazać, który podręcznik jest dla Ciebie najlepszy dla bootstrapu, który spełnia następujące kryteria? Podstawa filozoficzna / epistemologiczna techniki, która wymienia dziedzinę stosowalności, mocne i słabe …
Wdrożyłem Q-Learning zgodnie z opisem w http://web.cs.swarthmore.edu/~meeden/cs81/s12/papers/MarkStevePaper.pdf W celu ok. Q (S, A) Używam struktury sieci neuronowej, jak poniżej, Aktywacja Sigmoid Wejścia, liczba wejść + 1 dla neuronów akcji (wszystkie wejścia skalowane 0-1) Wyjścia, pojedyncze wyjście. Wartość Q N liczba M ukrytych warstw. Metoda eksploracji losowa 0 <rand () <propExplore …
Kiedy mówimy, aby cofnąć względem X , czy mamy na myśli, że X jest zmienną niezależną, a Y zmienną zależną? tj. Y = a X + b .YYYXXXXXXY=aX+bY=aX+bY =aX + b
Obecnie przeglądam zestaw slajdów, który mam do „analizy czynnikowej” (o ile wiem, PCA). Wywodzi się w nim „podstawowe twierdzenie analizy czynnikowej”, które twierdzi, że macierz korelacji danych przechodzących do analizy ( ) można odzyskać za pomocą macierzy ładunków czynnikowych ( ):RR\bf RAA\bf A R=AA⊤R=AA⊤\bf R = AA^\top To mnie jednak …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.