Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Czy losujesz liczby całkowite niezależnie i równomiernie losowo od 1 do przy użyciu sprawiedliwego d6?
Chciałbym narysować liczby całkowite od 1 do określonego , rzucając pewną liczbą uczciwych sześciościennych kości (d6). Dobra odpowiedź wyjaśni, dlaczego jej metoda daje jednolite i niezależne liczby całkowite.N.NN Jako przykład ilustrujący pomocne byłoby wyjaśnienie, jak działa rozwiązanie dla przypadku .N = 150N=150N=150 Ponadto chciałbym, aby procedura była jak najbardziej wydajna: …


3
Jak wielkość partii wpływa na konwergencję SGD i dlaczego?
Widziałem podobny wniosek z wielu dyskusji, że wraz ze wzrostem rozmiaru mini-partii konwergencja SGD faktycznie staje się trudniejsza / gorsza, na przykład ten artykuł i ta odpowiedź . Słyszałem także o ludziach stosujących sztuczki, takie jak małe stawki uczenia się lub wielkości partii na wczesnym etapie, aby rozwiązać ten problem …

2
Dlaczego rodzina wykładnicza nie obejmuje wszystkich rozkładów?
Czytam książkę: Bishop, Rozpoznawanie wzorców i uczenie maszynowe (2006) który definiuje wykładniczą rodzinę jako rozkłady postaci (równanie 2.194): p(x|η)=h(x)g(η)exp{ηTu(x)}p(x|η)=h(x)g(η)exp⁡{ηTu(x)}p(\mathbf x|\boldsymbol \eta) = h(\mathbf x) g(\boldsymbol \eta) \exp \{\boldsymbol \eta^\mathrm T \mathbf u(\mathbf x)\} Ale nie widzę żadnych ograniczeń dotyczących lub . Czy to nie oznacza, że dowolna dystrybucja może być …

3
Jak przeprowadzić izometryczną transformację logarytmiczną
Mam dane na temat zachowań ruchowych (czasu spania, siedzącego trybu życia i aktywności fizycznej), które wynoszą około 24 (jak w godzinach dziennie). Chcę utworzyć zmienną, która przechwytuje względny czas spędzony na każdym z tych zachowań - powiedziano mi, że dokonałaby tego izometryczna transformacja logarytmiczna. Wygląda na to, że powinienem użyć …

2
Czy próbki treningowe losowo losowane do treningu neuronowego należy pobierać bez wymiany?
Definiujemy epokę, która przeszła przez wszystkie dostępne próbki szkoleniowe, a rozmiar mini-partii jako liczbę próbek, w stosunku do której uśredniamy, aby znaleźć aktualizacje wag / odchyleń potrzebnych do zejścia z gradientu. Moje pytanie brzmi: czy powinniśmy rysować bez zastępowania z zestawu przykładów treningu, aby wygenerować każdą mini-partię w epoce. Wydaje …


3
Jak obsługiwać porządkową zmienną kategorialną jako zmienną niezależną
Korzystam z modelu logit. Moja zmienna zależna jest binarna. Jednak mam niezależną zmienną, która jest kategoryczne i zawiera odpowiedzi: 1.very good, 2.good, 3.average, 4.poor and 5.very poor. Jest to więc porządkowe („ilościowe jakościowe”). Nie jestem pewien, jak sobie z tym poradzić w modelu. Używam gretl. [Uwaga z @ttnphns: Chociaż pytanie …

2
Zalety optymalizacji roju cząstek w porównaniu z optymalizacją Bayesa do strojenia hiperparametrów?
Istnieją znaczące współczesne badania dotyczące optymalizacji bayesowskiej (1) dostrajania hiperparametrów ML. Motywacją do kierowania jest tutaj minimalna liczba punktów danych, aby dokonywać świadomych wyborów, które punkty warto wypróbować (wywołania funkcji celu są drogie, więc zmniejszenie ich liczby jest lepsze), ponieważ szkolenie modelu jest czasochłonne - niektóre skromnie -Duże problemy z …

2
jak zrobić funkcję nagrody w nauce wzmacniającej
Studiując uczenie się przez wzmocnienie, natknąłem się na wiele form funkcji nagrody: , R ( s , a , s ′ ) , a nawet funkcji nagrody, która zależy tylko od bieżącego stanu. Powiedziawszy to, zdałem sobie sprawę, że nie jest łatwo „stworzyć” lub „zdefiniować” funkcję nagrody.R(s,a)R(s,a)R(s,a)R(s,a,s′)R(s,a,s′)R(s,a,s') Oto moje pytania: …

2
Czy pochylenie gradientu można zastosować do funkcji niewypukłych?
Właśnie uczę się o optymalizacji i mam problem ze zrozumieniem różnicy między optymalizacją wypukłą i nie wypukłą. Z mojego zrozumienia funkcja wypukła to taka, w której „odcinek linii między dowolnymi dwoma punktami na wykresie funkcji znajduje się powyżej lub na wykresie”. W takim przypadku można zastosować algorytm spadku gradientu, ponieważ …

1
Czy dane powinny być wyśrodkowane i skalowane przed zastosowaniem t-SNE?
Niektóre funkcje moich danych mają duże wartości, podczas gdy inne funkcje mają znacznie mniejsze wartości. Czy konieczne jest wyśrodkowanie + skalowanie danych przed zastosowaniem t-SNE, aby zapobiec odchyleniu w kierunku większych wartości? Korzystam z implementacji sklearn.manifold.TSNE w Pythonie z domyślną miarą odległości euklidesowej.

2
Rozmiar efektu do podpisanego testu rang Wilcoxona?
Niektórzy autorzy (np. Pallant, 2007, s. 225; patrz zdjęcie poniżej) sugerują obliczenie wielkości efektu dla testu rang podpisanego przez Wilcoxona poprzez podzielenie statystyki testu przez pierwiastek kwadratowy z liczby obserwacji: r=Znx+ny√r=Znx+nyr = \frac{Z}{\sqrt{n_x + n_y}} Zjest wyjście statystyczny badania przez SPSS (patrz zdjęcie poniżej), jak również przez wilcoxsign_testw R. (Patrz …

2
Co wyjaśnia Dodany wykres zmienny (wykres częściowej regresji) w regresji wielokrotnej?
Mam model zestawu danych Filmy i użyłem regresji: model <- lm(imdbVotes ~ imdbRating + tomatoRating + tomatoUserReviews+ I(genre1 ** 3.0) +I(genre2 ** 2.0)+I(genre3 ** 1.0), data = movies) library(ggplot2) res <- qplot(fitted(model), resid(model)) res+geom_hline(yintercept=0) Co dało wynik: Teraz próbowałem po raz pierwszy pracować nad czymś o nazwie Dodany wykres zmienny …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.