Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
LASSO z warunkami interakcji - czy jest w porządku, jeśli główne efekty zostaną zmniejszone do zera?
Regresja LASSO zmniejsza współczynniki do zera, zapewniając w ten sposób efektywny wybór modelu. Uważam, że w moich danych występują znaczące interakcje między zmiennymi nominalnymi i ciągłymi zmiennymi towarzyszącymi. Jednak niekoniecznie „główne efekty” prawdziwego modelu są znaczące (niezerowe). Oczywiście tego nie wiem, ponieważ prawdziwy model jest nieznany. Moim celem jest znalezienie …


1
Czy istnieje wynik, który zapewnia, że ​​bootstrap jest prawidłowy tylko wtedy, gdy statystyki są płynne?
W całym założeniu nasza statystyka jest funkcją niektórych danych która jest pobierana z funkcji dystrybucyjnej ; funkcja rozkładu empirycznego naszej próbki to . Więc to statystyka postrzegana jako zmienna losowa, a to wersja statystyki ładowania początkowego. Używamy jako odległości KSθ(⋅)θ(⋅)\theta(\cdot)X1,…XnX1,…XnX_1, \ldots X_nF θ ( F ) θ ( M ) …

3
Jakie są zalety układania wielu LSTM?
Jakie są zalety, dlaczego warto korzystać z wielu LSTM, ułożonych jeden obok drugiego, w sieci głębokiej? Używam LSTM do reprezentowania sekwencji danych wejściowych jako pojedynczego wejścia. Więc kiedy mam tę pojedynczą reprezentację - dlaczego miałbym ją powtórzyć? Pytam o to, ponieważ widziałem to w programie generowania języka naturalnego.

1
Dlaczego skorygowane jednostki liniowe są uważane za nieliniowe?
Dlaczego funkcje aktywacji rektyfikowanych jednostek liniowych (ReLU) są uważane za nieliniowe? f(x)=max(0,x)f(x)=max(0,x) f(x) = \max(0,x) Są one liniowe, gdy dane wejściowe są dodatnie i z mojego zrozumienia, aby odblokować reprezentatywną moc głębokich sieci, nieliniowe aktywacje są koniecznością, w przeciwnym razie cała sieć mogłaby być reprezentowana przez pojedynczą warstwę.

5
Algorytmy uczenia maszynowego do obsługi brakujących danych
Próbuję opracować model predykcyjny z wykorzystaniem wielowymiarowych danych klinicznych, w tym wartości laboratoryjnych. Przestrzeń danych jest rzadka z 5k próbkami i 200 zmiennymi. Chodzi o to, aby uszeregować zmienne przy użyciu metody wyboru cech (IG, RF itp.) I użyć funkcji o najwyższym rankingu do opracowania modelu predykcyjnego. Podczas gdy wybór …

4
Funkcje niezależnych zmiennych losowych
Czy twierdzenie, że funkcje niezależnych zmiennych losowych są same w sobie niezależne, prawda? Widziałem ten wynik często używany pośrednio w niektórych dowodach, na przykład w dowodzie niezależności między średnią próbki a wariancją próby rozkładu normalnego, ale nie byłem w stanie znaleźć uzasadnienia. Wydaje się, że niektórzy autorzy uważają to za …

2
Rysunek z rozkładu Dirichleta
Załóżmy, że mamy rozkład Dirichleta z parametrem wektora wymiarowego . Jak narysować próbkę ( wektor wymiarowy) z tego rozkładu? Potrzebuję (możliwie) prostego wyjaśnienia.KKKα⃗ =[α1,α2,...,αK]α→=[α1,α2,...,αK]\vec\alpha = [\alpha_1, \alpha_2,...,\alpha_K]KKK

2
Intuicja regresji logistycznej
Ostatnio zacząłem studiować uczenie maszynowe, jednak nie rozumiałem intuicji stojącej za regresją logistyczną . Oto fakty dotyczące regresji logistycznej, które rozumiem. Jako podstawę hipotezy wykorzystujemy funkcję sigmoidalną . Rozumiem, dlaczego to poprawny wybór, ale dlaczego jest to tylko wybór nie rozumiem. Hipoteza reprezentuje prawdopodobieństwo, że odpowiednia wartość wyjściowa wynosi 1 …

3
Jak Bayesianie porównują rozkłady?
Myślę więc, że dobrze rozumiem podstawy prawdopodobieństwa częstokroć i analizy statystycznej (i tego, jak bardzo można je wykorzystać). W świecie częstokroć sensowne jest zadawanie takiego pytania, jak: „czy ten rozkład różni się od tego rozkładu”, ponieważ zakłada się, że rozkłady są rzeczywiste, obiektywne i niezmienne (przynajmniej dla danej sytuacji), i …

5
Czy powinieneś kiedykolwiek ustandaryzować zmienne binarne?
Mam zestaw danych z zestawem funkcji. Niektóre z nich są binarne aktywne lub zwolnione, nieaktywne lub nieaktywne), a reszta ma wartość rzeczywistą, np . .(1=(1=(1=0=0=0=4564.3424564.3424564.342 Chcę nakarmić te dane do algorytmu uczenia maszynowego, więc zzz -score wszystkie wartościach rzeczywistych możliwości. Dostaję je w przybliżeniu między zakresem 333 a −2−2-2 . …


3
Krzywa ROC dla dyskretnych klasyfikatorów, takich jak SVM: Dlaczego wciąż nazywamy ją „krzywą”? Czy to nie jest tylko „punkt”?
W dyskusji: jak wygenerować krzywą roc do klasyfikacji binarnej , myślę, że zamieszanie polegało na tym, że „klasyfikator binarny” (który jest dowolnym klasyfikatorem, który oddziela 2 klasy) był dla Yang tak zwany „dyskretny klasyfikator” (który produkuje wyjścia dyskretne 0/1 jak SVM), a nie ciągłe dane wyjściowe, takie jak klasyfikatory ANN …

1
Jak działa weryfikacja krzyżowa typu „out-one-out”? Jak wybrać ostateczny model spośród różnych modeli?
Mam trochę danych i chcę zbudować model (powiedzmy model regresji liniowej) z tych danych. W następnym kroku chcę zastosować weryfikację krzyżową Leave-One-Out (LOOCV) na modelu, aby zobaczyć, jak dobrze sobie radzi. Jeśli dobrze zrozumiałem LOOCV, buduję nowy model dla każdej z moich próbek (zestaw testowy), używając każdej próbki oprócz tej …

1
Losowe macierze z ograniczeniami długości wierszy i kolumn
Muszę wygenerować losowe macierze nie kwadratowe z wierszami i kolumnami C , elementy losowo rozmieszczone ze średnią = 0 i ograniczone tak, że długość (norma L2) każdego wiersza wynosi 1, a długość każdej kolumny wynosi √RRRCCC111 . Odpowiednio suma wartości kwadratowych wynosi 1 dla każdego wiersza iR.RC−−√RC\sqrt{\frac{R}{C}}RCRC\frac{R}{C} dla każdej kolumny. …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.