Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

9
Skąd wiemy, że prawdopodobieństwo rzutu 1 i 2 wynosi 1/18?
Od pierwszej klasy prawdopodobieństwa zastanawiałem się nad następującymi kwestiami. Obliczanie prawdopodobieństw zwykle wprowadza się poprzez stosunek „wydarzeń uprzywilejowanych” do wszystkich możliwych zdarzeń. W przypadku rzutu dwiema 6-stronnymi kostkami ilość możliwych zdarzeń wynosi , jak pokazano w poniższej tabeli.363636 1234561(1,1)(2,1)(3,1)(4,1)(5,1)(6,1)2(1,2)(2,2)(3,2)(4,2)(5,2)(6,2)3(1,3)(2,3)(3,3)(4,3)(5,3)(6,3)4(1,4)(2,4)(3,4)(4,4)(5,4)(6,4)5(1,5)(2,5)(3,5)(4,5)(5,5)(6,5)6(1,6)(2,6)(3,6)(4,6)(5,6)(6,6)1234561(1,1)(1,2)(1,3)(1,4)(1,5)(1,6)2(2,1)(2,2)(2,3)(2,4)(2,5)(2,6)3)(3),1)(3),2))(3),3))(3),4)(3),5)(3),6)4(4,1)(4,2))(4,3))(4,4)(4,5)(4,6)5(5,1)(5,2))(5,3))(5,4)(5,5)(5,6)6(6,1)(6,2))(6,3))(6,4)(6,5)(6,6)\begin{array} {|c|c|c|c|c|c|c|} \hline &1 & 2 & 3 & 4 & 5 …
20 probability  dice 

7
Dlaczego macierze symetryczne z dodatnim określeniem (SPD) są tak ważne?
Znam definicję macierzy symetrycznej dodatniej określonej (SPD), ale chcę zrozumieć więcej. Dlaczego są tak ważne, intuicyjnie? Oto co wiem. Co jeszcze? Dla danych danych macierzą współwariancji jest SPD. Macierz współwariancji jest ważnym miernikiem, zobacz ten doskonały post dla intuicyjnego wyjaśnienia. Forma kwadratowa 12x⊤Ax−b⊤x+c12x⊤Ax−b⊤x+c\frac 1 2 x^\top Ax-b^\top x +cjest wypukły, …

1
Jeśli LASSO jest równoważne regresji liniowej z Laplace'em wcześniej, to jak może być masa na zbiorach ze składowymi zerowymi?
Wszyscy dobrze znamy dobrze udokumentowane w literaturze pojęcie, że optymalizacja LASSO (dla uproszczenia ogranicza tu uwagę na przypadek regresji liniowej) jest równoważny modelowi liniowemu z błędami Gaussa, w którym parametrom nadawany jest Laplace przed \ exp (- \ lambda \ | \ beta \ | _1) Wiemy również, że wyższy …

4
Kodowanie danych kąta dla sieci neuronowej
Uczę sieci neuronowej (szczegóły nieważne), gdzie dane docelowe to wektor kątów (od 0 do 2 * pi). Szukam porady, jak zakodować te dane. Oto, co obecnie próbuję (z ograniczonym sukcesem): 1) Kodowanie 1-of-C: I bin ustawiam możliwe kąty na około 1000 dyskretnych kątów, a następnie wskazuję konkretny kąt, umieszczając 1 …

1
Czy splajny mogą być używane do przewidywania?
Nie mogę sprecyzować charakteru danych, ponieważ są one zastrzeżone, ale załóżmy, że mamy takie dane: Każdego miesiąca niektóre osoby zapisują się na usługi. Następnie w każdym kolejnym miesiącu osoby te mogą uaktualnić usługę, przerwać usługę lub odmówić usługi (np. Z powodu braku zapłaty). Dla najwcześniejszej kohorty w naszych danych mamy …

3
Dlaczego w uczeniu maszynowym stosowane są indeksy górne zamiast indeksów dolnych?
Biorę kurs Andrew Ng na Machine Learning poprzez Coursera . W przypadku równań zamiast indeksów dolnych stosuje się indeks górny. Na przykład w poniższym równaniu użyto zamiast : x ix(i)x(i)x^{(i)}xixix_i J(θ0,θ1)=12m∑i=1m(hθ(x(i))−y(i))2J(θ0,θ1)=12m∑i=1m(hθ(x(i))−y(i))2J(\theta_0, \theta_1) = \frac{1}{2m} \sum\limits_{i=1}^{m}{(h_\theta(x^{(i)}) - y^{(i)})^2} Najwyraźniej jest to powszechna praktyka. Moje pytanie brzmi: po co używać indeksów górnych …


5
Dlaczego używamy tendencyjnego i mylącego wzoru odchylenia standardowego dla rozkładu normalnego?
Zaskoczyło mnie to, kiedy po raz pierwszy przeprowadziłem symulację Monte Carlo z rozkładem normalnym i odkryłem, że średnia z standardowych odchyleń od próbek, z których każda ma wielkość próbki tylko , okazała się znacznie mniejsza niż, tj. uśrednianie razy, użyte do wygenerowania populacji. Jest to jednak dobrze znane, jeśli rzadko …

1
Co to jest „efekt podkowy” i / lub „efekt łuku” w analizie PCA / korespondencji?
W statystyce ekologicznej istnieje wiele technik analizy danych eksploracyjnych danych wielowymiarowych. Są to tak zwane techniki „święceń”. Wiele z nich jest takich samych lub ściśle powiązanych z powszechnymi technikami w innych miejscach statystyki. Być może prototypowym przykładem byłaby analiza głównych składników (PCA). Ekolodzy mogą użyć PCA i powiązanych technik, aby …

1
Jak skonfigurować sieć neuronową do generowania danych porządkowych?
Mam sieć neuronową skonfigurowaną do przewidywania czegoś, gdzie zmienna wyjściowa jest porządkowa. Opiszę poniżej, używając trzech możliwych wyjść A <B <C. Jest całkiem oczywiste, jak używać sieci neuronowej do generowania danych kategorycznych: dane wyjściowe to tylko softmax ostatniej (zwykle w pełni połączonej) warstwy, jednej na kategorię, a przewidywana kategoria to …

1
Prawdziwe przykłady procesów decyzyjnych Markowa
Oglądałem wiele filmów instruktażowych i wyglądają tak samo. Ten na przykład: https://www.youtube.com/watch?v=ip4iSMRW5X4 Wyjaśniają stany, działania i prawdopodobieństwa, które są w porządku. Osoba wyjaśnia to dobrze, ale po prostu nie mogę zrozumieć, do czego byłaby używana w prawdziwym życiu. Do tej pory nie spotkałem żadnych list. Najbardziej powszechne, jakie widzę, to …


5
Czy nadal musimy dokonywać wyboru funkcji, korzystając z algorytmów regularyzacyjnych?
Mam jedno pytanie dotyczące potrzeby korzystania z metod wyboru funkcji (losowe wartości ważności cech lasów lub metody wyboru cech Univariate itp.) Przed uruchomieniem algorytmu uczenia statystycznego. Wiemy, że aby uniknąć przeregulowania, możemy wprowadzić karę regularyzacyjną dla wektorów masy. Więc jeśli chcę zrobić regresję liniową, mógłbym wprowadzić parametry L2 lub L1, …

1
Czy paradoks Stein'a nadal obowiązuje, gdy stosuje się normę
Paradoks Stein'a pokazuje, że gdy jednocześnie szacuje się trzy lub więcej parametrów, istnieją połączone estymatory średnio bardziej dokładne (to znaczy mające niższy oczekiwany średni błąd kwadratu) niż jakakolwiek metoda osobno obsługująca parametry. To bardzo sprzeczny z intuicją wynik. Czy ten sam wynik obowiązuje, jeśli zamiast stosowania normy (oczekiwany średni błąd …

4
Podręczniki na rachunku macierzowym?
Zobacz to pytanie na Math SE . Krótka historia: Przeczytałem Elementy uczenia statystycznego i denerwowałem się, gdy próbowałem zweryfikować niektóre wyniki, np. Biorąc pod uwagę a następnie RSS ( β) = ( y - X β)T.( y - X β) ,RSS(β)=(y-Xβ)T.(y-Xβ),\text{RSS}(\beta) = \left(\mathbf{y}-\mathbf{X}\beta\right)^{T}\left(\mathbf{y}-\mathbf{X}\beta\right)\text{,} Szukam macierzowego rachunku różniczkowego, który jest napisany …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.