Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Dlaczego P (A, B | C) / P (B | C) = P (A | B, C)?
Rozumiem P(A∩B)/P(B)=P(A|B)P(A∩B)/P(B)=P(A|B)P(A\cap B)/P(B) = P(A|B) . Warunkowe jest przecięciem A i B podzielonym przez cały obszar B. Ale dlaczego P(A∩B|C)/P(B|C)=P(A|B∩C)P(A∩B|C)/P(B|C)=P(A|B∩C)P(A\cap B|C)/P(B|C) = P(A|B \cap C) ? Czy możesz podać trochę intuicji? Czy nie powinno być: ?P(A∩B∩C)/P(B,C)=P(A|B∩C)P(A∩B∩C)/P(B,C)=P(A|B∩C)P(A\cap B \cap C)/P(B,C) = P(A|B \cap C)


2
Notacja macierzowa dla regresji logistycznej
W regresji liniowej (strata kwadratowa) za pomocą macierzy mamy bardzo zwięzłą notację dla celu minimize ∥Ax−b∥2minimize ‖Ax−b‖2\text{minimize}~~ \|Ax-b\|^2 Gdzie AAA to macierz danych, xxx to współczynniki, a bbb to odpowiedź. Czy istnieje podobna notacja macierzowa dla celu regresji logistycznej? Wszystkie oznaczenia widziałem nie może pozbyć się suma nad wszystkimi punktami …


2
Jaką miarę błędu szkolenia zgłosić w Losowych lasach?
Obecnie dopasowuję losowe lasy pod kątem problemu z klasyfikacją za pomocą randomForestpakietu w R i nie jestem pewien, jak zgłosić błąd szkolenia dla tych modeli. Mój błąd szkolenia jest bliski 0%, kiedy go obliczam, używając prognoz, które otrzymuję za pomocą polecenia: predict(model, data=X_train) gdzie X_trainsą dane treningowe. W odpowiedzi na …

2
Interpretacja przedziału ufności
Uwaga: z góry przepraszam, jeśli jest to duplikat, nie znalazłem podobnego q w moim wyszukiwaniu Powiedzmy, że mamy prawdziwy parametr p. Przedział ufności C (X) to RV, który zawiera p, powiedzmy 95% czasu. Załóżmy teraz, że obserwujemy X i obliczamy C (X). Częstą odpowiedzią wydaje się być to, że błędne …

3
Jak wybrać optymalną liczbę ukrytych czynników w nieujemnym rozkładzie macierzy?
Biorąc pod uwagę macierz , Faktoryzacja macierzy nieujemnej (NMF) znajduje dwie nieujemne macierze i ( tzn. ze wszystkimi elementami ) do reprezentowania rozłożonej macierzy jako:Vm×nVm×n\mathbf V^{m \times n}H k × n ≥0Wm×kWm×k\mathbf W^{m \times k}Hk×nHk×n\mathbf H^{k \times n}≥0≥0\ge 0 V≈WH,V≈WH,\mathbf V \approx \mathbf W\mathbf H, na przykład wymagając, aby nieujemne …

3
Kiedy możemy mówić o kolinearności
W modelach liniowych musimy sprawdzić, czy istnieje relacja między zmiennymi objaśniającymi. Jeśli korelują one zbyt mocno, występuje kolinearność (tzn. Zmienne częściowo się wyjaśniają). Właśnie patrzę właśnie na korelację par pomiędzy każdą z zmiennych objaśniających. Pytanie 1: Co klasyfikuje jako zbyt dużą korelację? Na przykład, czy korelacja Pearsona o 0,5 jest …

3
Dlaczego do wybierania zagnieżdżonych modeli var-covar należy używać REML (zamiast ML)?
Różne opisy wyboru modeli losowych efektów liniowych modeli mieszanych instruują użycie REML. Znam różnicę między REML i ML na pewnym poziomie, ale nie rozumiem, dlaczego REML powinien być używany, ponieważ ML jest stronniczy. Na przykład, czy błędem jest przeprowadzanie LRT na parametrze wariancji normalnego modelu dystrybucji przy użyciu ML (patrz …

1
Jak obliczyć czystość?
Jak w analizie skupień obliczamy czystość? Jakie jest równanie? Nie szukam kodu, który by to dla mnie zrobił. Niech będzie klastrem k, a c j będzie klasą j.ωkωk\omega_kcjcjc_j Czy czystość jest właściwie dokładnością? wygląda na to, że sumują liczbę prawdziwie sklasyfikowanych klas na klaster na podstawie wielkości próby. źródło równania …
16 clustering 


1
Minimalna liczba punktów dla regresji liniowej
Jaka byłaby „rozsądna” minimalna liczba obserwacji w celu znalezienia trendu w czasie z regresją liniową? co z dopasowaniem modelu kwadratowego? Pracuję ze złożonymi wskaźnikami nierówności w zdrowiu (SII, RII) i mam tylko 4 fale ankiety, czyli 4 punkty (1997,2001,2004,2008). Nie jestem statystykiem, ale mam intuicyjne wrażenie, że 4 punkty nie …
16 regression 

2
Jakie są techniki próbkowania dwóch skorelowanych zmiennych losowych?
Jakie są techniki próbkowania dwóch skorelowanych zmiennych losowych: jeśli ich rozkłady prawdopodobieństwa są sparametryzowane (np. log-normal) jeśli mają rozkłady nieparametryczne. Dane są dwoma szeregami czasowymi, dla których możemy obliczyć niezerowe współczynniki korelacji. Chcemy symulować te dane w przyszłości, zakładając, że historyczna korelacja i szeregi czasowe CDF są stałe. W przypadku …


2
Które oznaczenie i dlaczego:
Czy są to jedynie konwencje stylistyczne (kursywą lub nie kursywą), czy też istnieją istotne różnice w znaczeniu tych zapisów? Czy istnieją inne zapisy oznaczające „ prawdopodobieństwo ”, które należy wziąć pod uwagę w tym pytaniu?

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.