Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Ogólna metoda wyprowadzania błędu standardowego
Nie mogę nigdzie znaleźć ogólnej metody wyprowadzania standardowych błędów. Przeglądałem google, tę stronę internetową, a nawet podręczniki, ale wszystko, co mogę znaleźć, to wzór na standardowe błędy średniej, wariancji, proporcji, współczynnika ryzyka itp., A nie sposób, w jaki te formuły zostały osiągnięte. Gdyby jakikolwiek organ mógł to wyjaśnić w prosty …

1
Wzór estymatora regresji kwantowej
Widziałem dwie różne reprezentacje estymatora regresji kwantowej Q ( βq) = ∑ja : yja≥ x′jaβnq. Yja- x′jaβq∣ + ∑ja : yja&lt; x′jaβn( 1 - q) ∣ yja- x′jaβq∣Q(βq)=∑ja:yja≥xja′βnq∣yja-xja′βq∣+∑ja:yja&lt;xja′βn(1-q)∣yja-xja′βq∣Q(\beta_{q}) = \sum^{n}_{i:y_{i}\geq x'_{i}\beta} q\mid y_i - x'_i \beta_q \mid + \sum^{n}_{i:y_{i}< x'_{i}\beta} (1-q)\mid y_i - x'_i \beta_q \mid i Q(βq)=∑i=1nρq(yi−x′iβq),ρq(u)=ui(q−1(ui&lt;0))Q(βq)=∑i=1nρq(yi−xi′βq),ρq(u)=ui(q-1(uja&lt;0))Q(\beta_q) = \sum^{n}_{i=1} …

1
Odwrócone przedziały ufności
Po tym spotkaniu zadaję pytanie o przekształcone wstecz konwencje dotyczące przedziałów ufności. Zgodnie z tym artykułem nominalny CI transformowany wstecznie CI dla średniej logarytmicznej zmiennej losowej wynosi: LCL(X)=exp(Y+var(Y) UdoL ( X) = exp( Y+ var ( Y)2)+ zvar ( Y)n+ var ( Y)2)2 ( n - 1 )------------√) UdoL.(X)=exp⁡(Y+var(Y)2)+zvar(Y)n+var(Y)2)2)(n-1))\ UCL(X)= …

1
Szacunki parametrów dla rozkładu normalnego skośnego
Jakie są szacunkowe parametry formalne dla skośnego-normalnego? Jeśli możesz, wyprowadzenie za pośrednictwem MLE lub Mom byłoby również świetne. Dzięki Edit . Mam zestaw danych, dla których mogę wizualnie stwierdzić, że wykresy są lekko przekrzywione w lewo. Chcę oszacować średnią i wariancję, a następnie wykonać test dopasowania pod względem dopasowania (dlatego …

3
Kiedy najmniejsze kwadraty byłyby złym pomysłem?
Jeśli mam model regresji: gdzie i ,Y= Xβ+ εY=Xβ+ε Y = X\beta + \varepsilon V [ε]=Ire∈ Rn × nV[ε]=Id∈Rn×n\mathbb{V}[\varepsilon] = Id \in \mathcal{R} ^{n \times n}E [ε]=(0,…,0)E[ε]=(0,…,0)\mathbb{E}[\varepsilon]=(0, \ldots , 0) kiedy użycie , zwykłego estymatora najmniejszych kwadratów , byłoby złym wyborem dla estymatora?βOLSβOLS\beta_{\text{OLS}}ββ\beta Próbuję wymyślić przykład, w którym najmniejsze kwadraty …

2
Znaczenie średniego współczynnika korelacji
Zastrzeżenie: jeśli uznasz to pytanie za zbyt podobne do innego, cieszę się, że zostało połączone. Jednak nigdzie indziej nie znalazłem satysfakcjonującej odpowiedzi (i nie mam jeszcze „reputacji” do komentowania lub głosowania), więc pomyślałem, że najlepiej byłoby zadać sobie nowe pytanie. Moje pytanie brzmi: Dla każdego z 12 badanych ludzi obliczyłem …

1
Test ilorazu wiarygodności i test Walda dostarczają różnych wniosków dla glm w R.
Odtwarzam przykład z modeli uogólnionych, liniowych i mieszanych . Moje MWE jest poniżej: Dilution &lt;- c(1/128, 1/64, 1/32, 1/16, 1/8, 1/4, 1/2, 1, 2, 4) NoofPlates &lt;- rep(x=5, times=10) NoPositive &lt;- c(0, 0, 2, 2, 3, 4, 5, 5, 5, 5) Data &lt;- data.frame(Dilution, NoofPlates, NoPositive) fm1 &lt;- glm(formula=NoPositive/NoofPlates~log(Dilution), family=binomial("logit"), …

1
Czy SurveyMonkey ignoruje fakt, że otrzymujesz nieprzypadkową próbkę?
SurveyMonkey ma kroki i tabelę, aby dowiedzieć się, jaki rozmiar próby jest potrzebny dla danego marginesu błędu lub przedziału ufności, na podstawie wielkości populacji. Wielkość próby SurveyMonkey Czy ta tabela po prostu ignoruje fakt, że nie otrzymasz losowej próbki, ponieważ tylko osoby, które zawracają sobie głowę odpowiedzią na ankietę? Zostaję …

3
Jakiej odległości użyć? np. manhattan, euklidesowy, Bray-Curtis itp
Nie jestem ekologiem społeczności, ale obecnie pracuję nad danymi dotyczącymi ekologii społeczności. To, czego nie mogłem zrozumieć, oprócz matematyki tych odległości, to kryteria dla każdej odległości do wykorzystania i w jakich sytuacjach można ją zastosować. Na przykład, czego używać z danymi zliczania? Jak przekonwertować kąt nachylenia między dwiema lokalizacjami na …

4
Analiza i regresja głównych składników w języku Python
Próbuję wymyślić, jak odtworzyć w Pythonie niektóre prace, które wykonałem w SAS. Korzystając z tego zestawu danych , gdzie problemem jest wielokoliniowość, chciałbym przeprowadzić analizę głównych składników w Pythonie. Przyjrzałem się scikit-learn i statsmodels, ale nie jestem pewien, jak wykorzystać ich dane wyjściowe i przekonwertować je na tę samą strukturę …



1
Szkolenie splotowej sieci neuronowej
Obecnie pracuję nad oprogramowaniem do rozpoznawania twarzy, które wykorzystuje sieci neuronowe splotu do rozpoznawania twarzy. Na podstawie moich odczytów stwierdziłem, że splotowa sieć neuronowa ma takie same ciężary, aby zaoszczędzić czas podczas treningu. Ale w jaki sposób dostosowuje się propagację wsteczną, aby można ją było wykorzystać w sieci neuronowej splotu. …

3
Jakie przykłady czających się zmiennych w kontrolowanych eksperymentach znajdują się w publikacjach?
W tym papierze: Czające się zmienne: niektóre przykłady Brian L. Joiner The American Statistician Vol. 35, nr 4, listopad 1981 227-233 Brian Joiner twierdzi, że „randomizacja nie jest panaceum”. Jest to sprzeczne z powszechnymi stwierdzeniami, takimi jak poniższe: Dobrze zaprojektowany eksperyment obejmuje funkcje projektowe, które pozwalają badaczom wyeliminować zewnętrzne zmienne …

4
Klasyfikator niepewnych etykiet klas
Załóżmy, że mam zestaw instancji z przypisanymi etykietami klas. Nie ma znaczenia, jak te instancje zostały oznaczone, ale jak pewne jest ich członkostwo w klasie. Każde wystąpienie należy do dokładnie jednej klasy. Powiedzmy, że potrafię oszacować pewność przynależności do każdej klasy za pomocą nominalnego atrybutu, który wynosi od 1 do …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.