Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

5
Niezbędne artykuły na temat rozkładu macierzy
Niedawno przeczytałem książkę Skillicorn o rozkładach matryc i byłem nieco rozczarowany, ponieważ był skierowany do słuchaczy. Chciałbym skompilować (dla siebie i innych) krótką bibliografię podstawowych artykułów (ankiety, ale także artykuły przełomowe) na temat rozkładu macierzy. Mam przede wszystkim na myśli SVD / PCA (i mocne / rzadkie warianty) i NNMF, …

4
Właściwości średnie i mediany
Czy ktoś może mi wyjaśnić logikę matematyczną, która łączyłaby dwa zdania (a) i (b) razem? Pozwól nam mieć zestaw wartości (pewna dystrybucja). Teraz, a) Mediana nie zależy od każdej wartości [zależy tylko od jednej lub dwóch wartości średnich]; b) Mediana jest miejscem występowania minimalnych sum bezwzględnych odchyleń od niej. I …


10
Zestawy danych w sieciach społecznościowych
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Szukam zestawów danych sieci społecznościowych (Twitter, Friendfeed, Facebook, Lastfm itp.) Do zadań klasyfikacyjnych, najlepiej w formacie ARFF. Moje wyszukiwania za pośrednictwem UCI i Google jak …

5
Używanie lmera do przewidywania
Witaj Mam dwa problemy, które brzmią jak naturalni kandydaci na modele wielopoziomowe / mieszane, których nigdy nie używałem. Prostszy i taki, który mam nadzieję wypróbować jako wprowadzenie, wygląda następująco: Dane wyglądają jak wiele wierszy formularza x y innergroup outergroup gdzie x jest zmienną liczbową, na której chcę regresować y (inna …

10
Strategia edycji plików z wartościami oddzielonymi przecinkami (CSV)
Podczas pracy nad projektami analizy danych często przechowuję dane w plikach danych rozdzielanych przecinkami lub tabulatorami (CSV, TSV). Podczas gdy dane często należą do dedykowanego systemu zarządzania bazą danych. W przypadku wielu moich aplikacji byłoby to przesadzanie. Mogę edytować pliki CSV i TSV w programie Excel (lub prawdopodobnie innym programie …

7
W jaki sposób badanie „procesów stochastycznych” pomoże mi jako statystyce?
Chcę zdecydować, czy powinienem wziąć udział w kursie „WPROWADZENIE DO PROCESÓW STOCHASTYCZNYCH”, który odbędzie się w następnym semestrze na mojej uczelni. Zapytałem wykładowcę, w jaki sposób studiowanie takiego kursu pomogłoby mi jako statystykowi, powiedział, że skoro pochodzi z prawdopodobieństwa, zna niewiele statystyk i nie wie, jak odpowiedzieć na moje pytanie. …

3
Oceń określony przedział rozkładu normalnego
Wiem, że brakuje nieco łatwej w obsłudze formuły dla CDF normalnej dystrybucji, ze względu na skomplikowaną funkcję błędu. Zastanawiam się jednak, czy istnieje fajna formuła dla . Albo jakie może być przybliżenie tego najnowszego stanu techniki.N(c−≤x&lt;c+|μ,σ2)N(c−≤x&lt;c+|μ,σ2)N(c_{-} \leq x < c_{+}| \mu, \sigma^2)

1
Czy poprawnie oblicziłem te współczynniki prawdopodobieństwa?
Jestem autorem pakietu ez dla R i pracuję nad aktualizacją w celu włączenia automatycznego obliczania ilorazów wiarygodności (LR) w danych wyjściowych ANOVA. Chodzi o to, aby zapewnić LR dla każdego efektu, który jest analogiczny do testu tego efektu, który osiąga ANOVA. Na przykład LR dla efektu głównego reprezentuje porównanie modelu …

2
Jaka jest siła regresji logistycznej i testu t?
Czy moc regresji logistycznej i testu t jest równoważna? Jeśli tak, powinny one być „ekwiwalentem gęstości danych”, przez co rozumiem, że ta sama liczba podstawowych obserwacji daje tę samą moc, biorąc pod uwagę stałą wartość alfa równą 0,05. Rozważ dwa przypadki: [Parametryczny test t]: wykonuje się 30 losowań z obserwacji …


3
Jak mogę oszacować standardowe błędy współczynnika podczas regresji kalenicy?
Używam regresji grzbietu na wysoce wielokoliniowych danych. Używając OLS, otrzymuję duże standardowe błędy współczynników z powodu wielokoliniowości. Wiem, że regresja kalenicy jest sposobem na poradzenie sobie z tym problemem, ale we wszystkich implementacjach regresji kalenicy, na które patrzyłem, nie zgłoszono żadnych standardowych błędów dla współczynników. Chciałbym w jakiś sposób oszacować, …



5
Dlaczego nie używamy rozkładu t do konstruowania przedziału ufności dla proporcji?
Aby obliczyć przedział ufności (CI) dla średniej z nieznanym odchyleniem standardowym populacji (sd), szacujemy odchylenie standardowe populacji, stosując rozkład t. W szczególności gdzie . Ponieważ jednak nie mamy oszacowania punktowego odchylenia standardowego populacji, szacujemy poprzez przybliżenie gdzieCI=X¯±Z95%σX¯CI=X¯±Z95%σX¯CI=\bar{X} \pm Z_{95\% }\sigma_{\bar X}σX¯=σn√σX¯=σn\sigma_{\bar X} = \frac{\sigma}{\sqrt n}CI=X¯±t95%(se)CI=X¯±t95%(se)CI=\bar{X} \pm t_{95\% }(se)se=sn√se=snse = \frac{s}{\sqrt …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.