Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Jaka jest różnica między nauczaniem online i wsadowym?
Obecnie czytam artykuł Efficient Online and Batch Learning with Forward-Backward Spliting autorstwa John Duchi i Yoram Singer. Jestem bardzo zdezorientowany co do używania terminów „Online” i „Batch”. Pomyślałem, że „Online” oznacza, że ​​aktualizujemy parametry wagi po przetworzeniu jednej jednostki danych treningowych. Następnie wykorzystujemy nowe parametry wagi do przetwarzania następnej jednostki …


2
Jak wybrać odpowiedni algorytm optymalizacji?
Muszę znaleźć minimum funkcji. Czytając dokumenty na stronie http://docs.scipy.org/doc/scipy/reference/optimize.html Widzę, że istnieje kilka algorytmów, które robią to samo, tzn. Znajdują minimum. Skąd mam wiedzieć, który wybrać? niektóre z wymienionych algorytmów Zminimalizuj funkcję za pomocą algorytmu downhill simplex. Zminimalizuj funkcję za pomocą algorytmu BFGS. Zminimalizuj funkcję za pomocą nieliniowego algorytmu gradientu …

3
Czy dodanie większej liczby zmiennych do regresji wielowymiarowej zmienia współczynniki istniejących zmiennych?
Powiedzmy, że mam regresję wielowymiarową (kilka zmiennych niezależnych), która składa się z 3 zmiennych. Każda z tych zmiennych ma określony współczynnik. Jeśli zdecyduję się wprowadzić czwartą zmienną i ponownie uruchomić regresję, czy zmienią się współczynniki 3 pierwotnych zmiennych? Mówiąc szerzej: czy w regresji wielowymiarowej (wiele zmiennych niezależnych) na współczynnik danej …

1
Czy mogę przekonwertować macierz kowariancji na niepewności dla zmiennych?
Mam urządzenie GPS, które wyprowadza pomiar hałasu za pomocą macierzy kowariancji :ΣΣ\Sigma Σ = ⎡⎣⎢σx xσyxσx zσx yσyyσyzσx zσyzσzz⎤⎦⎥Σ=[σxxσxyσxzσyxσyyσyzσxzσyzσzz]\Sigma = \left[\begin{matrix} \sigma_{xx} & \sigma_{xy} & \sigma_{xz} \\ \sigma_{yx} & \sigma_{yy} & \sigma_{yz} \\ \sigma_{xz} & \sigma_{yz} & \sigma_{zz} \end{matrix}\right] (tam też zaangażowany ale zignorujmy że na sekundę).ttt Załóżmy, że chcę …

5
W jaki sposób rozkład próbkowania w próbkach oznacza przybliżoną średnią dla populacji?
Próbuję nauczyć się statystyki, ponieważ uważam, że jest tak powszechna, że ​​zabrania mi uczenia się niektórych rzeczy, jeśli nie rozumiem jej poprawnie. Mam problem ze zrozumieniem tego pojęcia rozkładu próbkowania średnich próbek. Nie rozumiem, w jaki sposób niektóre książki i strony to wyjaśniły. Myślę, że rozumiem, ale nie jestem pewien, …

3
Korzystanie z pakietu prognozy R z brakującymi wartościami i / lub nieregularnymi szeregami czasowymi
Jestem pod wrażeniem forecastpakietu R , a także np. zooPakietu dla nieregularnych szeregów czasowych i interpolacji brakujących wartości. Moja aplikacja jest w zakresie prognozowania ruchu w call center, więc danych w weekendy (prawie) zawsze brakuje (prawie), co można ładnie obsłużyć zoo. Ponadto może brakować niektórych dyskretnych punktów, po prostu używam …

2
Walidacja krzyżowa PCA i k-krotnie w pakiecie karetki w R.
Właśnie obejrzałem ponownie wykład z kursu Machine Learning na Coursera. W części, w której profesor omawia PCA do wstępnego przetwarzania danych w nadzorowanych aplikacjach edukacyjnych, mówi, że PCA powinno być wykonywane tylko na danych szkoleniowych, a następnie mapowanie służy do transformacji zestawów walidacji krzyżowej i testów. Zobacz także PCA i …

2
Kiedy ktoś mówi, że odchylenie resztkowe / df powinno wynosić ~ 1 dla modelu Poissona, jak przybliżone jest przybliżenie?
Często widziałem porady dotyczące sprawdzania, czy dopasowanie modelu Poissona jest nadmiernie rozproszone, polegające na podzieleniu resztkowego odchylenia przez stopnie swobody. Wynikowy stosunek powinien wynosić „około 1”. Pytanie brzmi, o jakim zakresie mówimy dla „przybliżonego” - jaki jest stosunek, który powinien wywoływać alarmy, aby rozważyć alternatywne formy modeli?

5
Jaki wpływ ma zwiększenie danych treningowych na ogólną dokładność systemu?
Czy ktoś może podsumować dla mnie możliwe przykłady, w jakich sytuacjach zwiększenie danych treningowych poprawia cały system? Kiedy wykrywamy, że dodanie większej ilości danych treningowych może nadmiernie dopasować dane i nie dać dokładności danych testowych? To bardzo niespecyficzne pytanie, ale jeśli chcesz odpowiedzieć na konkretne pytanie w konkretnej sytuacji, zrób …

2
Test na pobieranie próbek IID
Jak byś przetestował lub sprawdził, czy próbkowanie jest IID (niezależne i identycznie rozproszone)? Zauważ, że nie mam na myśli Gaussa i dystrybucji identycznej, tylko IID. Pomysł, który przychodzi mi na myśl, to wielokrotne dzielenie próbki na dwie podpróbki o równej wielkości, wykonanie testu Kołmogorowa-Smirnowa i sprawdzenie, czy rozkład wartości p …

3
Czy dostępna jest ogólna metoda symulowania danych ze wzoru lub analizy?
De novo symulacja danych z eksperymentalnej ramki danych projektowych. Z naciskiem na R (choć inne rozwiązanie językowe byłoby świetne). Podczas projektowania eksperymentu lub ankiety symulowanie danych i przeprowadzanie analizy tych symulowanych danych może zapewnić świetny wgląd w zalety i wady projektu. Takie podejście może być również niezbędne do zrozumienia i …

3
Jak wyjaśniłbyś uogólnione modele liniowe osobom bez tła statystycznego?
Zawsze trudno mi wyjaśnić odbiorcom techniki statystyczne bez tła statystycznego. Gdybym chciał wyjaśnić, czym jest GLM dla takich odbiorców (bez rzucania statystycznego żargonu), jaki byłby najlepszy lub najskuteczniejszy sposób? Zazwyczaj tłumaczę GLM trzema częściami - (1) składową losową, która jest zmienną odpowiedzi, (2) składową systematyczną, która jest predyktorami liniowymi, oraz …


2
Poissona czy quasi-poissona w regresji z danymi zliczania i nadmierną dyspersją?
Mam dane zliczania (analiza popytu / oferty z liczbą klientów, w zależności od - być może - wielu czynników). Próbowałem regresji liniowej z normalnymi błędami, ale mój wykres QQ nie jest naprawdę dobry. Próbowałem przekształcić log odpowiedzi: po raz kolejny zły wykres QQ. Więc teraz próbuję regresji za pomocą błędów …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.