Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Interpretowanie wyników splajnu
Usiłuję dopasować splajn dla GLM za pomocą R. Po dopasowaniu splajnu chcę móc wziąć wynikowy model i utworzyć plik modelowania w skoroszycie programu Excel. Załóżmy na przykład, że mam zestaw danych, w którym y jest losową funkcją x, a nachylenie zmienia się nagle w określonym punkcie (w tym przypadku @ …
20 splines 



1
Jaki jest nieparametryczny odpowiednik dwukierunkowej ANOVA, który może obejmować interakcje?
Cześć, próbuję znaleźć nieparametryczny odpowiednik dwukierunkowej ANOVA (konstrukcja 3x4), która może zawierać interakcje. Z mojego czytania z Zar 1984 „Analiza biostatystyczna” jest to możliwe przy użyciu metody przedstawionej w Scheirer, Ray i Hare (1976), jednak zgodnie z innymi postami online wywnioskowano, że ta metoda nie jest już odpowiednia (jeśli kiedykolwiek …

3
Uczenie maszynowe w celu przewidywania prawdopodobieństw klasowych
Szukam klasyfikatorów, które generują prawdopodobieństwa, że ​​przykłady należą do jednej z dwóch klas. Znam regresję logistyczną i naiwne Bayesa, ale czy możesz mi powiedzieć o innych, którzy działają w podobny sposób? Czyli klasyfikatory, które przewidują nie klasy, do których należą przykłady, ale prawdopodobieństwo, że przykłady pasują do konkretnej klasy? Punkty …


2
Rzucanie wielowymiarowego modelu liniowego jako regresji wielokrotnej
Czy przekształcenie wielowymiarowego modelu regresji liniowej jako wielokrotnej regresji liniowej jest całkowicie równoważne? Ja nie odnosząc się po prostu działa ttt oddzielnych regresji. Przeczytałem o tym w kilku miejscach (Bayesian Data Analysis - Gelman i wsp. Oraz Multivariate Old School - Marden), że wielowymiarowy model liniowy można łatwo sparametryzować jako …

3
Przedział ufności RMSE
Pobrałem próbkę punktów danych z populacji. Każdy z tych punktów ma prawdziwą wartość (znaną z podstawowej prawdy) i wartość szacunkową. Następnie obliczam błąd dla każdego próbkowanego punktu, a następnie obliczam RMSE próbki.nnn Jak mogę wnioskować o pewnym przedziale ufności wokół tego RMSE na podstawie wielkości próbki ?nnn Gdybym używał średniej, …

4
Różnica między ANOVA a testem Kruskala-Wallisa
Uczę się R i eksperymentowałem z analizą wariancji. Prowadziłem oba kruskal.test(depVar ~ indepVar, data=df) i anova(lm(depVar ~ indepVar, data=dF)) Czy istnieje praktyczna różnica między tymi dwoma testami? Rozumiem, że oboje oceniają hipotezę zerową, że populacje mają ten sam środek.

4
Oblicz średnią zmiennej porządkowej
Czytałem w wielu miejscach, że obliczanie średniej zmiennej porządkowej jest niewłaściwe. Próbuję uzyskać intuicję, dlaczego może to być nieodpowiednie. Myślę, że dzieje się tak, ponieważ generalnie zmienna porządkowa nie jest normalnie rozkładana, a zatem obliczenie średniej da niedokładną reprezentację. Czy ktoś mógłby podać bardziej szczegółowe uzasadnienie, dlaczego obliczanie średniej zmiennej …

8
Statystyki to nie matematyka?
Czy statystyki są matematyczne, czy nie? Biorąc pod uwagę, że są to wszystkie liczby, głównie nauczane przez działy matematyki, a dostaniesz za to kredyty matematyczne, zastanawiam się, czy ludzie mają na myśli żart, kiedy to mówią, na przykład mówiąc, że to niewielka część matematyki, czy tylko matematyka stosowana. Zastanawiam się, …

3
Czy wartość p wynosząca 0,04993 jest wystarczająca, aby odrzucić hipotezę zerową?
W teście istotności statystycznej rang Wilcoxona natrafiliśmy na pewne dane, które dają wartość wynoszącą . Czy przy progu wynik ten jest wystarczający, aby odrzucić hipotezę zerową, czy też bezpieczniej jest powiedzieć, że test był niejednoznaczny, ponieważ jeśli zaokrąglimy wartość p do 3 miejsc po przecinku, to ona ?ppp0,049930,049930.04993p < 0,05p<0,05p …


2
Jak korzystać z funkcji weryfikacji krzyżowej scikit-learn w klasyfikatorach z wieloma etykietami
Testuję różne klasyfikatory na zbiorze danych, w którym jest 5 klas, a każda instancja może należeć do jednej lub więcej z tych klas, więc w szczególności używam klasyfikatorów wieloznakowych scikit-learn sklearn.multiclass.OneVsRestClassifier. Teraz chcę przeprowadzić weryfikację krzyżową za pomocą sklearn.cross_validation.StratifiedKFold. Powoduje to następujący błąd: Traceback (most recent call last): File "mlfromcsv.py", …

2
Co to jest cykliczne uczenie się zbrojenia
Ostatnio natknąłem się na słowo „Recurrent Reinforcement Learning”. Rozumiem, czym jest „Recurrent Neur Network” i czym jest „Reinforcement Learning”, ale nie mogłem znaleźć wielu informacji na temat tego, czym jest „Recurrent Reinforcement Learning”. Czy ktoś może mi wyjaśnić, czym jest „uczenie się z powtarzalnym wzmocnieniem” i jaka jest różnica między …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.