Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Dowód równoważnych wzorów regresji kalenicowej
Czytałem najpopularniejsze książki w nauce statystycznej 1- Elementy uczenia statystycznego. 2- Wprowadzenie do uczenia statystycznego . Obaj wspominają, że regresja kalenicy ma dwie równoważne formuły. Czy istnieje zrozumiały matematyczny dowód tego wyniku? Przeszedłem również przez Cross Validated , ale nie mogę znaleźć tam konkretnego dowodu. Ponadto, czy LASSO będzie korzystać …


1
Porównanie Newey-West (1987) i Hansen-Hodrick (1980)
Pytanie: Jakie są główne różnice i podobieństwa między stosowaniem standardowych błędów Newey-West (1987) a Hansen-Hodrick (1980)? W jakich sytuacjach należy preferować jedną z nich? Uwagi: Wiem, jak działa każda z tych procedur dostosowawczych; jednak nie znalazłem jeszcze żadnego dokumentu, który by je porównał, ani w Internecie, ani w moim podręczniku. …

2
Dlaczego ta prognoza szeregów czasowych jest „dość słaba”?
Próbuję nauczyć się korzystać z sieci neuronowych. Czytałem ten samouczek . Po dopasowaniu sieci neuronowej do szeregu czasowego przy użyciu wartości aby przewidzieć wartość przy autor otrzymuje następujący wykres, w którym niebieska linia to szereg czasowy, zielony to prognoza danych pociągu, czerwony to prognoza danych testowych (wykorzystał podział pociągu testowego)tttt …

3
Intuicja dla maszyn wektorów wsparcia i hiperpłaszczyzny
W moim projekcie chcę stworzyć model regresji logistycznej do przewidywania klasyfikacji binarnej (1 lub 0). Mam 15 zmiennych, z których 2 są kategoryczne, a pozostałe są mieszaniną zmiennych ciągłych i dyskretnych. Aby dopasować model regresji logistycznej, zalecono mi sprawdzenie liniowej separowalności za pomocą SVM, perceptronu lub programowania liniowego. Jest to …


3
Dlaczego założenia ANOVA (równość wariancji, normalność reszt) mają znaczenie?
Podczas przeprowadzania analizy ANOVA powiedziano nam, że muszą istnieć pewne założenia testu, aby można ją było zastosować do danych. Nigdy nie zrozumiałem powodu, dla którego następujące założenia były niezbędne do funkcjonowania testu: Wariancja zmiennej zależnej (reszty) powinna być równa w każdej komórce projektu Zmienna zależna (reszty) powinna być w przybliżeniu …

4
Typowa koncepcja zestawu
Pomyślałem, że koncepcja typowego zestawu jest dość intuicyjna: sekwencja długości należałaby do typowego zestawu jeśli prawdopodobieństwo wystąpienia sekwencji byłoby wysokie. Tak więc każda sekwencja, która prawdopodobnie byłaby w . (Unikam formalnej definicji związanej z entropią, ponieważ staram się ją zrozumieć jakościowo.)A ( n ) ϵ A ( n ) ϵnnnA(n)ϵAϵ(n)A_\epsilon …

4
Wartość oczekiwana a najbardziej prawdopodobna wartość (tryb)
Oczekiwana wartość rozkładu jest średnią, to znaczy średnią ważoną E [ x ] = ∫ + ∞ - ∞ xf(x)f(x)f(x)E[x]=∫+∞−∞xf(x)dxE[x]=∫−∞+∞xf(x)dxE[x]=\int_{-\infty}^{+\infty} x \, \, f(x) dx Najbardziej prawdopodobną wartością jest tryb, czyli najbardziej prawdopodobna wartość. Czy jednak spodziewamy się, że jakoś zobaczymy wiele razy? Cytowanie stąd :E[x]E[x]E[x] Jeżeli wyniki nie są …


2
Regresja krokowa w R - jak to działa?
Próbuję zrozumieć podstawową różnicę między regresją krokową i wsteczną w R za pomocą funkcji krokowej. Do regresji krokowej użyłem następującego polecenia step(lm(mpg~wt+drat+disp+qsec,data=mtcars),direction="both") Mam poniższy wynik dla powyższego kodu. Do wyboru zmiennej wstecznej użyłem następującego polecenia step(lm(mpg~wt+drat+disp+qsec,data=mtcars),direction="backward") I mam poniższe wyjście do tyłu O ile rozumiem, gdy żaden parametr nie jest …
15 r  regression 

3
Czy naprawdę musimy uwzględnić „wszystkie istotne predyktory?”
Podstawowym założeniem stosowania modeli regresji do wnioskowania jest to, że „wszystkie istotne predyktory” zostały uwzględnione w równaniu predykcyjnym. Uzasadnieniem jest to, że nieuwzględnienie ważnego czynnika w świecie rzeczywistym prowadzi do tendencyjnych współczynników, a tym samym do niedokładnych wniosków (tj. Pominiętej zmienności stronniczości). Ale w praktyce badawczej nigdy nie widziałem nikogo, …

5
Zagadnienia osobliwości w modelu mieszanki Gaussa
W rozdziale 9 książki Rozpoznawanie wzorców i uczenie maszynowe jest ta część o modelu mieszanki Gaussa: Szczerze mówiąc, tak naprawdę nie rozumiem, dlaczego stworzyłoby to osobliwość. Czy ktoś może mi to wytłumaczyć? Przykro mi, ale jestem tylko studentem i początkującym w uczeniu maszynowym, więc moje pytanie może zabrzmieć trochę głupio, …

3
Regresja logistyczna: Scikit Learn vs glmnet
Próbuję powielić wyniki z sklearnbiblioteki regresji logistycznej przy użyciu glmnetpakietu w języku R. Z dokumentacjisklearn regresji logistycznej próbuje zminimalizować funkcję kosztu w ramach kary l2 minw , c12)wT.w + C∑i = 1N.log( exp( - yja( XT.jaw + c ) ) + 1 )minw,do12)wT.w+do∑ja=1N.log⁡(exp⁡(-yja(XjaT.w+do))+1)\min_{w,c} \frac12 w^Tw + C\sum_{i=1}^N \log(\exp(-y_i(X_i^Tw+c)) + 1) …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.