Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Jak się dowiedzieć, czy szereg czasowy jest stacjonarny czy niestacjonarny?
Używam R, szukałem w Google i dowiedział się, że kpss.test(), PP.test()iadf.test() są wykorzystywane wiedzieć o stacjonarności szeregów czasowych. Ale nie jestem statystykiem, który potrafi interpretować swoje wyniki > PP.test(x) Phillips-Perron Unit Root Test data: x Dickey-Fuller = -30.649, Truncation lag parameter = 7, p-value = 0.01 > kpss.test(b$V1) KPSS Test …

8
Jakie teorie powinien znać każdy statystyk?
Myślę o tym z bardzo podstawowej, minimalnej perspektywy. Jakie są najważniejsze teorie, które statystycy branżowi (a nie akademiccy) powinni znać, rozumieć i wykorzystywać na bieżąco? Wielkim, jakie przychodzi na myśl, jest prawo wielkich liczb . Jakie są najbardziej istotne dla zastosowania teorii statystycznej do analizy danych?

9
Jaka jest różnica między estymatorem a statystyką?
Dowiedziałem się, że statystyka jest atrybutem, który można uzyskać z próbek. Pobierając wiele próbek tego samego rozmiaru, obliczając ten atrybut dla wszystkich z nich i wykreślając pdf, otrzymujemy rozkład odpowiedniego atrybutu lub rozkład odpowiednich statystyk. Słyszałem również, że statystyki mają służyć jako estymatory, czym różnią się te dwa pojęcia?

6
Wykres liniowy ma zbyt wiele linii, czy jest lepsze rozwiązanie?
Próbuję przedstawić liczbę działań użytkowników (w tym przypadku „polubień”) w czasie. Mam więc „liczbę działań” jako moją oś y, moją oś x to czas (tygodnie), a każda linia reprezentuje jednego użytkownika. Mój problem polega na tym, że chcę spojrzeć na te dane dla zestawu około 100 użytkowników. Wykres liniowy szybko …

3
Jak dobrze R skaluje się do zadań klasyfikacji tekstu? [Zamknięte]
Próbuję przyspieszyć z R. W końcu chcę używać bibliotek R do klasyfikacji tekstu. Zastanawiałem się tylko, jakie są ludzkie doświadczenia w odniesieniu do skalowalności języka R, jeśli chodzi o klasyfikację tekstu. Prawdopodobnie napotkam dane o dużych wymiarach (~ 300 tys. Wymiarów). Patrzę na wykorzystanie SVM i Random Forest w szczególności …


2
Interpretacja dwupłatów w analizie głównych składników
Natknąłem się na ten przyjemny samouczek: Podręcznik analiz statystycznych przy użyciu R. Rozdział 13. Analiza głównych składników: Olimpijski heptathlon na temat tego, jak robić PCA w języku R. Nie rozumiem interpretacji rysunku 13.3: Planuję więc pierwszy wektor własny vs drugi wektor własny. Co to znaczy? Załóżmy, że wartość własna odpowiadająca …


6
Kiedy przydatne są przedziały ufności?
Jeśli dobrze rozumiem, przedział ufności parametru to przedział skonstruowany metodą, która daje przedziały zawierające prawdziwą wartość dla określonej proporcji próbek. „Pewność” dotyczy więc metody, a nie przedziału, który obliczam na podstawie konkretnej próbki. Jako użytkownik statystyk zawsze czułem się przez to oszukany, ponieważ przestrzeń wszystkich próbek jest hipotetyczna. Mam tylko …

3
Wizualizacja skrzyżowań wielu zbiorów
Czy istnieje model wizualizacji, który jest dobry do pokazywania nakładania się przecięcia wielu zbiorów? Myślę o czymś takim jak diagramy Venna, ale to może jakoś lepiej nadawać się do większej liczby zestawów, takich jak 10 lub więcej. Wikipedia pokazuje kilka wyższych zestawów diagramów Venna, ale nawet 4 zestawy diagramów są …

4
Optymalizacja pod kątem krzywych Precyzja-Przywołanie przy niewyważeniu klasy
Mam zadanie klasyfikacji, w którym mam wiele predyktorów (z których jeden jest najbardziej pouczający) i używam modelu MARS do budowy mojego klasyfikatora (jestem zainteresowany dowolnym prostym modelem, a używanie glms do celów ilustracyjnych byłoby też dobrze). Teraz mam ogromną nierównowagę klas w danych treningowych (około 2700 próbek ujemnych na każdą …

6
Szacowanie dwumianowego przedziału ufności - dlaczego nie jest symetryczne?
Użyłem następującego kodu r do oszacowania przedziałów ufności proporcji dwumianowej, ponieważ rozumiem, że zastępuje to „obliczanie mocy” podczas projektowania krzywych charakterystycznych dla odbiornika działającego na wykrywanie chorób w populacji. n wynosi 150, a choroba, naszym zdaniem, występuje w populacji w 25%. Obliczyłem wartości 75% czułości i 90% swoistości (ponieważ wydaje …

3
Jak rygorystycznie zdefiniować prawdopodobieństwo?
Prawdopodobieństwo można określić na kilka sposobów, na przykład: Funkcja LLL z Θ×XΘ×X\Theta\times{\cal X} , który odwzorowuje (θ,x)(θ,x)(\theta,x) do L(θ∣x)L(θ∣x)L(\theta \mid x) to znaczy L:Θ×X→RL:Θ×X→RL:\Theta\times{\cal X} \rightarrow \mathbb{R} . funkcja losowa L(⋅∣X)L(⋅∣X)L(\cdot \mid X) moglibyśmy również wziąć pod uwagę, że prawdopodobieństwo to tylko „zaobserwowane” prawdopodobieństwo L(⋅∣xobs)L(⋅∣xobs)L(\cdot \mid x^{\text{obs}}) w praktyce prawdopodobieństwo …

1
W jaki sposób centrowanie wpływa na PCA (w przypadku SVD i rozkładu własnego)?
Jaką różnicę ma centrowanie (lub odznaczanie) danych w przypadku PCA? Słyszałem, że ułatwia to matematykę lub zapobiega zdominowaniu pierwszego komputera przez zmienne, ale wydaje mi się, że nie byłem jeszcze w stanie zrozumieć tej koncepcji. Na przykład najlepsza odpowiedź tutaj W jaki sposób centrowanie danych pozbywa się przechwytywania w regresji …
30 r  pca  svd  eigenvalues  centering 

6
Jaka jest różnica między regresją logistyczną a perceptronem?
Przeglądam notatki z wykładu Andrew Ng na temat uczenia maszynowego. Notatki wprowadzają nas do regresji logistycznej, a następnie do perceptronu. Opisując Perceptron, notatki mówią, że po prostu zmieniamy definicję funkcji progowej używanej do regresji logistycznej. Po wykonaniu tej czynności możemy użyć modelu Perceptron do klasyfikacji. Moje pytanie brzmi - jeśli …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.