Używam R, szukałem w Google i dowiedział się, że kpss.test(), PP.test()iadf.test() są wykorzystywane wiedzieć o stacjonarności szeregów czasowych. Ale nie jestem statystykiem, który potrafi interpretować swoje wyniki > PP.test(x) Phillips-Perron Unit Root Test data: x Dickey-Fuller = -30.649, Truncation lag parameter = 7, p-value = 0.01 > kpss.test(b$V1) KPSS Test …
Myślę o tym z bardzo podstawowej, minimalnej perspektywy. Jakie są najważniejsze teorie, które statystycy branżowi (a nie akademiccy) powinni znać, rozumieć i wykorzystywać na bieżąco? Wielkim, jakie przychodzi na myśl, jest prawo wielkich liczb . Jakie są najbardziej istotne dla zastosowania teorii statystycznej do analizy danych?
Dowiedziałem się, że statystyka jest atrybutem, który można uzyskać z próbek. Pobierając wiele próbek tego samego rozmiaru, obliczając ten atrybut dla wszystkich z nich i wykreślając pdf, otrzymujemy rozkład odpowiedniego atrybutu lub rozkład odpowiednich statystyk. Słyszałem również, że statystyki mają służyć jako estymatory, czym różnią się te dwa pojęcia?
Próbuję przedstawić liczbę działań użytkowników (w tym przypadku „polubień”) w czasie. Mam więc „liczbę działań” jako moją oś y, moją oś x to czas (tygodnie), a każda linia reprezentuje jednego użytkownika. Mój problem polega na tym, że chcę spojrzeć na te dane dla zestawu około 100 użytkowników. Wykres liniowy szybko …
Próbuję przyspieszyć z R. W końcu chcę używać bibliotek R do klasyfikacji tekstu. Zastanawiałem się tylko, jakie są ludzkie doświadczenia w odniesieniu do skalowalności języka R, jeśli chodzi o klasyfikację tekstu. Prawdopodobnie napotkam dane o dużych wymiarach (~ 300 tys. Wymiarów). Patrzę na wykorzystanie SVM i Random Forest w szczególności …
To podstawowe pytanie, ale nie mogłem znaleźć odpowiedzi. Mam dwa pomiary: zdarzenia n1 w czasie t1 i zdarzenia n2 w czasie t2, oba wytworzone (powiedzmy) przez procesy Poissona z możliwie różnymi wartościami lambda. To tak naprawdę pochodzi z artykułu prasowego, który zasadniczo twierdzi, że od że oba są różne, ale …
Natknąłem się na ten przyjemny samouczek: Podręcznik analiz statystycznych przy użyciu R. Rozdział 13. Analiza głównych składników: Olimpijski heptathlon na temat tego, jak robić PCA w języku R. Nie rozumiem interpretacji rysunku 13.3: Planuję więc pierwszy wektor własny vs drugi wektor własny. Co to znaczy? Załóżmy, że wartość własna odpowiadająca …
Jeśli dobrze rozumiem, przedział ufności parametru to przedział skonstruowany metodą, która daje przedziały zawierające prawdziwą wartość dla określonej proporcji próbek. „Pewność” dotyczy więc metody, a nie przedziału, który obliczam na podstawie konkretnej próbki. Jako użytkownik statystyk zawsze czułem się przez to oszukany, ponieważ przestrzeń wszystkich próbek jest hipotetyczna. Mam tylko …
Czy istnieje model wizualizacji, który jest dobry do pokazywania nakładania się przecięcia wielu zbiorów? Myślę o czymś takim jak diagramy Venna, ale to może jakoś lepiej nadawać się do większej liczby zestawów, takich jak 10 lub więcej. Wikipedia pokazuje kilka wyższych zestawów diagramów Venna, ale nawet 4 zestawy diagramów są …
Mam zadanie klasyfikacji, w którym mam wiele predyktorów (z których jeden jest najbardziej pouczający) i używam modelu MARS do budowy mojego klasyfikatora (jestem zainteresowany dowolnym prostym modelem, a używanie glms do celów ilustracyjnych byłoby też dobrze). Teraz mam ogromną nierównowagę klas w danych treningowych (około 2700 próbek ujemnych na każdą …
Użyłem następującego kodu r do oszacowania przedziałów ufności proporcji dwumianowej, ponieważ rozumiem, że zastępuje to „obliczanie mocy” podczas projektowania krzywych charakterystycznych dla odbiornika działającego na wykrywanie chorób w populacji. n wynosi 150, a choroba, naszym zdaniem, występuje w populacji w 25%. Obliczyłem wartości 75% czułości i 90% swoistości (ponieważ wydaje …
Prawdopodobieństwo można określić na kilka sposobów, na przykład: Funkcja LLL z Θ×XΘ×X\Theta\times{\cal X} , który odwzorowuje (θ,x)(θ,x)(\theta,x) do L(θ∣x)L(θ∣x)L(\theta \mid x) to znaczy L:Θ×X→RL:Θ×X→RL:\Theta\times{\cal X} \rightarrow \mathbb{R} . funkcja losowa L(⋅∣X)L(⋅∣X)L(\cdot \mid X) moglibyśmy również wziąć pod uwagę, że prawdopodobieństwo to tylko „zaobserwowane” prawdopodobieństwo L(⋅∣xobs)L(⋅∣xobs)L(\cdot \mid x^{\text{obs}}) w praktyce prawdopodobieństwo …
Jaką różnicę ma centrowanie (lub odznaczanie) danych w przypadku PCA? Słyszałem, że ułatwia to matematykę lub zapobiega zdominowaniu pierwszego komputera przez zmienne, ale wydaje mi się, że nie byłem jeszcze w stanie zrozumieć tej koncepcji. Na przykład najlepsza odpowiedź tutaj W jaki sposób centrowanie danych pozbywa się przechwytywania w regresji …
Przeglądam notatki z wykładu Andrew Ng na temat uczenia maszynowego. Notatki wprowadzają nas do regresji logistycznej, a następnie do perceptronu. Opisując Perceptron, notatki mówią, że po prostu zmieniamy definicję funkcji progowej używanej do regresji logistycznej. Po wykonaniu tej czynności możemy użyć modelu Perceptron do klasyfikacji. Moje pytanie brzmi - jeśli …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.