Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
R Język, jaka jest różnica między rnorm a runif [zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 6 lat temu . Jaka jest różnica między funkcjami rnorma runifR?
16 r 

2
Resztki Pearsona
Pytanie początkującego o resztki Pearsona w kontekście testu chi-kwadrat na dobroć dopasowania: Oprócz statystyki testowej chisq.testfunkcja R zgłasza resztkową wartość Pearsona: (obs - exp) / sqrt(exp) Rozumiem, dlaczego przyglądanie się różnicy między wartościami obserwowanymi i oczekiwanymi nie jest tak pouczające, ponieważ mniejsza próbka spowoduje mniejszą różnicę. Chciałbym jednak dowiedzieć się …

1
Pytanie, jak znormalizować współczynnik regresji
Nie jestem pewien, czy normalizacja jest tu właściwym słowem, ale postaram się zilustrować, o co próbuję zapytać. Zastosowany tutaj estymator to najmniej kwadratów. Załóżmy, że masz y=β0+β1x1y=β0+β1x1y=\beta_0+\beta_1x_1 , możesz wyśrodkować go wokół średniej o y=β′0+β1x′1y=β0′+β1x1′y=\beta_0'+\beta_1x_1' gdzie β′0=β0+β1x¯1β0′=β0+β1x¯1\beta_0'=\beta_0+\beta_1\bar x_1 i x′1=x−x¯x1′=x−x¯x_1'=x-\bar x , tak że β′0β0′\beta_0' nie ma już żadnego wpływu …

1
Górne granice gęstości kopuły?
Fréchet-Hoeffding górna granica odnosi się do funkcji rozkładu kopułą i jest przekazywana przez C(u1,...,ud)≤min{u1,..,ud}.C(u1,...,ud)≤min{u1,..,ud}.C(u_1,...,u_d)\leq \min\{u_1,..,u_d\}. Czy istnieje podobna (w tym sensie, że zależy to od gęstości krańcowej) górna granica gęstości kopuły c(u1,...,ud)c(u1,...,ud)c(u_1,...,u_d) zamiast CDF? Wszelkie odniesienia będą mile widziane.

1
Rozkład z
Czy są jakieś informacje o rozkładzie, którego nnn ty skumulowany parametr podaje 1n1n\frac 1 n ? Funkcja generująca kumulanty ma postać κ(t)=∫10etx−1x dx.κ(t)=∫01etx−1x dx. \kappa(t) = \int_0 ^ 1 \frac{e^{tx} - 1}{x} \ dx. Natknąłem się na to jako ograniczający rozkład niektórych zmiennych losowych, ale nie byłem w stanie znaleźć …

1
Kryteria do ustawienia szerokości okna STL s
Za pomocą Rprzeprowadzania rozkładu STL s.windowkontroluje, jak szybko składnik sezonowy może się zmieniać. Małe wartości pozwalają na szybszą zmianę. Ustawienie nieskończoności okna sezonowego jest równoznaczne z wymuszeniem okresowego komponentu sezonowego (tj. Identycznego przez lata). Moje pytania: Jeśli mam miesięczny szereg czasowy (czyli częstotliwość równa ), jakie kryteria należy zastosować ?121212s.window …

2
podejścia szkoleniowe dla wysoce niezrównoważonego zestawu danych
Mam wysoce niezrównoważony zestaw danych testowych. Zestaw dodatni składa się ze 100 przypadków, a zestaw ujemny składa się z 1500 przypadków. Po stronie treningowej mam większą pulę kandydatów: pozytywny zestaw treningowy ma 1200 przypadków, a negatywny zestaw treningowy ma 12000 przypadków. W przypadku tego rodzaju scenariusza mam kilka możliwości: 1) …

1
Prawidłowa technika ładowania dla klastrowanych danych?
Mam pytanie dotyczące właściwej techniki ładowania początkowego w przypadku danych, w których występuje silne grupowanie. Zadanie polegało na ocenie modelu prognostycznego z wieloma zmiennymi efektami mieszanymi na danych dotyczących roszczeń ubezpieczeniowych poprzez ocenę obecnego modelu bazowego na nowszych danych dotyczących roszczeń, aby określić, jak dobrze model przewiduje, które odcinki opieki …

2
Obserwowana matryca informacji jest spójnym estymatorem oczekiwanej matrycy informacji?
Próbuję udowodnić, że obserwowana matryca informacji oceniana przy mało spójnym estymatorze maksymalnego prawdopodobieństwa (MLE), jest słabo spójnym estymatorem oczekiwanej matrycy informacji. Jest to często cytowany wynik, ale nikt nie podaje odniesienia ani dowodu (wyczerpałem się, myślę, że pierwsze 20 stron wyników Google i podręczników statystyk)! Używając słabo spójnej sekwencji MLE, …

2
Jakie wcześniejsze rozkłady mogłyby / powinny być zastosowane dla wariancji w hierarchicznym modelu bayezjańskim, gdy interesująca jest średnia wariancja?
W szeroko cytowanym artykule Wcześniejsze rozkłady parametrów wariancji w modelach hierarchicznych (916 cytowanie do tej pory na Google Scholar) Gelman sugeruje, że dobre wcześniejsze nieinformacyjne wcześniejsze rozkłady dla wariancji w hierarchicznym modelu bayesowskim to rozkład równomierny i rozkład połowy t. Jeśli dobrze rozumiem, działa to dobrze, gdy parametr lokalizacji (np. …

2
Wybór parametru złożoności w KOSZYKU
W procedurze rpart () do tworzenia modeli CART określasz parametr złożoności, do którego chcesz przyciąć drzewo. Widziałem dwie różne rekomendacje dotyczące wyboru parametru złożoności: Wybierz parametr złożoności związany z minimalnym możliwym błędem walidowanym krzyżowo. Ta metoda jest zalecana przez Quick-R i HSAUR. Wybierz parametr największej złożoności, którego szacowany błąd zweryfikowany …
16 r  cart  rpart 

3
Opcjonalne reguły zatrzymywania, których nie ma w podręcznikach
Reguły zatrzymania wpływają na związek między wartościami P a wskaźnikami błędów związanymi z decyzjami. Niedawny artykuł Simmonsa i in. W 2011 r . Termin „ stopnie swobody badacza” opisuje zbiór zachowań, które uważają za odpowiedzialne za wiele raportów w literaturze psychologicznej, które okazały się nie do odtworzenia. Spośród tych zachowań …

4
Niska dokładność klasyfikacji, co dalej?
Jestem więc nowicjuszem w dziedzinie ML i staram się dokonać klasyfikacji. Moim celem jest przewidzieć wynik wydarzenia sportowego. Zebrałem trochę danych historycznych i teraz próbuję wyszkolić klasyfikatora. Dostałem około 1200 próbek, z czego 0,2 oddzieliłem do celów testowych, inne poddałem wyszukiwaniu sieci (w tym walidacji krzyżowej) z różnymi klasyfikatorami. Do …

2
Jakie procesy mogą generować dane lub parametry dystrybuowane przez Laplace'a (podwójnie wykładnicze)?
Wiele dystrybucji ma „mity o pochodzeniu” lub przykłady procesów fizycznych, które dobrze opisują: Dane normalnie rozproszone można uzyskać z sumy nieskorelowanych błędów za pomocą centralnego twierdzenia o granicy Możesz uzyskać dane dystrybuowane dwumianowo z niezależnych rzutów monet lub zmiennych dystrybuowanych przez Poissona z limitu tego procesu Możesz uzyskać wykładniczo rozproszone …

3
Poisson ma wykładniczy charakter, tak jak Gamma-Poisson do czego?
Rozkład Poissona może mierzyć zdarzenia na jednostkę czasu, a parametr to λλ\lambda . Rozkład wykładniczy mierzy czas do następnego zdarzenia za pomocą parametru 1λ1λ\frac{1}{\lambda} . Można przekształcić jedną dystrybucję w drugą, w zależności od tego, czy łatwiej jest modelować zdarzenia lub czasy. Teraz gamma-poissona jest „rozciągniętym” poissonem o większej wariancji. …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.