Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


3
Porównanie wyników dokładności dwóch klasyfikatorów dla istotności statystycznej z testem t
Chcę porównać dokładność dwóch klasyfikatorów dla istotności statystycznej. Oba klasyfikatory działają na tym samym zestawie danych. To prowadzi mnie do przekonania, że ​​powinienem używać testu t jednej próbki z tego, co czytałem . Na przykład: Classifier 1: 51% accuracy Classifier 2: 64% accuracy Dataset size: 78,000 Czy to właściwy test? …

4
Terminy błędów modelu średniej ruchomej
To jest podstawowe pytanie dotyczące modeli Box-Jenkins MA. Jak rozumiem, model MA jest zasadniczo liniową regresję szeregów czasowych wartości YYY przeciwko poprzednich kadencjach błędach et,...,et−net,...,et−ne_t,..., e_{t-n} . Oznacza to, że obserwacja YYY najpierw regresji na jej poprzednich wartości Yt−1,...,Yt−nYt−1,...,Yt−nY_{t-1}, ..., Y_{t-n} , a następnie jedno lub więcej Y−Y^Y−Y^Y - \hat{Y} …

1
Parametry wejściowe do użycia ukrytego przydziału Dirichleta
Podczas korzystania z modelowania tematów (Latent Dirichlet Allocation) liczba tematów jest parametrem wejściowym, który użytkownik musi określić. Wydaje mi się, że powinniśmy również dostarczyć zbiór kandydujących zestawów tematów, z którymi proces Dirichleta musi próbkować? Czy moje rozumowanie jest prawidłowe? W praktyce, jak skonfigurować tego rodzaju zestaw tematów kandydujących?

5
Szybka metoda znajdowania najlepszych metaparametrów SVM (jest szybsza niż wyszukiwanie w siatce)
Używam modeli SVM do krótkoterminowego prognozowania zanieczyszczeń powietrza. Aby wytrenować nowy model, muszę znaleźć odpowiednie metaparametry dla modelu SVM (mam na myśli C, gamma i tak dalej). Dokumentacja Libsvm (i wiele innych książek, które przeczytałem) sugeruje użycie wyszukiwania siatki w celu znalezienia tych parametrów - w zasadzie trenuję model dla …

4
Potwierdzenie rozkładu reszt w regresji liniowej
Załóżmy, że przeprowadziliśmy prostą regresję liniową y=β0+β1x+uy=β0+β1x+uy=\beta_0+\beta_1x+u , zapisaliśmy reszty ui^ui^\hat{u_i} narysowaliśmy histogram rozkładu reszt. Jeśli otrzymamy coś, co wygląda jak dobrze znana dystrybucja, czy możemy założyć, że nasz termin błędu ma tę dystrybucję? Powiedzmy, że jeśli dowiemy się, że reszty przypominają rozkład normalny, czy uzasadnione jest przyjęcie normalności terminu …

1
Przedział ufności oparty na bootstrapie
Studiując przedział ufności oparty na bootstrap, raz przeczytałem następujące oświadczenie: Jeśli rozkład bootstrapu jest przekrzywiony w prawo, przedział ufności oparty na bootstrapie zawiera korektę przesunięcia punktów końcowych jeszcze bardziej w prawo; może się to wydawać sprzeczne z intuicją, ale jest to prawidłowe działanie. Próbuję zrozumieć logikę leżącą u podstaw powyższego …


3
Współczynniki zależne od czasu w R - jak to zrobić?
Aktualizacja : Przepraszam za kolejną aktualizację, ale znalazłem kilka możliwych rozwiązań z ułamkami wielomianów i konkurencyjnym pakietem ryzyka, z którym potrzebuję pomocy. Problem Nie mogę znaleźć łatwego sposobu na wykonanie analizy współczynnika zależnego od czasu w R. Chcę mieć mój współczynnik zmiennych i zrobić to w zależności od czasu (nie …



2
Jaka jest różnica między „testowaniem hipotezy” a „testem istotności”?
Czy istnieje różnica między zwrotami „testowanie hipotezy” i „test istotności”, czy są one takie same? Po szczegółowej odpowiedzi od @Micheal Lew mam jedno zamieszanie, że dzisiejsza hipoteza (np. Test t do średniej testowej) jest przykładem albo „testu istotności”, albo „testu hipotezy”? Czy jest to połączenie obu? Jak wyróżniłbyś je za …

2
Jak piszesz ustalenia post-hoc Tukeya?
Jaki jest właściwy sposób na napisanie wyniku post-hoc Tukeya? Istnieje kilka przykładów z różnymi wynikami? Załóżmy, że masz północ, południe, wschód i zachód. North N=50 Mean=2.45 SD=3.9 std error=.577 LB=1.29 UB=3.62 South N=40 Mean=2.54 SD=3.8 std error=.576 LB=1.29 UB=3.63 East N=55 Mean=3.45 SD=3.7 std error=.575 LB=1.29 UB=3.64 West N=45 Mean=3.54 …


4
Zmienne „normalizujące” dla SVD / PCA
Załóżmy, że mamy mierzalnych zmiennych, , wykonujemy liczbę pomiarów, a następnie chcemy przeprowadzić rozkład wyników w liczbie pojedynczej na wynikach, aby znaleźć osie największej wariancji dla punktów w przestrzeni wymiarowej. ( Uwaga: załóżmy, że środki zostały już odjęte, więc dla wszystkich .)N.N.N( a1, a2), … , AN.)(za1,za2),…,zaN.)(a_1, a_2, \ldots, a_N)M.> …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.