Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Jak właściwie zastosować walidację krzyżową w kontekście wyboru parametrów uczenia się dla maszyn wektorów wsparcia?
Wspaniały pakiet libsvm zawiera interfejs Pythona i plik „easy.py”, który automatycznie wyszukuje parametry uczenia się (koszt i gamma), które maksymalizują dokładność klasyfikatora. W obrębie danego zestawu parametrów uczenia się kandydata dokładność jest operacjonalizowana przez krzyżową weryfikację, ale wydaje mi się, że podważa to cel krzyżowej weryfikacji. Oznacza to, że o …

2
Jakie jest prawdopodobieństwo, że bukmacher źle wycenia kursy na mecze piłki nożnej?
Angielska drużyna piłkarska rozgrywa serię meczów z różnymi przeciwnikami o różnych umiejętnościach. Bukmacher oferuje kursy na każdy mecz, czy będzie to zwycięstwo gospodarzy, gości na wyjeździe czy remis. W połowie sezonu drużyna rozegrała meczów i zremisowała z nich, co jest więcej niż można się spodziewać po kursach.nnnkkk Jakie jest prawdopodobieństwo, …


3
Czy źle jest wstrząsać przed wykonaniem testu Wilcoxona?
Napisałem skrypt testujący dane przy użyciu wilcox.test, ale kiedy otrzymałem wyniki, wszystkie wartości p były równe 1. Czytam na niektórych stronach internetowych, że możesz użyć jittera przed przetestowaniem danych (aby uniknąć powiązań, jak powiedzieli), Zrobiłem to i teraz mam akceptowalny wynik. Czy to źle? test<- function(column,datacol){ library(ggplot2) t=read.table("data.txt", stringsAsFactors=FALSE) uni=unique(c(t$V9)) …
9 r  nonparametric  ties 

1
Czy istnieje prosty sposób na połączenie dwóch modeli GLM w R?
Mam dwa modele regresji logistycznej w R wykonane glm(). Oba używają tych samych zmiennych, ale zostały wykonane przy użyciu różnych podzbiorów macierzy. Czy istnieje prosty sposób na uzyskanie średniego modelu, który podaje średnie współczynników, a następnie użycie go z funkcją predykcji ()? [przepraszam, jeśli tego typu pytanie powinno zostać opublikowane …

1
Czy istnieje nazwa dla tego typu ładowania początkowego?
Rozważ eksperyment z wieloma ludzkimi uczestnikami, z których każdy jest mierzony wiele razy w dwóch warunkach. Model efektów mieszanych można sformułować (używając składni lme4 ) jako: fit = lmer( formula = measure ~ (1|participant) + condition ) Powiedzmy, że chcę wygenerować przedziały ufności ładowania początkowego dla prognoz tego modelu. Myślę, …

1
Funkcje dyskretne: zakres przedziału ufności?
Jak obliczyć pokrycie przedziału dyskretnego? Co wiem jak to zrobić: Gdybym miał model ciągły, mógłbym zdefiniować 95% przedział ufności dla każdej z moich przewidywanych wartości, a następnie zobaczyć, jak często rzeczywiste wartości mieściły się w przedziale ufności. Mogę stwierdzić, że tylko 88% czasu, w którym mój 95% przedział ufności obejmował …

3
Korelacja Spearmana lub Pearsona ze skalami Likerta, w których można naruszyć liniowość i homoscedastyczność
Chcę przeprowadzić korelacje na wielu pomiarach, w których zastosowano skale Likerta. Patrząc na wykresy rozrzutu, wydaje się, że założenia liniowości i homoscedastyczności mogły zostać naruszone. Biorąc pod uwagę, że wydaje się, że istnieje pewna debata wokół skalowania poziomu porządkowego zbliżającego się do skalowania poziomu interwału, czy powinienem grać w nim …

1
Jak konstruować kwadraty dla procesów punktowych, które różnią się znacznie częstotliwością?
Chcę przeprowadzić analizę liczby kwadratów na kilku procesach punktowych (lub jednym oznaczonym procesie punktowym), aby następnie zastosować pewne techniki redukcji wymiarowości. Znaki nie są identycznie rozmieszczone, tzn. Niektóre znaki pojawiają się dość często, a niektóre są dość rzadkie. Dlatego nie mogę po prostu podzielić mojej przestrzeni 2D na zwykłą siatkę, …

4
Referencje na temat optymalizacji numerycznej dla statystyk
Szukam solidnego odniesienia (lub odniesień) do technik optymalizacji numerycznej skierowanych do statystyków, to znaczy, że zastosowałby te metody do niektórych standardowych problemów wnioskowania (np. MAP / MLE we wspólnych modelach). Rzeczy takie jak opadanie gradientu (proste i stochastyczne), EM i jego wydzielenia / uogólnienia, symulowane wyżarzanie itp. Mam nadzieję, że …

3
Dodatni rozkład stabilny w R.
Pozytywne rozkłady stabilne są opisane przez cztery parametry: parametr skośności , parametr skali , parametr lokalizacji i tak dalej - wywołany parametr indeksu . Gdy wynosi zero, rozkład jest symetryczny wokół , gdy jest dodatni (względnie ujemny), rozkład jest przekrzywiony w prawo (odpowiednio w lewo) Stabilne rozkłady pozwalają na grube …

2
Jak znaleźć relacje między różnymi typami zdarzeń (zdefiniowanych przez ich lokalizację 2D)?
Mam zestaw danych zdarzeń, które miały miejsce w tym samym okresie czasu. Każde zdarzenie ma typ (istnieje kilka różnych typów, mniej niż dziesięć) i lokalizację, reprezentowaną jako punkt 2D. Chciałbym sprawdzić, czy istnieje jakaś korelacja między typami zdarzeń, czy też między typem a lokalizacją. Na przykład, może zdarzenia typu A …

4
Do czego służy błąd standardowy?
Korzystam z samouczka, który znalazłem i wykreślam wartości średnie wraz ze standardowymi błędami, aby pokazać moje dane. Ale mam problem z omówieniem wyników. Moja fabuła jest pokazana poniżej: niektóre standardowe błędy (pokazane jako pasek błędów) różnią się znacznie, a niektóre z nich są bardzo bliskie zeru.


2
Czy do wyboru funkcji można użyć jądra PCA?
Czy można używać analizy głównych składników jądra (kPCA) do latentnego indeksowania semantycznego (LSI) w taki sam sposób, jak w przypadku PCA? Wykonuję LSI in R za pomocą prcompfunkcji PCA i wydobywam cechy z najwyższymi obciążeniami od pierwszegokkkskładniki. Dzięki temu uzyskuję funkcje najlepiej opisujące komponent. Próbowałem użyć kpcafunkcji (z kernlibpakietu), ale …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.