Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Jak analizować dane dotyczące liczby podłużnej: rozliczanie czasowej autokorelacji w GLMM?
Witaj guru statystyczni i kreatorzy programowania R, Interesuje mnie modelowanie chwytów zwierząt jako funkcji warunków środowiskowych i dnia w roku. W ramach innego badania mam liczbę przechwyceń przez ~ 160 dni w ciągu trzech lat. Na każdy z tych dni mam temperaturę, opady, prędkość wiatru, wilgotność względną itp. Ponieważ dane …

8
Minimalna wielkość próbki dla niesparowanego testu t
Czy istnieje „reguła” określająca minimalną wielkość próbki wymaganą do prawidłowego przeprowadzenia testu t? Na przykład należy dokonać porównania między średnimi 2 populacji. Istnieje 7 punktów danych z jednej populacji i tylko 2 punkty danych z drugiej. Niestety eksperyment jest bardzo kosztowny i czasochłonny, a uzyskanie większej ilości danych nie jest …


6
Gdzie znaleźć duży korpus tekstowy? [Zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 6 lat temu . Szukam dużego (> 1000) korpusu tekstu do pobrania. Najlepiej z wiadomościami ze świata lub raportami . Znalazłem tylko jednego z patentami. …
16 dataset 

2
Jakie jest statystyczne uzasadnienie interpolacji?
Załóżmy, że mamy dwa punkty (poniższy rysunek: czarne kółka) i chcemy znaleźć wartość trzeciego punktu między nimi (krzyżyk). Rzeczywiście, oszacujemy to na podstawie naszych wyników eksperymentalnych, czarnych punktów. Najprostszym przypadkiem jest narysowanie linii, a następnie znalezienie wartości (tj. Interpolacja liniowa). Gdybyśmy mieli np. Punkty podparcia, jako brązowe punkty po obu …

5
Teorie prawdopodobieństwa do samodzielnego studiowania
Czy są jakieś dobre książki, które wyjaśniają ważne pojęcia teorii prawdopodobieństwa, takie jak funkcje rozkładu prawdopodobieństwa i funkcje rozkładu skumulowanego? Proszę unikać odwoływania się do książek takich jak „Statystyka matematyczna i analiza danych” Johna Rice'a, które zaczynają się od prostych koncepcji permutacji, a następnie nagle (w drugim rozdziale) wykonują skok, …

3
Dokonywanie dużych, inteligentnych (er) zakładów
Próbowałem kodować algorytm sugerujący zakłady w grach 1x2 (ważonych). Zasadniczo każda gra ma zestaw meczów (drużyny gospodarzy vs gości): 1: wygrywa dom X: remis 2: wyjazd wygrywa Dla każdego dopasowania i symbolu ( 1, Xi 2) przypiszę procent reprezentujący szanse / prawdopodobieństwo, że ten symbol będzie prawidłowym wynikiem dopasowania. Oto …

4
Grupowanie danych 1D
Mam zestaw danych, chcę utworzyć klastry na tych danych na podstawie tylko jednej zmiennej (nie ma brakujących wartości). Chcę utworzyć 3 klastry na podstawie tej jednej zmiennej. Którego algorytmu grupowania użyć, k-średnich, EM, DBSCAN itp.? Moje główne pytanie brzmi: w jakich okolicznościach powinienem używać k-średnich zamiast EM lub EM ponad …
16 clustering 

11
Jak zacząć i nauczyć się R?
Kilka razy próbowałem „pójść sam” - ale z ograniczonym sukcesem. Jestem zwykłym użytkownikiem SPSS i mam doświadczenie w SAS. Doceniłby wskaźnik lub dwa od kogoś, kto ma podobne pochodzenie i teraz używa R.
16 r  references 

1
Czy mogę użyć Kołmogorowa-Smirnowa do porównania dwóch rozkładów empirycznych?
Czy można stosować test dobroci dopasowania Kołmogorowa-Smirnowa do porównywania dwóch rozkładów empirycznych w celu ustalenia, czy wydają się pochodzić z tego samego rozkładu podstawowego, zamiast porównywania jednego rozkładu empirycznego z wcześniej określonym rozkładem odniesienia? Pozwól, że spróbuję zapytać o to w inny sposób. Zbieram N próbek z jakiejś dystrybucji w …

2
Kiedy łączymy redukcję wymiarowości z klastrowaniem?
Próbuję przeprowadzić klastrowanie na poziomie dokumentu. Skonstruowałem macierz częstotliwości termin-dokument i próbuję zgrupować te wektory o dużych wymiarach za pomocą k-średnich. Zamiast bezpośredniego grupowania, najpierw zastosowałem dekompozycję wektora osobliwego LSA (Latent Semantic Analysis) w celu uzyskania macierzy U, S, Vt, wybrałem odpowiedni próg za pomocą wykresu piargowego i zastosowałem grupowanie …

1
Generowanie losowych próbek z niestandardowej dystrybucji
Próbuję wygenerować losowe próbki z niestandardowego pliku PDF przy użyciu R. Mój pdf to: fX(x)=32(1−x2),0≤x≤1fX(x)=32(1−x2),0≤x≤1f_{X}(x) = \frac{3}{2} (1-x^2), 0 \le x \le 1 Wygenerowałem jednolite próbki, a następnie próbowałem przekształcić je w moją niestandardową dystrybucję. Zrobiłem to, znajdując plik cdf mojej dystrybucji ( FX(x)FX(x)F_{X}(x) ) i ustawiając go na jednolitą …
16 r  sampling  uniform 

2
Co dokładnie oznacza „gromadzenie danych”?
Pomyślałem, że „łączenie danych” oznacza po prostu łączenie danych, które wcześniej były podzielone na kategorie ... zasadniczo, ignorując kategorie i czyniąc zestaw danych jedną gigantyczną „pulą” danych. Myślę, że to pytanie dotyczy bardziej terminologii niż stosowania statystyk. Na przykład: chcę porównać 2 witryny, aw ramach każdej witryny mam dwa typy …

2
Czy można utworzyć wykres „zestawów równoległych” za pomocą R?
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Dzięki pytaniu Tormod (zamieszczonemu tutaj ) natrafiłem na fabułę zestawów równoległych . Oto przykład tego, jak to wygląda: (Jest to wizualizacja zestawu danych Titanica. Pokazuje, …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.