Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

5
W jakim języku programowania zalecasz prototypowanie problemu uczenia maszynowego?
Obecnie pracuje w Octave, ale z powodu słabej dokumentacji postęp jest bardzo wolny. Jaki język jest łatwy do opanowania i używania oraz dobrze udokumentowany, aby rozwiązać problemy z uczeniem maszynowym? Szukam prototypu na małym zestawie danych (tysiące przykładów), więc szybkość nie jest ważna. EDYCJA: Opracowuję silnik rekomendacji. Tak więc jestem …


1
Jaki jest dobry wskaźnik stopnia naruszenia normalności i jakie opisowe etykiety można przypisać do tego indeksu?
Kontekst: W poprzednim pytaniu @Robbie zadał w badaniu z około 600 przypadków, dlaczego testy normalności sugerują znaczną nienormalność, a wykresy sugerują rozkład normalny . Kilka osób zauważyło, że testy istotności normalności nie są zbyt przydatne. Przy małych próbkach takie testy nie mają dużej mocy do wykrycia łagodnych naruszeń normalności, a …

1
Czy mogę zastosować sparowany test t, gdy próbki są normalnie rozmieszczone, ale ich różnica nie jest?
Mam dane z eksperymentu, w którym zastosowałem dwa różne zabiegi w identycznych warunkach początkowych, w wyniku czego otrzymałem liczbę całkowitą od 0 do 500 w każdym przypadku. Chcę użyć sparowanego testu t, aby ustalić, czy efekty wywołane dwoma zabiegami są znacząco różne. Wyniki dla każdej grupy leczenia są zwykle rozkładane, …


5
Dlaczego wszystkie testy normalności odrzucają hipotezę zerową?
Test Kolgomorova-Smirnova, test Shapiro itp.… Wszyscy odrzucają hipotezę, że rozkład jest normalny. Jednak kiedy wykreślam normalne kwantyle i histogram, dane są wyraźnie normalne. Może dlatego, że moc testów jest wysoka? Wielkość próbki wynosi około 650. Czy więc przynajmniej jeden z tych testów nie powinien odrzucić hipotezy zerowej? Wyniki: Kolmogorov-Smirnov D …

1
Solidna metoda klastrowa dla mieszanych danych w języku R
Chcę skupić mały zestaw danych (64 obserwacje 4 zmiennych interwałowych i pojedynczej zmiennej kategorialnej trzyczynnikowej). Teraz jestem całkiem nowy w analizie skupień, ale zdaję sobie sprawę, że od czasów, gdy hierarchiczne grupowanie lub k-średnie były jedynymi dostępnymi opcjami, nastąpił znaczny postęp. W szczególności wydaje się, że dostępne są nowe metody …

5
Jak skutecznie obliczyć jądro Gaussa w numpy [zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 3 lata temu . Mam tablicy numpy z m kolumn i n wierszy, kolumn i wymiarach będących rzędów punktów danych. Teraz muszę obliczyć wartości jądra …

3
Oszacowanie parametrów procesu przestrzennego
Dostaję siatki dodatnich wartości całkowitych. Liczby te reprezentują intensywność, która powinna odpowiadać sile przekonania osoby zajmującej to miejsce na siatce (wyższa wartość oznacza wyższe przekonanie). Osoba na ogół będzie miała wpływ na wiele komórek siatki.n × nn×nn\times n Uważam, że wzorzec intensywności powinien „wyglądać gaussowsko”, ponieważ będzie centralne położenie o …

5
Jak zrobić dobrą skalę intensywności kolorów?
Nie jestem dobry w statystyce, ale myślę, że trafiłem we właściwe miejsce. Moje pytanie jest proste: Mój problem polega na porównaniu populacji kilku stanów w małym kraju, ale niektóre stany mają 3000 000 mieszkańców, a niektóre 2 000 mieszkańców. Maluję to na mapie, a „intensywność” koloru zależy od tego, jak …

4
Jak wykonać PCA dla danych o bardzo dużych wymiarach?
Aby przeprowadzić analizę głównego składnika (PCA), należy odjąć średnie z każdej kolumny od danych, obliczyć macierz współczynnika korelacji, a następnie znaleźć wektory własne i wartości własne. Cóż, raczej to zrobiłem, aby zaimplementować go w Pythonie, z wyjątkiem tego, że działa tylko z małymi macierzami, ponieważ metoda znajdowania macierzy współczynnika korelacji …
12 pca  python 



4
Jak pobrać wiele próbek 10 z dużej listy, bez ogólnej wymiany
Mam duży zestaw danych (20 000 punktów danych), z których chcę pobrać powtarzane próbki 10 punktów danych. Jednak po wybraniu tych 10 punktów danych chcę, aby nie były ponownie wybierane. Próbowałem użyć tej samplefunkcji, ale wydaje się, że nie ma opcji próbkowania bez zamiany przez wiele wywołań funkcji. Czy istnieje …
12 r  sample 

1
Statystyki oparte na matematyce fraktalnej
Szukam książek / podręczników dotyczących statystyki opartej na matematyce fraktalnej. Wiem, że nie jest to zbyt dobrze znany obszar i raczej trudno jest znaleźć dobrą literaturę. Wszelkie sugestie są mile widziane (książki, podręczniki, materiały online).

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.