Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


4
Prawdopodobieństwo znalezienia określonej sekwencji par zasad
Myślenie o prawdopodobieństwie zawsze uświadamia mi, jak źle liczę ... Rozważ ciąg podstawowych liter , z których każde może pojawić się w jednakowym stopniu. Jakie jest prawdopodobieństwo, że ta sekwencja zawiera określoną sekwencję interesujących par zasad o długości ?A ,nnnR ≤ nA,T,C, and GA,T,C, and GA,\; T, \; C, \text{ …


1
Podwajanie ogonów w teście permutacji na dwóch próbkach
Załóżmy, że mamy dwie próbki i chcemy ustalić, czy są one pobierane z tego samego rozkładu, przy czym próbki A, B składają się z niektórych liczb całkowitych. Jeśli przetestujemy to za pomocą testu permutacji z dwiema próbkami, w szczególności patrząc na permutacje, w których różnice w średnich próbkach są tak …

3
Odnośnie użycia modelu Bigram (N-gram) do budowy wektora cech dla dokumentu tekstowego
Tradycyjne podejście do konstruowania obiektów do eksploracji tekstu jest oparte na zasadzie work-of-words i można je ulepszyć za pomocą tf-idf do konfigurowania wektora cech charakteryzującego dany dokument tekstowy. Obecnie próbuję użyć bi-gramowego modelu językowego lub (N-gram) do budowy wektora cech, ale nie bardzo wiesz, jak to zrobić? Czy możemy postępować …


1
Różnica między modelami krańcowymi i warunkowymi
Marginalny wzór stanowi korelacji w każdym klastrze. Warunkowy Model uwzględnia również korelację w każdym klastrze. Moje pytania to: Czy model krańcowy modeluje główne efekty w populacji, podczas gdy model warunkowy modeluje główne efekty w klastrze i w populacji? Interpretacja współczynników modelu krańcowego jest zasadniczo taka sama jak „model regularny”. A …

3
Rozkłady klastrowe
Mam kilka rozkładów (10 rozkładów na poniższym rysunku). W rzeczywistości są to histogramy: na osi x znajduje się 70 wartości, które są wielkościami niektórych cząstek w roztworze, a dla każdej wartości x odpowiadająca wartość y jest proporcją cząstek, których wielkość jest zbliżona do wartości x. Chciałbym zgrupować te dystrybucje. Obecnie …
10 clustering 

2
Korelacja między zmienną dychotomiczną i zmienną ciągłą
Próbuję znaleźć korelację między zmienną dychotomiczną i zmienną ciągłą. Na podstawie moich prac nad tym stwierdziłem, że muszę zastosować niezależny test t, a warunkiem tego jest, aby rozkład zmiennej był normalny. Przeprowadziłem test Kołmogorowa-Smirnowa w celu przetestowania normalności i stwierdziłem, że zmienna ciągła jest nienormalna i jest wypaczona (dla około …

3
Materiał online do nauki analizy szeregów czasowych
Moje pytanie brzmi, czy są jakieś dobre materiały online do nauki tego. Coś, co dobrze wprowadza rzeczy, zwłaszcza modele ARMA i powiązana matematyka. Edycja: Szukam czegoś z wyższej klasy studiów licencjackich. Coś jak we wprowadzeniu Brockwella i Davisa do szeregów czasowych i prognoz


2
Jak pogrupować ciągi według wspólnych tematów?
Próbuję grupować, na przykład, ciągi o programowaniu z innymi ciągami o programowaniu, ciągi o fizyce z innymi ciągami o fizyce itp., Dla szerokiego zakresu tematów. Pomimo rażącego teoretycznego aspektu językowego problemu, zamierzam to zrobić za pomocą programowania / oprogramowania. Podsumowanie: Biorąc pod uwagę dużą liczbę ciągów, jak miałbym pogrupować je …




Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.