Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Próg ukrytego modelu Markowa
Opracowałem system sprawdzania koncepcji rozpoznawania dźwięku za pomocą modeli mfcc i ukrytych marek. Daje obiecujące wyniki, gdy testuję system na znanych dźwiękach. Chociaż system, gdy wprowadzany jest nieznany dźwięk, zwraca wynik z najbliższym dopasowaniem, a wynik nie jest tak wyraźny, aby go wymyślić, jest to dźwięk nieznany, np .: Wytrenowałem …


2
Czy odrzucasz hipotezę zerową, gdy
Jest to oczywiście kwestia definicji lub konwencji i praktycznie nie ma praktycznego znaczenia. Jeśli jest ustawiona na tradycyjną wartość 0,05, to czy wartość 0,0500000000000 ... jest uważana za statystycznie znaczącą, czy nie? Czy reguła definiująca istotność statystyczną jest zwykle uważana za lub ??p p &lt; α p ≤ ααα\alphapppp&lt;αp&lt;αp < …

1
Podział wariancji i zmiany wzdłużne w korelacji z danymi binarnymi
Analizuję dane dotyczące 300 000 uczniów w 175 szkołach za pomocą logistycznego liniowego modelu efektów mieszanych (przechwytywanie losowe). Każdy uczeń występuje dokładnie raz, a dane obejmują 6 lat. Jak podzielić wariancję między poziom szkoły i ucznia, w sposób podobny do VPC / ICC, aby uzyskać ciągłe wyniki? Widziałem ten artykuł, …

1
Jakie są różne rodzaje kodowania dostępne dla zmiennych kategorialnych (w R) i kiedy ich użyjesz?
Jeśli dopasujesz model liniowy lub mieszany, dostępne są różne typy kodowania, aby przekształcić zmienną kategorialną lub nominalną w szereg zmiennych, dla których szacowane są parametry, takie jak atrapa warunkowa (domyślnie R) i kodowanie efektów. Słyszałem, że kodowanie efektów (czasami nazywane kodowaniem dewiacyjnym lub kontrastowym) jest preferowane, gdy masz interakcje, ale …

3
Modele tematyczne dla krótkich dokumentów
Zainspirowany tym pytaniem zastanawiam się, czy nie wykonano żadnej pracy nad modelami tematycznymi dla dużych kolekcji niezwykle krótkich tekstów. Moją intuicją jest to, że Twitter powinien być naturalną inspiracją dla takich modeli. Jednak z niektórych ograniczonych eksperymentów wygląda na to, że standardowe modele tematyczne (LDA itp.) Działają dość słabo na …


5
Interpretowanie rozbieżności między R i SPSS z eksploracyjną analizą czynnikową
Jestem absolwentem informatyki. Przeprowadziłem eksploracyjną analizę czynników dla projektu badawczego. Moi koledzy (którzy prowadzą projekt) używają SPSS, podczas gdy ja wolę używać R. To nie miało znaczenia, dopóki nie odkryliśmy dużej rozbieżności między dwoma pakietami statystycznymi. Używamy faktoringu osi głównej jako metody ekstrakcji (pamiętaj, że jestem świadomy różnicy między PCA …

3
Dynamiczne systemy rekomendujące
Recommender system będzie mierzyć korelację między ocenie różnych użytkowników i zaleceń dochodowości dla danego użytkownika na temat elementów, które mogą być interesujące dla niego. Jednak gusta zmieniają się z czasem, więc stare oceny mogą nie odzwierciedlać obecnych preferencji i odwrotnie. Być może kiedyś umieściłeś „doskonałą” w książce, którą teraz oceniasz …

2
Radzenie sobie ze zbiorami danych o zmiennej liczbie funkcji
Jakie są metody klasyfikacji danych o zmiennej liczbie funkcji? Jako przykład rozważmy problem, w którym każdy punkt danych jest wektorem punktów xiy, a my nie mamy takiej samej liczby punktów dla każdej instancji. Czy możemy traktować każdą parę punktów xiy jako cechę? A może powinniśmy w jakiś sposób podsumować punkty, …

2
Pytanie o regresję logistyczną
Chcę uruchomić binarną regresję logistyczną, aby modelować obecność lub brak konfliktu (zmienna zależna) z zestawu zmiennych niezależnych w okresie 10 lat (1997-2006), przy czym każdego roku ma 107 obserwacji. Moi niezależni to: degradacja gruntów (kategoryczna dla 2 rodzajów degradacji); wzrost populacji (0 - nie; 1 - tak); typ źródła utrzymania …


1
Dlaczego powinniśmy omawiać zachowania konwergencji różnych estymatorów w różnych topologiach?
W pierwszym rozdziale książki Geometria algebraiczna i statystyczna teoria uczenia się, która mówi o zbieżności oszacowań w różnych przestrzeniach funkcjonalnych, wspomina, że ​​oszacowanie Bayesa odpowiada topologii rozkładu Schwartza, podczas gdy oszacowanie maksymalnego prawdopodobieństwa odpowiada topologii ponadnormatywnej (na stronie 7): Na przykład, sup normą, LpLpL^p -norm słaby Topologia Hilberta , topologia …

2
Kodowanie funkcji jakościowych do liczb w celu uczenia maszynowego
Wiele algorytmów uczenia maszynowego, na przykład sieci neuronowe, oczekuje obsługi liczb. Tak więc, jeśli masz dane kategoryczne, musisz je przekonwertować. Przez kategoryczne rozumiem na przykład: Marki samochodów: Audi, BMW, Chevrolet ... ID użytkownika: 1, 25, 26, 28 ... Mimo że identyfikatory użytkowników są liczbami, są tylko etykietami i nie oznaczają …

1
Ograniczona funkcja generowania momentu
To pytanie wynika z zadanego tutaj pytania na temat funkcji generowania momentu związanego (MGF). Załóżmy, że XXX jest ograniczoną losową zmienną o zerowej średniej przyjmującą wartości w i niech będzie jej MGF. Z granicy użytej w dowodzie nierówności Hoeffdinga mamy gdzie prawa strona jest rozpoznawalna jako MGF zerowej średniej normalnej …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.