Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Obsługa nieznanych słów w zadaniach modelowania języka za pomocą LSTM
W przypadku zadania przetwarzania języka naturalnego (NLP) często wykorzystuje się wektory word2vec jako osadzenie słów. Jednak może istnieć wiele nieznanych słów, które nie są przechwytywane przez wektory word2vec po prostu dlatego, że słowa te nie są wystarczająco często widoczne w danych szkoleniowych (wiele implementacji używa minimalnej liczby przed dodaniem słowa …



4
Jak wizualizować niezależny test t dwóch próbek?
Jakie są najbardziej akceptowane sposoby wizualizacji wyników niezależnego testu t dla dwóch próbek? Czy częściej używana jest tablica numeryczna czy jakiś wykres? Celem jest, aby przypadkowy obserwator spojrzał na postać i od razu zobaczył, że prawdopodobnie pochodzą z dwóch różnych populacji.

1
Pytanie o odejmowanie średniej w zestawie pociąg / ważny / testowy
Robię wstępne przetwarzanie danych i zamierzam później zbudować Convonets na moich danych. Moje pytanie brzmi: Powiedzmy, że mam całkowitą liczbę zestawów danych ze 100 obrazami, obliczałem średnią dla każdego ze 100 obrazów, a następnie odejmowałem je od każdego z obrazów, a następnie dzieliłem to na ciąg i zestaw sprawdzania poprawności, …

2
Bezstronny estymator dla modelu AR ( )
Rozważ model AR ( ) (zakładając zero dla uproszczenia):ppp xt=φ1xt−1+…+φpxt−p+εtxt=φ1xt−1+…+φpxt−p+εt x_t = \varphi_1 x_{t-1} + \dotsc + \varphi_p x_{t-p} + \varepsilon_t Oszacowano, że estymator OLS (równoważny estymatorowi warunkowego maksymalnego prawdopodobieństwa) dla jest tendencyjny, jak zauważono w ostatnim wątku .φ:=(φ1,…,φp)φ:=(φ1,…,φp)\mathbf{\varphi} := (\varphi_1,\dotsc,\varphi_p) (Co ciekawe, nie mogę znaleźć nastawienie mowa w Hamilton …

1
Jak interpretować współczynnik drugiego stopnia w regresji zmiennych instrumentalnych za pomocą instrumentu binarnego i binarnej zmiennej endogennej?
(dość długi post, przepraszam. Zawiera wiele podstawowych informacji, więc możesz przejść do pytania na dole). Wprowadzenie: Pracuję nad projektem, w którym próbujemy zidentyfikować wpływ binarnej zmiennej endogennej na ciągły wynik, . Stworzyliśmy instrument , który naszym zdaniem jest przypisany losowo.x1x1x_1yyyz1z1z_1 Dane: Same dane są w strukturze panelu z około 34 …

4
Kiedy stosować zejście gradientu vs Monte Carlo jako technikę numerycznej optymalizacji
Gdy zestawu równań nie można rozwiązać analitycznie, możemy zastosować algorytm spadku gradientu. Wydaje się jednak, że istnieje również metoda symulacji Monte Carlo, która może być wykorzystana do rozwiązania problemów, które nie mają rozwiązań analitycznych. Jak powiedzieć, kiedy należy korzystać z opadania gradientu, a kiedy Monte Carlo? A może po prostu …

2
Jaki jest rozkład dla maksimum (minimum) dwóch niezależnych normalnych zmiennych losowych?
Załóżmy konkretnie XXX i YYYsą normalnymi zmiennymi losowymi (niezależne, ale niekoniecznie identycznie rozmieszczone). Biorąc pod uwagę dowolnyaaa, czy istnieje fajna formuła dla P(max(X,Y)≤x)P(max(X,Y)≤x)P(\max(X,Y)\leq x)lub podobne koncepcje? Czy wiemy, że max(X,Y)max(X,Y)\max(X,Y) jest normalnie rozkładane, może wzór na średnią i odchylenie standardowe w kategoriach tych dla XXX i YYY ? Sprawdziłem zwykłe …

2
Grupowanie bardzo wypaczonych, zliczanie danych: jakieś sugestie (transformacja itp.)?
Podstawowy problem Oto mój podstawowy problem: próbuję zgrupować zestaw danych zawierający niektóre bardzo wypaczone zmienne z licznikami. Zmienne zawierają wiele zer i dlatego nie są zbyt pouczające dla mojej procedury klastrowania - która prawdopodobnie jest algorytmem k-średnich. Dobra, mówisz, po prostu przekształć zmienne za pomocą pierwiastka kwadratowego, pola Coxa lub …

1
Który test do analizy krzyżowej: Boschloo czy Barnard?
Analizuję tabelę 2x2 z małego zestawu danych 30 pacjentów. Próbujemy retrospektywnie znaleźć pewne zmienne, które podpowiadają, jaki rodzaj leczenia wybrać. Zmienne (obs normalne / dziwne) i decyzja dotycząca leczenia (A / B) są szczególnie interesujące i dlatego dane wyglądają tak: Obs / Tr. GrudnianormalnadziwneZA12012b1351825530Obs/Tr. Dec.ABnormal121325strange055121830\begin{array} {|r|r|r|r|} \hline \text{Obs/Tr. Dec.} &\text{A} …

1
Estymator maksymalnego prawdopodobieństwa dla ujemnego rozkładu dwumianowego
Pytanie jest następujące: Losowa próbka n wartości jest pobierana z ujemnego rozkładu dwumianowego o parametrze k = 3. Znajdź estymator największego prawdopodobieństwa parametru π. Znajdź asymptotyczną formułę błędu standardowego tego estymatora. Wyjaśnij, dlaczego ujemny rozkład dwumianowy będzie w przybliżeniu normalny, jeśli parametr k jest wystarczająco duży. Jakie są parametry tego …

3
Jak radzić sobie z ostrzeżeniem „non-integer” z ujemnego dwumianowego GLM?
Staram się modelować średnie intensywności pasożytów atakujących gospodarza w R przy użyciu ujemnego modelu dwumianowego. Ciągle otrzymuję 50 lub więcej ostrzeżeń, które mówią: In dpois(y, mu, log = TRUE) : non-integer x = 251.529000 Jak sobie z tym poradzić? Mój kod wygląda następująco: mst.nb = glm.nb(Larvae+Nymphs+Adults~B.type+Month+Season, data=MI.df)

2
Metoda Różnicy w Różnicy: jak sprawdzić, czy istnieje wspólny trend między grupą leczenia a grupą kontrolną?
Po komentarzu z poprzedniego wątku chcę wiedzieć, w jaki sposób można przetestować założenie o wspólnej tendencji między grupą leczoną i kontrolną w metodzie Różnica w Różnicy? Czy mogę przetestować to założenie na podstawie danych z dwóch punktów czasowych (na przykład badanie podstawowe w 2002 r., Leczenie odbywa się w latach …

4
Przekleństwo wymiarowości: klasyfikator kNN
Czytam książkę Kevina Murphy'ego: Machine Learning - A probabilistic Perspective. W pierwszym rozdziale autor wyjaśnia przekleństwo wymiarowości i jest część, której nie rozumiem. Jako przykład autor stwierdza: Zastanów się, czy dane wejściowe są równomiernie rozmieszczone wzdłuż sześcianu jednostki D-wymiarowej. Załóżmy, że szacujemy gęstość etykiet klas, powiększając hiper sześcian wokół x, …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.