Patrzę na niektóre problemy, aw niektórych na testowanie współczynników, czasami widzę ludzi korzystających z rozkładu Studenta, a czasem widzę Rozkład normalny. Jaka jest reguła?
Używam SVM do przewidywania cukrzycy. Używam do tego zestawu danych BRFSS . Zestaw danych ma wymiary i jest przekrzywiony. Procent s w zmiennej docelowej wynosi 11 %, podczas gdy s stanowią pozostałe 89 % .432607 × 136432607×136432607 \times 136Y11 %11%11\%N89 %89%89\% Korzystam tylko 15z 136niezależnych zmiennych z zestawu danych. Jednym …
Używam pakietu randomForest w R do opracowania losowego modelu lasu w celu wyjaśnienia ciągłego wyniku w „szerokim” zestawie danych z większą liczbą predyktorów niż próbek. W szczególności dopasowuję jeden model RF, umożliwiając procedurze wybranie zestawu ~ 75 zmiennych predykcyjnych, które moim zdaniem są ważne. Testuję, jak dobrze ten model przewiduje …
Wiemy z teorii miary, że istnieją zdarzenia, których nie można zmierzyć, tj. Nie można ich zmierzyć Lebesgue'a. Co nazywamy zdarzeniem z prawdopodobieństwem, że miara prawdopodobieństwa nie jest zdefiniowana? Jakiego rodzaju oświadczenia chcielibyśmy wypowiedzieć na temat takiego zdarzenia?
Chciałbym połączyć prognozę i prognozę wsteczną (mianowicie prognozowane wartości przeszłe) zestawu danych szeregów czasowych w jeden szereg czasowy, minimalizując średni błąd przewidywania kwadratu. Powiedzmy, że mam szeregi czasowe z lat 2001–2010 z luką dla roku 2007. Byłem w stanie prognozować 2007 na podstawie danych z lat 2001–2007 (czerwona linia - …
Obliczyłem macierz korelacji zbioru danych, który zawiera 455 punktów danych, każdy punkt danych zawiera 14 charakterystyk. Zatem wymiar macierzy korelacji wynosi 14 x 14. Zastanawiałem się, czy istnieje próg wartości współczynnika korelacji, który wskazuje, że istnieje znacząca korelacja między dwiema tymi cechami. Mam wartość w zakresie od -0,2 do 0,85 …
Pracuję nad dość wieloma modelami statystycznymi, takimi jak Ukryte Modele Markowa i Modele Mieszanki Gaussa. Widzę, że szkolenie dobrych modeli w każdym z tych przypadków wymaga dużej (> 20000 zdań dla HMM) ilości danych, które są pobierane z podobnych środowisk, jak ostateczne użycie. Moje pytanie brzmi: Czy w literaturze istnieje …
Nie znam się tak dobrze na tej literaturze, więc proszę wybacz mi, jeśli jest to oczywiste pytanie. Ponieważ AIC i BIC zależą od maksymalizacji prawdopodobieństwa, wydaje się, że można ich używać jedynie do względnych porównań między zestawem modeli próbujących dopasować dany zestaw danych. Według mojego zrozumienia nie ma sensu obliczanie …
Mam szereg funkcji, z których każda rzekomo reprezentuje gęstość zmiennej losowej między agentami. Każda funkcja ma również domenę, która opisuje, jakie wartości zmiennej losowej są prawidłowe. Teraz, jeśli dobrze pamiętam klasy statystyk, jeśli wezmę całkę jednej z funkcji w wartościach opisanych przez dziedzinę funkcji, powinienem otrzymać wartość 1,0. Tak się …
Biorąc pod uwagę próbki IID z rozkładem Gaussa i estymator M, μ m = argmin a ∑ ρ ( | X i - a | ) , jakie właściwości na ρ są wystarczające do zagwarantowania prawdopodobieństwa μ m → μ ? Czy ρ jest ściśle wypukłe i ściśle rośnie?X1,...,Xn∼N(μ,σ)X1,...,Xn∼N(μ,σ)X_1,...,X_n \sim …
Wydaje się uniwersalne, że statystyki demograficzne są podawane w przeliczeniu na 100 000 ludności rocznie. Na przykład wskaźnik samobójstw, wskaźnik zabójstw, rok życia skorygowany o niepełnosprawność, lista jest długa. Dlaczego? Gdybyśmy mówili o chemii, części na milion (ppm) są powszechne. Dlaczego liczenie ludzi jest postrzegane zasadniczo inaczej. Liczba 100 000 …
Zawsze uważałem, że czas nie powinien być wykorzystywany jako predyktor w regresjach (w tym gam), ponieważ wtedy po prostu „opisałby” sam trend. Jeśli celem badań jest znalezienie parametrów środowiskowych, takich jak temperatura itp., Które wyjaśniają wariancję, powiedzmy, aktywności zwierzęcia, to zastanawiam się, w jaki sposób można wykorzystać czas? jako proxy …
Chcę przetwarzać automatycznie segmentowane obrazy mikroskopowe w celu wykrycia wadliwych obrazów i / lub wadliwych segmentacji w ramach wysokowydajnego potoku obrazowania. Istnieje wiele parametrów, które można obliczyć dla każdego surowego obrazu i segmentacji, i które stają się „ekstremalne”, gdy obraz jest wadliwy. Na przykład bąbelek na obrazie spowoduje anomalie, takie …
Mam trzy zestawy danych szeregów czasowych, które chcę porównać. Zostały one pobrane na 3 osobne okresy około 12 dni. Są to średnie, maksymalne i minimalne liczby głów zebrane w bibliotece uniwersyteckiej podczas tygodni finałowych. Musiałem podać średnie, maksymalne i minimalne, ponieważ godzinowe zliczanie głowic nie było ciągłe (patrz Regularne luki …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.