Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


4
Zbadaj istotną różnicę w stosunkach normalnie rozłożonych zmiennych losowych
Związane z analizowaniem stosunków zmiennych i jak sparametryzować stosunek dwóch normalnie rozłożonych zmiennych lub odwrotność jednej? . Załóżmy, że mam szereg próbek z czterech różnych ciągłych rozkładów losowych, z których wszystkie możemy założyć, że są w przybliżeniu normalne. W moim przypadku odpowiadają one niektórym miernikom wydajności dwóch różnych systemów plików …

2
Model proporcjonalnego hazardu Coxa i losowo wybrana próbka
Czy istnieją metody korygowania błędu systematycznego w modelu proporcjonalnego hazardu Coxa spowodowanego przez losowo wybraną próbkę (coś w rodzaju korekty Heckmana)? Tło : Załóżmy, że sytuacja wygląda następująco: - W ciągu pierwszych dwóch lat wszyscy klienci są przyjmowani. - Po tych dwóch latach budowany jest model Cox PH. Model przewiduje, …
9 bias  cox-model 

4
Jak radzić sobie z lukami / danymi NaN w danych szeregów czasowych, gdy używasz Matlaba do autokorelacji i sieci neuronowych?
Mam szereg czasowy pomiarów (wysokości-jednowymiarowy szereg). W okresie obserwacji proces pomiaru spadł o kilka punktów czasowych. Tak więc dane wynikowe są wektorem z NaN, w których występują luki w danych. Korzystanie z MATLAB-a powoduje mi problem podczas obliczania autokorelacji ( autocorr) i stosowania sieci neuronowych ( nnstart). Jak należy sobie …

4
Najbardziej wydajne zamówienie do nauki LaTeX, Sweave, Beamer? [Zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 3 lata temu . Jestem bardzo zainteresowany nauczeniem się, jak tworzyć powtarzające się raporty z mojego kodu R i wizualizacji ggplot2. Rozumiem, że LaTeX wydaje …
9 r 

3
Przyjmowanie korelacji przed lub po transformacji logarytmicznej zmiennych
Czy istnieje ogólna zasada określająca, czy należy obliczyć korelację Pearsona dla dwóch zmiennych losowych X i Y przed podjęciem ich transformacji logicznej, czy po niej? Czy istnieje procedura sprawdzania, która jest bardziej odpowiednia? Dają podobne, ale różne wartości, ponieważ transformacja logarytmiczna jest nieliniowa. Czy zależy to od tego, czy X …

7
Poszukuję sztucznych danych 2D w celu wykazania właściwości algorytmów klastrowania
Szukam zestawów danych 2-wymiarowych punktów danych (każdy punkt danych jest wektorem dwóch wartości (x, y)) o różnych rozkładach i formach. Pomocny byłby również kod do generowania takich danych. Chcę ich użyć do wykreślenia / wizualizacji działania niektórych algorytmów klastrowych. Oto kilka przykładów: gwiazda jak dane w chmurze cztery klastry, jedna …

1
Tworzenie modelu maksymalnej entropii Markowa na podstawie istniejącego klasyfikatora maksymalnego entropii z wieloma wejściami
Intryguje mnie koncepcja modelu Maksymalnej Entropii Markowa (MEMM) i zastanawiam się nad użyciem go do taggera części mowy (POS). W tej chwili używam konwencjonalnego klasyfikatora Maximum Entropy (ME) do oznaczania każdego słowa. Wykorzystuje szereg funkcji, w tym dwa poprzednie tagi. MEMM używają algorytmu Viterbi do znalezienia optymalnej ścieżki w łańcuchu …

1
Filtr cząstek stałych w R - przykład trywialnego kodu
Szukam prostego przykładu kodu, w jaki sposób uruchomić filtr cząstek w R. Wydaje się, że pakiet pomp obsługuje bit matematyki w przestrzeni stanów, ale przykłady są nieco trudne do zaprogramowania dla prostego programisty OO, takiego jak ja, szczególnie jak załadować obserwowane dane do obiektu typu pomp. Przykłady tutaj: http://cran.r-project.org/web/packages/pomp/vignettes/intro_to_pomp.pdf Powiedzmy, …
9 r 

4
Zmniejszenie liczby zmiennych w regresji wielokrotnej
Mam duży zestaw danych składający się z wartości kilkuset zmiennych finansowych, które można by zastosować w regresji wielokrotnej do przewidywania zachowania funduszu indeksowego w czasie. Chciałbym zmniejszyć liczbę zmiennych do około dziesięciu, jednocześnie zachowując jak największą moc predykcyjną. Dodano: Zredukowany zestaw zmiennych musi być podzbiorem oryginalnego zestawu zmiennych, aby zachować …

1
Jak obliczyć miarę dokładności na podstawie RMSE? Czy mój duży zestaw danych jest zwykle dystrybuowany?
Mam kilka zestawów danych rzędu tysięcy punktów. Wartości w każdym zestawie danych to X, Y, Z odnoszące się do współrzędnej w przestrzeni. Wartość Z reprezentuje różnicę wysokości w parze współrzędnych (x, y). Zazwyczaj w moim polu GIS błąd wysokości jest odniesiony w RMSE poprzez odjęcie punktu prawdziwości podłoża do punktu …

1
Jaka jest różnica między GLM a GEE?
Jaka jest różnica między modelem GLM (regresja logistyczna) ze zmienną odpowiedzi binarnej, która obejmuje podmiot i czas jako współzmienne, a analogicznym modelem GEE, który uwzględnia korelację między pomiarami w wielu punktach czasowych? Mój GLM wygląda następująco: Y(binary) ~ A + B1X1(subject id) + B2X2(time) + B3X3(interesting continuous covariate) z funkcją …

1
Uwzględnianie parametrów dyskretnych lub binarnych w kryterium informacji bayesowskiej
BIC penalizuje na podstawie liczby parametrów. Co jeśli niektóre parametry są jakimś rodzajem zmiennych binarnych? Czy liczą się one jako pełne parametry? Ale można połączyć parametry binarnych na jednej dyskretnej zmiennej przyjąć wartość w . Czy należy je liczyć jako parametrów czy jeden parametr?mmm{0,1,...,2m−1}{0,1,...,2m−1}\{0,1,...,2^m-1\}mmm

1
Jak uczciwie określić zwycięzców regionalnych targów nauki?
Potrzebuję pomocy w znalezieniu właściwego sposobu obliczania zwycięzców na naszych targach naukowych. Nie chcę, aby moja nieznajomość statystyki i matematyki przeszkadzała dziecku w wygrywaniu. (w grę wchodzi wiele świadczeń stypendialnych i awansowych). Z góry dziękuje za twoją pomoc. Najpierw małe tło tego, jak konfigurujemy rzeczy: Nasze targi zazwyczaj obejmują około …

1
Różny wykres prognostyczny od przeżycia coxph i rms cph
Stworzyłem własną, nieco ulepszoną wersję termplotu, której używam w tym przykładzie. Znajdziesz ją tutaj . Wcześniej pisałem na SO, ale im więcej o tym myślę, uważam, że to prawdopodobnie bardziej dotyczy interpretacji modelu proporcjonalnych zagrożeń Coxa niż faktycznego kodowania. Problem Kiedy patrzę na wykres współczynnika ryzyka, spodziewam się, że będę …
9 r  survival  cox-model 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.