Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Czy ktoś może wyjaśnić dynamiczne dopasowanie czasu w celu ustalenia podobieństwa szeregów czasowych?
Próbuję uchwycić dynamiczny środek dopasowania czasu do porównywania szeregów czasowych razem. Mam trzy zestawy danych szeregów czasowych takie jak to: T1 <- structure(c(0.000213652387565, 0.000535045478866, 0, 0, 0.000219346347883, 0.000359669104424, 0.000269469145783, 0.00016051364366, 0.000181950509461, 0.000385579332948, 0.00078170803205, 0.000747244535774, 0, 0.000622858922454, 0.000689084895259, 0.000487983408564, 0.000224744353298, 0.000416449765747, 0.000308388157895, 0.000198906016907, 0.000179549331179, 9.06289650172e-05, 0.000253506844685, 0.000582896161212, 0.000386473429952, 0.000179839942451, 0, 0.000275608635737, …

1
Biblioteka ograniczonej optymalizacji dla ograniczeń równości i nierówności
Jakieś zalecenia dotyczące wyboru ograniczonej biblioteki optymalizacji odpowiedniej dla mojej funkcji optymalizacji? Minimalizuję ai) funkcję nieliniową z liniowymi ograniczeniami równości i nierówności, oraz ii) mam dostępny gradient i hessian funkcji. Jeśli to pomaga, funkcja, którą minimalizuję, to dywergencja Kullbacka-Lieblera . constrOptim zajmuje się tylko ograniczeniami nierówności. Quadprog radzi sobie z …

5
Jak dopasować rozkład Weibulla do danych wejściowych zawierających zera?
Próbuję odtworzyć istniejący algorytm prognozowania, przekazany przez emerytowanego badacza. Pierwszym krokiem jest dopasowanie niektórych obserwowanych danych do rozkładu Weibulla, aby uzyskać kształt i skalę, które zostaną wykorzystane do przewidywania przyszłych wartości. Używam do tego R. Oto przykład mojego kodu: x<-c(23,19,37,38,40,36,172,48,113,90,54,104,90,54,157,51,77,78,144,34,29,45,16,15,37,218,170,44,121) f<-fitdistr(x, 'weibull') Działa to dobrze, chyba że w tablicy wejściowej …

2
W jaki sposób ARMA / ARIMA jest związana z modelowaniem efektów mieszanych?
W analizie danych panelowych wykorzystałem modele wielopoziomowe z efektami losowymi / mieszanymi, aby poradzić sobie z problemami autokorelacji (tj. Obserwacje są skupione w obrębie poszczególnych osób w czasie) z innymi parametrami dodanymi w celu dostosowania do niektórych specyfikacji czasu i szoków zainteresowania . Wydaje się, że ARMA / ARIMA ma …


3
Co oznacza skrócona dystrybucja?
W artykule badawczym na temat analizy wrażliwości modelu równania różniczkowego zwyczajnego układu dynamicznego autor podał rozkład parametru modelu jako Rozkład normalny (średnia = 1e-4, std = 3e-5) obcięty do zakresu [0,5e -4 1,5e-4]. Następnie wykorzystuje próbki z tego obciętego rozkładu do symulacji modelu. Co to znaczy mieć obcięty rozkład i …

1
Czy przy nadmiernym / niedostatecznym próbkowaniu niesymetrycznych klas maksymalizacja dokładności różni się od minimalizacji kosztów błędnej klasyfikacji?
Przede wszystkim chciałbym opisać niektóre popularne układy używane w książkach Data Mining, wyjaśniając, jak radzić sobie z niezrównoważonymi zestawami danych . Zwykle główna sekcja nosi nazwę Niezrównoważone zestawy danych i obejmują te dwie podsekcje: Klasyfikacja wrażliwa na koszty i Techniki pobierania próbek. Wydaje się, że w obliczu problemu z rzadką …

4
Jak przetrawić kontekst statystyczny?
Po pierwsze, przypuszczam, że nie wszyscy aktywni członkowie tej interesującej strony są statystykami. W przeciwnym razie pytanie zadane w następujący sposób nie ma sensu! Oczywiście ich szanuję, ale potrzebuję wyjaśnienia, które jest bardziej praktyczne niż koncepcyjne. Zacznę od przykładu z Wikipedii, aby zdefiniować point process: Niech S będzie lokalnie kompaktową …

8
Jakie są „gorące algorytmy” uczenia maszynowego?
To naiwne pytanie kogoś, kto zaczyna uczyć się uczenia maszynowego. Czytam dziś książkę „Machine Learning: algorytmiczna perspektywa” z Marsland. Uważam, że jest przydatna jako książka wprowadzająca, ale teraz chciałbym przejść do zaawansowanych algorytmów, które dają obecnie najlepsze wyniki. Najbardziej interesuje mnie bioinformatyka: grupowanie sieci biologicznych i znajdowanie wzorców w sekwencjach …


3
Jak korzystać z funkcji testu Levene'a w R?
Jestem nowicjuszem w statystyce i R i mam problem z używaniem funkcji Levene'a (chciałbym sprawdzić równość wariancji dwóch próbek). Dokumentacja mówi, że powinienem uruchomić: levene.test (y, grupa) Ale nie mam pojęcia, co powinienem umieścić jako y i grupę? Mam dwie różne próbki, z których chciałbym sprawdzić równość wariancji. Czy powinienem …

2
Czy istnieją różnice w bayesowskim i częstym podejściu do EDA?
Mówiąc najprościej: czy są jakieś różnice w podejściu Bayesa i Frequentist do analizy danych eksploracyjnych? Nie znam żadnych nieodłącznych uprzedzeń w metodach EDA, ponieważ histogram jest histogramem, wykres rozrzutu jest wykresem rozrzutu itp., Ani nie znalazłem przykładów różnic w sposobie nauczania lub prezentacji EDA (ignorując szczególnie teoretyczny artykuł A. Gelmana) …

1
Interpretowanie odległości od hiperpłaszczyzny w SVM
Mam kilka wątpliwości co do intuicyjnego zrozumienia SVM. Załóżmy, że przeszkoliliśmy model SVM do klasyfikacji przy użyciu standardowych narzędzi, takich jak SVMLight lub LibSVM. Kiedy używamy tego modelu do przewidywania danych testowych, model generuje plik mający wartości „alfa” dla każdego punktu testowego. Jeśli wartość alfa jest dodatnia, punkt testowy należy …


3
Jak skalować wykresy skrzypiec do porównań?
Próbuję rysować wykresy skrzypcowe i zastanawiam się, czy istnieje sprawdzona najlepsza praktyka skalowania ich między grupami. Oto trzy opcje, które wypróbowałem przy użyciu mtcarszestawu danych R (Motor Trend Cars z 1973 roku, tutaj ). Równe szerokości Wygląda na to, co robi oryginalny papier * i co vioplotrobi R ( przykład …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.