Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Znajdowanie najlepszych funkcji w modelach interakcji
Mam listę białek z ich wartościami funkcji. Przykładowa tabela wygląda następująco: ...............Feature1...Feature2...Feature3...Feature4 Protein1 Protein2 Protein3 Protein4 Rzędy to białka, a kolumny to cechy. Mam również listę białek, które również wchodzą w interakcje; na przykład Protein3, Protein4 Protein1, Protein2 Protein4, Protein1 Problem : W celu wstępnej analizy chcę wiedzieć, które cechy …

2
Problem z e1071 libsvm?
Mam zestaw danych z dwiema nakładającymi się klasami, po siedem punktów w każdej klasie, punkty są w przestrzeni dwuwymiarowej. W R i biegnę svmz e1071pakietu, aby zbudować oddzielną hiperpłaszczyznę dla tych klas. Używam następującego polecenia: svm(x, y, scale = FALSE, type = 'C-classification', kernel = 'linear', cost = 50000) gdzie …

1
Sekwencja Haltona vs sekwencja Sobola?
Z odpowiedzi z poprzedniego pytania skierowano mnie w stronę sekwencji Haltona, aby stworzyć zestaw wektorów, które pokrywają równomiernie jednolitą przestrzeń próbki. Ale strona wikipedia wspomina, że ​​przede wszystkim wyższe liczby pierwsze są często silnie skorelowane na początku serii. Wydaje się, że dzieje się tak w przypadku każdej pary wysokich liczb …

2
Dlaczego funkcje pochodne są używane w sieciach neuronowych?
Na przykład chce się przewidzieć ceny domu i mieć dwie cechy wejściowe: długość i szerokość domu. Czasami jeden zawiera również „wielowymiarowe” funkcje wprowadzania, takie jak obszar, który ma długość * szerokość. 1) Po co uwzględniać funkcje pochodne? Czy sieć neuronowa nie powinna nauczyć się związku między długością, szerokością i ceną …


2
Prognozowanie regresji kwantowej
Jestem zainteresowany wykorzystaniem regresji kwantylowej dla niektórych moich modeli, ale chciałbym uzyskać wyjaśnienia na temat tego, co mogę osiągnąć przy użyciu tej metodologii. Rozumiem mogę uzyskać bardziej solidną analizę IV / DV relacji , zwłaszcza w obliczu skrajnych i heteroskedastyczności, ale w moim przypadku nacisk kładziony jest na przewidywania. W …



4
Sidak czy Bonferroni?
Używam uogólnionego modelu liniowego w SPSS, aby spojrzeć na różnice w średniej liczbie gąsienic (nienormalne, przy zastosowaniu rozkładu Tweediego) na 16 różnych gatunkach roślin. Chcę przeprowadzić wiele porównań, ale nie jestem pewien, czy powinienem użyć testu korekcji Sidaka lub Bonferroniego. Jaka jest różnica między tymi dwoma testami? Czy jedno jest …



5
lme4 lub inny kod pakietu open source R równoważny asreml-R
Chcę dopasować model mieszany za pomocą pakietu lme4, nme, pakietu regresji baysian lub dowolnego dostępnego. Model mieszany w konwencjach kodowania Asreml-R zanim przejdziemy do szczegółów, możemy chcieć uzyskać szczegółowe informacje na temat konwencji asreml-R dla tych, którzy nie znają kodów ASREML. y = Xτ + Zu + e ........................(1) ; …
13 r 



2
Radzenie sobie z wielokoliniowością
Nauczyłem się, że stosując vif()metodę carpakietu, możemy obliczyć stopień wielokoliniowości danych wejściowych w modelu. Z wikipedii , jeśli vifwartość jest większa niż 5wtedy, możemy uznać, że dane wejściowe cierpią z powodu problemu wielokoliniowości. Na przykład opracowałem model regresji liniowej przy użyciu lm()metody i vif()daje on następujące wyniki. Jak widzimy, wejścia …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.