Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Dlaczego miałbyś przewidywać na podstawie modelu efektu mieszanego bez uwzględnienia efektów losowych dla prognozy?
Jest to bardziej pytanie koncepcyjne, ale w miarę używania Rbędę odwoływał się do pakietów w R. Jeśli celem jest dopasowanie modelu liniowego do celów przewidywania, a następnie dokonanie prognoz, w których efekty losowe mogą być niedostępne, czy jest jakaś korzyść ze stosowania modelu efektów mieszanych, czy zamiast tego należy zastosować …


1
K-oznacza: ile iteracji w sytuacjach praktycznych?
Nie mam doświadczenia w branży eksploracji danych ani dużych zbiorów danych, więc chciałbym usłyszeć, jak dzielisz się doświadczeniami. Czy ludzie faktycznie używają k-średnich, PAM, CLARA itp. Na naprawdę dużym zbiorze danych? Czy po prostu losowo wybierają z niego próbkę? Jeśli po prostu pobiorą próbkę zestawu danych, czy wynik byłby wiarygodny, …


3
Funkcja straty dla segmentacji semantycznej
Przeprasza za niewłaściwe użycie terminów technicznych. Pracuję nad projektem segmentacji semantycznej za pośrednictwem splotowych sieci neuronowych (CNN); próbuje zaimplementować architekturę typu Enkoder-Dekoder, dlatego wyjście ma ten sam rozmiar co wejście. Jak projektujesz etykiety? Jaką funkcję utraty należy zastosować? Zwłaszcza w sytuacji dużej nierównowagi klas (ale stosunek między klasami jest zmienny …

2
Skorygowany wskaźnik Rand a skorygowane informacje wzajemne
Usiłuję ocenić wydajność klastrowania. Czytałem dokumentację skiscit-learn dotyczącą metryk . Nie rozumiem różnicy między ARI a AMI. Wydaje mi się, że robią to samo na dwa różne sposoby. Cytowanie z dokumentacji: Biorąc pod uwagę znajomość podstawowych przypisań do klasy prawdy label_true i nasz algorytm grupowania tych samych próbek label_pred, skorygowany …


1
Nazewnictwo lewej i prawej strony w modelach regresji
y=β0+β1x1+ε0y=β0+β1x1+ε0y = \beta_{0} + \beta_{1}x_{1} + \varepsilon_{0} Język opisujący modele regresji, taki jak bardzo prosta regresja liniowa opisana powyżej, często się różni i takie zmiany często niosą subtelne zmiany znaczeń. Na przykład część modelu po lewej stronie równania można nazwać (między innymi jestem tego nieświadomy), używając konotacji i denotacji w …

2
Twierdzenie o granicy centralnej dla łańcuchów Markowa
\newcommand{\E}{\mathbb{E}}\newcommand{\P}{\mathbb{P}} The Central Limit Theorem (CLT) stwierdza, że ​​dla niezależne i identycznie rozmieszczone (iid) z i nazwa , suma zbiega się do rozkładu normalnego jako : X1,X2,…X1,X2,…X_1,X_2,\dotsE[Xi]=0E[Xi]=0\E[X_i]=0Var(Xi)&lt;∞Var⁡(Xi)&lt;∞\operatorname{ Var} (X_i)<\inftyn→∞n→∞n\to\infty∑i=1nXi→N(0,n−−√).∑i=1nXi→N(0,n). \sum_{i=1}^n X_i \to N\left(0, \sqrt{n}\right). Załóżmy zamiast tego, że tworzą łańcuch Markowa w stanie skończonym ze stacjonarnym rozkładem z oczekiwaniem 0 …

1
RNN z L2 Regulararyzacja przestaje się uczyć
Korzystam z dwukierunkowego RNN, aby wykryć zdarzenie niezrównoważonego wystąpienia. Klasa dodatnia jest 100 razy rzadziej niż klasa negatywna. Chociaż nie używa się regularyzacji, mogę uzyskać 100% dokładności na zestawie pociągów i 30% na zestawie walidacji. Włączam regularyzację l2, a wynik to tylko 30% dokładności na zestawie pociągów zamiast dłuższego uczenia …



4
Najlepszy sposób na wysianie N niezależnych generatorów liczb losowych od 1 wartości
W moim programie muszę uruchomić N osobnych wątków, każdy z własnym RNG, który służy do próbkowania dużego zestawu danych. Muszę być w stanie zaszczepić cały ten proces jedną wartością, aby móc odtwarzać wyniki. Czy wystarczy po prostu sekwencyjnie zwiększać ziarno dla każdego indeksu? Obecnie używam numpytych, RandomStatektóre korzystają z generatora …

2
Częstotliwościowa definicja prawdopodobieństwa; czy istnieje formalna definicja?
Czy istnieje jakakolwiek formalna (matematyczna) definicja tego, co osoby często oceniające rozumieją pod „prawdopodobieństwem”? Czytam, że jest to względna częstotliwość występowania „na dłuższą metę”, ale czy istnieje jakiś formalny sposób jej zdefiniowania? Czy są jakieś znane odniesienia, w których mogę znaleźć tę definicję? EDYTOWAĆ: Z częstym (patrz komentarz @whuber i …

2
Testowanie założenia proporcjonalnych zagrożeń w modelach parametrycznych
Jestem świadomy testowania założenia proporcjonalnych zagrożeń w kontekście modeli PH Coxa, ale nie spotkałem się z niczym związanym z modelami parametrycznymi? Czy istnieje realny sposób przetestowania założenia PH dla niektórych modeli parametrycznych? Wydaje się, że należy podać, że modele parametryczne różnią się tylko nieznacznie od półparametrycznych modeli Coxa? Na przykład, …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.