Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Czy istnieje wiarygodny nieparametryczny przedział ufności dla średniej przekrzywionego rozkładu?
Bardzo wypaczone rozkłady, takie jak log-normal, nie dają dokładnych przedziałów ufności ładowania. Oto przykład pokazujący, że lewy i prawy obszar ogona są dalekie od idealnego 0,025 bez względu na to, jaką metodę ładowania początkowego wypróbujesz w R: require(boot) n <- 25 B <- 1000 nsim <- 1000 set.seed(1) which <- …

2
Uczenie nadzorowane, uczenie się bez nadzoru i uczenie się wzmacniające: podstawy przepływu pracy
Nadzorowana nauka 1) Ludzka tworzy klasyfikator oparty na wejściowych i wyjściowych danych 2) Ten klasyfikator jest szkolony przy użyciu zestawu danych szkoleniowych 3) Ten klasyfikator jest testowany z testowym zestawem danych 4) Wdrożenie, jeśli wynik jest zadowalający Do użycia, gdy: „Wiem, jak klasyfikować te dane, potrzebuję tylko ciebie (klasyfikatora), aby …

3
Jaka jest podstawowa przyczyna problemu braku równowagi klas?
Ostatnio dużo myślałem o „problemie nierównowagi klas” w uczeniu maszynowym / statystycznym i coraz głębiej odczuwam, że po prostu nie rozumiem, co się dzieje. Najpierw pozwól mi zdefiniować (lub spróbować) zdefiniować moje warunki: Problemem klasa nierównowaga w maszyny / uczenia statystycznego jest obserwacja, że niektóre klasyfikacji binarnej (*) algorytmy nie …

2
Jaka jest różnica między cenzurą a obcięciem?
W książce Modele statystyczne i metody dożywotnich danych napisano: Ocenzurowanie: Gdy obserwacja jest niekompletna z jakiejś przypadkowej przyczyny. Obcinanie: gdy niekompletny charakter obserwacji wynika z systematycznego procesu selekcji właściwego dla projektu badania. Co rozumie się przez „systematyczny proces selekcji nieodłączny od projektu badania” w definicji skrótu? Jaka jest różnica między …




2
Dlaczego powinniśmy używać błędów t zamiast zwykłych błędów?
W tym poście na blogu Andrew Gelmana znajduje się następujący fragment: Modele bayesowskie sprzed 50 lat wydają się beznadziejnie proste (z wyjątkiem, oczywiście, prostych problemów) i spodziewam się, że modele bayesowskie będą wydawać się beznadziejnie proste, za 50 lat. (Dla prostego przykładu: prawdopodobnie powinniśmy rutynowo używać t zamiast zwykłych błędów …


7
Wnioskowanie a szacowanie?
Jakie są różnice między „wnioskowaniem” a „szacowaniem” w kontekście uczenia maszynowego ? Jako początkujących, czuję, że możemy wywnioskować zmiennych losowych i oszacowanie parametrów modelu. Czy moje zrozumienie jest słuszne? Jeśli nie, jakie dokładnie są różnice i kiedy powinienem użyć którego? Który też jest synonimem „uczenia się”?

2
Co to jest rozkład quasi-dwumianowy (w kontekście GLM)?
Mam nadzieję, że ktoś zapewni intuicyjny przegląd tego, czym jest dystrybucja quasibinomial i co robi. Szczególnie interesują mnie następujące punkty: Jak quasibinomial różni się od rozkładu dwumianowego. Gdy zmienna odpowiedzi jest proporcją (przykładowe wartości obejmują 0,23, 0,11, 0,78, 0,98), model quasibinomial będzie działał w R, ale model dwumianowy nie. Dlaczego …

2
Ile naklejek potrzebuję, aby ukończyć album FIFA Panini?
Gram w FIFA Panini Online Sticker Album , który jest internetową adaptacją klasycznych albumów Panini, które są zwykle wydawane na mistrzostwa świata w piłce nożnej, mistrzostwa Europy i ewentualnie inne turnieje. Album zawiera symbole zastępcze dla 424 różnych naklejek. Celem gry jest zebranie wszystkich 424. Naklejki są dostarczane w paczkach …

2
Konwolucyjne sieci neuronowe: czy neurony centralne nie są nadmiernie reprezentowane na wyjściu?
[To pytanie zadawano również przy przepełnieniu stosu] Pytanie w skrócie Badam splotowe sieci neuronowe i uważam, że sieci te nie traktują każdego neuronu wejściowego (piksela / parametru) w sposób równoważny. Wyobraź sobie, że mamy głęboką sieć (wiele warstw), która stosuje splot na niektórych obrazach wejściowych. Neurony w „środku” obrazu mają …

6
Jeśli „korelacja nie oznacza związku przyczynowego”, to jeśli znajdę korelację istotną statystycznie, jak mogę udowodnić związek przyczynowy?
Rozumiem, że korelacja nie jest przyczyną . Załóżmy, że otrzymujemy wysoką korelację między dwiema zmiennymi. Jak sprawdzić, czy ta korelacja jest rzeczywiście spowodowana przyczyną? Lub, pod jakimi dokładnie warunkami możemy wykorzystać dane eksperymentalne, aby wywnioskować związek przyczynowy między dwiema lub więcej zmiennymi?


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.