Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Czy próbkowanie w regresji logistycznej powinno odzwierciedlać rzeczywisty stosunek 1 i 0?
Załóżmy, że chcę stworzyć model regresji logistycznej, który może oszacować prawdopodobieństwo wystąpienia niektórych gatunków zwierząt żyjących na drzewach w oparciu o cechy drzew (np. Wysokość). Jak zawsze mój czas i pieniądze są ograniczone, dlatego jestem w stanie zebrać tylko ograniczoną liczbę próbek. Mam następujące pytania: Czy stosunek 1 do 0 …

3
Czy redukcję wymiarów podczas wizualizacji należy uznać za „zamknięty” problem rozwiązany przez t-SNE?
Dużo czytałem o algorytmie sne do redukcji wymiarów. Jestem pod wielkim wrażeniem wydajności „klasycznych” zestawów danych, takich jak MNIST, w których osiąga wyraźne rozdzielenie cyfr ( patrz oryginalny artykuł ):ttt Użyłem go również do wizualizacji funkcji poznanych przez sieć neuronową, którą trenuję i byłem bardzo zadowolony z wyników. Tak więc, …

2
Jaki model statystyczny lub algorytm można zastosować do rozwiązania problemu John Snow Cholera?
Chciałbym dowiedzieć się, jak opracować przybliżenie geograficzne pewnego rodzaju epicentrum na podstawie danych z epidemii choroby John Snow Cholera. Jakie modelowanie statystyczne można zastosować do rozwiązania takiego problemu bez uprzedniej wiedzy o tym, gdzie znajdują się studnie. Jako ogólny problem miałbyś do dyspozycji czas, lokalizację znanych punktów i ścieżkę spacerową …

10
Najlepszy termin na gotowe dane?
Piszę przykład i stworzyłem trochę danych. Chcę, aby czytelnik zrozumiał, że to nie są prawdziwe dane, ale nie chcę też sprawiać wrażenia złośliwości, ponieważ służy to jedynie za przykład. Nie ma (pseudo) losowego składnika tych konkretnych danych, więc wydaje mi się, że „symulowane” nie jest właściwe. Jeśli nazywam to fikcyjnym …

1
Wyjaśnienie, co Nate Silver powiedział o lessu
W pytaniu, które zadałem niedawno , powiedziano mi, że ekstrapolacja za pomocą lessa była dużym „nie-nie”. Ale w najnowszym artykule Nate'a Silvera na FiveThirtyEight.com omówił wykorzystanie lessu do prognozowania wyborów. Z lesssem omawiał specyfikę agresywnych i konserwatywnych prognoz z lesssem, ale jestem ciekawy, czy trafne jest przewidywanie przyszłych prognoz z …

1
Właściwości PCA dla obserwacji zależnych
Zwykle używamy PCA jako techniki redukcji wymiarów dla danych, w których zakłada się, że przypadki są identyczne Pytanie: Jakie są typowe niuanse w stosowaniu PCA w odniesieniu do zależnych danych innych niż iid? Jakie miłe / użyteczne właściwości PCA, które przechowują dane ID, są zagrożone (lub całkowicie utracone)? Na przykład …

4
Problem Monty Hall z omylnym Monty
Monty doskonale wiedział, czy za drzwiami stoi koza (czy była pusta). Ten fakt pozwala Graczowi podwoić swój wskaźnik sukcesu w czasie, przełączając „domysły” na inne Drzwi. Co jeśli wiedza Monty'ego nie była doskonała? Co się stanie, jeśli czasami Nagroda rzeczywiście będzie w tej samej Bramie co Kozioł? Ale nie mogłeś …

1
Jak interpretować histogramy podane przez TensorFlow w TensorBoard?
Niedawno biegałem i uczyłem się przepływu tensora i otrzymałem kilka histogramów, których nie umiałem interpretować. Zazwyczaj myślę o wysokości słupków jako o częstotliwości (lub częstotliwości względnej / zliczeniach). Jednak fakt, że nie ma pasków jak na zwykłym histogramie oraz fakt, że rzeczy są zacienione, myli mnie. wydaje się, że jednocześnie …

1
Keras, jak działa spadek szybkości uczenia się SGD?
Jeśli spojrzysz na dokumentację http://keras.io/optimizers/, w SGD znajduje się parametr rozpadu. Wiem, że to zmniejsza szybkość uczenia się w miarę upływu czasu. Nie mogę jednak dowiedzieć się, jak to dokładnie działa. Czy jest to wartość pomnożona przez współczynnik uczenia się, np. Czy lr = lr * (1 - decay) jest …


4
Dlaczego algorytmy optymalizacyjne są zdefiniowane w kontekście innych problemów optymalizacyjnych?
Prowadzę badania nad technikami optymalizacji w uczeniu maszynowym, ale jestem zaskoczony, że duża liczba algorytmów optymalizacji jest definiowana pod kątem innych problemów z optymalizacją. Poniżej zilustruję kilka przykładów. Na przykład https://arxiv.org/pdf/1511.05133v1.pdf Wszystko wygląda ładnie i dobrze, ale jest to w aktualizacji .... więc jaki algorytm rozwiązuje dla ? Nie wiemy …

3
Rozbieżność Kullbacka-Leiblera BEZ teorii informacji
Po długim przeszukiwaniu Cross Validated nadal nie czuję, że jestem bliżej zrozumienia dywergencji KL poza sferą teorii informacji. To dość dziwne, gdy ktoś z wykształceniem matematycznym łatwiej jest zrozumieć wyjaśnienie teorii informacji. Podsumowując moje rozumienie na podstawie teorii informacji: jeśli mamy zmienną losową o skończonej liczbie wyników, istnieje optymalne kodowanie, …

2
Czy ostateczny (gotowy do produkcji) model powinien być szkolony na kompletnych danych, czy tylko na zestawie szkoleniowym?
Załóżmy, że trenowałem kilka modeli na zestawie treningowym, wybierz najlepszy, używając zestawu do krzyżowej weryfikacji i mierzonej wydajności na zestawie testowym. Więc teraz mam jeden ostateczny najlepszy model. Czy powinienem przekwalifikować je na wszystkie dostępne dane lub wysłać rozwiązanie szkolone tylko na zestawie szkoleniowym? Jeśli to drugie, to dlaczego? AKTUALIZACJA: …

3
Czy ta dystrybucja ma nazwę?
Przyszło mi dziś do głowy, że rozkład może być postrzegany jako kompromis między gaussowskim a Laplace'em dystrybucje, dla iCzy taka dystrybucja ma nazwę? I czy ma ona wyraz swojej stałej normalizacji? Rachunek mnie zaskakuje, ponieważ nie wiem, jak nawet rozpocząć rozwiązywanie dla w całce f(x)∝exp(−|x−μ|pβ)f(x)∝exp⁡(−|x−μ|pβ) f(x)\propto\exp\left(-\frac{|x-\mu|^p}{\beta}\right) x∈R,p∈[1,2]x∈R,p∈[1,2]x\in\mathbb{R}, p\in[1,2]β>0.β>0.\beta>0.CCC1=C⋅∫∞−∞exp(−|x−μ|pβ)dx1=C⋅∫−∞∞exp⁡(−|x−μ|pβ)dx 1=C\cdot \int_{-\infty}^\infty …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.