Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

7
Koncepcja statystyczna wyjaśniająca, dlaczego rzadziej przewracasz tyle samo głów co ogony, gdy liczba przewrotów rośnie?
Pracuję nad nauką prawdopodobieństwa i statystyki, czytając kilka książek i pisząc kod, a podczas symulacji rzutu monetą zauważyłem coś, co uderzyło mnie nieco jako sprzeczne z naiwną intuicją. Jeśli rzucisz uczciwą monetę razy, stosunek główek do reszka zbiega się w kierunku 1, gdy wzrasta, dokładnie tak, jak można się spodziewać. …



1
Porównanie hierarchicznych dendrogramów grupowania uzyskanych różnymi odległościami i metodami
[Początkowy tytuł „Pomiar podobieństwa dla hierarchicznych drzew klastrowych” został później zmieniony przez @ttnphns, aby lepiej odzwierciedlić temat] Przeprowadzam szereg hierarchicznych analiz skupień na ramce danych rekordów pacjentów (np. Podobnie do http://www.biomedcentral.com/1471-2105/5/126/figure/F1?highres=y ) Eksperymentuję z różnymi miarami odległości , różnymi wagami parametrów i różnymi metodami hierarchicznymi , aby zrozumieć ich wpływ …

1
Estymatory maksymalnego prawdopodobieństwa dla skróconego rozkładu
Rozważmy NNN niezależnych próbek SSS otrzymano z losowej zmiennej XXX , który jest przyjmowany śledzić skróconą dystrybucji (np obcięty rozkład normalny ) znanego (Finite) minimalne i maksymalne wartości aaa i bbb , lecz z nieznanych parametrów μμ\mu i σ2σ2\sigma^2 . Jeśli XXX następnie non-obcięte rozkładzie estymatorów największej wiarygodności ľ i …

7
Dlaczego i kiedy utworzyć pakiet R?
Rozumiem, że to pytanie jest dość szerokie, ale zastanawiam się, jakie powinny być decydujące punkty przy podejmowaniu decyzji o utworzeniu (lub nie) nowego pakietu dla R. Aby być bardziej szczegółowym, dodam, że pytanie nie dotyczy powodów użyj R w sobie, więcej o decyzji o kompilacji różnych skryptów i zintegrowaniu ich …
28 r  software 

3
Rozkład współczynnika Gaussa: Pochodne wrt leżące u podstaw
Pracuję z dwoma niezależnymi rozkładami normalnymi i Y , ze średnimi μ x i μ y oraz wariancjami σ 2 x i σ 2 y .XXXYYYμxμx\mu_xμyμy\mu_yσ2xσx2\sigma^2_xσ2yσy2\sigma^2_y Jestem zainteresowany w dystrybucji ich stosunek . Ani X, ani Y nie ma średniej zero, więc Z nie jest dystrybuowane jako Cauchy.Z=X/YZ=X/YZ=X/YXXXYYYZZZ Muszę znaleźć …


5
Książka statystyk, która wyjaśnia użycie większej liczby obrazów niż równań
Zainteresowałem się statystykami, ale muszę przyznać, że od dawna poważnie wykorzystałem matematykę. Czasami rozumiem, co oznaczają równania, ale czasami nie mogę ich przestrzegać. Podoba mi się podana tutaj odpowiedź, która używa obrazu ze strzałką: Koncepcyjne zrozumienie średniego błędu kwadratu pierwiastkowego i średniego odchylenia odchylenia . Czy masz jakieś porady dotyczące …
28 references 

5
Przykłady typowych rozkładów z życia
Jestem studentem, który interesuje się statystykami. Materiał bardzo mi się podoba, ale czasami trudno mi myśleć o zastosowaniach w prawdziwym życiu. W szczególności moje pytanie dotyczy najczęściej używanych rozkładów statystycznych (normalnych - beta-gamma itp.). Wydaje mi się, że w niektórych przypadkach uzyskuję określone właściwości, które sprawiają, że rozkład jest całkiem …

3
Dlaczego podczas uczenia się uczniowie są „słabi”?
Zobacz także podobne pytanie na temat statystyki . SE . W zwiększeniu algorytmy, takie jak adaboost i LPBoost wiadomo, że „słabe” uczestników być łączone tylko lepsze wyniki niż przypadek użyteczne z Wikipedia: Stosowane przez niego klasyfikatory mogą być słabe (tj. Wykazywać znaczny poziom błędów), ale dopóki ich wydajność nie jest …

4
Samokształcenie a nauczana edukacja?
Istnieje pytanie o podobnym przeznaczeniu na programmers.SE . To pytanie ma kilka całkiem dobrych odpowiedzi, ale ogólny temat wydaje się być taki, że bez samokształcenia nie ma miejsca. Oczywiście istnieje pewna znacząca różnica między programowaniem a statystyką - dzięki programowaniu naprawdę uczysz się podstawowej logiki, a następnie stosujesz ją wielokrotnie. …


1
Jak interpretować wariancję i korelację efektów losowych w modelu efektów mieszanych?
Mam nadzieję, że wszystkim wam to nie przeszkadza, ale potrzebuję pomocy w interpretacji wyników dla liniowego modelu efektów mieszanych, o których starałem się nauczyć w R. Jestem nowy w analizie danych podłużnych i regresji liniowych efektów mieszanych. Mam model, który dopasowałem do tygodni jako predyktor czasu, a moim wynikiem jest …

3
Przykłady błędów w algorytmach MCMC
Badam metodę automatycznego sprawdzania metod Monte Carlo w łańcuchu Markowa i chciałbym podać kilka przykładów błędów, które mogą wystąpić podczas konstruowania lub wdrażania takich algorytmów. Punkty bonusowe, jeśli w opublikowanym artykule użyto niewłaściwej metody. Szczególnie interesują mnie przypadki, w których błąd oznacza, że ​​łańcuch ma niepoprawny rozkład niezmienniczy, chociaż inne …
28 mcmc 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.