Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Sprawdzanie, czy poprawa dokładności jest znacząca
Załóżmy, że mam algorytm, który dzieli rzeczy na dwie kategorie. Mogę zmierzyć dokładność algorytmu na powiedzmy 1000 rzeczy testowych - załóżmy, że 80% rzeczy jest poprawnie sklasyfikowanych. Załóżmy, że zmodyfikowałem algorytm w taki sposób, aby 81% rzeczy zostało poprawnie sklasyfikowanych. Czy statystyki mogą mi powiedzieć coś o tym, czy moje …


2
Gradient descent vs lm () function in R?
Przeglądam filmy z bezpłatnego internetowego kursu uczenia maszynowego Andrew Ng w Stanford. Omawia Gradient Descent jako algorytm do rozwiązywania regresji liniowej i pisania funkcji w Octave do jej wykonania. Przypuszczalnie mógłbym przepisać te funkcje w R, ale moje pytanie brzmi: czy funkcja lm () już nie daje wyników regresji liniowej? …

2
Interpretacja i walidacja modelu regresji proporcjonalnych hazardów Coxa przy użyciu R w języku angielskim
Czy ktoś może mi wyjaśnić mój model Coxa zwykłym angielskim? Dopasowałem następujący model regresji Coxa do wszystkich moich danych za pomocą tej cphfunkcji. Moje dane są zapisywane w obiekcie o nazwie Data. Zmienne w, xi ysą ciągłe; zjest czynnikiem dwóch poziomów. Czas mierzony jest w miesiącach. Niektórym moim pacjentom brakuje …

3
Dlaczego często przyjmuje się rozkład Gaussa?
Cytując z artykułu z Wikipedii na temat szacowania parametrów naiwnego klasyfikatora Bayesa : „typowym założeniem jest to, że ciągłe wartości związane z każdą klasą są rozkładane zgodnie z rozkładem Gaussa”. Rozumiem, że rozkład Gaussa jest dogodny ze względów analitycznych. Czy istnieje jednak jakiś inny powód, aby przyjąć takie przypuszczenie? Co …

3
Centralne twierdzenie graniczne a prawo wielkich liczb
Twierdzenie o granicy centralnej stwierdza, że ​​średnia zmiennych iid, gdy przechodzi w nieskończoność, staje się normalnie rozkładem.N.NN Rodzi to dwa pytania: Czy możemy z tego wywnioskować prawo wielkich liczb? Jeśli prawo wielkich liczb mówi, że średnia próbki wartości zmiennej losowej jest równa prawdziwej średniej gdy przechodzi w nieskończoność, wydaje się …

4
Szacowanie punktu przerwania w złamanym drążku / częściowym modelu liniowym z losowymi efektami w R [zawiera kod i dane wyjściowe]
Czy ktoś może mi powiedzieć, jak R oszacować punkt przerwania w częściowym modelu liniowym (jako parametr stały lub losowy), gdy muszę również oszacować inne efekty losowe? Poniżej zamieściłem przykład zabawki, który pasuje do regresji kija hokejowego / łamanego kija z losowymi wariancjami nachylenia i losową wariancją przechwytywania y dla punktu …



4
Jak zacząć czytać o eksploracji danych?
Jestem nowicjuszem, który zacznie czytać o eksploracji danych. Mam podstawową wiedzę na temat sztucznej inteligencji i statystyki. Ponieważ wielu twierdzi, że uczenie maszynowe odgrywa również ważną rolę w eksploracji danych, czy konieczne jest przeczytanie o uczeniu maszynowym, zanim będę mógł kontynuować eksplorację danych?


3
Jak obliczyć prawdopodobieństwo związane z absurdalnie dużymi wynikami Z?
Pakiety oprogramowania do wykrywania motywów sieciowych mogą zwracać niezwykle wysokie wyniki Z (najwyższy, jaki widziałem, to 600 000+, ale wyniki Z powyżej 100 są dość powszechne). Planuję pokazać, że te wyniki Z są fałszywe. Ogromne wyniki Z odpowiadają bardzo niskim związanym prawdopodobieństwom. Wartości powiązanych prawdopodobieństw podano np. Na stronie wikipedii …

1
Dlaczego powiązania są tak trudne w statystyce nieparametrycznej?
Mój tekst nieparametryczny, Practical Nonparametric Statistics , często podaje czyste formuły dla oczekiwań, wariancji, statystyk testowych itp., Ale zawiera zastrzeżenie, że działa to tylko wtedy, gdy zignorujemy więzi. Przy obliczaniu statystyki U Manna-Whitneya zaleca się, abyś wyrzucał związane pary podczas porównywania większych. Rozumiem, że więzi tak naprawdę nie mówią nam …

4
Obliczanie AUPR w R [zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 8 miesięcy temu . Łatwo jest znaleźć obszar obliczania pakietu pod ROC, ale czy istnieje pakiet, który oblicza obszar pod krzywą dokładnego przywołania?


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.