Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Jak interpretujesz RMSLE (błąd logarytmiczny średniej kwadratowej)?
Brałem udział w konkursie uczenia maszynowego, w którym używają RMSLE (Root Mean Squared Logarithmic Error) do oceny wydajności przewidującej cenę sprzedaży danej kategorii sprzętu. Problem w tym, że nie jestem pewien, jak interpretować sukces mojego końcowego wyniku. Na przykład, jeśli osiągnąłem RMSLE na poziomie czy mogę podnieść moc wykładniczą i …

3
K-fold vs. walidacja krzyżowa Monte Carlo
Próbuję poznać różne metody walidacji krzyżowej, przede wszystkim z zamiarem zastosowania do nadzorowanych technik analizy wielowymiarowej. Dwa, z którymi się spotkałem, to techniki K-fold i Monte Carlo. Czytałem, że K-fold jest odmianą Monte Carlo, ale nie jestem pewien, czy w pełni rozumiem, co składa się na definicję Monte Carlo. Czy …

2
Wybór przepustowości dla estymatorów gęstości jądra
W przypadku jednowymiarowych estymatorów gęstości jądra (KDE) używam reguły Silvermana do obliczania hhh : 0,9 min ( s d, JaQ R / 1.34 ) × n- 0,20,9min(sre,jaQR/1.34)×n-0.2\begin{equation} 0.9 \min(sd, IQR/1.34)\times n^{-0.2} \end{equation} Jakie są standardowe reguły dla wielowymiarowego KDE (przy założeniu normalnego jądra).



3
R: Losowy las wyrzucający NaN / Inf w błędzie „wywołanie funkcji zagranicznej” pomimo braku NaN w zbiorze danych [zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 2 lata temu . Używam karetki, aby uruchomić sprawdzony krzyżowo losowy las w zbiorze danych. Zmienna Y jest czynnikiem. W moim zestawie danych nie ma …

1
co oznaczają liczby w raporcie klasyfikacyjnym sklearn?
Mam poniżej przykład, który wyciągnąłem ze sklearn.metrics.classification_report dokumentacji sklearn. Nie rozumiem, dlaczego istnieją wartości f1-score, precyzja i przywołanie dla każdej klasy, w której moim zdaniem klasa jest etykietą predyktora? Myślałem, że wynik f1 mówi o ogólnej dokładności modelu. Co również mówi nam kolumna wsparcia? Nie mogłem znaleźć żadnych informacji na …



4
Jak mierzy się nierównomierność rozkładu?
Próbuję wymyślić metrykę pomiaru nierównomierności rozkładu dla prowadzonego eksperymentu. Mam zmienną losową, która powinna być równomiernie rozłożona w większości przypadków, i chciałbym być w stanie zidentyfikować (i ewentualnie zmierzyć stopień) przykładów zestawów danych, w których zmienna nie jest równomiernie rozmieszczona w pewnym marginesie. Przykład trzech serii danych, z których każda …

3
Dlaczego mieszanka dwóch normalnie rozłożonych zmiennych jest bimodalna tylko wtedy, gdy ich średnie różnią się co najmniej dwa razy częściej niż standardowe odchylenie standardowe?
Pod mieszaniną dwóch normalnych rozkładów: https://en.wikipedia.org/wiki/Multimodal_distribution#Mixture_of_two_normal_distribution „Mieszanina dwóch rozkładów normalnych ma do oszacowania pięć parametrów: dwa średnie, dwie wariancje i parametr mieszania. Mieszanina dwóch rozkładów normalnych z jednakowymi odchyleniami standardowymi jest bimodalna tylko wtedy, gdy ich średnie różnią się co najmniej dwukrotnie wspólnym odchyleniem standardowym . ” Szukam pochodnej lub …
28 bimodal 

2
Czy Statistics.com opublikowało złą odpowiedź?
Statistics.com opublikowało problem tygodnia: Wskaźnik oszustw związanych z ubezpieczeniami mieszkaniowymi wynosi 10% (jedno na dziesięć roszczeń jest nieuczciwe). Konsultant zaproponował system uczenia maszynowego do przeglądu roszczeń i zaklasyfikowania ich jako oszustwo lub zakaz oszustwa. System jest w 90% skuteczny w wykrywaniu fałszywych roszczeń, ale tylko w 80% skuteczny w prawidłowej …

4
Ekstrapolacja v. Interpolacja
Jaka jest różnica między ekstrapolacją a interpolacją i jaki jest najbardziej precyzyjny sposób używania tych terminów? Na przykład widziałem oświadczenie w pracy z interpolacją jako: „Procedura interpoluje kształt oszacowanej funkcji między punktami bin” Zdanie, które używa zarówno ekstrapolacji, jak i interpolacji, to na przykład: Poprzedni krok, w którym ekstrapolowaliśmy funkcję …

2
Jaki jest model statystyczny za algorytmem SVM?
Nauczyłem się, że w przypadku danych przy użyciu podejścia modelowego pierwszym krokiem jest modelowanie procedury danych jako modelu statystycznego. Następnie kolejnym krokiem jest opracowanie wydajnego / szybkiego wnioskowania / algorytmu uczenia się w oparciu o ten model statystyczny. Chcę więc zapytać, który model statystyczny stoi za algorytmem maszyny wektorowej wsparcia …

4
Czy jednolity rozkład wielu wartości p daje statystyczny dowód, że H0 jest prawdą?
Pojedynczy test statystyczny może udowodnić, że hipoteza zerowa (H0) jest fałszywa, a zatem hipoteza alternatywna (H1) jest prawdziwa. Ale nie można go użyć do wykazania, że ​​H0 jest prawdą, ponieważ brak odrzucenia H0 nie oznacza, że ​​H0 jest prawdą. Załóżmy jednak, że masz możliwość wykonania testu statystycznego wiele razy, ponieważ …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.