Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Jaka jest definicja rozkładu symetrycznego?
Jaka jest definicja rozkładu symetrycznego? Ktoś powiedział mi, że losowa zmienna pochodzi z rozkładu symetrycznego wtedy i tylko wtedy, gdy i mają ten sam rozkład. Ale myślę, że ta definicja jest częściowo prawdziwa. Ponieważ mogę przedstawić kontrprzykład i . Oczywiście ma rozkład symetryczny, ale i mają inny rozkład! Czy mam …

2
Co to jest empiryczna entropia?
W definicji wspólnie typowych zbiorów (w „Elementach teorii informacji”, rozdz. 7.6, s. 195) używamy np(xn)=∏ n i = 1 p(xi)- 1nlogp ( xn)-1nlog⁡p(xn)-\frac{1}{n} \log{p(x^n)} jako empirycznej entropii wystąpienia -sequence z . Nigdy wcześniej nie spotkałem się z tą terminologią. Nigdzie nie jest wyraźnie zdefiniowane zgodnie z indeksem książki.nnnp ( xn) …

2
Czy transformacja dziennika jest prawidłową techniką testowania danych niestandardowych?
Przeglądając artykuł, autorzy stwierdzają: „Ciągłe zmienne wyników wykazujące skośny rozkład zostały przekształcone przy użyciu logarytmów naturalnych, zanim przeprowadzono testy t w celu spełnienia wstępnych założeń normalności”. Czy jest to akceptowalny sposób analizy danych nienormalnych, szczególnie jeśli rozkład podstawowy niekoniecznie jest logarytmiczny? To może być bardzo głupie pytanie, ale nie widziałem …

2
Aktualizacja prawdopodobieństwa klasyfikacji w regresji logistycznej w czasie
Buduję model predykcyjny, który przewiduje prawdopodobieństwo sukcesu studenta na koniec semestru. Szczególnie interesuje mnie to, czy student odniesie sukces, czy nie, gdzie sukces jest zwykle definiowany jako ukończenie kursu i osiągnięcie 70% lub więcej punktów spośród wszystkich możliwych punktów. Kiedy wdrażam model, oszacowanie prawdopodobieństwa sukcesu musi być aktualizowane z upływem …


3
Częściowo nadzorowane uczenie się, aktywne uczenie się i głębokie uczenie się w celu klasyfikacji
Ostateczna edycja ze zaktualizowanymi wszystkimi zasobami: W przypadku projektu stosuję algorytmy uczenia maszynowego do klasyfikacji. Wyzwanie: Dość ograniczone dane oznaczone i znacznie więcej danych nieznakowanych. Cele: Zastosuj klasyfikację częściowo nadzorowaną Zastosuj w jakiś sposób częściowo nadzorowany proces etykietowania (znany jako aktywne uczenie się) Znalazłem wiele informacji z prac naukowych, takich …

2
Jak przewidzieć, kiedy nastąpi kolejne wydarzenie, na podstawie czasów poprzednich wydarzeń?
Jestem uczniem szkoły średniej i pracuję nad projektem programowania komputerowego, ale nie mam dużego doświadczenia w statystyce i modelowaniu danych poza kursem statystyki w szkole średniej, więc jestem trochę zdezorientowany. Zasadniczo mam dość dużą listę (zakładając, że jest wystarczająco duża, aby spełnić założenia dla wszelkich testów lub miar statystycznych) czasów, …

5
Analog 2D odchylenia standardowego?
Rozważ następujący eksperyment: grupa ludzi otrzymuje listę miast i proszona jest o zaznaczenie odpowiednich lokalizacji na (nieoznaczonej) mapie świata. Dla każdego miasta otrzymasz rozrzut punktów z grubsza wyśrodkowanych w danym mieście. Niektóre miasta, powiedzmy Stambuł, będą wykazywały mniej rozproszenia niż inne, mówią Moskwa. Załóżmy, że dla danego miasta otrzymujemy zestaw …


2
Jaki jest rozkład różnicy rozkładów dwóch-t
... i dlaczego ? Zakładając , że , są niezależnymi zmiennymi losowymi o wartości odpowiednio i wariancji . Moja podstawowa książka statystyk mówi mi, że dystrybucja ma następujące właściwości:X 2 μ 1 , μ 2 σ 2 1 , σ 2 2 X 1 - X 2X1X1X_1X2)X2)X_2μ1, μ2)μ1,μ2)\mu_1,\mu_2σ2)1, σ2)2)σ12),σ2)2)\sigma^2_1,\sigma^2_2X1- X2)X1-X2)X_1-X_2 …

4
Jak obliczyć przedział ufności średniej średnich?
Wyobraź sobie, że powtarzasz eksperyment trzy razy. W każdym eksperymencie zbierasz trzykrotnie pomiary. Trzy powtórzenia wydają się być dość blisko siebie, w porównaniu do różnic między trzema średnimi eksperymentalnymi. Obliczenie wielkiego środka jest dość łatwe. Ale jak obliczyć przedział ufności dla wielkiej średniej? Przykładowe dane: Eksperyment 1: 34, 41, 39 …

1
Jakie jest zdanie społeczności na temat czwartego kwadrantu?
Nassim Taleb, znany ze sławy Black Swan (lub niesławny), opracował koncepcję i opracował coś, co nazywa „mapą granic statystyki” . Jego podstawowym argumentem jest to, że istnieje jeden rodzaj problemu decyzyjnego, w którym stosowanie dowolnego modelu statystycznego jest szkodliwe. Byłyby to wszelkie problemy decyzyjne, w przypadku których konsekwencje podjęcia złej …

3
Czy ktoś rozwiązał ćwiczenie PTLOS 4.1?
To ćwiczenie podane w Teorii Prawdopodobieństwa: Logika Nauki Edwin Jaynesa 2003. Jest to częściowe rozwiązanie tutaj . Opracowałem bardziej ogólne częściowe rozwiązanie i zastanawiałem się, czy ktoś go rozwiązał. Poczekam chwilę, zanim opublikuję swoją odpowiedź, aby dać innym szansę. Okej, więc załóżmy, że mamy wzajemnie wykluczającą się i wyczerpującą hipotezę, …

7
Oznacza przesuwane okno w R.
Mam wektor wartości, które chciałbym zgłosić średnią w oknach wzdłuż mniejszego slajdu. Na przykład dla wektora następujących wartości: 4, 5, 7, 3, 9, 8 Okno o rozmiarze 3 i slajd 2 wykonałyby następujące czynności: (4+5+7)/3 = 5.33 (7+3+9)/3 = 6.33 (9+8)/3 = 5.67 I zwróć wektor tych wartości: 5.33, 6.33, …
19 r 


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.