Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Dobre książki dotyczące technik wstępnego przetwarzania danych i wykrywania wartości odstających
Jak tytuł mówi, czy ktoś wie o dobrej, aktualnej książce, która ogólnie obejmuje wstępne przetwarzanie danych, a szczególnie techniki wykrywania wartości odstających? Książka nie musi skupiać się wyłącznie na tym, ale powinna wyczerpująco omawiać wyżej wymienione tematy - nie byłbym zadowolony z czegoś, co stanowi punkt wyjścia i cytuje listę …

3
Ćwiczenia / eksperymenty w klasie, aby uczyć pojęć statystycznych?
Zamierzam udzielić nastolatkom godzinnego wykładu na temat statystyki. Prawdopodobnie zobaczę je tylko raz. Ten scenariusz może się powtarzać w kółko. Chciałbym dać im trochę aktywności, aby mogli doświadczyć statystyk. Ale jestem zmuszony to zrobić z ludźmi, którzy nie wiedzą nic o prawdopodobieństwie, wnioskowaniu statystycznym, analizie eksploracyjnej itp. Myślałem o przejściu …
11 teaching 

2
Obliczanie wymiaru VC sieci neuronowej
Jeśli mam pewną stałą topologię nierekurencyjną (DAG) (ustalony zestaw węzłów i krawędzi, ale algorytm uczenia może zmieniać ciężar na krawędziach) neuronów esowatych z neuronami wejściowymi, które mogą przyjmować tylko łańcuchy w jako dane wejściowe i prowadzące do jednego wyniku (który wyprowadza rzeczywistą wartość, którą zaokrąglamy w górę do 1 lub …


2
Jak przeprowadzić porównanie post hoc dla terminu interakcji z modelem efektów mieszanych?
Pracuję nad zestawem danych w celu oceny wpływu suszenia na aktywność mikrobiologiczną osadów. Celem jest ustalenie, czy wpływ suszenia różni się w zależności od rodzaju osadu i / lub głębokości osadu. Projekt eksperymentalny jest następujący: Pierwszy czynnik Osad odpowiada trzem rodzajom osadu (kodowany Sed1, Sed2, Sed3). Dla każdego rodzaju osadu …

2
Jak poprawić stabilność mojej sieci neuronowej?
Używam sieci neuronowej w R, aby zbudować NN z 14 wejściami i jednym wyjściem. Sieć buduję / trenuję kilka razy przy użyciu tych samych danych treningowych i tych samych architektury / ustawień sieciowych. Po wytworzeniu każdej sieci używam jej do samodzielnego zestawu danych testowych do obliczania niektórych przewidywanych wartości. Zauważyłem, …

4
Ocena przewidywalności szeregów czasowych
Załóżmy, że mam trochę ponad 20 000 miesięcznych szeregów czasowych od stycznia do 05 grudnia. Każdy z nich reprezentuje globalne dane dotyczące sprzedaży innego produktu. Co jeśli zamiast obliczać prognozy dla każdego z nich, chciałbym skoncentrować się tylko na niewielkiej liczbie produktów, które „faktycznie mają znaczenie”? Mógłbym uszeregować te produkty …

1
Granice współczynnika Giniego i granice błędów
Mam szereg czasowy danych o liczbie N = 14 w każdym punkcie czasowym i chcę obliczyć współczynnik Giniego i błąd standardowy dla tego oszacowania w każdym punkcie czasowym. Ponieważ mam tylko N = 14 zliczeń w każdym punkcie czasowym, przystąpiłem do obliczania wariancji scyzoryka, tj. z równania 7 Tomsona Ogwanga„Wygodna …




1
Dlaczego ludzie używają terminu „ciężar dowodów” i czym różni się od „punktowej wzajemnej informacji”?
W tym przypadku „ciężar dowodów” (WOE) jest powszechnym terminem w opublikowanej literaturze naukowej i politycznej, najczęściej postrzeganym w kontekście oceny ryzyka, definiowanym przez: w(e:h)=logp(e|h)p(e|h¯¯¯)w(e:h)=log⁡p(e|h)p(e|h¯)w(e : h) = \log\frac{p(e|h)}{p(e|\overline{h})} gdzie jest dowodem, h jest hipotezą.eeehhh Teraz chcę wiedzieć, jaka jest główna różnica w PMI (punktowe wzajemne informacje) pmi(e,h)=logp(e,h)p(e)∗p(h)pmi(e,h)=log⁡p(e,h)p(e)∗p(h)pmi(e,h)=\log\frac{p(e,h)}{p(e)*p(h)}

2
Problem z konwersją ze współczynnika na zmienną numeryczną w R [zamknięty]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 7 lat temu . Chciałbym przekonwertować zmienną czynnikową na zmienną numeryczną, ale as.numericnie daje oczekiwanego efektu. Poniżej otrzymuję statystyki podsumowujące dla numerycznej wersji zmiennej na …


1
Przykłady przypadków, gdy przedział ufności i przedział wiarygodności pokrywają się
W artykule na Wikipedii na temat przedziału wiarygodności napisano: W przypadku pojedynczego parametru i danych, które można podsumować za pomocą jednej wystarczającej statystyki, można wykazać, że wiarygodny przedział i przedział ufności zbiegną się, jeśli nieznany parametr jest parametrem lokalizacji (tj. Funkcja prawdopodobieństwa przekazania ma postać Pr (x | μ) = …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.