Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Równania w wiadomościach: Tłumaczenie modelu wielopoziomowego dla ogółu odbiorców
„New York Times” długo komentuje „oceniający wartość dodaną” system oceniania nauczycieli, który służy do przekazywania informacji nauczycielom z Nowego Jorku. Lede to równanie używane do obliczania wyników - przedstawione bez kontekstu. Retoryczna strategia wydaje się zastraszaniem za pomocą matematyki: Pełny tekst artykułu jest dostępny pod adresem : http://www.nytimes.com/2011/03/07/education/07winerip.html Autor, Michael …

7
Algorytm do dynamicznego monitorowania kwantyli
Chcę oszacować kwantyl niektórych danych. Dane są tak ogromne, że nie można ich zapisać w pamięci. A dane nie są statyczne, wciąż pojawiają się nowe dane. Czy ktoś zna jakiś algorytm do monitorowania kwantyli danych obserwowanych do tej pory przy bardzo ograniczonej pamięci i obliczeniach? Uważam, że algorytm P2 jest …

3
Czy kolejność zmiennych objaśniających ma znaczenie przy obliczaniu ich współczynników regresji?
Początkowo myślałem, że kolejność nie ma znaczenia, ale potem przeczytałem o procesie ortogonalizacji Gram-Schmidta do obliczania wielu współczynników regresji, a teraz mam inne przemyślenia. Zgodnie z procesem gram-schmidta, im później zmienna objaśniająca jest indeksowana wśród innych zmiennych, tym mniejszy jest jej wektor resztkowy, ponieważ odejmuje się od niego wektory resztkowe …

4
Korekta wartości p dla wielu testów, w których testy są skorelowane (genetyka)
Mam wartości p z wielu testów i chciałbym wiedzieć, czy rzeczywiście jest coś znaczącego po poprawieniu wielu testów. Komplikacja: moje testy nie są niezależne. Metoda, o której myślę (wariant metody produktu Fishera, Zaykin i wsp., Genet Epidemiol , 2002) wymaga korelacji między wartościami p. Aby oszacować tę korelację, obecnie myślę …

13
Podręczniki ekonometrii?
Jakie dobre podręczniki ekonometryczne poleciłbyś? Edycja: istnieje wiele książek o różnym poziomie zaawansowania matematycznego. Dobrze byłoby dowiedzieć się, jak technicznie polecana jest książka.

3
Czy godzina jest zmienną kategoryczną?
Czy „godzina dnia”, w której wartość może wynosić 0, 1, 2, ..., 23, jest zmienną kategoryczną? Kusiłoby mnie, by powiedzieć „nie”, ponieważ na przykład 5 jest „bliżej” do 4 lub 6 niż do 3 lub 7. Z drugiej strony występuje nieciągłość między 23 a 0. Czy ogólnie jest to kategoryczne, …



2
Jak rozumieć „nieliniowy” jak w „nieliniowej redukcji wymiarowości”?
Próbuję zrozumieć różnice między metodami liniowej redukcji wymiarów (np. PCA) a metodami nieliniowymi (np. Izomapa). Nie do końca rozumiem, co oznacza (nie) liniowość w tym kontekście. Czytałem z Wikipedii, że Dla porównania, jeżeli PCA (algorytm liniowej redukcji wymiarów) zostanie zastosowany do zredukowania tego samego zestawu danych do dwóch wymiarów, uzyskane …

2
W jaki sposób CNN Kriżewskiego '12 dostaje 253 440 neuronów w pierwszej warstwie?
W Alex Krizhevsky i in. Klasyfikacja Imagenet z głębokimi splotowymi sieciami neuronowymi wyliczają liczbę neuronów w każdej warstwie (patrz diagram poniżej). Dane wejściowe sieci są 150 528-wymiarowe, a liczba neuronów w pozostałych warstwach sieci wynosi 253 340–186,624–64 896–64 8896–43,264– 4096–4096–1000. Widok 3D Liczba neuronów dla wszystkich warstw po pierwszej jest …

4
Symuluj równomierny rozkład na dysku
Próbowałem symulować wstrzykiwanie losowych punktów w kółko, tak aby dowolna część koła miała takie samo prawdopodobieństwo wystąpienia wady. Spodziewałem się, że liczenie na pole wynikowego rozkładu będzie zgodne z rozkładem Poissona, jeśli podzielę okrąg na prostokąty o równej powierzchni. Ponieważ wymaga to jedynie umieszczenia punktów w obszarze kołowym, wstrzyknąłem dwa …

3
Jak interpretować macierz nieporozumień Sklearn
Korzystam z macierzy zamieszania, aby sprawdzić wydajność mojego klasyfikatora. Używam Scikit-Learn, jestem trochę zdezorientowany. Jak mogę zinterpretować wynik from sklearn.metrics import confusion_matrix >>> y_true = [2, 0, 2, 2, 0, 1] >>> y_pred = [0, 0, 2, 2, 0, 2] >>> confusion_matrix(y_true, y_pred) array([[2, 0, 0], [0, 0, 1], [1, …

7
jak reprezentować geografię lub kod pocztowy w modelu uczenia maszynowego lub systemie rekomendującym?
Buduję model i myślę, że położenie geograficzne może być bardzo dobre w przewidywaniu zmiennej docelowej. Mam kod pocztowy każdego z moich użytkowników. Nie jestem jednak całkowicie pewien najlepszego sposobu włączenia kodu pocztowego jako funkcji predykcyjnej w moim modelu. Chociaż kod pocztowy jest liczbą, nic nie znaczy, jeśli liczba rośnie lub …

3
Jak dokładnie rzadkie PCA jest lepsze od PCA?
Dowiedziałem się o PCA kilka wykładów temu na zajęciach i kopiąc więcej o tej fascynującej koncepcji, poznałem rzadkie PCA. Chciałem zapytać, jeśli się nie mylę, to jest to rzadkie PCA: w PCA, jeśli masz punktów danych ze zmiennymi , możesz zastosować każdy punkt danych w przestrzeni wymiarowej przed zastosowaniem PCA. …

3
Mapa funkcji dla jądra Gaussa
W SVM jądro Gaussa jest zdefiniowane jako: gdzie x, y \ in \ mathbb {R ^ n} . Nie znam jednoznacznego równania \ phi . Chcę wiedzieć.K(x,y)=exp(−∥x−y∥222σ2)=ϕ(x)Tϕ(y)K(x,y)=exp⁡(−‖x−y‖222σ2)=ϕ(x)Tϕ(y)K(x,y)=\exp\left({-\frac{\|x-y\|_2^2}{2\sigma^2}}\right)=\phi(x)^T\phi(y)x,y∈Rnx,y∈Rnx, y\in \mathbb{R^n}ϕϕ\phi Ja też chcę wiedzieć, czy ∑iciϕ(xi)=ϕ(∑icixi)∑iciϕ(xi)=ϕ(∑icixi)\sum_ic_i\phi(x_i)=\phi \left(\sum_ic_ix_i \right) gdzie ci∈Rci∈Rc_i\in \mathbb R . Teraz myślę, że to nie jest równe, ponieważ …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.