Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Dlaczego statystycy nie wykorzystują wzajemnych informacji jako miary powiązania?
Widziałem kilka rozmów niestatystów, w których wydaje się, że na nowo opracowują miary korelacji przy użyciu wzajemnej informacji zamiast regresji (lub równoważnych / ściśle powiązanych testów statystycznych). Rozumiem, że istnieje dobry powód, dla którego statystycy nie przyjmują takiego podejścia. Rozumiem przez laika, że ​​estymatory entropii / wzajemnej informacji bywają problematyczne …



4
Zbieżność wag sieci neuronowej
Doszedłem do sytuacji, w której wagi mojej sieci neuronowej nie są zbieżne nawet po 500 iteracjach. Moja sieć neuronowa zawiera 1 warstwę wejściową, 1 warstwę ukrytą i 1 warstwę wyjściową. Są to około 230 węzłów w warstwie wejściowej, 9 węzłów w warstwie ukrytej i 1 węzeł wyjściowy w warstwie wyjściowej. …

3
Czy wyboru funkcji należy dokonywać tylko na danych treningowych (lub wszystkich danych)?
Czy wybór funkcji powinien być wykonywany tylko na danych treningowych (lub wszystkich danych)? Przeszedłem kilka dyskusji i artykułów, takich jak Guyon (2003) i Singhi i Liu (2006) , ale wciąż nie jestem pewien, czy odpowiedź jest prawidłowa. Moja konfiguracja eksperymentu wygląda następująco: Zestaw danych: 50 zdrowych kontroli i 50 pacjentów …



1
Porównanie rozkładów wydajności uogólnienia
Powiedz, że mam dwie metody uczenia się dla problemu klasyfikacji , i , i że oceniam ich wydajność uogólniającą za pomocą czegoś takiego jak wielokrotne sprawdzanie poprawności lub ładowanie początkowe. Z tego procesu otrzymuję rozkład wyników i dla każdej metody w tych powtórzeniach (np. Rozkład wartości ROC AUC dla każdego …


1
korekta wartości p dla statystyki Local Moran's I (LISA)
Pracuję z eksploracyjną analizą przestrzenną w R przy użyciu pakietu spdep. Natknąłem się na opcję dostosowania wartości p lokalnych wskaźników asocjacji przestrzennej (LISA) obliczonych za pomocą localmoranfunkcji. Według dokumentów ma to na celu: ... korekta wartości prawdopodobieństwa dla wielu testów. W dalszej części dokumentacji p.adjustSPczytam, że dostępne opcje to: Metody …

2
Badanie macierzy wykresów punktowych dla wielu zmiennych
Analizuję zestaw danych z wieloma parametrami (powiedzmy 50-200) i jestem zainteresowany spojrzeniem na relacje między zmiennymi (np. Pod względem wykresów rozproszenia 2 zmiennych lub histogramów 2d). Jednak dla tej liczby parametrów wydaje się niewykonalne narysowanie tablicy o wymiarach 200 x 200 (chyba że wydrukuję ją i powiesię na ścianie). Z …


3
Model wielopoziomowy a osobne modele dla każdego poziomu
Jakie są zalety i wady uruchamiania osobnych modeli w porównaniu z modelowaniem wielopoziomowym? W szczególności załóżmy, że w badaniu przebadano pacjentów zagnieżdżonych w gabinetach lekarskich zagnieżdżonych w poszczególnych krajach. Jakie są zalety / wady prowadzenia osobnych modeli dla każdego kraju w porównaniu z trójpoziomowym modelem zagnieżdżonym?

3
Jakie są przyczyny statystyczne definiowania wskaźnika BMI jako masy / wzrostu
Może to pytanie ma odpowiedź w medycynie, ale czy istnieją jakieś statystyczne powody, dla których wskaźnik BMI jest obliczany jako ? Dlaczego nie na przykład waga / wzrost ? Mój pierwszy pomysł jest taki, że ma to coś wspólnego z regresją kwadratową.waga / wzrost2)waga/wysokość2)\text{weight}/\text{height}^2waga / wzrostwaga/wysokość\text{weight}/\text{height} Próbka rzeczywistych danych (200 …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.