Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


2
Czy przewidywanie jest „złotym kryterium” do oceny zdolności statystycznych?
W zeszły weekend czytałem podręczniki modeli liniowych Faraway z R (1. edycja). Faraway miał rozdział zatytułowany „Strategia statystyczna i niepewność modelu”. Opisał (strona 158), że sztucznie wygenerowany niektóre dane przy użyciu bardzo skomplikowany model, a następnie poprosił swoich uczniów do modelowania danych i porównać studentów przewidywanych wyników vs odczytu wyników. …

1
Kursy są proste
Mam problem ze zrozumieniem szans i chciałbym tylko podstawowe wyjaśnienie, jak je interpretować. Znalazłem różne posty związane z kursami, ale większość z nich jest bardziej złożona niż to, co próbuję zrozumieć. Oto przykład, w jaki sposób interpretuję szanse: jeśli szanse na wydarzenie wynoszą od 3 do 1, to wydarzenie nastąpi …

5
Średnia wartość wybranej matrycy z nieskończonej serii rolek
Jeśli rzuciłem parę kostek nieskończoną liczbę razy i zawsze wybieram wyższą z nich, czy oczekiwana średnia z najwyższych wartości przekroczy 3,5? Wydaje się, że musi tak być, ponieważ gdybym rzucił milion kości i wybrał najwyższą wartość za każdym razem, szanse są ogromne, że szóstki byłyby dostępne w każdym rzucie. Zatem …
13 dice 

1
Wyjaśnij, w jaki sposób „własny” pomaga odwrócić macierz
Moje pytanie dotyczy techniki obliczeniowej wykorzystywanej w geoR:::.negloglik.GRFlub geoR:::solve.geoR. W liniowym modelu mieszanym: gdzie i to odpowiednio efekty stałe i losowe. Ponadtoβ b Σ = cov ( Y )Y=Xβ+Zb+eY=Xβ+Zb+e Y=X\beta+Zb+e ββ\betabbbΣ=cov(Y)Σ=cov(Y)\Sigma=\text{cov}(Y) Podczas szacowania efektów konieczne jest obliczenie które normalnie można wykonać za pomocą czegoś podobnego , ale czasami jest prawie …

1
Najnowocześniejsze w dziedzinie filtrowania grupowego
Pracuję nad projektem dla wspólnego filtrowania (CF), tj. Ukończenia częściowo zaobserwowanej macierzy lub bardziej ogólnie tensora. Jestem nowicjuszem w tej dziedzinie i ostatecznie w tym projekcie muszę porównać naszą metodę z innymi dobrze znanymi, które obecnie porównywane są z nimi proponowane metody, a mianowicie najnowocześniejszy w CF. Moje wyszukiwanie ujawniło …

3
Definicja i delimitacja modelu regresji
Żenująco proste pytanie - ale wydaje się, że nie zostało wcześniej zadane w Cross Validated: Jaka jest definicja modelu regresji? Także pytanie pomocnicze, Co to nie jest model regresji? Jeśli chodzi o to drugie, interesują mnie trudne przykłady, w których odpowiedź nie jest od razu oczywista, np. ARIMA lub GARCH.

3
Regresja liniowa: jakikolwiek nienormalny rozkład dający tożsamość OLS i MLE?
To pytanie jest inspirowane długą dyskusją w komentarzach tutaj: W jaki sposób regresja liniowa wykorzystuje rozkład normalny? W zwykłym modelu regresji liniowej, dla uproszczenia, zapisanym tutaj tylko z jednym predyktorem: gdzie są znanymi stałymi, a są zerowymi średnimi niezależnymi błędami. Jeśli dodatkowo przyjmiemy rozkład normalny dla błędów, wówczas zwykłe estymatory …

1
Co to za wykres?
Przepraszamy za niejasne pytanie, ale ta tabela pojawia się w Biddle i in. 2009 i wcześniej nie spotkałem czegoś takiego. To wykres słupkowy ze ściętymi krawędziami, czasem „rogami”. Co to znaczy? Czy ten typ wykresu ma nazwę? Według /meta/244083/site-for-asking-about-charts pomyślałem, że Academia jest najlepszym miejscem do zapytania.

7
Czy błędem jest określanie wyników jako „prawie” lub „nieco” znaczących?
Ogólny konsensus w podobnej kwestii: czy błędem jest odnosić się do wyników jako „bardzo znaczących”? jest to, że „wysoce znaczący” jest ważnym, choć niespecyficznym, sposobem opisania siły powiązania, którego wartość p jest znacznie poniżej ustalonego progu istotności. A co z opisywaniem wartości p, które są nieco powyżej twojego progu? Widziałem, …

3
centrowanie i skalowanie zmiennych zastępczych
Mam zestaw danych, który zawiera zarówno zmienne jakościowe, jak i zmienne ciągłe. Poradzono mi, aby przekształcić zmienne kategorialne jako zmienne binarne dla każdego poziomu (tj. A_level1: {0,1}, A_level2: {0,1}) - Myślę, że niektórzy nazywają to „zmiennymi obojętnymi”. Mając to na uwadze, czy wprowadzanie w błąd i wyśrodkowanie całego zestawu danych …

1
Nadzorowana redukcja wymiarów
Mam zestaw danych składający się z 15K próbek znakowanych (z 10 grup). Chcę zastosować redukcję wymiarowości do 2 wymiarów, które uwzględnią znajomość etykiet. Kiedy używam „standardowych” nienadzorowanych technik redukcji wymiarów, takich jak PCA, wykres rozproszenia wydaje się nie mieć nic wspólnego ze znanymi etykietami. Czy to, czego szukam, ma imię? …

1
Czym są „obrócone” i „nieobrócone” główne elementy, biorąc pod uwagę, że PCA zawsze obraca osie współrzędnych?
O ile rozumiem, główne komponenty są uzyskiwane przez obrót osi współrzędnych w celu wyrównania ich z kierunkami maksymalnej wariancji. Niemniej jednak wciąż czytam o „niezabezpieczonych głównych składnikach”, a moje oprogramowanie statystyczne (SAS) daje mi główne elementy obrócone varimax, a także te niezabezpieczone. Tutaj jestem zdezorientowany: kiedy obliczamy główne elementy, osie …

1
Jak wytrenować warstwę LSTM w sieci głębokiej
Używam sieci lstm i feed-forward do klasyfikowania tekstu. Przekształcam tekst w pojedyncze gorące wektory i wprowadzam każdy do lstm, dzięki czemu mogę podsumować jako pojedynczą reprezentację. Następnie przesyłam go do innej sieci. Ale jak mam trenować lstm? Chcę po prostu sklasyfikować tekst - czy powinienem go karmić bez szkolenia? Chcę …

3
Jak dokładnie splotowe sieci neuronowe używają splotu zamiast mnożenia macierzy?
Czytałem książkę Yoshua Bengio o głębokim uczeniu się i na stronie 224 napisano: Sieci splotowe to po prostu sieci neuronowe, które używają splotu zamiast ogólnego mnożenia macierzy w co najmniej jednej z ich warstw. nie byłem jednak w 100% pewien, jak „zastąpić mnożenie macierzy splotem” w matematycznie precyzyjnym sensie. To, …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.