Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


3
Czy ujemne prawdopodobieństwa / amplitudy prawdopodobieństwa mają zastosowania poza mechaniką kwantową?
Mechanika kwantowa uogólniła teorię prawdopodobieństwa na liczby ujemne / urojone, głównie w celu wyjaśnienia wzorów interferencji, dualizmu fal / cząstek i ogólnie takich dziwnych rzeczy. Można to jednak postrzegać bardziej abstrakcyjnie jako nieprzemienne uogólnienie prawdopodobieństwa Bayesa (cytat z Terrence Tao). Jestem ciekawa tych rzeczy, choć w żadnym wypadku nie jestem …


9
Oprogramowanie do analizy statystyk i eksploracji danych do obsługi dużych zestawów danych
Obecnie muszę przeanalizować około 20 milionów rekordów i zbudować modele predykcyjne. Do tej pory wypróbowałem Statistica, SPSS, RapidMiner i R. Wśród nich Statistica wydaje się najbardziej odpowiedni do eksploracji danych, a interfejs użytkownika RapidMiner jest również bardzo przydatny, ale wydaje się, że Statistica, RapidMiner i SPSS są odpowiednie tylko dla …

5
Czy ze statystycznego punktu widzenia można wnioskować o przyczynowości na podstawie wyników oceny skłonności w badaniu obserwacyjnym?
Pytanie: Czy z punktu widzenia statystyki (lub praktyka) można wnioskować o przyczynowości na podstawie wyników skłonności w badaniu obserwacyjnym ( nie w eksperymencie )? Proszę, nie chcę rozpętać wojny z płomieniami ani fanatycznej debaty. Kontekst: W ramach naszego programu doktoranckiego statystyką zajmowaliśmy się jedynie wnioskami przyczynowymi za pośrednictwem grup roboczych …

4
Prawdopodobieństwo, że nie narysuje słowa z worka liter w Scrabble
Załóżmy, że masz torbę z płytkami, z których każda zawiera literę. Są kafelki z literą „A”, z „B” itd., I „symbole wieloznaczne” (mamy ). Załóżmy, że masz słownik ze skończoną liczbą słów. Z torby wybierasz płytek bez wymiany. Jak obliczysz (lub oszacujesz) prawdopodobieństwo, że możesz sformułować zero słów ze słownika, …



2
Obszar pod krzywą Precyzja-przywołanie (AUC krzywej PR) i Średnia precyzja (AP)
Czy średnia precyzja (AP) to obszar pod krzywą Precyzja-przywołanie (AUC krzywej PR)? EDYTOWAĆ: oto komentarz na temat różnicy w AUC PR i AP. AUC jest uzyskiwane przez trapezoidalną interpolację precyzji. Alternatywnym i zwykle prawie równoważnym miernikiem jest średnia precyzja (AP), zwracana jako info.ap. Jest to średnia precyzji uzyskanej za każdym …


6
Dlaczego mniejsze ciężary powodują prostsze modele regularyzacji?
Ukończyłem kurs uczenia maszynowego Andrew Nga około rok temu, a teraz piszę moje badanie matematyki w szkole średniej na temat działania regresji logistycznej i technik optymalizacji wydajności. Jedną z tych technik jest oczywiście regularyzacja. Celem regularyzacji jest zapobieganie nadmiernemu dopasowaniu poprzez rozszerzenie funkcji kosztów o cel prostoty modelu. Możemy to …

1
przewidywanie () Funkcja dla mniejszych modeli efektów mieszanych
Problem: Przeczytałem w innych postach, które predictnie są dostępne dla lmermodeli z efektami mieszanymi {lme4} w [R]. Próbowałem zgłębić ten temat za pomocą zestawu danych o zabawkach ... Tło: Zestaw danych jest dostosowany z tego źródła i dostępny jako ... require(gsheet) data <- read.csv(text = gsheet2text('https://docs.google.com/spreadsheets/d/1QgtDcGJebyfW7TJsB8n6rAmsyAnlz1xkT3RuPFICTdk/edit?usp=sharing', format ='csv')) Oto pierwsze …

4
Zespół różnych rodzajów regresorów wykorzystujących scikit-learn (lub dowolną inną platformę python)
Próbuję rozwiązać zadanie regresji. Dowiedziałem się, że 3 modele działają dobrze dla różnych podzbiorów danych: LassoLARS, SVR i Gradient Tree Boosting. Zauważyłem, że kiedy robię prognozy na podstawie tych wszystkich 3 modeli, a następnie tworzę tabelę „rzeczywistych wyników” i wyników moich 3 modeli, widzę, że za każdym razem przynajmniej jeden …

2
Jak używać jednocześnie zmiennych binarnych i ciągłych w grupowaniu?
Potrzebuję użyć zmiennych binarnych (wartości 0 i 1) w k-średnich. Ale k-średnie działa tylko ze zmiennymi ciągłymi. Wiem, że niektórzy ludzie nadal używają tych zmiennych binarnych w k-średnich, ignorując fakt, że k-średnie jest zaprojektowane tylko dla zmiennych ciągłych. To jest dla mnie nie do przyjęcia. Pytania: Jaki jest zatem statystycznie …

2
Czy powinniśmy zajmować się korektami wielu porównań, stosując przedziały ufności?
Załóżmy, że mamy scenariusz wielokrotnych porównań, takich jak wnioskowanie post hoc na statystyce parami lub jak regresja wielokrotna, w której dokonujemy w sumie porównań. Załóżmy również, że chcielibyśmy poprzeć wnioskowanie w tych wielokrotnościach z wykorzystaniem przedziałów ufności.mmm 1. Czy stosujemy wiele korekt porównawczych do elementów CI? Oznacza to, że podobnie …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.