Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych



4
Najlepsze sposoby na agregację i analizę danych
Niedawno zacząłem uczyć się uczenia maszynowego i analizy danych. Uderzam w ścianę z powodu potrzeby tworzenia i wyszukiwania dużych zestawów danych. Chciałbym pobrać dane, które gromadzę w życiu zawodowym i osobistym, i przeanalizować je, ale nie jestem pewien, jak najlepiej wykonać następujące czynności: Jak powinienem przechowywać te dane? Przewyższać? SQL? …


3
Jak uruchomić regresję liniową w sposób równoległy / rozproszony dla ustawienia dużych zbiorów danych?
Pracuję nad bardzo dużym problemem z regresją liniową, przy czym rozmiar danych jest tak duży, że muszą być przechowywane na klastrze maszyn. Będzie o wiele za duży, aby zgrupować wszystkie próbki w pamięci jednego komputera (nawet dysku) Aby wykonać regresję tych danych, myślę o podejściu równoległym, tj. Uruchom regresję dla …


2
Keras: dlaczego strata maleje, a val_loss rośnie?
Ustawiam wyszukiwanie siatki dla kilku parametrów. Próbuję znaleźć najlepsze parametry dla sieci neuronowej Keras, która dokonuje klasyfikacji binarnej. Dane wyjściowe to 1 lub 0. Istnieje około 200 funkcji. Kiedy przeszukałem siatkę, dostałem kilka modeli i ich parametrów. Najlepszy model miał następujące parametry: Epochs : 20 Batch Size : 10 First …

2
Dlaczego źle jest zatrzymać test A / B przed osiągnięciem optymalnej wielkości próbki?
Jestem odpowiedzialny za prezentowanie wyników testów A / B (przeprowadzanych na różnych stronach internetowych) w mojej firmie. Test przeprowadzamy przez miesiąc, a następnie sprawdzamy wartości p w regularnych odstępach czasu, aż osiągniemy istotność (lub porzucimy, jeśli istotność nie zostanie osiągnięta po długim czasie testowania), coś, co teraz dowiaduję się, jest …

2
Jaka jest różnica między zmienną losową a losową próbką?
Te dwa wyrażenia bardzo mnie pomieszały, kiedy uczyłem się statystyki. Wydaje mi się, że są to zupełnie różne rzeczy. Losowa próbka jest losowo pobrać próbkę z populacji, podczas gdy zmienna losowa jest jak funkcja, która odwzorowuje zbiór wszystkich możliwych wyników eksperymentu do liczby rzeczywistej. Powiedzmy jednak, że jeśli jakieś próbki …

1
Czy generalnie wnioskowanie jest trudniejsze niż przewidywanie?
Moje pytanie pochodzi z następującego faktu. Czytam posty, blogi, wykłady oraz książki na temat uczenia maszynowego. Mam wrażenie, że praktycy uczenia maszynowego wydają się być obojętni na wiele rzeczy, którymi interesują się statystyki / ekonometria. W szczególności praktycy uczenia maszynowego kładą nacisk na dokładność przewidywania w porównaniu do wnioskowania. Jeden …


4
Dlaczego dopasowywanie wyniku oceny skłonności do wnioskowania przyczynowego?
Dopasowanie oceny skłonności służy do wnioskowania przyczynowego w badaniach obserwacyjnych (patrz artykuł Rosenbaum / Rubin ). Jaka jest prosta intuicja, dlaczego to działa? Innymi słowy, dlaczego jeśli upewnimy się, że prawdopodobieństwo uczestniczenia w leczeniu jest równe dla obu grup, znikną zakłócające efekty i możemy wykorzystać wynik, aby wyciągnąć wnioski przyczynowe …

1
Jak naprawić brak konwergencji w LogisticRegressionCV
Korzystam ze scikit-learn, aby przeprowadzić regresję logistyczną z weryfikacją krzyżową na zestawie danych (około 14 parametrów z> 7000 znormalizowanych obserwacji). Mam również docelowy klasyfikator, który ma wartość 1 lub 0. Problem, jaki mam, polega na tym, że niezależnie od używanego solwera wciąż otrzymuję ostrzeżenia o konwergencji ... model1 = linear_model.LogisticRegressionCV(cv=10,verbose=1,n_jobs=-1,scoring='roc_auc',solver='newton-cg',penalty='l2') …

4
Jaki jest cel normalizacji wierszy
Rozumiem uzasadnienie normalizacji kolumn, ponieważ powoduje, że cechy są ważone równo, nawet jeśli nie są mierzone w tej samej skali - jednak często w literaturze najbliższego sąsiada zarówno kolumny, jak i wiersze są znormalizowane. Do czego służy normalizacja wierszy / dlaczego normalizować wiersze? W szczególności, w jaki sposób wynik normalizacji …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.