Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Jak należy zamówić dobór funkcji i optymalizację hiperparametrów w potoku uczenia maszynowego?
Moim celem jest klasyfikacja sygnałów z czujników. Dotychczasowe pojęcie mojego rozwiązania to: i) Funkcje inżynieryjne z surowego sygnału ii) Wybieranie odpowiednich funkcji za pomocą ReliefF i podejścia klastrowego iii) Zastosuj NN, Losowy Las i SVM Jestem jednak uwięziony w dylemacie. W ii) i iii) istnieją hiperparametry, takie jak k-Najbliższe Neigbours …


2
Dlaczego funkcja bootstrap scikit-learn ponownie próbkuje zestaw testowy?
Kiedy używałem bootstrapowania do oceny modelu, zawsze myślałem, że próbki z torebki były bezpośrednio używane jako zestaw testowy. Jednak wydaje się, że nie jest tak w przypadku przestarzałego podejścia scikit-learnBootstrap , które wydaje się budować zestaw testowy na podstawie rysowania z zastępowaniem z podzbioru danych poza torbą. Jakie jest uzasadnienie …

4
Jak generować losowe dane kategoryczne?
Powiedzmy, że mam zmienną kategoryczną, która może przyjmować wartości A, B, C i D. Jak wygenerować 10000 losowych punktów danych i kontrolować częstotliwość każdego z nich? Na przykład: A = 10% B = 20% C = 65% D = 5% Jakieś pomysły, jak to zrobić?

2
Funkcje wpływu i OLS
Próbuję zrozumieć, jak działają funkcje wpływu. Czy ktoś mógłby wyjaśnić w kontekście prostej regresji OLS yi=α+β⋅xi+εiyi=α+β⋅xi+εi\begin{equation} y_i = \alpha + \beta \cdot x_i + \varepsilon_i \end{equation} gdzie chcę funkcję wpływu dla .ββ\beta

1
Jaka jest „pojemność” modelu uczenia maszynowego?
Studiuję ten samouczek na temat Autoencoderów wariacyjnych autorstwa Carla Doerscha . Na drugiej stronie znajduje się: Jednym z najpopularniejszych takich frameworków jest AutoCoder wariacyjny [1, 3], będący przedmiotem tego samouczka. Założenia tego modelu są słabe, a trening jest szybki dzięki propagacji wstecznej. Wartości VAE dokonują przybliżenia, ale błąd wprowadzony przez …




1
Jak działa L-BFGS?
Celem artykułu była optymalizacja niektórych parametrów poprzez maksymalizację znormalizowanego prawdopodobieństwa dziennika. Następnie obliczają pochodne częściowe. A potem autorzy wspominają, że optymalizują równanie za pomocą L-BFGS, standardowej procedury quasi-Newtona w celu optymalizacji płynnych funkcji wielu zmiennych (bez dalszych szczegółów). Jak to działa ?

4
Darmowy hosting danych w interesie publicznym? [Zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 4 lata temu . Mam raporty godzinowe i dzienne temperatury dla wielu stacji na stronie http://data.barrycarter.info/ Zachęcam ludzi do pobrania, ale przy 6.6G zużywa dużo …
14 dataset 

1
Dlaczego mieliby tutaj wybrać rozkład gamma?
W jednym z ćwiczeń na moim kursie korzystamy z medycznego zestawu danych Kaggle . Ćwiczenie mówi: chcemy modelować rozkład poszczególnych ładunków, a także naprawdę chcieć uchwycić naszą niepewność co do tego rozkładu, abyśmy mogli lepiej uchwycić zakres wartości, które możemy zobaczyć. Ładowanie danych i wykonywanie początkowego widoku: Z powyższego możemy …

2
Czy Wolfram Mathworld popełnia błąd opisując dyskretny rozkład prawdopodobieństwa z funkcją gęstości prawdopodobieństwa?
Zwykle rozkład prawdopodobieństwa między zmiennymi dyskretnymi opisuje się za pomocą funkcji masy prawdopodobieństwa (PMF): Pracując z ciągłymi zmiennymi losowymi, opisujemy rozkłady prawdopodobieństwa za pomocą funkcji gęstości prawdopodobieństwa (PDF) zamiast funkcji masy prawdopodobieństwa. - Dogłębne uczenie się przez Goodfellow, Bengio i Courville Jednak Wolfram Mathworld używa PDF do opisania rozkładu prawdopodobieństwa …


3
Jak zmierzyć statystyczną „odległość” między dwoma rozkładami częstotliwości?
Podejmuję się projektu analizy danych, który obejmuje badanie czasu użytkowania strony internetowej w ciągu roku. Chciałbym porównać, jak „spójne” wzorce użytkowania są, powiedzmy, jak blisko są do wzorca, który wymaga używania go przez 1 godzinę raz w tygodniu, lub takiego, który obejmuje używanie go przez 10 minut na raz, 6 …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.