Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Dlaczego stosowanie pseudoetykietowania nie wpływa trywialnie na wyniki?
Patrzyłem na częściowo nadzorowane metody uczenia się i natknąłem się na koncepcję „pseudo-etykietowania”. Jak rozumiem, dzięki pseudo-etykietowaniu masz zestaw danych oznaczonych etykietą, a także zestaw danych nieznakowanych. Najpierw trenujesz model tylko na danych z etykietami. Następnie wykorzystujesz te początkowe dane do klasyfikowania (dołączania tymczasowych etykiet) do nieoznaczonych danych. Następnie przekazujesz …


3
Czy losowy las regresji jest „prawdziwą” regresją?
Do regresji wykorzystywane są losowe lasy. Jednak z tego, co rozumiem, przypisują średnią wartość docelową na każdym liściu. Ponieważ w każdym drzewie jest tylko ograniczona liczba liści, istnieją tylko określone wartości, które cel może uzyskać z naszego modelu regresji. Czy zatem nie jest to regresja „dyskretna” (jak funkcja krokowa), a …

3
Czy MCMC nie ma pamięci?
Próbuję zrozumieć, czym jest łańcuch Markov Monte Carlo (MCMC) ze strony francuskiej Wikipedii. Mówią, że „metody Monte Carlo w łańcuchu Markowa polegają na generowaniu wektora xjaxjax_ {i} tylko z danych wektorowych xi - 1xja-1x_ {i-1} , dlatego jest to proces„ bez pamięci ”” Les méthodes de Monte-Carlo par chaînes de …
18 mcmc 

1
Kiedy słowo „bias” został ukuty oznaczać
Kiedy słowo „uprzedzenie” ukuto w znaczeniu „ ?E [ θ^- θ ]E[θ^−θ]\mathbb{E}[\hat{\theta}-\theta] Powodem, dla którego teraz o tym myślę, jest to, że przypominam Jaynesa w tekście teorii prawdopodobieństwa , krytykując użycie słowa „stronniczość” użytego do opisania tej formuły i sugerując alternatywę. Z teorii prawdopodobieństwa Jaynesa , sekcja 17.2 „Bezstronni estymatorzy:” …

2
Czy LASSO cierpi na te same problemy co regresja krokowa?
Krokowe algorytmiczne metody selekcji zmiennych mają tendencję do wybierania dla modeli, które mniej lub bardziej uwzględniają każde oszacowanie w modelach regresji ( ββ\beta i ich SE, wartości p , statystyki F itp.) I prawdopodobnie wykluczą prawdziwe predyktory, takie jak obejmują fałszywe predyktory zgodnie z dość dojrzałą literaturą symulacyjną. Czy LASSO …



3
Czy prawdopodobieństwo a posteriori może być> 1?
We wzorze Bayesa: P(x|a)=P(a|x)P(x)P(a)P(x|a)=P(a|x)P(x)P(a)P(x|a) = \frac{P(a|x) P(x)}{P(a)} czy prawdopodobieństwo tylne może przekraczać 1?P(x|a)P(x|a)P(x|a) Myślę, że jest to możliwe, jeśli na przykład przyjmujemy, że i oraz . Ale nie jestem tego pewien, bo co to znaczy, że prawdopodobieństwo jest większe niż jeden?P ( a ) < P ( x ) < …



7
Błędne dane w uczeniu maszynowym
Pracuję nad projektem Machine Learning z danymi, które są już (w dużym stopniu) stronnicze w wyniku selekcji danych. Załóżmy, że masz zestaw zakodowanych reguł. Jak zbudować model uczenia maszynowego, aby go zastąpić, skoro wszystkie dane, których może użyć, to dane, które zostały już odfiltrowane według tych reguł? Aby to wyjaśnić, …

11
Termin „liczba kolumn” macierzy
Czy istnieje jedno angielskie słowo oznaczające „liczbę kolumn” matrycy? Na przykład, „wymiarowości” o matrycy . Potrzebuję terminu na w tym przykładzie. Oczywiście zawsze mogę po prostu powiedzieć „liczbę kolumn”, ale czy mogę podać jedno słowo?2 × 3 32×32)×3)2\times 32×32)×3)2\times 33)3)3


3
Ikoniczne (zabawkowe) modele sieci neuronowych
Moi profesorowie fizyki w szkole gradowej, a także szlachetny laureat Feynman, zawsze prezentowali tak zwane modele zabawek, aby zilustrować podstawowe pojęcia i metody w fizyce, takie jak oscylator harmoniczny, wahadło, bączek i czarna skrzynka. Jakie modele zabawek służą do zilustrowania podstawowych pojęć i metod leżących u podstaw zastosowania sieci neuronowych? …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.