Wykonuję hierarchiczne grupowanie danych zebranych i przetworzonych ze zrzutu danych reddit w Google BigQuery. Mój proces jest następujący: Pobierz najnowsze 1000 postów w / r / politics Zbierz wszystkie komentarze Przetwarzaj dane i oblicz n x mmacierz danych (n: users / samples, m: posts / features) Oblicz macierz odległości dla …
Ostatnio dowiedziałem się o stosowaniu technik ładowania początkowego do obliczania standardowych błędów i przedziałów ufności dla estymatorów. Nauczyłem się, że jeśli dane są IID, możesz traktować dane przykładowe jako populację i wykonywać próbkowanie z wymianą, co pozwoli ci uzyskać wiele symulacji statystyki testowej. W przypadku szeregów czasowych wyraźnie nie możesz …
Przez długi czas nie rozumieć, dlaczego „suma” dwóch zmiennych losowych jest ich uwypuklony , natomiast suma funkcji gęstości mieszaniny f(x)f(x)f(x) i g(x)g(x)g(x) jest pf(x)+(1−p)g(x)pf(x)+(1−p)g(x)p\,f(x)+(1-p)g(x); suma arytmetyczna, a nie ich splot. Dokładna fraza „suma dwóch zmiennych losowych” pojawia się w Google 146 000 razy i jest eliptyczna w następujący sposób. Jeśli …
Próbuję zrozumieć współczynnik zmienności . Kiedy próbuję zastosować go do następujących dwóch próbek danych, nie jestem w stanie zrozumieć, jak interpretować wyniki. Powiedzmy, że próbka 1 to a próbka 2 to {10, 15, 17, 22, 21, 27} . Tutaj próbka 2 = próbka 1 + \ 10, jak widać.0 , …
Mam dziwne pytanie, kiedy eksperymentowałem z wypukłymi optymalizacjami. Pytanie brzmi: Załóżmy, że losowo (powiedzmy standardowy rozkład normalny) generuję macierz symetryczną (na przykład generuję górną macierz trójkątną i wypełniam dolną połowę, aby upewnić się, że jest symetryczna), jaka jest szansa, że jest to wartość dodatnia określona matryca? Czy w ogóle można …
Na podstawowych kursach statystyki poniżej stopnia uczniowie (zwykle?) Uczą się testowania hipotez dla średniej populacji. Dlaczego skupia się na średniej, a nie na środkowej? Domyślam się, że łatwiej jest przetestować średnią ze względu na centralne twierdzenie graniczne, ale chciałbym przeczytać kilka wykształconych wyjaśnień.
Czytam na https://en.wikipedia.org/wiki/Generative_adversarial_networks : [Generatywne sieci przeciwników] zostały wprowadzone przez Iana Goodfellow i in. W 2014 r. ale Jurgen Schmidhuber twierdzi, że wcześniej wykonał podobną pracę w tym kierunku (np. podczas NIPS 2016 odbyła się debata podczas samouczka generatywnych sieci przeciwników: https://channel9.msdn.com/Events/Neural-Information-Processing-Systems- Konferencja / Neural-Information-Processing-Systems-Conference-NIPS-2016 / Generative-Adversarial-Networks patrz 1h03min). Czy …
Kilka prac metodologicznych (np. Egger i in. 1997a, 1997b) omawia stronniczość publikacji ujawnioną w metaanalizach, wykorzystując wykresy lejkowe, takie jak ta poniżej. Artykuł z 1997b mówi dalej, że „jeśli obecne jest stronniczość publikacji, oczekuje się, że spośród opublikowanych badań największe z nich wykażą najmniejsze efekty”. Ale dlaczego tak jest? Wydaje …
Mam zestaw danych. Brakuje wielu wartości. W przypadku niektórych kolumn brakującą wartość zastąpiono wartością -999, ale w innych kolumnach brakującą wartość oznaczono jako „NA”. Dlaczego użyjemy -999, aby zastąpić brakującą wartość?
Pomagam moim chłopcom, obecnie w szkole średniej, w zrozumieniu statystyk i zastanawiam się nad kilkoma prostymi przykładami, nie zapominając o przebłyskach teorii. Moim celem byłoby zaproponowanie im najbardziej intuicyjnego, ale instrumentalnie konstruktywnego podejścia do nauki statystyk od zera, aby wzbudzić ich zainteresowanie dalszą nauką statystyki i nauką ilościową. Zanim jednak …
Czytam o entropii i trudno mi zrozumieć, co to znaczy w ciągłym przypadku. Strona wiki zawiera następujące informacje: Rozkład prawdopodobieństwa zdarzeń w połączeniu z ilością informacji każdego zdarzenia tworzy zmienną losową, której oczekiwaną wartością jest średnia ilość informacji lub entropia wygenerowana przez ten rozkład. Więc jeśli obliczę entropię związaną z …
Wikipedia mówi - W teorii prawdopodobieństwa centralne twierdzenie graniczne (CLT) ustala, że w większości sytuacji , gdy dodaje się niezależne zmienne losowe, ich odpowiednio znormalizowana suma zmierza w kierunku rozkładu normalnego (nieformalnie „krzywej dzwonowej”), nawet jeśli same zmienne pierwotne nie są normalnie dystrybuowane ... Kiedy mówi „w większości sytuacji”, w …
Na przykład podczas regresji, dwoma hiperparametrami do wyboru są często pojemność funkcji (np. Największy wykładnik wielomianu) i ilość regularyzacji. Jestem zdezorientowany, dlaczego nie po prostu wybrać funkcję niskiej pojemności, a następnie zignorować jakąkolwiek regularyzację? W ten sposób nie będzie pasował. Jeśli mam funkcję dużej pojemności wraz z regularyzacją, czy to …
W moim rozumieniu wysoce skorelowane zmienne nie spowodują problemów z wieloma kolinearnością w losowym modelu lasu (proszę mnie poprawić, jeśli się mylę). Jednak z drugiej strony, jeśli mam zbyt wiele zmiennych zawierających podobne informacje, czy model będzie ważył za dużo na tym zestawie, a nie na innych? Na przykład istnieją …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.