Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Ocena pików w szeregach czasowych danych sygnałów komórkowych
Sprawdzam obecność odpowiedzi w pomiarach sygnałów komórkowych. Najpierw zastosowałem algorytm wygładzania (Hanning) do szeregów czasowych danych, a następnie wykryłem piki. Dostaję to: Gdybym chciał, aby wykrycie odpowiedzi było nieco bardziej obiektywne niż „tak, widzisz wzrost w ciągłym spadku”, jakie byłoby najlepsze podejście? Czy ma to na celu uzyskanie odległości pików …

2
Jak znaleźć, kiedy wykres osiąga szczyt i płaskowyże?
Może to zabrzmieć bardzo prosto, ale mam ten problem: mam kolejkę danych o rozmiarze okna 300. Nowe dane są dodawane z jednego końca, stare wartości są usuwane z drugiego końca. Oczekuję, że dane w kolejce pozostaną mniej więcej spójne, np .: 10,12,15,10,20, a następnie zaczną gwałtownie rosnąć: 15,10,20,22,25,28,28,30,32 ... aż …

3
Prestiżowy paradoks magika
Prawdopodobnie znasz sztuczkę w filmie The Prestige : [SPOILER FILMU] Mag odkrył imponującą sztuczkę magiczną: wchodzi do maszyny, zamyka drzwi, a następnie znika i pojawia się po drugiej stronie pokoju. Ale maszyna nie jest idealna: zamiast go teleportować, powielają go. Mag pozostaje tam, gdzie jest, a kopia jest tworzona po …

5
Co mogę zrobić poza korelacją Pearsona?
Podczas sprawdzania, czy dwie zmienne są skorelowane, zauważyłem, że zastosowanie korelacji Pearsona dało liczby tak niskie jak 0,1, co wskazuje na brak korelacji. Czy jest coś, co mogę zrobić, aby wzmocnić to roszczenie? Zestaw danych (podzbiór z powodu limitów wysyłania), na który patrzę, jest następujący: 6162.178176 0.049820046 4675.14432 0.145022261 5969.056896 …

1
Oszacować średni przedział ufności metodą bootstrap t lub po prostu bootstrap?
Szacując przedział ufności średniej, myślę, że można zastosować zarówno metodę ładowania początkowego, jak i nieparametryczną metodę ładowania początkowego, ale ta pierwsza wymaga nieco więcej obliczeń. Zastanawiam się, jakie są zalety i wady bootstrapu t względem normalnego nieparametrycznego bootstrapu? Dlaczego? Czy są jakieś odniesienia do wyjaśnienia tego?

3
Jak zweryfikować bardzo niskie poziomy błędów
Mam do czynienia z próbą wykazania poprzez testowanie wyjątkowo niskiego poziomu błędu czujnika (nie więcej niż 1 błąd na 1 000 000 prób). Mamy ograniczony czas na przeprowadzenie eksperymentu, więc spodziewamy się, że nie będziemy w stanie uzyskać więcej niż około 4000 prób. Nie widzę problemu z pokazaniem, że czujnik …

2
Jakiego rodzaju regresji użyć, biorąc pod uwagę jedną zmienną z górną granicą?
Ja nie wiem, stosowanej metody modelowania zależność pomiędzy dwoma zmiennymi ( i ) w doświadczeniu opisano w sposób następujący:xxxyyy Istnieją 3 zmienne: , i .xaimxaimx_{aim}xxxyyy Wartość jest ustawiana podczas przeprowadzania eksperymentu. Jednak i nie zawsze są równe.xaimxaimx_{aim}xxxxaimxaimx_{aim} Współczynnik korelacji Pearsona między i wynosi około 0,9.xaimxaimx_{aim}xxx Współczynnik korelacji Pearsona między i …

5
Czy korekty wielokrotnych porównań są konieczne dla nieformalnych / wizualnych „wielokrotnych porównań”?
Mam coś w rodzaju filozoficznego pytania o to, kiedy konieczna jest korekta wielokrotnego porównania. Pomiar ciągłego zmieniającego się czasu sygnału (w dyskretnych punktach czasowych). Od czasu do czasu zdarzają się osobne zdarzenia i chciałbym ustalić, czy zdarzenia te mają znaczący wpływ na zmierzony sygnał. Mogę więc wziąć średni sygnał, który …

3
Algorytm Apriori w prostym języku angielskim?
Czytam artykuł wiki o Apriori. Mam problem ze zrozumieniem śliwek i kroku dołączenia. Czy ktoś może mi wyjaśnić, jak działa algorytm Apriori w prostych słowach (tak, że nowicjusz taki jak ja może łatwo zrozumieć)? Dobrze będzie, jeśli ktoś objaśni proces zaangażowany w to krok po kroku.





2
Czy dane mogą dyktować priorytety, a następnie uruchomić model przy użyciu tych priorytetów? (np. priory oparte na danych z tego samego zestawu danych)
Rozumiem, że nie powinniśmy pozwalać temu samemu zestawowi danych, który analizujemy, na określenie / zdefiniowanie wyglądu poprzednich dystrybucji w analizie bayesowskiej. W szczególności niewłaściwe jest definiowanie wcześniejszych rozkładów dla analizy bayesowskiej na podstawie statystyk podsumowujących z tego samego zestawu danych, z którego następnie zamierzasz korzystać z priors, aby pomóc dopasować …
9 bayesian  prior 

2
Czy próbkowanie ze złożonego rozkładu normalnego jest równoważne próbkowaniu z rozkładu normalnego obciętego do 0?
Chcę symulować z normalnej gęstości (powiedzmy średnią = 1, sd = 1), ale chcę tylko dodatnich wartości. Jednym ze sposobów jest symulacja z wartości normalnej i przyjęcie wartości bezwzględnej. Myślę o tym jak o złożonej normalności. Widzę w R, że istnieją funkcje do generowania skróconych zmiennych losowych. Jeśli wykonuję symulację …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.