Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Dlaczego termin odchylenia w SVM jest szacowany osobno, zamiast dodatkowego wymiaru w wektorze cech?
Optymalna hiperpłaszczyzna w SVM jest zdefiniowana jako: w⋅x+b=0,w⋅x+b=0,\mathbf w \cdot \mathbf x+b=0, gdzie oznacza próg. Jeśli mamy jakieś mapowanie które mapuje przestrzeń wejściową na jakąś przestrzeń , możemy zdefiniować SVM w przestrzeni , gdzie optymalna hiperplantu będzie:bbbϕϕ\mathbf \phiZZZZZZ w⋅ϕ(x)+b=0.w⋅ϕ(x)+b=0.\mathbf w \cdot \mathbf \phi(\mathbf x)+b=0. Zawsze możemy jednak zdefiniować mapowanie tak …
11 svm  threshold 


1
Przybliżony
Od niechcenia czytałem artykuł (z ekonomii), który miał następujące przybliżenie dla :log(E(X))log⁡(E(X))\log(E(X)) ,log(E(X))≈E(log(X))+0.5var(log(X))log⁡(E(X))≈E(log⁡(X))+0.5var(log⁡(X))\log(E(X)) \approx E(\log(X))+0.5 \mathrm{var}(\log(X)) które według autora jest dokładne, jeśli X jest log-normalny (co wiem). Nie wiem, jak wyprowadzić to przybliżenie. Próbowałem obliczyć przybliżenie Taylora drugiego rzędu i wymyśliłem tylko to wyrażenie: log(E(X))≈E(log(X))+0.5var(X)E(X)2log⁡(E(X))≈E(log⁡(X))+0.5var(X)E(X)2\log(E(X)) \approx E(\log(X))+0.5\frac{\mathrm{var}(X)}{E(X)^2}

3
Czy interakcje są użyteczne tylko w kontekście regresji?
Zawsze czytałem termin interakcja w kontekście regresji. Czy powinniśmy również rozważyć interakcje z różnymi modelami, np. Knn lub svm? Jeśli jest , lub nawet więcej funkcji i powiedzmy obserwacji, jaki jest zwykle sposób na znalezienie użytecznych interakcji? Wypróbować wszystkie kombinacje? Lub użyj tylko kombinacji, które mają sens?505050100100100100010001000

4
Dlaczego miary dyspersji są mniej intuicyjne niż centralność?
Wydaje się, że w naszym ludzkim rozumieniu jest coś, co stwarza trudności w intuicyjnym uchwyceniu idei wariancji. W wąskim znaczeniu odpowiedź jest natychmiastowa: podniesienie kwadratu odciąga nas od refleksyjnego zrozumienia. Ale czy to tylko wariancja powoduje problemy, czy też cała idea rozprzestrzeniania się w danych? Szukamy schronienia w zasięgulub po …

3
Zrozumienie koniugatu Beta przed wnioskiem Bayesa o częstotliwości
Poniżej znajduje się fragment wprowadzenia Bolstad do statystyki bayesowskiej . Dla wszystkich tych ekspertów może to być trywialne, ale nie rozumiem, w jaki sposób autor stwierdza, że ​​nie musimy wykonywać żadnej integracji, aby obliczyć prawdopodobieństwo późniejsze dla pewnej wartości . Rozumiem drugie wyrażenie, którym jest proporcjonalność i skąd pochodzą wszystkie …


2
Sukces prób Bernoulliego z różnymi prawdopodobieństwami
Jeśli przeprowadzonych zostanie 20 niezależnych prób Bernoulliego, każde z innym prawdopodobieństwem sukcesu, a tym samym porażki. Jakie jest prawdopodobieństwo, że dokładnie n z 20 prób zakończyło się sukcesem? Czy istnieje lepszy sposób obliczania tych prawdopodobieństw niż po prostu sumowanie kombinacji prawdopodobieństwa sukcesu i niepowodzenia?

2
Asymptotyka łacińskiego Hypercube
Próbuję skonstruować dowód na problem, nad którym pracuję, a jednym z założeń, które robię, jest to, że zbiór punktów, z których próbuję, jest gęsty na całej przestrzeni. Praktycznie używam łacińskiego próbkowania hipersześcianu, aby uzyskać punkty w całej przestrzeni próbki. Chciałbym wiedzieć, czy próbki łacińskiej hipersześcianu są gęste na całej przestrzeni, …

3
Wykreślanie wyników mających jedynie średnie i standardowe odchylenie
Staram się wizualizować odpowiedni wykres dla obserwacji w poniższej tabeli średnich i odchyleń standardowych wyników wycofania: RecallControlMean37SD8ExperimentalMean21SD6ControlExperimentalMeanSDMeanSDRecall378216\begin{array} {c|c c|c c|} & \text{Control} & & \text{Experimental} & \\ & \text{Mean} & \text{SD} &\text{Mean} &\text{SD} \\ \hline \text{Recall} & 37 & 8 & 21 & 6 \\ \hline \end{array} Jak najlepiej to …


3
Czy zawsze lepiej jest wyodrębnić więcej czynników, jeśli istnieją?
W przeciwieństwie do analizy głównych komponentów rozwiązania modeli analizy czynnikowej niekoniecznie są zagnieżdżone. Oznacza to, że ładunki (na przykład) dla pierwszego czynnika niekoniecznie będą identyczne, gdy tylko pierwszy czynnik zostanie wyodrębniony w porównaniu z pierwszymi dwoma czynnikami. Mając to na uwadze, rozważ przypadek, w którym masz zestaw zmiennych przejawionych, które …

1
Algorytmy osadzania słów pod względem wydajności
Próbuję osadzić około 60 milionów fraz w przestrzeni wektorowej , a następnie obliczyć podobieństwo między nimi. Używam sklearn's CountVectorizerz niestandardową wbudowaną funkcją tokenizera, która produkuje unigramy i bigramy. Okazuje się, że aby uzyskać sensowne reprezentacje, muszę pozwolić na ogromną liczbę kolumn, liniowych w liczbie wierszy. Prowadzi to do niewiarygodnie rzadkich …



Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.