Nauka danych data-mining

4

K-oznacza: Jakie są dobre sposoby wyboru skutecznego zestawu początkowych centroidów?

Gdy stosowana jest losowa inicjalizacja centroidów, różne serie K-średnich dają różne całkowite SSE. I ma to kluczowe znaczenie dla wydajności algorytmu. Jakie są skuteczne podejścia do rozwiązania tego problemu? Najnowsze podejścia są mile widziane.

17 data-mining clustering k-means

5

powiększ mapę cieplną dna morskiego

Tworzę plik corr()df z oryginalnego pliku df. corr()Df wyszedł 70 x 70 i to jest niemożliwe, aby wyobrazić sobie mapę cieplną ... sns.heatmap(df). Jeśli spróbuję wyświetlić corr = df.corr(), tabela nie pasuje do ekranu i widzę wszystkie korelacje. Czy jest to sposób na wydrukowanie całości dfbez względu na jej rozmiar …

17 visualization pandas plotting machine-learning neural-network svm decision-trees svm efficiency python linear-regression machine-learning nlp topic-model lda named-entity-recognition naive-bayes-classifier association-rules fuzzy-logic kaggle deep-learning tensorflow inception classification feature-selection feature-engineering machine-learning scikit-learn tensorflow keras encoding nlp text-mining nlp rnn python neural-network feature-extraction machine-learning predictive-modeling python r linear-regression clustering r ggplot2 neural-network neural-network training python neural-network deep-learning rnn predictive-modeling databases sql programming distribution dataset cross-validation neural-network deep-learning rnn machine-learning machine-learning python deep-learning data-mining tensorflow visualization tools sql embeddings orange feature-extraction unsupervised-learning gan machine-learning python data-mining pandas machine-learning data-mining bigdata apache-spark apache-hadoop deep-learning python convnet keras aggregation clustering k-means r random-forest decision-trees reference-request visualization data pandas plotting neural-network keras rnn theano deep-learning tensorflow inception predictive-modeling deep-learning regression sentiment-analysis nlp encoding deep-learning python scikit-learn lda convnet keras predictive-modeling regression overfitting regression svm prediction machine-learning similarity word2vec information-retrieval word-embeddings neural-network deep-learning rnn

3

Jednoklasowa klasyfikacja dyskryminacyjna o niezrównoważonym, heterogenicznym tle negatywnym?

Pracuję nad ulepszeniem istniejącego nadzorowanego klasyfikatora, do klasyfikowania sekwencji {białka} jako należących do określonej klasy (prekursorów hormonu neuropeptydowego), czy nie. Istnieje około 1150 znanych „pozytywów” na tle około 13 milionów sekwencji białek („Nieznane / słabo opatrzone adnotacjami tło”) lub około 100 000 sprawdzonych, odpowiednich białek, opatrzonych różnorodnymi właściwościami (ale bardzo …

16 machine-learning data-mining python classification

2

Różnica rekomendacji oparta na przedmiotach i użytkownikach w Mahout

Chciałbym wiedzieć, w jaki sposób rekomendacje oparte na użytkownikach Mahoutu i na produktach różnią się od siebie. Określa to Oparte na użytkownikach : polecaj przedmioty, znajdując podobnych użytkowników. Jest to często trudniejsze do skalowania ze względu na dynamiczny charakter użytkowników. Oparte na elementach : oblicz podobieństwo między elementami i przygotuj …

15 machine-learning data-mining algorithms recommender-system

4

Drzewo decyzyjne a KNN

W jakich przypadkach lepiej jest użyć drzewa decyzyjnego, a innych - KNN? Po co używać jednego z nich w niektórych przypadkach? A drugi w różnych przypadkach? (Patrząc na jego funkcjonalność, a nie na algorytm) Czy ktoś ma jakieś wyjaśnienia lub odniesienia na ten temat?

15 machine-learning data-mining decision-trees

3

Dlaczego zespoły są tak nieracjonalnie skuteczne

Wydaje się, że aksjomatem stało się to, że grupa uczniów prowadzi do najlepszych możliwych wyników modeli - i coraz rzadziej na przykład pojedyncze modele wygrywają zawody takie jak Kaggle. Czy istnieje teoretyczne wyjaśnienie, dlaczego zespoły są tak skuteczne?

14 machine-learning data-mining predictive-modeling

2

Używanie atrybutów do klasyfikowania / klastrowania profili użytkowników

Mam zbiór danych użytkowników kupujących produkty ze strony internetowej. Atrybuty, które mam, to identyfikator użytkownika, region (stan) użytkownika, identyfikator kategorii produktu, identyfikator słowa kluczowego produktu, identyfikator słowa kluczowego witryny internetowej i kwota sprzedaży produktu. Celem jest wykorzystanie informacji o produkcie i stronie internetowej w celu ustalenia tożsamości użytkowników, takich jak …

14 machine-learning data-mining classification clustering

1

Rozpoznawanie gramatyki w sekwencji rozmytych tokenów

Mam dokumenty tekstowe, które zawierają głównie listy pozycji. Każdy element jest grupą kilku tokenów z różnych typów: Imię, Nazwisko, Data urodzenia, Numer telefonu, Miasto, Zawód itp. Token to grupa słów. Przedmioty mogą leżeć w kilku liniach. Elementy z dokumentu mają mniej więcej tę samą składnię tokenów, ale niekoniecznie muszą być …

13 data-mining clustering text-mining time-series correlation

1

Neo4j vs OrientDB vs Titan

Pracuję nad projektem z zakresu analizy danych związanym z eksploracją relacji społecznych i potrzebuję przechowywać dane w niektórych bazach danych z grafami. Początkowo jako bazę danych wybrałem Neo4j. Ale wydaje się, że Neo4j nie skaluje się dobrze. Alternatywą, którą odkryłem, są Titan i oriebtDB. Przejrzałem to porównanie na tych trzech …

13 data-mining graphs databases social-network-analysis

4

Studium przypadku dla dużych zbiorów danych lub przykład zastosowania

Przeczytałem wiele blogów \ artykuł o tym, jak różne branże używają Big Data Analytic. Ale większość tego artykułu nie wspomina Jakie dane wykorzystały te firmy. Jaki był rozmiar danych Jakiego rodzaju narzędzi technologii wykorzystali do przetwarzania danych Jakiego problemu napotkali i jak wgląd w dane pomógł im rozwiązać problem. Jak …

13 data-mining bigdata usecase

1

Jaka jest różnica między jednym kodowaniem na gorąco a pominięciem jednego kodowania?

Czytam prezentację i zaleca się, aby nie używać pomijania jednego kodu, ale w przypadku jednego kodowania na gorąco jest to w porządku. Myślałem, że oba są takie same. Czy ktoś może opisać, jakie są między nimi różnice?

13 machine-learning data-mining feature-selection feature-extraction feature-engineering

2

Czy są jakieś interfejsy API do indeksowania streszczenia papieru?

Jeśli mam bardzo długą listę nazw artykułów, jak mogę uzyskać streszczenie tych artykułów z Internetu lub z dowolnej bazy danych? Nazwy artykułów są jak „Ocena użyteczności w Web Mining dla domeny zdrowia publicznego”. Czy ktoś zna API, które może dać mi rozwiązanie? Próbowałem zaindeksować Google Scholar, jednak Google zablokował mój …

13 data-mining machine-learning

2

Taryfy lotnicze - Jaką analizę należy zastosować, aby wykryć konkurencyjne zachowanie przy ustalaniu cen i korelacje cenowe?

Chcę zbadać zachowanie linii lotniczych w zakresie ustalania cen - w szczególności sposób, w jaki linie lotnicze reagują na ceny konkurentów. Ponieważ powiedziałbym, że moja wiedza na temat bardziej złożonych analiz jest dość ograniczona, zrobiłem głównie wszystkie podstawowe metody, aby zebrać ogólny widok danych. Obejmuje to proste wykresy, które już …

12 data-mining dataset regression correlation visualization

2

Czy FPGrowth jest nadal uważany za „najnowocześniejszy” w częstym wydobywaniu wzorów?

O ile wiem rozwój algorytmów do rozwiązania problemu Frequent Pattern Mining (FPM), droga ulepszeń ma kilka głównych punktów kontrolnych. Po pierwsze, algorytm Apriori został zaproponowany w 1993 r. Przez Agrawal i in. wraz z sformalizowaniem problemu. Algorytm był w stanie usunąć niektóre zestawy z 2^n - 1zestawów (powerset) za pomocą …

12 bigdata data-mining efficiency state-of-the-art

2

Jak dopasować jakościowe typy danych do losowej klasyfikacji lasu?

Muszę znaleźć dokładność zestawu danych szkoleniowych, stosując algorytm losowego lasu. Ale mój typ mojego zestawu danych jest zarówno kategoryczny, jak i numeryczny. Kiedy próbowałem dopasować te dane, pojawia się błąd. „Dane wejściowe zawierają NaN, nieskończoność lub wartość zbyt dużą dla dtype („ float32 ”)”. Problem może dotyczyć typów danych obiektowych. …

12 python data-mining random-forest

Pytania otagowane jako data-mining