Ograniczanie wyników
Czasopisma help
Autorzy help
Lata help
Preferencje help
Widoczny [Schowaj] Abstrakt
Liczba wyników

Znaleziono wyników: 89

Liczba wyników na stronie
first rewind previous Strona / 5 next fast forward last
Wyniki wyszukiwania
Wyszukiwano:
w słowach kluczowych:  Variables selection
help Sortuj według:

help Ogranicz wyniki do:
first rewind previous Strona / 5 next fast forward last
1
Content available remote Eliminacja zmiennych z wykorzystaniem marginesu
100%
Ważnym etapem budowy klasyfikatora jest dobór zmiennych. W metodzie k najbliższych sąsiadów, wrażliwej na zmienne nieistotne, etap ten jest niezbędny do uzyskania większej dokładności klasyfikacji. Metody doboru zmiennych, które także wykorzystują najbliższe sąsiedztwo, dokonują lokalnej oceny mocy dyskryminacyjnej zmiennych i zarazem reprezentują podejście wielowymiarowe. Część z nich wykorzystuje pojęcie marginesu (margin), definiując za jego pomocą funkcję celu i formułując zadanie ważenia zmiennych jako zadanie optymalizacji. W artykule porównano trzy algorytmy z tej grupy metod ze względu na zdolność identyfikacji zmiennych nieistotnych, dokładność klasyfikacji oraz czas pracy. Zweryfikowano też dwie własne propozycje modyfikacji. W badaniach wykorzystano zbiory danych rzeczywistych z dołączonymi zmiennymi nieistotnymi, które reprezentowały różne rozkłady, niezależne od klas(abstrakt oryginalny)
2
Content available remote Selekcja zmiennych w analizie skupień marketingowych zbiorów danych binarnych
100%
W roku 2001 Desai zaproponował ciekawą miarę podobieństwa dwóch różnych wartości/wariantów tej samej cechy. Miarę tę można w dość prosty sposób wykorzystać do wyznaczenia siły dyskryminacyjnej cechy binarnej lub nominalnej wielostanowej w problemie analizy skupień. Idea oparta jest na tym, że im mniejsze podobieństwo, na przykład 1 do 0 (jako wartości zmiennej binarnej), tym większa zdolność dyskryminacyjna cechy. Ten pomysł zastosowano do skonstruowania nowej metody selekcji zmiennych binarnych w zagadnieniu analizy skupień i w zastosowaniu do dość obszernej klasy zbiorów danych binarnych, jaką są dane marketingowe. Podstawową zaletą nowej metody jest jej niezależność od konieczności grupowania danych, co wiąże się zawsze z przyjęciem jakiejś konkretnej metody grupowania oraz konkretnej wartości liczby skupień. Eksperyment przeprowadzony na 162 zbiorach danych pokazuje wysoką efektywność metody.(abstrakt oryginalny)
3
Content available remote Dobór zmiennych do zagregowanych modeli dyskryminacyjnych
100%
Rozważania nad losowym doborem zmiennych do modeli dyskryminacyjnych ukazują wpływ liczby tych zmiennych (wymiaru przestrzeni zmiennych) na dokładność klasyfikacji modelu zagregowanego. Wprowadzenie do modelu większej liczby zmiennych powoduje zwiększenie błędu klasyfikacji. Aby zmniejszyć tę liczbę, zastosowano korelacyjną metodę doboru zmiennych do modelu. Zaproponowana metoda CFSH generuje modele dyskryminacyjne dokładniejsze od tych, które uzyskał Hall. Ponieważ wykazał on, że metoda CFS jest najlepsza (w sensie minimalizacji błędu klasyfikacji) metodę CFSH porównano jedynie z metodą CFS. (fragment tekstu)
4
Content available remote Problemy selekcji i ważenia zmiennych w zagadnieniu klasyfikacji
100%
W artykule, głównie na przykładzie wygenerowanych danych w dwuwymiarowej przestrzeni zmiennych, wskazano ograniczenia, które należy wziąć pod uwagę przy selekcji zmiennych w zagadnieniu klasyfikacji. W niektórych sytuacjach jest możliwe uogólnienie na większą liczbę wymiarów. W przeprowadzonych eksperymentach wykorzystano procedurę NtRandLMultiNorm z programu NtRand 2.01, generującą liczby losowe odpowiednie do zadanych wektorów średnich i macierzy kowariancji. W artykule zakładać będziemy, że zmienne opisujące obiekty badania są mierzone na skali przedziałowej lub ilorazowej. (fragment tekstu)
5
100%
W artykule ukazano bayesowskie podejście do problemu doboru zmiennych w modelu regresji liniowej. W tym podejściu dobór zbioru zmiennych dokonuje się przez poszukiwanie modelu o największym prawdopodobieństwie zaistnienia. Ponieważ analityczne obliczenie tego prawdopodobieństwa jest w większości przypadków niemożliwe, została wykorzystana metoda reversible jump. Metoda ta należy do klasy algorytmów typu MCMC (Markov Chain Monte Carlo) przystosowanych do przestrzeni o zmiennej liczbie wymiarów. W artykule przedstawiony jest przykład symulacyjny ze współliniowymi zmiennymi, a także przykład z rzeczywistymi danymi dotyczący predykcji PKB. (abstrakt oryginalny)
6
Content available remote Analiza czynnikowa zmiennych porządkowych
100%
W literaturze spotyka się zastosowanie tradycyjnej analizy czynnikowej dla zmiennych porządkowych. Celem artykułu jest zbadanie, czy takie podejście jest poprawne, jeśli tak, to czy dla wszystkich zmiennych porządkowych. W artykule porównane zostaną wyniki analizy czynnikowej przeprowadzonej na podstawie korelacji liniowych Pearsona i korelacji polichorycznych dla zmiennych mierzonych na skali trzystopniowej i osobno dla zmiennych mierzonych na skali siedmiostopniowej. Na tej podstawie zbada się, czy podstawne jest zastosowanie korelacji liniowych Pearsona dla zmiennych porządkowych mierzonych na tych skalach. Przedstawiony w artykule przykład empiryczny dotyczący rynku kawy ma na celu przedstawienie podobieństw i różnic w wynikach analizy czynnikowej po zastosowaniu obu korelacji. (fragment tekstu)
Feature selection plays vital role in the processing pipeline of today's data science applications and is a crucial step of the overall modeling process. Due to multitude of possibilities for extracting large and highly structured data in various fields, this is a serious issue in the area of machine learning without any optimal solution proposed so far. In recent years, methods based on concepts derived from information theory attracted particular attention, introducing eventually general framework to follow. The criterion developed by author et al., namely IIFS (Interaction Information Feature Selection), extended state-of-the-art methods by adopting interactions of higher order, both 3-way and 4-way. In this article, careful selection of data from industrial site was made in order to benchmark such approach with others. Results clearly show that including side effects in IIFS can reorder output set of features significantly and improve overall estimate of error for the selected classifier. (original abstract)
8
Content available remote Algorytm doboru zmiennych objaśniających o niestabilnej sile zależności
100%
W niniejszym artykule przeprowadzono badanie zmian zależności zmiennych poprzez określenie, jak długo między wybranymi dwoma zmiennymi utrzymywała się ta sama siła zależności. W tym celu wykorzystano wzrokową ocenę charakteru zależności na podstawie diagramu korelacyjnego. Dla okresów podobnego kształtowania się zależności obliczono współczynniki korelacji. Następnie dla każdej z analizowanych jednostek czasu wyznaczono macierz współczynników zależności. Na podstawie tej macierzy wyodrębniono najlepszą kombinację zmiennych objaśniających (dla każdej jednostki czasowej, w której zależność miała zbliżony charakter założono tę samą wartość miernika siły zależności), przy użyciu metody Hellwiga. Analiza przeprowadzana w niniejszym artykule ma na celu zbadanie, jakie są możliwe zmiany zależności zmiennych w miarę upływu czasu oraz jak zmieniają się kombinacje zmiennych najistotniej kształtujących zmienną objaśnianą.(fragment tekstu)
Celem artykułu jest przegląd metod statystycznych, stosowanych przy szacowaniu efektu oddziaływania czynników, wskazanie zalet i wad owych metod oraz zasygnalizowanie kierunków rozwoju w tym zakresie. Z danymi nieeksperymentalnymi wiąże się problem niewłaściwego doboru próby. Rozważona zostanie selekcja próby na podstawie czynników obserwowalnych oraz nieobserwowalnych. W pierwszym przypadku praktyczne znaczenie ma estymacja efektów oddziaływania czynników przez dopasowanie, w szczególności tzw. dobieranie na podstawie prawdopodobieństwa uczestnictwa (przedstawiony w opracowaniu przykład dotyczy właśnie tej metody). W drugim wskazano propozycje rozwiązań dla sytuacji, gdy ma miejsce selekcja na podstawie czynników nieobserwowalnych, jak estymator "różnic-w-różnicach", estymacja metodą zmiennych instrumentalnych czy parametr LATE. (fragment tekstu)
Wybór metody jest elementem decydującym o pomyślności procesu modelowania, choć jakość i dobór informacji wykorzystanych przy budowie modelu automatycznego uczenia się wydają się co najmniej tak samo ważne. Mimo zautomatyzowanego mechanizmu uczenia nie wystarczy do zbioru uczącego wrzucenie wszystkich danych, jakimi dysponujemy. Konieczne jest dostarczenie informacji istotnych. Jedną z możliwości jest dobór zmiennych do modelu. Inną jest ich przekształcanie. W artykule przedstawiono procedurę łączącą te dwa podejścia - wyodrębnianie zmiennych z wielowarstwowych sieci neuronowych jako metodę doboru zmiennych do modeli budowanych innymi metodami wielowymiarowej analizy statystycznej. Celem artykułu jest zbadanie, jak takie podejście wpływa na zdolności predykcyjne modeli. Pokazano, że technikę tę należy traktować jako jedną z metod wstępnego przetwarzania danych, którą warto wypróbować, bo może prowadzić do polepszenia zdolności predykcyjnych modelu końcowego, choć tego nie gwarantuje.(abstrakt oryginalny)
In this paper, we proposed an efficient family of ratio-type estimators using one auxiliary variable for the estimation of the current population mean under successive sampling scheme. This family of estimators have been studied by Ray and Sahai (1980) under simple random sampling using one auxiliary variable for estimation of the population mean. Using these estimators in successive sampling, the expression for bias and mean squared error of the proposed estimators are obtained up to the first order of approximation. Usual ratio estimator is identified as a particular case of the suggested estimators. Optimum replacement strategy is also discussed. The proposed family of estimators at optimum condition is compared with the simple mean per unit estimator, Cochran (1977) estimator and existing other members of the family. Expressions of optimization are derived and results have been justified through numerical study interpretation. (original abstract)
13
Content available remote Porównanie metod doboru zmiennych do zagregowanych modeli dyskryminacyjnych
100%
W artykule przedstawione zostaną wyniki symulacji porównawczej metod doboru zmiennych do modeli składowych na podstawie repozytorium danych z Uniwersytetu Kalifornijskiego w Irvine, przy czym porównanie błędów klasyfikacji zostanie przeprowadzone dla różnych miar zależności zmiennych. W badaniu wykorzystano metody: correlation-based feature selection, correlation-based feature selection based on Hellwig heuristics oraz modyfikację metody CFSH wykorzystującą do optymalizacji algorytmy genetyczne. (fragment tekstu)
14
Content available remote Modele ze zmiennymi ukrytymi w segmentacji rynku
100%
Celami artykułu są prezentacja podstawowych cech modeli ze zmiennymi ukrytymi, pokazanie korzyści płynących z ich stosowania w segmentacji rynku na gruncie badań marketingowych oraz wskazanie problemów związanych z ich praktycznym wykorzystaniem. (fragment tekstu)
15
Content available remote Wybór modelu oraz zmiennych do modelu w ujęciu Bayesowskim
100%
Wybór, a więc identyfikacja postaci analitycznej modelu regresji, jest jednym z istotniejszych problemów analizy danych eksperymentalnych. W ujęciu bayesowskim odbywa się on przy użyciu kryterium prawdopodobieństwa a posteriori prawdziwości modelu. Prawdziwość modelu rozumiana jest jako poprawność identyfikacji mechanizmu generującego dane będące przedmiotem analizy. Mimo że model, według którego generowane są dane, jest zdeterminowany (nie jest losowy), w ujęciu bayesowskim określa się rozkład prawdopodobieństwa na zbiorze rozpatrywanych modeli, wyrażając w ten sposób niepewność badacza względem postaci modelu. Takie podejście pozwala również na uwzględnienie w analizie subiektywnej wiedzy badacza poprzez określenie rozkładu a priori na przestrzeni modeli. Oznacza to, że w ujęciu bayesowskim jako zmienne losowe mogą być traktowane nie tylko parametry modelu regresji, ale również jego postać analityczna.Praktyczne obliczanie prawdopodobieństw modeli w ujęciu bayesowskim wymusza zwykle zastosowanie metod numerycznych - głównie algorytmów Monte Carlo (np. algorytm Gibbsa). (fragment tekstu)
W artykule zaproponowano zastosowanie liniowego modelu prawdopodobieństwa z regularyzacją jako narzędzia doboru zmiennych przed regresją logistyczną. W etapie selekcji zmiennych dodatkowo stosowano sprawdzanie krzyżowe. Takie podejście zapewnia skuteczniejszą eliminację zmiennych nieistotnych od powszechnie stosowanej regularyzowanej regresji logistycznej, a błędy klasyfikacji porównywanych metod nie różnią się w sposób statystycznie istotny. W badaniach empirycznych wykorzystano zbiory z repozytorium Uniwersytetu Kalifornijskiego, a sztucznie wprowadzane zmienne nieistotne generowano z rozkładów zero-jedynkowego lub normalnego.(abstrakt oryginalny)
17
Content available remote A Method of Variable Selection for Fuzzy Regression - the Possibility Approach
75%
A method of variable selection for fuzzy regression has been proposed. Using the method, the significance of fuzzy regression coefficients has been examined. The method presented is equivalent to the method of variable selection for classical regression based on an analysis of the confidence interval for their coefficients. Illustrative examples are presented. (original abstract)
Metoda wektorów nośnych (SVM - Support Vector Machines) należy do grupy eksploracyjnych metod wielowymiarowej analizy statystycznej. Została zaproponowana jako metoda dyskryminacji, czyli metoda klasyfikacji wzorcowej, w której dany jest pewien zbiór uczący, tj. taki zbiór, w którym znana jest przynależność do klas obserwacji w nim zawartych. Celem metod dyskryminacji jest rozpoznanie reguł przynależności obiektów do odpowiednich klas na podstawie informacji ze zbioru uczącego, by następnie wykorzystać te reguły do klasyfikowania nowych obiektów. Predykcja na podstawie modeli zbudowanych metodą wektorów nośnych jest obok predykcji modeli zagregowanych drzew klasyfikacyjnych najdokładniejszą w porównaniu z innymi znanymi obecnie modelami klasyfikacji.
In this paper, the effect of misspecification due to omission of relevant variables on the dominance of the r -(k,d) class estimator proposed by Özkale (2012), over the ordinary least squares (OLS) estimator and some other competing estimators when some of the regressors in the linear regression model are correlated, have been studied with respect to the mean squared error criterion. A simulation study and numerical example have been demostrated to compare the performance of the estimators for some selected values of the parameters involved. (original abstract)
Celem artykułu jest przedstawienie podstawowych przyczyn, skłaniających nas do ograniczania liczby zmiennych w przypadku grupowania obiektów oraz zaproponowanie stosowania heurystycznej metody wyboru zmiennych spośród większego ich zbioru, dających jak najlepsze pogrupowanie obiektów. Twórcami metody, algorytmu komputerowego i programu realizującego metodę jest zespół pracowników firmy МIТ - Management Intelligenter Technologien GmbH z Aachen. W metodzie tej rozpoczyna się od niewielkiej liczby cech (np. dwóch lub nawet jednej), do których dokładane są cechy do momentu uzyskania takiej jakości grupowania, że dołożenie jakiejkolwiek nowej cechy z założonego zbioru nie daje poprawy tej jakości. W artykule zostanie przedstawiony algorytm metody, a także jej zalety i wady w porównaniu z innymi metodami doboru zmiennych w zagadnieniach grupowania obiektów. Rozważania będą zilustrowane przykładem doboru cech, które były stosowane na potrzeby tworzenia grup (skupień) przedsiębiorstw podobnych pod względem kondycji ekonomicznej. (fragment tekstu)
first rewind previous Strona / 5 next fast forward last
JavaScript jest wyłączony w Twojej przeglądarce internetowej. Włącz go, a następnie odśwież stronę, aby móc w pełni z niej korzystać.