Overblog Tous les blogs Top blogs Technologie & Science Tous les blogs Technologie & Science
Suivre ce blog Administration + Créer mon blog
MENU

Sipina - Arbres de décision

Sipina : fonctionnalités et références

Publicité

CHAID (Kass, 1980)

Description. CHAID est la variante supervisée (variable à prédire catégorielle) des techniques issues de AID (Morgan et Sonquist, 1963), considérée comme l'ancêtre de toutes les méthodes de segmentation. Cette méthode se démarque de deux manières : le...

Lire la suite
Publicité

ASSISTANT 86 (Cestnik et al., 1987)

Description. ASSISTANT 86 fait partie des méthodes dérivées de ID3 (Quinlan, 1979). Elle introduit un certain nombre d'améliorations destinées à mieux guider l'induction. L'arbre construit est forcément binaire. Lors de la segmentation, ASSISTANT cherche...

Lire la suite

GID3 (Cheng et al., 1988)

Description. GID3 est une " généralisation " de ID3 dans le sens où, lors d'une segmentation, les modalités non informatives de la variable de partitionnement sont fusionnées. L'objectif est de ne produire de feuilles que pour les modalités importantes,...

Lire la suite

ID3-IV (Quinlan, 1986)

Description. ID3-IV (1986) est la (une des) dernière version de ID3, avant que Quinlan ne se tourne vers le post-élagage avec C4 puis C4.5 (et les autres versions commerciales, non publiées qui s'en suivront). Par rapport à l'algorithme originel (ID 3...

Lire la suite
Publicité

A Limited search induction tree algorithm (Catlett, 1991)

Description. Catlett (1991) est certainement un des premiers data miner de l’histoire. Son seul tort est d’avoir eu raison trop tôt. En effet, plusieurs années avant la grande vague du data mining et l’article fondateur de Fayyad (1996), il a présenté...

Lire la suite

Échantillonnage dans les arbres de décision

Stratégie d'échantillonnage pour les arbres de décision. Dans tous les algorithmes d'induction d'arbres, SIPINA introduit une option d'échantillonnage. L'idée est la suivante : plutôt que de travailler sur l'ensemble des individus disponibles sur chaque...

Lire la suite

Statistiques descriptives avec SIPINA

SIPINA propose des fonctionnalités de statistiques descriptives. Peu de personnes le savent. En soi l'information n'est pas éblouissante, il existe un grand nombre de logiciels libres capables de produire les indicateurs de la description statistique....

Lire la suite

Importer un fichier Weka dans Sipina

WEKA est un logiciel de Data Mining libre très populaire dans la communauté « Machine Learning ». Il intègre un grand nombre de méthodes, articulées essentiellement autour des approches supervisées et non supervisées. WEKA possède un format de fichier...

Lire la suite
Publicité

Description de l’interface SIPINA

Un texte, un peu ancien et assez succinct, qui décrit les principales fonctionnalités de SIPINA : chargement de données, avec le format propriétaire binaire (*.fdm) ; choix de la méthode d'apprentissage ; définition de la variable à prédire et des variables...

Lire la suite

Déploiement d'un arbre de décision

Déploiement de modèles. Le déploiement des modèles est une activité clé du Data Mining. Dans le cas de l’apprentissage supervisé, il s’agit de classer de nouveaux individus à partir des valeurs connues des variables prédictives introduites dans le modèle....

Lire la suite