Sipina : fonctionnalités et références
Description. CHAID est la variante supervisée (variable à prédire catégorielle) des techniques issues de AID (Morgan et Sonquist, 1963), considérée comme l'ancêtre de toutes les méthodes de segmentation. Cette méthode se démarque de deux manières : le...
Lire la suiteDescription. ASSISTANT 86 fait partie des méthodes dérivées de ID3 (Quinlan, 1979). Elle introduit un certain nombre d'améliorations destinées à mieux guider l'induction. L'arbre construit est forcément binaire. Lors de la segmentation, ASSISTANT cherche...
Lire la suiteDescription. GID3 est une " généralisation " de ID3 dans le sens où, lors d'une segmentation, les modalités non informatives de la variable de partitionnement sont fusionnées. L'objectif est de ne produire de feuilles que pour les modalités importantes,...
Lire la suiteDescription. ID3-IV (1986) est la (une des) dernière version de ID3, avant que Quinlan ne se tourne vers le post-élagage avec C4 puis C4.5 (et les autres versions commerciales, non publiées qui s'en suivront). Par rapport à l'algorithme originel (ID 3...
Lire la suiteDescription. Catlett (1991) est certainement un des premiers data miner de l’histoire. Son seul tort est d’avoir eu raison trop tôt. En effet, plusieurs années avant la grande vague du data mining et l’article fondateur de Fayyad (1996), il a présenté...
Lire la suiteStratégie d'échantillonnage pour les arbres de décision. Dans tous les algorithmes d'induction d'arbres, SIPINA introduit une option d'échantillonnage. L'idée est la suivante : plutôt que de travailler sur l'ensemble des individus disponibles sur chaque...
Lire la suiteSIPINA propose des fonctionnalités de statistiques descriptives. Peu de personnes le savent. En soi l'information n'est pas éblouissante, il existe un grand nombre de logiciels libres capables de produire les indicateurs de la description statistique....
Lire la suiteWEKA est un logiciel de Data Mining libre très populaire dans la communauté « Machine Learning ». Il intègre un grand nombre de méthodes, articulées essentiellement autour des approches supervisées et non supervisées. WEKA possède un format de fichier...
Lire la suiteUn texte, un peu ancien et assez succinct, qui décrit les principales fonctionnalités de SIPINA : chargement de données, avec le format propriétaire binaire (*.fdm) ; choix de la méthode d'apprentissage ; définition de la variable à prédire et des variables...
Lire la suiteDéploiement de modèles. Le déploiement des modèles est une activité clé du Data Mining. Dans le cas de l’apprentissage supervisé, il s’agit de classer de nouveaux individus à partir des valeurs connues des variables prédictives introduites dans le modèle....
Lire la suite