Overblog Tous les blogs Top blogs Technologie & Science Tous les blogs Technologie & Science
Suivre ce blog Administration + Créer mon blog
MENU

Sipina - Arbres de décision

Sipina : fonctionnalités et références

Publicité

Sipina - Traitement des données manquantes

L’appréhension des données manquantes est un problème difficile. La gestion informatique en elle-même ne pose pas de problème, il suffit de signaler la valeur manquante par un code spécifique. En revanche, son traitement avant ou durant l’analyse des...

Lire la suite
Publicité

Stratégie "wrapper" pour la sélection de variables

La sélection de variables est un aspect essentiel de l’apprentissage supervisé. Nous devons déterminer les variables pertinentes pour la prédiction des valeurs de la variable à prédire, pour différentes raisons : un modèle plus simple sera plus facile...

Lire la suite

Sipina - Formats de fichiers

L’accès aux données est la première étape du processus Data Mining. Lorsque nous souhaitons initier un traitement à l’aide d’un logiciel quelconque, la première question que nous nous posons est systématiquement « comment dois-je procéder pour importer...

Lire la suite

Sipina sous Linux

Je suis dans la période où je (re)découvre Linux. J'avais étudié récemment la possibilité de travailler avec Tanagra sous Linux via Wine, simplement, sans contorsions compliquées. Nous montrons dans ce document qu'il est possible de faire de même avec...

Lire la suite
Publicité

Traitement de gros volumes - Sipina et les autres

Dans ce document, nous comparons les performances de SIPINA avec celles de plusieurs implémentations libres lors du traitement d’un fichier de taille relativement importante, avec 500.000 observations et 22 variables. Nous avons utilisé la méthode C4.5...

Lire la suite

La méthode SIPINA

SIPINA est un logiciel. Mais c' est aussi une méthode d'apprentissage . Elle généralise les arbres en introduisant une opération supplémentaire, la fusion, lors de l'induction du modèle de prédiction. On parle de " Graphes d'Induction " . L'idée de fusion...

Lire la suite

Cost sensitive C4.5 (Rakotomalala et Chauchat, 2001)

Description. Dans une analyse, les coûts de mauvais classement sont rarement unitaires et symétriques. Dans un problème à 2 classes (malade vs. non-malade par exemple), diagnostiquer l'absence de la maladie chez une personne souffrante n'a pas les mêmes...

Lire la suite

Improved C4.5 (Rakotomalala et Lallich, 1999)

Description. C'est une généralisation de C4.5 où, plutôt que d'utiliser l'entropie de Shannon pour le calcul du gain ratio, nous introduisons les entropies généralisées de type beta. L'algorithme de base reste donc C4.5, intégrant notamment le post élagage...

Lire la suite
Publicité

C4.5 (Quinlan, 1993)

Description. La méthode de référence au sein de la communauté « apprentissage automatique ». Vers la fin des années 1980, Quinlan a publié d'innombrables variantes de son algorithme de base, ID3 (Quinlan, 1979). Avec C4, puis C4.5, il est arrivé à une...

Lire la suite

Improved CHAID (Tschuprow Goodness of Split)

Description. Ma méthode préférée, celle que je présente en priorité dans mes enseignements. Elle est directement dérivée de CHAID. Elle apporte quelques améliorations : le critère t de Tschuprow est substitué au KHI-2, essentiellement parce qu'il est...

Lire la suite