Sipina : fonctionnalités et références
L’appréhension des données manquantes est un problème difficile. La gestion informatique en elle-même ne pose pas de problème, il suffit de signaler la valeur manquante par un code spécifique. En revanche, son traitement avant ou durant l’analyse des...
Lire la suiteLa sélection de variables est un aspect essentiel de l’apprentissage supervisé. Nous devons déterminer les variables pertinentes pour la prédiction des valeurs de la variable à prédire, pour différentes raisons : un modèle plus simple sera plus facile...
Lire la suiteL’accès aux données est la première étape du processus Data Mining. Lorsque nous souhaitons initier un traitement à l’aide d’un logiciel quelconque, la première question que nous nous posons est systématiquement « comment dois-je procéder pour importer...
Lire la suiteJe suis dans la période où je (re)découvre Linux. J'avais étudié récemment la possibilité de travailler avec Tanagra sous Linux via Wine, simplement, sans contorsions compliquées. Nous montrons dans ce document qu'il est possible de faire de même avec...
Lire la suiteDans ce document, nous comparons les performances de SIPINA avec celles de plusieurs implémentations libres lors du traitement d’un fichier de taille relativement importante, avec 500.000 observations et 22 variables. Nous avons utilisé la méthode C4.5...
Lire la suiteSIPINA est un logiciel. Mais c' est aussi une méthode d'apprentissage . Elle généralise les arbres en introduisant une opération supplémentaire, la fusion, lors de l'induction du modèle de prédiction. On parle de " Graphes d'Induction " . L'idée de fusion...
Lire la suiteDescription. Dans une analyse, les coûts de mauvais classement sont rarement unitaires et symétriques. Dans un problème à 2 classes (malade vs. non-malade par exemple), diagnostiquer l'absence de la maladie chez une personne souffrante n'a pas les mêmes...
Lire la suiteDescription. C'est une généralisation de C4.5 où, plutôt que d'utiliser l'entropie de Shannon pour le calcul du gain ratio, nous introduisons les entropies généralisées de type beta. L'algorithme de base reste donc C4.5, intégrant notamment le post élagage...
Lire la suiteDescription. La méthode de référence au sein de la communauté « apprentissage automatique ». Vers la fin des années 1980, Quinlan a publié d'innombrables variantes de son algorithme de base, ID3 (Quinlan, 1979). Avec C4, puis C4.5, il est arrivé à une...
Lire la suiteDescription. Ma méthode préférée, celle que je présente en priorité dans mes enseignements. Elle est directement dérivée de CHAID. Elle apporte quelques améliorations : le critère t de Tschuprow est substitué au KHI-2, essentiellement parce qu'il est...
Lire la suite