7. Paquetages scikit-learn
En principe à installer sur l’environnement (prod) ou un environnement dédié. En principe, scikit-learn n’est basé que sur des paquetages standard (numy, matplotlib …) qui sont déjà installés. S’il n’y a pas d’interactions avec de la chimie-biologie, scikit-learn peut s’installer à partir dans un environnement (base) sans trop de décalage avec la version courante.
| Paquetage | canal | commandes |
| threadpoolctl + joblib | win-64 | mamba install threadpoolctl joblib |
| scikit-learn | win-64 | mamba install scikit-learn => version 1.4.2 / 1.5 |
tests externes
Le paquetage scikit-learn est fonctionnel, dans C:\Dev\tests-buildez\test_scikit différents modules de tests sont fonctionnels (test-dataset-01.py, test-pca-01.py ) .
Liens et lectures
- Scikit-learn [ https://scikit-learn.org/ ].
- Github scikit-learn [ https://github.com/scikit-learn/ ].
- Scikit-learn User Guide [ https://scikit-learn.org/stable/user_guide.html ].
- Scikit-learn examples [ https://scikit-learn.org/stable/auto_examples/index.html ].
- Scikit-learn Wikipedia [ https://fr.wikipedia.org/wiki/Scikit-learn ].
- Python simple [ https://www.python-simple.com/python-scikit-learn/scikit-datasets.php ].
- DataScientest [ https://datascientest.com/cinq-fonctions-de-scikit-learn ]
Datasets scikit-learn
Dans le cas de l’environnement (prod) les datasets sont dans C:\Python3\envs\prod\Lib\site-packages\sklearn\datasets qui contient des répertoires data, descr, images et tests.
Les fichiers dans /data sont des fichiers CSV avec une entête : rows_n, cols_n, [targets]. Les targets (ou classes) sont des listes des jeux de données, qui n’ont rien à voir avec les titres (features) des colonnes. Par exemple targets=[malignant, benign] pour le fichier breast_cancer.csv. Parmi les fichiers :
![]() |
Par exemple, pour iris.csv :150,4,setosa,versicolor,virginica5.1,3.5,1.4,0.2,04.9,3.0,1.4,0.2,04.7,3.2,1.3,0.2,0...6.5,3.0,5.2,2.0,26.2,3.4,5.4,2.3,25.9,3.0,5.1,1.8,2 |
Dans le répertoire /desc nous avons les descriptions des données, qui sont normalisées. On retrouve systématiquement Number of Instances, Number of Attributes, Attribute Information, class … avec une syntaxe précise. Par exemple pour iris, le fichier iris.rst :
|
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 |
.. _iris_dataset: Iris plants dataset -------------------- **Data Set Characteristics:** :Number of Instances: 150 (50 in each of three classes) :Number of Attributes: 4 numeric, predictive attributes and the class :Attribute Information: - sepal length in cm - sepal width in cm - petal length in cm - petal width in cm - class: - Iris-Setosa - Iris-Versicolour - Iris-Virginica :Summary Statistics: ============== ==== ==== ======= ===== ==================== Min Max Mean SD Class Correlation ============== ==== ==== ======= ===== ==================== sepal length: 4.3 7.9 5.84 0.83 0.7826 sepal width: 2.0 4.4 3.05 0.43 -0.4194 petal length: 1.0 6.9 3.76 1.76 0.9490 (high!) petal width: 0.1 2.5 1.20 0.76 0.9565 (high!) ============== ==== ==== ======= ===== ==================== :Missing Attribute Values: None :Class Distribution: 33.3% for each of 3 classes. :Creator: R.A. Fisher :Donor: Michael Marshall (MARSHALL%PLU@io.arc.nasa.gov) :Date: July, 1988 The famous Iris database, first used by Sir R.A. Fisher. The dataset is taken from Fisher's paper. Note that it's the same as in R, but not as in the UCI Machine Learning Repository, which has two wrong data points. ... |details-start| **References** |details-split| - Fisher, R.A. "The use of multiple measurements in taxonomic problems" Annual Eugenics, 7, Part II, 179-188 (1936); also in "Contributions to Mathematical Statistics" (John Wiley, NY, 1950). ... - See also: 1988 MLC Proceedings, 54-64. Cheeseman et al"s AUTOCLASS II conceptual clustering system finds 3 classes in the data. - Many, many more ... |details-end| |
Il s’agit d’un format de texte restructuré que l’on peut émuler. Ceci dit, ce n’est pas limitatif car dans scikit, les formats pandas, numpy Arrays sont aussi utilisables en input [ https://stackoverflow.com/questions/61208808/how-to-use-pandas-dataframes-with-sklearn ].
Avec Molegro Dava Visualiser ?
Des fichiers similaires (iris.csv, selwood.csv) sont inclus dans MVD et il est possible de comparer ou de reproduire des résultats scikit-learn vs. MVD sur ces bases (plusieurs outils/fonctions sont similaires).
