Environnement (prod) : paquetages (Win-x64)

7. Paquetages scikit-learn

En principe à installer sur l’environnement (prod) ou un environnement dédié. En principe, scikit-learn n’est basé que sur des paquetages standard (numy, matplotlib …) qui sont déjà installés. S’il n’y a pas d’interactions avec de la chimie-biologie, scikit-learn peut s’installer à partir dans un environnement (base) sans trop de décalage avec la version courante.

Paquetage canal commandes
threadpoolctl + joblib win-64 mamba install threadpoolctl joblib
scikit-learn win-64 mamba install scikit-learn => version 1.4.2 / 1.5

tests externes
Le paquetage scikit-learn est fonctionnel, dans C:\Dev\tests-buildez\test_scikit différents modules de tests sont fonctionnels (test-dataset-01.py, test-pca-01.py ) .

Datasets scikit-learn

Dans le cas de l’environnement (prod) les datasets sont dans C:\Python3\envs\prod\Lib\site-packages\sklearn\datasets qui contient des répertoires data, descr, images et tests.
Les fichiers dans /data sont des fichiers CSV avec une entête : rows_n, cols_n, [targets]. Les targets (ou classes) sont des listes des jeux de données, qui n’ont rien à voir avec les titres (features) des colonnes. Par exemple targets=[malignant, benign] pour le fichier breast_cancer.csv. Parmi les fichiers :

Par exemple, pour iris.csv :
150,4,setosa,versicolor,virginica
5.1,3.5,1.4,0.2,0
4.9,3.0,1.4,0.2,0
4.7,3.2,1.3,0.2,0
...
6.5,3.0,5.2,2.0,2
6.2,3.4,5.4,2.3,2
5.9,3.0,5.1,1.8,2

Dans le répertoire /desc nous avons les descriptions des données, qui sont normalisées. On retrouve systématiquement Number of Instances, Number of Attributes, Attribute Information, class … avec une syntaxe précise. Par exemple pour iris, le fichier iris.rst :

Il s’agit d’un format de texte restructuré que l’on peut émuler. Ceci dit, ce n’est pas limitatif car dans scikit, les formats pandas, numpy Arrays sont aussi utilisables en input [ https://stackoverflow.com/questions/61208808/how-to-use-pandas-dataframes-with-sklearn ].

Avec Molegro Dava Visualiser ?
Des fichiers similaires (iris.csv, selwood.csv) sont inclus dans MVD et il est possible de comparer ou de reproduire des résultats scikit-learn vs. MVD sur ces bases (plusieurs outils/fonctions sont similaires).

Retour en haut