Je fournirai des solutions personnalisées de machine learning pour les problèmes de données en recherche biologique
Solutions d'analyse de données
À propos de ce service
Je développe des pipelines de machine learning sur mesure pour la recherche biologique : scientifiquement
rigoureux, entièrement documentés et conçus pour résister à la revue par les pairs :
- Analyse basée sur l’image avec quantification automatisée, classification et profilage morphométrique à partir d’images de fluorescence, de brightfield, confocales et autres.
- Modèles prédictifs pour données moléculaires et omiques, découverte de biomarqueurs et réduction de dimension sur des jeux de données génomiques, protéomiques ou épigénétiques.
- Pipeline reproductible, chaque projet comprend un script commenté, un README et un notebook de démonstration (prêt pour Google Colab) pour que vous ou votre laboratoire puissiez le relancer
- Sortie de qualité recherche, figures pour publication, validation statistique et sections méthodologie que vous pouvez utiliser dans votre manuscrit
Stack
Python · scikit-learn · PyTorch · OpenCV · scikit-image · Pandas · matplotlib · ImageJ
Langage de programmation:
Python
•
Java
Frameworks:
Scikit-learn
•
keras
•
PyTorch
•
Panda
Outils:
Jupyter Notebook
•
opencv
•
tensorflow
•
Excel
•
Autres
Mon portfolio
FAQ
Traduction automatique
Avec quels types de données biologiques travaillez-vous ?
Images de microscopie à fluorescence (multicanal, z-stack), arrays de méthylation de l’ADN (Illumina 450K/EPIC), données de cytométrie en flux, et jeux de données omiques tabulaires en général. Si vous n’êtes pas sûr que vos données conviennent, envoyez-moi un message avant de commander.
Dois-je partager les données brutes ou seulement les fichiers traités ?
Les deux options sont possibles. Les images brutes ou les fichiers .idat/.csv sont idéaux, mais les matrices prétraitées conviennent aussi. Je signerai un NDA si vos données sont sensibles ou non publiées.
Pourrai-je relancer le pipeline moi-même ?
Oui, tous les livrables incluent un script commenté et un README avec instructions étape par étape. Les commandes Standard et Premium incluent un notebook Colab que vous pouvez exécuter sans installation locale.
Puis-je utiliser les résultats dans une publication ?
Absolument. Les packages Standard et Premium incluent une documentation de la méthodologie conforme aux standards des revues scientifiques. Je demande simplement à être mentionné dans la section Remerciements (pas en tant qu’auteur).
Mon jeu de données est petit... le ML est-il toujours pertinent ?
Souvent oui. Pour un petit n (< 100 échantillons), j’utilise des modèles régularisés (ElasticNet, Ridge, SVM) et des stratégies de validation croisée adaptées à votre taille d’échantillon. Je vous dirai d’emblée si le ML n’est pas vraiment la bonne solution.
Et si mon projet est plus complexe que les packages proposés ?
Envoyez-moi un message. Je accepte des commandes personnalisées et peux définir un projet basé sur des étapes pour des pipelines multi-tâches.
