Je conçois et déploie des solutions IA de bout en bout : ingestion, traitement, modèles prédictifs, LLMs, RAG, MCP, déploiements Docker & CI/CD.
Classification, régression : XGBoost, Scikit-learn, TensorFlow, Keras. Feature engineering, évaluation et mise en production (Streamlit).
Chatbots RAG, agents CrewAI, LangChain, LLMs (Mistral, ChatGPT), stockage vectoriel, serveurs IA via MCP.
ETL distribué PySpark, extraction SQL, structuration, tableaux de bord et analyses avancées.
Docker, Streamlit, Git, GitHub, CI/CD. Cloud AWS : EC2, S3, Lambda, SageMaker, CloudFormation. Bases PostgreSQL, MySQL.
Je m’appelle Youssouf Mohamed Nouh, Data Scientist et développeur IA basé à Montréal.
Je suis spécialisé dans la création de solutions intelligentes de bout en bout : Machine Learning (Scikit-learn, XGBoost, TensorFlow, Keras), IA générative (LLMs, RAG, MCP, CrewAI), pipelines Big Data avec PySpark et Cloud AWS.
Je conçois des systèmes RAG (LangChain + Mistral), ETL distribué PySpark, tableaux de bord interactifs, modèles prédictifs et applications déployées avec Docker, Streamlit et CI/CD.
Je suis disponible pour des opportunités en Data Science, MLOps et développement IA. N’hésitez pas à me contacter.
Modèles prédictifs sur données structurées : classification, régression, déployés en démos publiques sur Hugging Face.
Modèle de classification prédisant le risque de diabète à partir d'indicateurs médicaux (glycémie, BMI, âge, antécédents).
Classification de tumeurs malignes vs bénignes à partir du dataset Wisconsin Breast Cancer. Précision > 97%.
Prédiction de souscription à un produit financier après campagne télémarketing. Modèle XGBoost + feature engineering.
Anticipation du départ de clients d'une compagnie télécom pour la rétention. Modèle XGBoost + analyse SHAP des variables.
Régression du prix d'une maison à partir de caractéristiques (surface, quartier, nombre de pièces, équipements). Gradient Boosting.
Réseaux de neurones convolutifs pour la détection automatique de pathologies sur images médicales.
CNN qui détecte le parasite paludique sur images microscopiques de cellules sanguines. Modèle entraîné sur 27 000 images.
Classification multi-classe de tumeurs cérébrales sur IRM (glioma, meningioma, pituitary). Transfer learning avec ResNet50.
Détection du bacille de Koch sur images microscopiques de cultures bactériennes. Préprocessing OpenCV + CNN custom.
Détection de pneumonie sur radiographies pulmonaires (dataset NIH ChestX-ray). DenseNet121 avec fine-tuning.
Classification COVID/Normal sur scans tomodensitométriques avec EfficientNet et augmentation de données.
3 projets basiques et 2 avancés : pipelines documentaires, vector stores et retrieval de production.
Pipeline LangChain : loaders PDF, splitters récursifs, retriever vectoriel et chaîne LCEL avec citations des sources.
Vector store persistent ChromaDB : indexation incrémentale, métadonnées par chunk et filtres par source ou date.
Index avancés LlamaIndex : VectorStoreIndex, SummaryIndex et KeywordTableIndex pour des stratégies de retrieval adaptées.
Combinaison recherche lexicale BM25 et embeddings denses, fusion des scores via Reciprocal Rank Fusion.
Le LLM cite chaque affirmation avec le passage source exact — réduction des hallucinations et traçabilité.
Architectures cloud, pipelines ETL serverless, déploiements ML production-ready et IA générative sur AWS.
Pipeline ETL automatisée : CSV bruts sur S3 → nettoyage PySpark (Glue) → Parquet optimisé. Crawler, Data Catalog et jobs planifiés.
Remake end-to-end sur AWS du modèle churn télécom : EDA, feature engineering, XGBoost sur SageMaker, endpoint et dashboard QuickSight.
Modèle XGBoost entraîné et déployé sur un endpoint SageMaker temps réel. Prédictions via API managée, tests et cycle de vie endpoint.
Chatbot conversationnel avec mémoire, base vectorielle OpenSearch et génération Claude via Bedrock. Documents indexés depuis S3.
Serveur MCP sur EC2 connecté à RDS PostgreSQL et fichiers S3. Le LLM interroge SQL et documents en temps réel via le protocole MCP.
3 projets basiques et 2 avancés : serveurs, clients et orchestration multi-tools pour connecter les LLMs aux systèmes.
Serveur MCP exposant un dossier en Resources (lecture seule) et un tool query() SELECT-only sur SQLite/PostgreSQL.
Mini-client Python : lance un serveur MCP, liste les tools et appelle les fonctions — comprendre ce que fait Claude Desktop en interne.
Serveur MCP minimal en stdio : comprendre la boucle JSON-RPC, tools/list et tools/call avec un tool add(a, b).
Un client unique agrège GitHub + SQLite + RAG en parallèle et expose tous les tools à Claude.
Boucle ReAct sur Claude API connectée à N serveurs MCP — capstone du parcours MCP.
Orchestration d'équipes d'agents IA pour des workflows complexes : recherche, rédaction, code, analyse.
Pipeline en 3 étapes : Chercheur → Rédacteur → Éditeur. Chaque task reçoit le context de la précédente (article factory).
Le manager LLM délègue dynamiquement aux agents spécialisés selon la nature de la tâche — plus flexible que le sequential.
Control flow event-driven avec @start, @listen, @router — combiner code déterministe et autonomie LLM.
Multi-crew + Flow + FastAPI + Streamlit + AgentOps + Docker Compose — stack production-ready complète.
PDFs, CSVs et sites web intégrés nativement aux agents — sans pipeline RAG manuel.
Sous-titre
Description complète…