Mon expertise

Ce que je fais

Je conçois et déploie des solutions IA de bout en bout : ingestion, traitement, modèles prédictifs, LLMs, RAG, MCP, déploiements Docker & CI/CD.

Modèles Prédictifs

Classification, régression : XGBoost, Scikit-learn, TensorFlow, Keras. Feature engineering, évaluation et mise en production (Streamlit).

IA Générative & RAG

Chatbots RAG, agents CrewAI, LangChain, LLMs (Mistral, ChatGPT), stockage vectoriel, serveurs IA via MCP.

Traitement & Analyse de Données

ETL distribué PySpark, extraction SQL, structuration, tableaux de bord et analyses avancées.

Déploiement & DevOps

Docker, Streamlit, Git, GitHub, CI/CD. Cloud AWS : EC2, S3, Lambda, SageMaker, CloudFormation. Bases PostgreSQL, MySQL.

À Propos de moi

Présentation personnelle

Qui suis-je ?

Je m’appelle Youssouf Mohamed Nouh, Data Scientist et développeur IA basé à Montréal.

Je suis spécialisé dans la création de solutions intelligentes de bout en bout : Machine Learning (Scikit-learn, XGBoost, TensorFlow, Keras), IA générative (LLMs, RAG, MCP, CrewAI), pipelines Big Data avec PySpark et Cloud AWS.

Je conçois des systèmes RAG (LangChain + Mistral), ETL distribué PySpark, tableaux de bord interactifs, modèles prédictifs et applications déployées avec Docker, Streamlit et CI/CD.

Je suis disponible pour des opportunités en Data Science, MLOps et développement IA. N’hésitez pas à me contacter.

Machine Learning supervisé

Projets ML Tabulaire

Modèles prédictifs sur données structurées : classification, régression, déployés en démos publiques sur Hugging Face.

ML

Détection du Diabète

Modèle de classification prédisant le risque de diabète à partir d'indicateurs médicaux (glycémie, BMI, âge, antécédents).

Scikit-learnXGBoostStreamlit
Voir les détails
ML

Cancer du Sein

Classification de tumeurs malignes vs bénignes à partir du dataset Wisconsin Breast Cancer. Précision > 97%.

Random ForestScikit-learnStreamlit
Voir les détails
ML

Souscription Bancaire

Prédiction de souscription à un produit financier après campagne télémarketing. Modèle XGBoost + feature engineering.

XGBoostPandasStreamlit
Voir les détails
ML

Churn Client Télécom

Anticipation du départ de clients d'une compagnie télécom pour la rétention. Modèle XGBoost + analyse SHAP des variables.

XGBoostSHAPStreamlit
Voir les détails
ML

Prix Immobilier

Régression du prix d'une maison à partir de caractéristiques (surface, quartier, nombre de pièces, équipements). Gradient Boosting.

GradientBoostingRégressionStreamlit
Voir les détails
Deep Learning Vision

Projets CNN & Imagerie Médicale

Réseaux de neurones convolutifs pour la détection automatique de pathologies sur images médicales.

CNN

Détection du Paludisme

CNN qui détecte le parasite paludique sur images microscopiques de cellules sanguines. Modèle entraîné sur 27 000 images.

TensorFlowKerasCNN
Voir les détails
CNN

Tumeurs Cérébrales (IRM)

Classification multi-classe de tumeurs cérébrales sur IRM (glioma, meningioma, pituitary). Transfer learning avec ResNet50.

ResNet50Transfer LearningKeras
Voir les détails
CNN

Détection Tuberculose

Détection du bacille de Koch sur images microscopiques de cultures bactériennes. Préprocessing OpenCV + CNN custom.

CNNKerasOpenCV
Voir les détails
CNN

Pneumonie sur Radios

Détection de pneumonie sur radiographies pulmonaires (dataset NIH ChestX-ray). DenseNet121 avec fine-tuning.

DenseNet121TensorFlowStreamlit
Voir les détails
CNN

COVID-19 sur Scanners CT

Classification COVID/Normal sur scans tomodensitométriques avec EfficientNet et augmentation de données.

EfficientNetTransfer LearningAugmentation
Voir les détails
Retrieval-Augmented Generation

Projets RAG

3 projets basiques et 2 avancés : pipelines documentaires, vector stores et retrieval de production.

Basique

RAG LangChain — pipeline PDF → Q/A

Pipeline LangChain : loaders PDF, splitters récursifs, retriever vectoriel et chaîne LCEL avec citations des sources.

LangChainChromaLCELMistral
Voir les détails
Basique

RAG avec ChromaDB

Vector store persistent ChromaDB : indexation incrémentale, métadonnées par chunk et filtres par source ou date.

ChromaDBEmbeddingsMétadonnées
Voir les détails
Basique

RAG LlamaIndex — query engine

Index avancés LlamaIndex : VectorStoreIndex, SummaryIndex et KeywordTableIndex pour des stratégies de retrieval adaptées.

LlamaIndexQuery EngineIndex
Voir les détails
Avancé

Hybrid search (BM25 + dense)

Combinaison recherche lexicale BM25 et embeddings denses, fusion des scores via Reciprocal Rank Fusion.

BM25DenseRRFLangChain
Voir les détails
Avancé

RAG avec citations vérifiables

Le LLM cite chaque affirmation avec le passage source exact — réduction des hallucinations et traçabilité.

CitationsSourcesStreamlit
Voir les détails
Cloud Computing

Projets AWS

Architectures cloud, pipelines ETL serverless, déploiements ML production-ready et IA générative sur AWS.

Basique

Pipeline ETL avec AWS Glue

Pipeline ETL automatisée : CSV bruts sur S3 → nettoyage PySpark (Glue) → Parquet optimisé. Crawler, Data Catalog et jobs planifiés.

GlueS3CrawlerData Catalog
Voir les détails
Intermédiaire

Prédiction de churn (Djibouti Telecom)

Remake end-to-end sur AWS du modèle churn télécom : EDA, feature engineering, XGBoost sur SageMaker, endpoint et dashboard QuickSight.

SageMakerXGBoostS3QuickSight
Voir les détails
Intermédiaire

Déployer un endpoint ML SageMaker

Modèle XGBoost entraîné et déployé sur un endpoint SageMaker temps réel. Prédictions via API managée, tests et cycle de vie endpoint.

SageMakerEndpointsXGBoostS3
Voir les détails
Avancé

Chatbot RAG avec Bedrock + LangChain

Chatbot conversationnel avec mémoire, base vectorielle OpenSearch et génération Claude via Bedrock. Documents indexés depuis S3.

BedrockLangChainOpenSearchS3
Voir les détails
Avancé

Pipeline MCP sur AWS

Serveur MCP sur EC2 connecté à RDS PostgreSQL et fichiers S3. Le LLM interroge SQL et documents en temps réel via le protocole MCP.

EC2RDSS3MCP SDK
Voir les détails
Model Context Protocol

Projets MCP

3 projets basiques et 2 avancés : serveurs, clients et orchestration multi-tools pour connecter les LLMs aux systèmes.

Basique

Fichiers locaux + requêtes SQL

Serveur MCP exposant un dossier en Resources (lecture seule) et un tool query() SELECT-only sur SQLite/PostgreSQL.

ResourcesSQLPython SDKstdio
Voir les détails
Basique

Client MCP Python en CLI

Mini-client Python : lance un serveur MCP, liste les tools et appelle les fonctions — comprendre ce que fait Claude Desktop en interne.

ClientSessionstdio_clientPython
Voir les détails
Basique

Premier serveur MCP « Hello World »

Serveur MCP minimal en stdio : comprendre la boucle JSON-RPC, tools/list et tools/call avec un tool add(a, b).

MCP SDKstdioFastMCP
Voir les détails
Avancé

Orchestration multi-serveurs MCP

Un client unique agrège GitHub + SQLite + RAG en parallèle et expose tous les tools à Claude.

Multi-serveursasyncioAggregation
Voir les détails
Avancé

Agent autonome multi-tools via MCP

Boucle ReAct sur Claude API connectée à N serveurs MCP — capstone du parcours MCP.

ReActClaude APIMCPMulti-tools
Voir les détails
Multi-Agent Systems

Projets CrewAI

Orchestration d'équipes d'agents IA pour des workflows complexes : recherche, rédaction, code, analyse.

Bases

Crew séquentiel — Researcher + Writer + Editor

Pipeline en 3 étapes : Chercheur → Rédacteur → Éditeur. Chaque task reçoit le context de la précédente (article factory).

CrewAIProcess.sequentialcontext flow
Voir les détails
Intermédiaire

Process hiérarchique — Manager + workers

Le manager LLM délègue dynamiquement aux agents spécialisés selon la nature de la tâche — plus flexible que le sequential.

Process.hierarchicalManagerDelegation
Voir les détails
Avancé

CrewAI Flows — workflows déterministes

Control flow event-driven avec @start, @listen, @router — combiner code déterministe et autonomie LLM.

Flows@routerPydantic State
Voir les détails
Production

Capstone — Content Factory production

Multi-crew + Flow + FastAPI + Streamlit + AgentOps + Docker Compose — stack production-ready complète.

FastAPIDockerAgentOpsRedis
Voir les détails
Avancé

Knowledge sources — RAG natif CrewAI

PDFs, CSVs et sites web intégrés nativement aux agents — sans pipeline RAG manuel.

Knowledge SourcesPDFCSVWeb
Voir les détails
Réseaux

Contact