Ce sujet de stage est rattaché au lab'Innov d'Aubay. il s'agit de la cellulle d'innovation du groupe Aubay. Tu pourras intervenir sur des projets en mode R&D adoptant une approche agile. À Paris ou à Lyon, nous te proposons des sujets Innovants notamment sur l’IA, la Data, le numérique responsable ... et encore pleins d’autres à découvrir !
ici, nous te proposons le stage "Décris moi l'image"
SUJET :
Les modèles de description d'images (captioning) et de questions-réponses visuelles (VQA) affichent des scores impressionnants sur les benchmarks académiques type COCO… avec des photos nettes, bien cadrées et prises par des photographes.
Cependant, l'usage réel de ces technologies par des personnes aveugles ou malvoyantes implique des conditions très différentes : l'image est souvent floue, mal cadrée, sur- ou sous-exposée. Et là, les modèles décrochent.
Pire : une description approximative ou « hallucinée » n'est pas seulement inexacte, elle est inutilisable, voire dangereuse. Précision, rapidité et fiabilité absolue : voilà le triple défi que tu vas relever.
TA CONTRIBUTION :
Tu construis le projet de bout en bout :
• Explorer — réaliser l'état de l'art du Captioning et de la VQA, puis te concentrer sur les jeux de données et compétitions dédiés à l'accessibilité (VizWiz…).
• Expérimenter — évaluer les modèles existants et identifier précisément où et pourquoi ils échouent sur les cas critiques.
• Innover — proposer et implémenter tes propres améliorations (fine-tuning, robustesse, réduction des hallucinations).
• Concrétiser — intégrer tes travaux dans une application réellement utilisable par toutes et tous.
POUR TOI :
Ce stage va t'apporter :
• Une expérience concrète sur les modèles vision-langage (VLM), l'un des domaines les plus chauds de l'IA aujourd'hui — une ligne qui parle sur un CV.
• La maîtrise d'un cycle complet : recherche, expérimentation, industrialisation, mise en production.
• Un vrai sujet à impact social, démontrable en entretien, idéal pour t'orienter vers l'IA responsable.
Mots clés : IA, Deep Learning, VLM, Captioning, VQA, Computer Vision, NLP, Accessibilité, IA Responsable, Multimodal
Stack technique : Python · PyTorch · Hugging Face Transformers · BLIP-2 / LLaVA / CLIP · Jeux de données VizWiz & COCO · Git · Docker