A

Décris moi l'image l'IA qui rend le monde visible (IA gen · Vision-Langage (VLM) · Deep Learning ·

Description de l'emploi - Décris moi l'image l'IA qui rend le monde visible (IA gen · Vision-Langage (VLM) · Deep Learning ·

Ce sujet de stage est rattaché au lab'Innov d'Aubay. il s'agit de la cellulle d'innovation du groupe Aubay. Tu pourras intervenir sur des projets en mode R&D adoptant une approche agile. À Paris ou à Lyon, nous te proposons des sujets Innovants notamment sur l’IA, la Data, le numérique responsable ... et encore pleins d’autres à découvrir !

ici, nous te proposons le stage "Décris moi l'image"

SUJET :

Les modèles de description d'images (captioning) et de questions-réponses visuelles (VQA) affichent des scores impressionnants sur les benchmarks académiques type COCO… avec des photos nettes, bien cadrées et prises par des photographes.

Cependant, l'usage réel de ces technologies par des personnes aveugles ou malvoyantes implique des conditions très différentes : l'image est souvent floue, mal cadrée, sur- ou sous-exposée. Et là, les modèles décrochent.

Pire : une description approximative ou « hallucinée » n'est pas seulement inexacte, elle est inutilisable, voire dangereuse. Précision, rapidité et fiabilité absolue : voilà le triple défi que tu vas relever.

TA CONTRIBUTION :

Tu construis le projet de bout en bout :

• Explorer — réaliser l'état de l'art du Captioning et de la VQA, puis te concentrer sur les jeux de données et compétitions dédiés à l'accessibilité (VizWiz…).

• Expérimenter — évaluer les modèles existants et identifier précisément où et pourquoi ils échouent sur les cas critiques.

• Innover — proposer et implémenter tes propres améliorations (fine-tuning, robustesse, réduction des hallucinations).

• Concrétiser — intégrer tes travaux dans une application réellement utilisable par toutes et tous.

POUR TOI :

Ce stage va t'apporter :

• Une expérience concrète sur les modèles vision-langage (VLM), l'un des domaines les plus chauds de l'IA aujourd'hui — une ligne qui parle sur un CV.

• La maîtrise d'un cycle complet : recherche, expérimentation, industrialisation, mise en production.

• Un vrai sujet à impact social, démontrable en entretien, idéal pour t'orienter vers l'IA responsable.

Mots clés : IA, Deep Learning, VLM, Captioning, VQA, Computer Vision, NLP, Accessibilité, IA Responsable, Multimodal

Stack technique : Python · PyTorch · Hugging Face Transformers · BLIP-2 / LLaVA / CLIP · Jeux de données VizWiz & COCO · Git · Docker

Application deadline

As long as the job is online

Study level

Master level or equivalent

Job Category

Programming
Original job Décris moi l'image l'IA qui rend le monde visible (IA gen · Vision-Langage (VLM) · Deep Learning · posted on GrabJobs ©. To flag any issues with this job please use the Report Job button on GrabJobs.
Share Job
Share Job

Similar Décris moi l'image Jobs in France

GrabJobs est le portail d'emploi n°1 en :country, te connectant rapidement à des milliers d'emplois ! Trouve les meilleurs emplois de dans France, postule en 1 clic et obtiens un emploi dès aujourd'hui !

Applications mobile

Copyright © 2026 Grabjobs Pte.Ltd. All Rights Reserved.