Extrait des Informations

Fier d’être soutenu par Investissement Québec, Scale AI et Confiance IA. IA multimodale (texte et image) appliquée à la classification de produits dans le commerce de détail. Combinaison de récupération de données, de modèles vision-langage, d’extraction OCR et d’analyse fondée sur les représentations vectorielles.

Étude de cas / 04

Contexte du projet

Classification de produits par IA
Systèmes de recommandation
Intelligence d’affaires pour le commerce de détail

Contribution de Plumfind

IA et systèmes intelligents
Recherche et expérimentation
Infonuagique et infrastructure

Technologies

CLIP, SigLIP, OCR, représentations vectorielles, recherche vectorielle, AWS

Échéancier

Découverte, Expérimentation, Évaluation, Déploiement de la démo

Un projet de recherche appliquée visant à explorer les systèmes d’IA multimodale modernes pour comprendre les produits de détail, retrouver des articles visuellement similaires et extraire des informations structurées à partir d’images réelles de produits.

Aperçu / La raison d’être

Un outil de classification utile commence par une question claire.

Ce qui a été exploré

Approches d’IA multimodale pour la recherche de produits similaires dans le commerce de détail, l’évaluation de modèles, l’extraction OCR et l’analyse des représentations vectorielles.

À qui cela s’adressait

Équipes technologiques du commerce de détail, gestionnaires de commerce électronique, chercheurs et professionnels de l’IA.

Pourquoi c’était important

Comprendre où les modèles vision-langage sont efficaces, où ils montrent leurs limites et comment des systèmes complémentaires peuvent améliorer les flux de travail liés à l’intelligence d’affaires dans le commerce de détail.

LE DÉFI

Les données du commerce de détail sont rarement propres. Les modèles doivent quand même fonctionner.

Les catalogues de commerce électronique contiennent des photos incohérentes, des descriptions de produits variables, des styles changeants et des différences importantes d’un détaillant à l’autre, ce qui en fait un environnement difficile pour les systèmes d’apprentissage automatique.


EXIGENCES

Réduire l’incertitude grâce à l’expérimentation.

Contexte d’affaires

Nous avons commencé par une question simple : dans quelle mesure les modèles multimodaux modernes peuvent-ils comprendre de façon fiable les produits à travers différents ensembles de données, magasins et conditions visuelles?

Approche

Nous avons mis au point une série d’expériences pratiques couvrant la recherche par similarité, l’évaluation comparative de CLIP, l’extraction OCR, le réglage fin et l’analyse au niveau des magasins. Nous avons évalué la performance du pipeline d’IA pour des produits neufs et d’occasion afin de mieux comprendre les capacités des modèles dans des conditions réalistes.

Orientation de l’expérience

Une approche axée d’abord sur la recherche, qui privilégie les observations mesurables, l’évaluation comparative et des résultats explicables plutôt que le déploiement en production.

Plan de production

Une infrastructure infonuagique légère a soutenu l’expérimentation, l’évaluation comparative, l’entraînement des modèles et les démonstrations interactives.

Découverte

La clarté vient de la comparaison.

Nous avons comparé plusieurs modèles de vision-langage, systèmes OCR, ensembles de données et environnements de magasins afin de comprendre comment différentes approches se comportent dans des conditions réelles.

Exemple de question de recherche

“Les modèles multimodaux modernes peuvent-ils identifier de façon fiable des produits vestimentaires visuellement similaires provenant de différents magasins?”

  • Évalué à l’aide de la similarité des plongements vectoriels
  • Comparé entre plusieurs variantes de CLIP
  • Testé avec des images de commerce de détail provenant de conditions réelles
  • Analysé dans des conditions de décalage de domaine (domain shift)

Ce que Plumfind a conçu et évalué.

Une collection d’expériences d’IA appliquée, de cadres d’évaluation comparative, de systèmes de recherche d’information et de flux de travail d’analyse multimodale.

Modèle de contenu

Nous avons regroupé les détails des livres, les épisodes de balados, les thèmes et les métadonnées dans une seule couche source fiable.


Recherche par similarité

Des plongements d’images ont été utilisés pour récupérer des produits visuellement similaires à travers différents ensembles de données.

Évaluation comparative

Plusieurs modèles de type CLIP ont été évalués sur des ensembles de données identiques afin de mesurer leur constance et leur robustesse.

Intelligence OCR

Des informations structurées ont été extraites directement des étiquettes, des balises et des métadonnées des vêtements.

Infrastructure expérimentale

Des environnements d’expérimentation infonuagiques ont soutenu l’entraînement, l’évaluation, le traitement par lots et les flux de travail de démonstration.

Solution / architecture

Conçu comme un parcours de recherche clair et cohérent.

01

Compréhension des images de produits

Des modèles basés sur CLIP ont généré des plongements vectoriels capables de représenter la similarité visuelle entre les produits.

02

Évaluation comparative

Plusieurs modèles de vision-langage ont été évalués à l’aide de bancs d’essai sur des ensembles de données de produits communs afin de mettre en évidence leurs forces et leurs limites.

03

Extraction OCR

Les informations provenant des étiquettes ont été extraites afin de fournir des attributs de produits structurés allant au-delà de l’inférence visuelle.

04

Déploiement expérimental

Une infrastructure infonuagique a permis de réaliser des expériences reproductibles, des pipelines d’évaluation et des démonstrations interactives.


Flux du système

01

Images de produits

Images de produits provenant de plusieurs ensembles de données et magasins.

02

Génération d’embeddings

Des modèles basés sur CLIP génèrent des représentations sémantiques.

03

Similarité et évaluation

Flux de travail pour la recherche, la comparaison, l’évaluation comparative et l’analyse.

04

Environnement expérimental

L’infrastructure infonuagique prend en charge les tests, l’entraînement et les démonstrations.

DÉVELOPPEMENT

Des questions de recherche aux résultats mesurables.

Conception des expériences

La récupération de données, l’extraction OCR, l’évaluation comparative et l’analyse au niveau des magasins ont été structurées autour de questions pratiques d’affaires et techniques.

Ingénierie

Des pipelines de plongements, des systèmes de recherche par similarité, des flux de travail OCR, des cadres d’évaluation et des expériences de réglage fin ont constitué la fondation technique.

Expérimentation infonuagique

Les services AWS ont soutenu l’entraînement des modèles, les points de terminaison d’inférence, les flux de travail d’évaluation comparative et les environnements de démonstration.

RÉSULTATS

Ce qui est devenu visible grâce à une expérimentation systématique.

  • Construit des démonstrations fonctionnelles de recherche de produits par similarité
  • Évalué plusieurs modèles de type CLIP sur des ensembles de données de produits
  • Évalué des systèmes OCR pour l’extraction d’attributs
  • Exploré l’analyse des plongements au niveau des magasins
  • Mesuré les effets du décalage de domaine entre différents détaillants
  • Testé des flux de travail de réglage fin de CLIP à petite échelle
  • Identifié les limites des systèmes d’intelligence produit fondés uniquement sur l’analyse visuelle

Principales conclusions

La qualité des données est plus importante que le choix du modèle.
Le nettoyage, la normalisation et la cohérence des données ont souvent produit des améliorations plus importantes que le changement d’architecture.
L’OCR complète les modèles de vision.
Les informations structurées sur les produits sont souvent plus fiables lorsqu’elles sont extraites directement des étiquettes plutôt que déduites visuellement.
La recherche par récupération est plus robuste que la classification.
La recherche de similarité basée sur les plongements vectoriels a démontré une meilleure résilience face au décalage de domaine que les tâches de classification traditionnelles.
Les données du commerce de détail sont très variables.
Les différences entre les magasins influencent considérablement le comportement des modèles, leur capacité de généralisation et les résultats des évaluations.

TECHNOLOGIES / SERVICES

Couche vision-langage

Pour la compréhension des images, la génération de plongements, la recherche par similarité et l’évaluation multimodale.

Couche OCR

Pour l’extraction d’attributs structurés des produits directement à partir des étiquettes et des identifiants des vêtements.

Couche de recherche

Pour l’évaluation comparative des modèles, la mesure du décalage de domaine et l’analyse des résultats expérimentaux.

Infrastructure infonuagique

Pour l’entraînement, l’expérimentation, le déploiement, le traitement par lots et les environnements de démonstration.

Contexte du financement: Soutenu par Investissement Québec et Scale AI dans le cadre d’une initiative de recherche appliquée et d’expérimentation visant à évaluer les capacités de l’IA multimodale au sein d’ensembles de données et d’environnements de commerce de détail.

Projets connexes

Poursuivez votre exploration de nos projets.

Commencez par le résultat d’affaires.

Apportez la question à laquelle vous cherchez à répondre. Nous vous aiderons à déterminer ce qui mérite d’être développé.