LEXA: Cadre d’évaluation de la précision des LLM
Fiers d’être soutenus par Investissement Québec et Confiance IA. Une initiative d’évaluation de l’IA visant à mesurer la fiabilité, l’exactitude et la performance des grands modèles de langage (LLM) pour des applications commerciales.
CADRE D’ÉVALUATION / IA APPLIQUÉE

ÉVALUATION DES LLM / DOMAINE DU COMMERCE ÉLECTRONIQUE
Étude de cas / 07
Contexte du projet
IA appliquée et commerce électronique
Contribution de Plumfind
Évaluation des modèles d’IA
Métriques et outils
Analytique et données
Technologies
LLM, RAG, OCR, méthodes et métriques d’évaluation
ÉTAT DU PROJET
Recherche active / évaluation en cours

DÉFI D’AFFAIRES
L’IA générative doit gagner votre confiance avant d’être déployée.
Les organisations qui adoptent des systèmes de recommandation et d’automatisation propulsés par des LLM ont besoin d’une méthode fiable pour mesurer l’exactitude factuelle, détecter les hallucinations et évaluer la performance dans des environnements réels.
ÉCART ENTRE LA FIABILITÉ DES LLM ET LEUR DÉPLOIEMENT
DÉCOUVERTE ET RECHERCHE
01 / Panorama de l’évaluation
Nous avons analysé les méthodes d’évaluation des LLM, d’évaluation du RAG, de détection des hallucinations et d’extraction de l’information afin de définir un cadre d’évaluation pratique.
02 / Jeu de données propre au domaine
Un jeu de données de catalogue de vêtements basé sur Shopify a permis d’ancrer l’évaluation dans un contexte réel de commerce électronique, avec des descriptions de produits et des métadonnées structurées.
03 / Évaluation de référence
Nous avons testé plusieurs mesures de précision pour l’extraction des caractéristiques, la synthèse, la détection des hallucinations et l’exhaustivité.
04 / Enrichissement multimodal
L’OCR a permis d’extraire des informations sur les produits à partir des images et de les combiner aux métadonnées du catalogue afin de vérifier si l’ajout de contexte multimodal améliore la précision des modèles.
EXIGENCES DE LA RECHERCHE / ÉTUDE DE TERRAIN OPÉRATIONNELLE
Un cadre pratique pour les LLM en contexte réel.
LEXA relie les critères d’évaluation à des données propres au domaine, ce qui permet aux équipes d’évaluer conjointement la pertinence des réponses, les hallucinations, l’exactitude des résumés, l’utilisation du contexte et la performance du RAG.

SOLUTION
Des critères d’évaluation à un cadre fiable.
01
Dimensions d’évaluation
Un modèle clair pour évaluer la pertinence des réponses, les hallucinations, l’exactitude des résumés, l’utilisation du contexte et la performance du RAG a rendu l’évaluation concrète et exploitable.
02
Jeu de données ancré dans le domaine
Un jeu de données du secteur du commerce de détail, basé sur des fiches de produits Shopify accessibles au public, a permis de refléter la complexité réelle du contexte commercial plutôt que de s’appuyer sur un jeu de données universitaire générique.
03
Enrichissement multimodal
L’OCR et l’enrichissement des informations sur les produits ont permis de vérifier si l’ajout de contexte pouvait améliorer la fiabilité des modèles et la qualité des réponses.
Architecture / flux du système
Le système est conçu pour des décisions fiables.
Chaque étape relie les données sources, les réponses des LLM, les critères d’évaluation et les éléments probants afin que les équipes puissent comprendre où la performance est solide et où des améliorations sont nécessaires.

Mise en œuvre
De l’évaluation des modèles à un système d’évaluation fiable.
01
Conception de la recherche et des bancs d’essai
Une revue structurée et un plan d’évaluation ont transformé des méthodes académiques en un cadre de test pertinent sur le plan commercial.
02
Évaluation des LLM et des systèmes RAG
Les modèles de référence, le comportement des systèmes RAG et l’enrichissement multimodal ont été évalués à l’aide d’un ensemble de données spécifique au domaine et de mesures pratiques de qualité.
03
Perspectives et prochaines étapes
Les résultats permettent d’identifier où des données supplémentaires, un meilleur contexte ou un perfectionnement des modèles peuvent améliorer un déploiement fiable.
IMPACT COMMERCIAL
Une IA fiable sur laquelle les équipes peuvent s’appuyer.
- Défini des mesures pratiques pour la pertinence, les hallucinations et la qualité de la synthèse
- Créé un ensemble de données d’évaluation comparative spécifique au domaine du commerce électronique
- Évalué la performance de référence des LLM et des systèmes RAG à l’aide de questions réelles
- Évalué l’enrichissement par OCR et l’efficacité de l’utilisation du contexte
LEÇON APPRISE
Une IA digne de confiance nécessite des méthodes d’évaluation qui tiennent compte de ses données, de ses cas d’utilisation et de ses risques — et pas seulement des tests de référence génériques.

TECHNOLOGIES UTILISÉES
Cadre d’évaluation
IA
Pour mesurer la qualité des modèles en fonction de la pertinence des réponses, des hallucinations, de la synthèse, de l’utilisation du contexte et de la performance RAG.
Ensemble de données de domaine
ANALYTIQUE
Pour ancrer l’évaluation des modèles dans des données réelles sur les produits, des descriptions structurées et un contexte commercial.
Enrichissement multimodal
INFONUAGIQUE
Pour tester si l’OCR et des sources d’information supplémentaires améliorent la qualité et la fiabilité des réponses des modèles.
Projets connexes
Poursuivez votre exploration de nos projets.
ENTAMEZ UNE CONVERSATION
Commencez par le résultat d’affaires.
Apportez la question à laquelle vous cherchez à répondre. Nous vous aiderons à déterminer ce qui mérite d’être développé.

