
Tekunda Team

Tekunda Team

Reponse courte : c'est la qualite de la recherche documentaire qui decide si le RAG sur des donnees Salesforce fonctionne, pas le choix du modele. Un modele de pointe a qui l'on donne les trois mauvais enregistrements repondra avec assurance et a cote, et changer de modele n'y change rien. Trois choses comptent vraiment : ce que vous considerez comme un fragment, la maniere dont les droits sont appliques pendant la recherche, et le fait de mesurer la recherche separement de la generation.
Parce qu'un corpus CRM casse les hypotheses sur lesquelles repose le RAG documentaire.
Le decoupage champ par champ est l'erreur qu'on nous demande le plus souvent de corriger. La valeur d'un champ n'est pas une unite de sens recuperable. Assemblez plutot.
C'est l'exigence qui separe un systeme RAG d'entreprise d'une demonstration, et elle n'a qu'une forme sure : filtrer avant de rechercher, avec l'identite de l'utilisateur qui pose la question.
Trois modeles, du plus solide au moins solide.
Quel que soit le stockage, l'identite doit circuler de bout en bout : session, recherche, invite et journal d'audit. Ne demandez jamais au modele de langue d'appliquer les droits. C'est un predicteur de texte, pas un moteur de politique, et une consigne d'invite n'est pas un controle de securite.
La plupart des equipes ne savent pas repondre, et c'est pour cela qu'elles changent de modele. Separez les deux modes d'echec : soit le bon enregistrement n'etait pas dans le contexte, soit il y etait et le modele l'a ignore. Seul le second est un probleme de modele.
Les equipes qui ajoutent ce harnais decouvrent en general que leur rappel tournait autour de la moitie, et qu'aucune mise a niveau de modele n'allait corriger cela.
Natif ou externe compte moins que le contrat de recherche. Data 360 prend en charge la recherche vectorielle et des retrievers sur du contenu non structure comme les articles de connaissance, les PDF et les transcriptions (aide Salesforce), ce qui garde l'ancrage pres des donnees et dans la gouvernance de la plateforme. Un stockage vectoriel externe donne plus de controle sur le decoupage, le classement hybride et les corpus multi-systemes, ce qui compte quand la reponse vit aussi dans l'ERP ou l'outil de tickets.
Choisissez l'un ou l'autre, mais ecrivez d'abord le contrat : ce qu'est un fragment, quelles metadonnees chaque fragment porte, comment l'identite est appliquee, et ce que le jeu de reference appelle bon. Nous construisons des systemes RAG agentiques sur ce modele, a travers Salesforce et plus de 70 systemes d'entreprise, et c'est au contrat, pas au modele, que nous consacrons le plus de temps. Plus de details sur notre facon de travailler chez Tekunda.
Un modele plus gros corrige-t-il une mauvaise recherche ?
Non. Si l'enregistrement qui contient la reponse n'entre jamais dans la fenetre de contexte, la taille du modele n'a aucune importance. Corrigez le rappel d'abord, comparez les modeles ensuite.
Faut-il affiner un modele plutot que faire du RAG sur des donnees CRM ?
Rarement. Les donnees CRM changent tous les jours et l'acces est par utilisateur : un modele affine serait perime et incapable de respecter le partage. L'affinage sert au comportement et au format, la recherche aux faits.
Comment eviter que l'agent divulgue des enregistrements interdits ?
Filtrez les candidats selon les droits de l'utilisateur avant le classement, et journalisez chaque recherche avec cette identite. Les consignes d'invite ne sont pas un controle d'acces.
A quelle frequence rafraichir l'index ?
Pilotez-le par les evenements de modification plutot que par un traitement nocturne. Dans un corpus CRM, un index perime donne des reponses fausses d'une maniere difficile a detecter pour les utilisateurs.