- Métriques de qualité IA, telles que l’exactitude, la fiabilité factuelle (groundedness), la pertinence, la sécurité ou la conformité
- Métriques de performance des agents, telles que la réussite de l’utilisation des outils ou l’achèvement des tâches
- Métriques opérationnelles, telles que la latence, la consommation de tokens, les erreurs et le coût
- Métriques utilisateur et business, telles que la satisfaction, l’escalade, la conversion, la rétention et le revenu
L’évaluation et l’expérimentation résolvent des problèmes différents
L’évaluation détermine si une sortie individuelle d’un modèle ou d’un agent atteint un standard de qualité défini. Les outils d’observabilité permettent d’inspecter les prompts, les réponses, les traces, les étapes de récupération et les appels d’outils à l’origine de cette sortie. L’expérimentation détermine si un changement apporté à la configuration sous-jacente entraîne une amélioration mesurable pour les utilisateurs ou pour l’entreprise, une question distincte des deux précédentes. Par exemple, un juge LLM peut évaluer un prompt comme plus fiable factuellement qu’un autre. Une expérience Kameleoon vous indique si ce même prompt améliore également l’achèvement des tâches, réduit l’escalade, augmente la satisfaction, ou affecte la latence et le coût, les résultats dont votre équipe est responsable. Kameleoon ne remplace pas votre pile d’observabilité ou d’évaluation LLM. Transmettez les scores de vos évaluateurs (RAGAS, juge LLM ou processus de révision humaine) à Kameleoon sous forme d’objectif personnalisé avec une valeur numérique, et suivez-les aux côtés des objectifs comportementaux et business déjà mesurés par votre expérience, ce qui relie les signaux de qualité au niveau du modèle à une mesure statistiquement fiable de l’impact réel sur les utilisateurs. Pour la plupart des expériences liées à l’IA, combinez plusieurs types de métriques plutôt que de vous fier à une seule :- Définissez un résultat utilisateur ou business comme objectif principal.
- Suivez les métriques de qualité IA comme objectifs secondaires ou garde-fous.
- Surveillez la latence, le coût, les erreurs et la sécurité comme garde-fous opérationnels.
- Validez les juges automatisés par rapport à un échantillon d’exemples révisés par des humains avant de faire confiance à leurs scores à grande échelle.
Fonctionnement
Un feature flag stocke chaque configuration (comme un prompt) en tant que valeur d’une variable de feature, avec une variation par option que vous voulez tester. Lorsqu’un visiteur accède à votre application, le SDK Kameleoon affecte le visiteur à une variation et retourne la valeur correspondante, que votre code applicatif utilise pour appeler le LLM ou configurer l’agent. Un objectif rattaché au feature flag enregistre une conversion lorsque le visiteur interagit avec votre fonctionnalité basée sur un LLM ou votre agent IA, par exemple en posant une question de suivi ou en menant à bien une tâche grâce à son aide. Une fois que vous avez collecté suffisamment de trafic, comparez le taux de conversion de chaque variation, ainsi que les éventuelles métriques de qualité IA ou opérationnelles que vous suivez, pour déterminer quelle configuration est la plus performante.Prérequis
- Un compte Kameleoon avec un projet configuré pour Feature Experimentation.
- L’ID client et la clé secrète client de votre compte. Pour trouver ces valeurs, consultez Identifiants API.
- Une application Python dans laquelle vous pouvez installer le SDK Kameleoon.
Configurer votre expérience de prompt dans Kameleoon
Configurez le feature flag, les variations de prompt et l’objectif de suivi dans la plateforme Kameleoon avant de toucher à votre code applicatif.Créer le feature flag
Créez un feature flag pour contenir vos variations de prompt et contrôler le déploiement de votre expérience.- Dans l’application Kameleoon, cliquez sur Features > Flags & Experiments > New feature flag.
- Saisissez un nom, par exemple
LLM prompt test, et sélectionnez le projet pour le flag. - Dans le champ Description, notez ce que le flag contrôle, afin que les autres membres de votre équipe comprennent son objectif.
- Cliquez sur Validate.
Stocker le prompt dans une variable de feature
Ajoutez une variable de feature pour contenir le texte du prompt, afin de pouvoir le modifier depuis la plateforme Kameleoon sans éditer votre code applicatif.- Sur la page du flag, dans la barre latérale gauche, cliquez sur Set Up > Variables > Add Variable.
- Définissez le Type de la variable sur String.
- Saisissez une Variable Key, par exemple
prompt_template. - Définissez la Default Value sur le prompt actuellement utilisé par votre application. Kameleoon délivre cette valeur aux visiteurs qui ne font pas partie de votre expérience.
- Cliquez sur Save.

Créer une variation par prompt
Créez une variation par prompt que vous voulez tester, et définissez la variableprompt_template avec le texte correspondant dans chacune.
- Dans la barre latérale gauche, cliquez sur Set Up > Variations > Add variation.
- Saisissez un Name pour la variation, par exemple
Detailed summary. - Définissez la variable
prompt_templateavec le texte du prompt pour cette variation. - Cliquez sur Save.
- Répétez ces étapes pour chaque prompt supplémentaire que vous voulez tester.

Attacher un objectif pour mesurer l’engagement
Attachez un objectif au feature flag afin que Kameleoon puisse mesurer quelle variation de prompt génère le plus d’engagement. Kameleoon étant une plateforme unifiée, vous pouvez attacher n’importe quel objectif déjà existant dans votre organisation, comme un objectif de transaction défini par une autre équipe, ou créer un objectif spécifique à votre fonctionnalité basée sur un LLM.- Sur la page du flag, dans le menu Set Up, cliquez sur Goals > Add goal.
- Sélectionnez un objectif existant, ou cliquez sur Create a new goal pour en définir un, comme un objectif personnalisé déclenché lorsqu’un visiteur interagit avec votre fonctionnalité basée sur un LLM.
- Cliquez sur Save.

Déployer l’expérience
Créez une règle d’expérience qui répartit le trafic entre vos variations de prompt, puis activez l’environnement pour commencer à collecter des données.- Dans le Rollout Planner, sélectionnez l’environnement que vous voulez cibler, par exemple Production.
- Cliquez sur Add a rule > Experiment.
- Sous Variations to serve, ajoutez chaque variation de prompt et définissez son pourcentage d’exposition. Par exemple, répartissez le trafic également entre deux variations à 50 % chacune.
- Définissez le ciblage de la règle pour inclure les visiteurs que vous voulez tester, par exemple tous les visiteurs qui accèdent à l’application.
- Activez le toggle ON/OFF de l’environnement sur ON.
- Cliquez sur Save.

Récupérer le prompt dans votre application
Installez le SDK Python de Kameleoon, puis récupérez le prompt affecté au visiteur et suivez une conversion lorsque le visiteur interagit avec votre fonctionnalité basée sur un LLM. Le même principe s’applique à n’importe quel SDK Kameleoon côté serveur, y compris Node.js, Java et Go.-
Installez le SDK comme dépendance :
-
Initialisez le client avec votre site code et vos identifiants :
-
Récupérez le prompt affecté avant d’appeler votre LLM, et suivez une conversion lorsque le visiteur interagit avec la fonctionnalité basée sur un LLM :
Appelez
get_prompt_for_visitor()avec levisitor_codedu visiteur avant d’envoyer une requête à votre LLM, et utilisez la valeur retournée comme prompt. Appeleztrack_llm_interaction()lorsque le visiteur interagit avec la fonctionnalité basée sur un LLM, par exemple en soumettant une question ou en recevant une réponse.
Utilisez
get_visitor_code() pour attribuer un ID unique à chaque visiteur, et set_legal_consent() si votre application nécessite le consentement du visiteur avant tout suivi de données. Pour la référence complète d’initialisation et de configuration du client, consultez le guide du développeur du SDK Python.Suivre et itérer
Ouvrez la page de résultats du feature flag pour comparer le taux de conversion de chaque variation de prompt par rapport à l’objectif attaché. Kameleoon suit les expositions et les conversions automatiquement dès que votre application appelleget_variation() et track_conversion(), vous n’avez donc besoin d’aucune instrumentation supplémentaire. Si vous avez également attaché une métrique de qualité IA ou opérationnelle comme objectif, comparez-la au taux de conversion avant de décider quelle variation déployer.
Pour en savoir plus, consultez Consulter les résultats globaux de votre feature flag.
Étapes suivantes
- Consultez la référence du SDK Python pour des options avancées telles que les custom data, l’expérimentation cross-device et les conditions de ciblage.
- Attachez des critères de segmentation précis pour cibler l’expérience sur une audience spécifique.
- Explorez les variables de feature pour variabiliser d’autres parties de votre fonctionnalité basée sur un LLM ou de votre agent IA, comme les paramètres du modèle, les paramètres de récupération ou les définitions d’outils.
- Attachez plusieurs objectifs au même flag, par exemple un score de qualité IA issu de votre pipeline d’évaluation aux côtés d’une métrique business, pour comparer les configurations selon plusieurs dimensions à la fois. Consultez Créer des objectifs pour les feature flags.