- KI-Qualitätsmetriken, wie Korrektheit, Fundiertheit (Groundedness), Relevanz, Sicherheit oder Compliance
- Agenten-Leistungsmetriken, wie erfolgreiche Tool-Nutzung oder Aufgabenerfüllung
- Operative Metriken, wie Latenz, Token-Verbrauch, Fehler und Kosten
- Nutzer- und Geschäftsmetriken, wie Zufriedenheit, Eskalation, Conversion, Bindung und Umsatz
Evaluierung und Experimente lösen unterschiedliche Probleme
Evaluierung stellt fest, ob eine einzelne Modell- oder Agenten-Ausgabe einen definierten Qualitätsstandard erfüllt. Observability-Tools ermöglichen es Ihnen, die Prompts, Antworten, Traces, Retrieval-Schritte und Tool-Aufrufe hinter dieser Ausgabe zu untersuchen. Experimente stellen fest, ob eine Änderung an der zugrunde liegenden Konfiguration eine messbare Verbesserung für Nutzer oder das Geschäft bewirkt: eine Frage, die weder die Evaluierung noch die Observability beantwortet. Ein LLM-Judge könnte beispielsweise einen Prompt als fundierter bewerten als einen anderen. Ein Kameleoon-Experiment zeigt Ihnen, ob derselbe Prompt außerdem die Aufgabenerfüllung verbessert, Eskalationen reduziert, die Zufriedenheit steigert oder sich auf Latenz und Kosten auswirkt, die Ergebnisse, für die Ihr Team verantwortlich ist. Kameleoon ersetzt nicht Ihren LLM-Observability- oder Evaluierungs-Stack. Speisen Sie Bewertungsergebnisse aus RAGAS, einem LLM-Judge oder einem menschlichen Review-Prozess als benutzerdefiniertes Ziel mit einem numerischen Wert in Kameleoon ein, und verfolgen Sie sie zusammen mit den Verhaltens- und Geschäftszielen, die Ihr Experiment bereits misst, und verbinden Sie damit Qualitätssignale auf Modellebene mit einer statistisch zuverlässigen Messung der tatsächlichen Auswirkung auf Nutzer. Kombinieren Sie bei den meisten KI-Experimenten mehrere Metriktypen, anstatt sich auf einen einzigen zu verlassen:- Legen Sie ein Nutzer- oder Geschäftsergebnis als primäres Ziel fest.
- Verfolgen Sie KI-Qualitätsmetriken als sekundäre Ziele oder Guardrails.
- Überwachen Sie Latenz, Kosten, Fehler und Sicherheit als operative Guardrails.
- Validieren Sie automatisierte Judges anhand einer Stichprobe menschlich geprüfter Beispiele, bevor Sie deren Bewertungen im großen Maßstab vertrauen.
Funktionsweise
Ein Feature Flag speichert jede Konfiguration (zum Beispiel einen Prompt) als Wert einer Feature-Variable, mit einer Variation pro Option, die Sie testen möchten. Wenn ein Besucher Ihre Anwendung erreicht, weist das Kameleoon SDK dem Besucher eine Variation zu und gibt den entsprechenden Wert zurück, den Ihr Anwendungscode verwendet, um das LLM aufzurufen oder den Agenten zu konfigurieren. Ein an das Feature Flag angehängtes Ziel erfasst eine Conversion, wenn der Besucher mit Ihrer LLM-basierten Funktion oder Ihrem KI-Agenten interagiert, zum Beispiel durch eine Anschlussfrage oder das Abschließen einer Aufgabe mithilfe des Agenten. Sobald Sie genügend Traffic gesammelt haben, vergleichen Sie die Conversion-Rate jeder Variation zusammen mit allen KI-Qualitäts- oder operativen Metriken, die Sie verfolgen, um zu entscheiden, welche Konfiguration am besten performt.Voraussetzungen
- Ein Kameleoon-Konto mit einem für Feature Experimentation eingerichteten Projekt.
- Die Client-ID und das Client-Secret Ihres Kontos. Diese Werte finden Sie unter API-Anmeldeinformationen.
- Eine Python-Anwendung, in der Sie das Kameleoon SDK installieren können.
Ihr Prompt-Experiment in Kameleoon einrichten
Konfigurieren Sie das Feature Flag, die Prompt-Variationen und das Tracking-Ziel in der Kameleoon-Plattform, bevor Sie Ihren Anwendungscode anfassen.Das Feature Flag erstellen
Erstellen Sie ein Feature Flag, um Ihre Prompt-Variationen aufzunehmen und die Bereitstellung Ihres Experiments zu steuern.- Klicken Sie in der Kameleoon-App auf Features > Flags & Experiments > New feature flag.
- Geben Sie einen Namen ein, zum Beispiel
LLM prompt test, und wählen Sie das Projekt für das Flag aus. - Notieren Sie im Feld Description, wofür das Flag steht, damit andere Teammitglieder seinen Zweck verstehen.
- Klicken Sie auf Validate.
Den Prompt in einer Feature-Variable speichern
Fügen Sie eine Feature-Variable hinzu, um den Prompt-Text zu speichern, sodass Sie ihn über die Kameleoon-Plattform ändern können, ohne Ihren Anwendungscode zu bearbeiten.- Klicken Sie auf der Seite des Flags in der linken Seitenleiste auf Set Up > Variables > Add Variable.
- Setzen Sie den Type der Variable auf String.
- Geben Sie einen Variable Key ein, zum Beispiel
prompt_template. - Setzen Sie die Default Value auf den Prompt, den Ihre Anwendung derzeit verwendet. Kameleoon liefert diesen Wert an Besucher aus, die nicht Teil Ihres Experiments sind.
- Klicken Sie auf Save.

Für jeden Prompt eine Variation erstellen
Erstellen Sie eine Variation pro Prompt, den Sie testen möchten, und setzen Sie die Variableprompt_template in jeder auf den entsprechenden Text.
- Klicken Sie in der linken Seitenleiste auf Set Up > Variations > Add variation.
- Geben Sie einen Name für die Variation ein, zum Beispiel
Detailed summary. - Setzen Sie die Variable
prompt_templatefür diese Variation auf den Prompt-Text. - Klicken Sie auf Save.
- Wiederholen Sie diese Schritte für jeden weiteren Prompt, den Sie testen möchten.

Ein Ziel zum Messen des Engagements anhängen
Hängen Sie ein Ziel an das Feature Flag an, damit Kameleoon messen kann, welche Prompt-Variation mehr Engagement erzeugt. Da Kameleoon eine einheitliche Plattform ist, können Sie jedes bereits in Ihrer Organisation vorhandene Ziel anhängen, etwa ein von einem anderen Team definiertes Transaktionsziel, oder ein Ziel erstellen, das speziell auf Ihre LLM-basierte Funktion zugeschnitten ist.- Klicken Sie auf der Seite des Flags im Menü Set Up auf Goals > Add goal.
- Wählen Sie ein vorhandenes Ziel aus, oder klicken Sie auf Create a new goal, um eines zu definieren, zum Beispiel ein benutzerdefiniertes Ziel, das ausgelöst wird, wenn ein Besucher mit Ihrer LLM-basierten Funktion interagiert.
- Klicken Sie auf Save.

Das Experiment ausrollen
Erstellen Sie eine Experiment-Regel, die den Traffic auf Ihre Prompt-Variationen verteilt, und aktivieren Sie dann die Umgebung, um mit der Datenerfassung zu beginnen.- Wählen Sie im Rollout Planner die Umgebung aus, die Sie anvisieren möchten, zum Beispiel Production.
- Klicken Sie auf Add a rule > Experiment.
- Fügen Sie unter Variations to serve jede Prompt-Variation hinzu und legen Sie deren Expositionsprozentsatz fest. Verteilen Sie den Traffic beispielsweise gleichmäßig auf zwei Variationen mit je 50 %.
- Legen Sie das Targeting der Regel so fest, dass es die Besucher einschließt, die Sie testen möchten, zum Beispiel alle Besucher, die die Anwendung erreichen.
- Schalten Sie den ON/OFF-Schalter der Umgebung auf ON.
- Klicken Sie auf Save.

Den Prompt in Ihrer Anwendung abrufen
Installieren Sie das Kameleoon Python SDK, rufen Sie dann den dem Besucher zugewiesenen Prompt ab und verfolgen Sie eine Conversion, wenn der Besucher mit Ihrer LLM-basierten Funktion interagiert. Das gleiche Muster gilt für jedes serverseitige Kameleoon SDK, einschließlich Node.js, Java und Go.-
Installieren Sie das SDK als Abhängigkeit:
-
Initialisieren Sie den Client mit Ihrem Site Code und Ihren Zugangsdaten:
-
Rufen Sie den zugewiesenen Prompt ab, bevor Sie Ihr LLM aufrufen, und verfolgen Sie eine Conversion, wenn der Besucher mit der LLM-basierten Funktion interagiert:
Rufen Sie
get_prompt_for_visitor()mit demvisitor_codedes Besuchers auf, bevor Sie eine Anfrage an Ihr LLM senden, und verwenden Sie den zurückgegebenen Wert als Prompt. Rufen Sietrack_llm_interaction()auf, wenn der Besucher mit der LLM-basierten Funktion interagiert, zum Beispiel durch das Absenden einer Frage oder den Erhalt einer Antwort.
Verwenden Sie
get_visitor_code(), um jedem Besucher eine eindeutige ID zuzuweisen, und set_legal_consent(), falls Ihre Anwendung die Einwilligung des Besuchers vor dem Tracking von Daten benötigt. Die vollständige Referenz zur Client-Initialisierung und -Konfiguration finden Sie im Entwicklerhandbuch des Python SDK.Überwachen und iterieren
Öffnen Sie die Ergebnisseite des Feature Flags, um die Conversion-Rate jeder Prompt-Variation mit dem angehängten Ziel zu vergleichen. Kameleoon verfolgt Expositionen und Conversions automatisch, sobald Ihre Anwendungget_variation() und track_conversion() aufruft. Sie benötigen daher keine zusätzliche Instrumentierung. Wenn Sie zusätzlich eine KI-Qualitäts- oder operative Metrik als Ziel angehängt haben, vergleichen Sie diese zusammen mit der Conversion-Rate, bevor Sie entscheiden, welche Variation Sie ausrollen.
Weitere Details finden Sie unter Die Gesamtergebnisse eines Feature Flags anzeigen.
Nächste Schritte
- Lesen Sie die Python SDK-Referenz für erweiterte Optionen wie Custom Data, geräteübergreifende Experimente und Targeting-Bedingungen.
- Hängen Sie präzise Segmentierungskriterien an, um das Experiment auf eine bestimmte Zielgruppe auszurichten.
- Erkunden Sie Feature-Variablen, um weitere Teile Ihrer LLM-basierten Funktion oder Ihres KI-Agenten zu variabilisieren, etwa Modellparameter, Retrieval-Einstellungen oder Tool-Definitionen.
- Hängen Sie mehrere Ziele an dasselbe Flag an, etwa einen KI-Qualitäts-Score aus Ihrer Evaluierungs-Pipeline zusammen mit einer Geschäftsmetrik, um Konfigurationen anhand mehrerer Dimensionen gleichzeitig zu vergleichen. Siehe Ziele für Feature Flags erstellen.