Skip to main content
LLM-basierte Anwendungen und KI-Agenten sind nicht deterministisch. Wenn Sie einen Prompt, ein Modell, eine Retrieval-Strategie, eine Tool-Konfiguration oder einen Agenten-Workflow ändern, wirkt sich das auf unterschiedliche, schwer vorhersehbare Weise auf Antwortqualität, Betriebskosten, Latenz und Nutzerverhalten aus. Evaluierungs-Frameworks wie RAGAS bewerten, ob eine einzelne Antwort einen Qualitätsstandard erfüllt, aber diese Bewertung sagt Ihnen nicht, ob die Änderung den Nutzern hilft, das zu erreichen, weswegen sie Ihr Produkt überhaupt nutzen. Sie können die Funktionen von Kameleoon Feature Experimentation nutzen, um die Konfiguration hinter einer generativen KI-Anwendung oder einem KI-Agenten anzupassen, zu testen und auszurollen. Eine Feature-Variable enthält jeweils einen Teil dieser Konfiguration (einen Prompt, einen Modellparameter, eine Retrieval-Strategie, eine Tool-Definition), sodass Ihr Team sie außerhalb des Anwendungscodes verwalten kann. Jede Variation stellt eine mögliche Konfiguration dar, was Ihnen ermöglicht, Änderungen zu iterieren, zu testen und sicherer zu veröffentlichen, ohne erneut bereitzustellen. Verteilen Sie den Traffic auf die Variationen, und vergleichen Sie deren Auswirkungen anhand mehrerer Metriktypen:
  • KI-Qualitätsmetriken, wie Korrektheit, Fundiertheit (Groundedness), Relevanz, Sicherheit oder Compliance
  • Agenten-Leistungsmetriken, wie erfolgreiche Tool-Nutzung oder Aufgabenerfüllung
  • Operative Metriken, wie Latenz, Token-Verbrauch, Fehler und Kosten
  • Nutzer- und Geschäftsmetriken, wie Zufriedenheit, Eskalation, Conversion, Bindung und Umsatz
Da die Konfiguration in einem Feature Flag statt in Ihrem Quellcode liegt, können Sie jederzeit direkt über die Kameleoon-Plattform eine Variation hinzufügen, bearbeiten oder zurücksetzen.

Evaluierung und Experimente lösen unterschiedliche Probleme

Evaluierung stellt fest, ob eine einzelne Modell- oder Agenten-Ausgabe einen definierten Qualitätsstandard erfüllt. Observability-Tools ermöglichen es Ihnen, die Prompts, Antworten, Traces, Retrieval-Schritte und Tool-Aufrufe hinter dieser Ausgabe zu untersuchen. Experimente stellen fest, ob eine Änderung an der zugrunde liegenden Konfiguration eine messbare Verbesserung für Nutzer oder das Geschäft bewirkt: eine Frage, die weder die Evaluierung noch die Observability beantwortet. Ein LLM-Judge könnte beispielsweise einen Prompt als fundierter bewerten als einen anderen. Ein Kameleoon-Experiment zeigt Ihnen, ob derselbe Prompt außerdem die Aufgabenerfüllung verbessert, Eskalationen reduziert, die Zufriedenheit steigert oder sich auf Latenz und Kosten auswirkt, die Ergebnisse, für die Ihr Team verantwortlich ist. Kameleoon ersetzt nicht Ihren LLM-Observability- oder Evaluierungs-Stack. Speisen Sie Bewertungsergebnisse aus RAGAS, einem LLM-Judge oder einem menschlichen Review-Prozess als benutzerdefiniertes Ziel mit einem numerischen Wert in Kameleoon ein, und verfolgen Sie sie zusammen mit den Verhaltens- und Geschäftszielen, die Ihr Experiment bereits misst, und verbinden Sie damit Qualitätssignale auf Modellebene mit einer statistisch zuverlässigen Messung der tatsächlichen Auswirkung auf Nutzer. Kombinieren Sie bei den meisten KI-Experimenten mehrere Metriktypen, anstatt sich auf einen einzigen zu verlassen:
  • Legen Sie ein Nutzer- oder Geschäftsergebnis als primäres Ziel fest.
  • Verfolgen Sie KI-Qualitätsmetriken als sekundäre Ziele oder Guardrails.
  • Überwachen Sie Latenz, Kosten, Fehler und Sicherheit als operative Guardrails.
  • Validieren Sie automatisierte Judges anhand einer Stichprobe menschlich geprüfter Beispiele, bevor Sie deren Bewertungen im großen Maßstab vertrauen.

Funktionsweise

Ein Feature Flag speichert jede Konfiguration (zum Beispiel einen Prompt) als Wert einer Feature-Variable, mit einer Variation pro Option, die Sie testen möchten. Wenn ein Besucher Ihre Anwendung erreicht, weist das Kameleoon SDK dem Besucher eine Variation zu und gibt den entsprechenden Wert zurück, den Ihr Anwendungscode verwendet, um das LLM aufzurufen oder den Agenten zu konfigurieren. Ein an das Feature Flag angehängtes Ziel erfasst eine Conversion, wenn der Besucher mit Ihrer LLM-basierten Funktion oder Ihrem KI-Agenten interagiert, zum Beispiel durch eine Anschlussfrage oder das Abschließen einer Aufgabe mithilfe des Agenten. Sobald Sie genügend Traffic gesammelt haben, vergleichen Sie die Conversion-Rate jeder Variation zusammen mit allen KI-Qualitäts- oder operativen Metriken, die Sie verfolgen, um zu entscheiden, welche Konfiguration am besten performt.

Voraussetzungen

  • Ein Kameleoon-Konto mit einem für Feature Experimentation eingerichteten Projekt.
  • Die Client-ID und das Client-Secret Ihres Kontos. Diese Werte finden Sie unter API-Anmeldeinformationen.
  • Eine Python-Anwendung, in der Sie das Kameleoon SDK installieren können.

Ihr Prompt-Experiment in Kameleoon einrichten

Konfigurieren Sie das Feature Flag, die Prompt-Variationen und das Tracking-Ziel in der Kameleoon-Plattform, bevor Sie Ihren Anwendungscode anfassen.

Das Feature Flag erstellen

Erstellen Sie ein Feature Flag, um Ihre Prompt-Variationen aufzunehmen und die Bereitstellung Ihres Experiments zu steuern.
  1. Klicken Sie in der Kameleoon-App auf Features > Flags & Experiments > New feature flag.
  2. Geben Sie einen Namen ein, zum Beispiel LLM prompt test, und wählen Sie das Projekt für das Flag aus.
  3. Notieren Sie im Feld Description, wofür das Flag steht, damit andere Teammitglieder seinen Zweck verstehen.
  4. Klicken Sie auf Validate.
Weitere Details finden Sie unter Ein Feature Flag erstellen.

Den Prompt in einer Feature-Variable speichern

Fügen Sie eine Feature-Variable hinzu, um den Prompt-Text zu speichern, sodass Sie ihn über die Kameleoon-Plattform ändern können, ohne Ihren Anwendungscode zu bearbeiten.
  1. Klicken Sie auf der Seite des Flags in der linken Seitenleiste auf Set Up > Variables > Add Variable.
  2. Setzen Sie den Type der Variable auf String.
  3. Geben Sie einen Variable Key ein, zum Beispiel prompt_template.
  4. Setzen Sie die Default Value auf den Prompt, den Ihre Anwendung derzeit verwendet. Kameleoon liefert diesen Wert an Besucher aus, die nicht Teil Ihres Experiments sind.
  5. Klicken Sie auf Save.
Der Variables-Einrichtungsbildschirm zeigt eine String-Variable namens prompt_template mit einem Platzhalter für den Standardwert des Prompt-Texts.
Weitere Details finden Sie unter Feature-Variablen definieren.

Für jeden Prompt eine Variation erstellen

Erstellen Sie eine Variation pro Prompt, den Sie testen möchten, und setzen Sie die Variable prompt_template in jeder auf den entsprechenden Text.
  1. Klicken Sie in der linken Seitenleiste auf Set Up > Variations > Add variation.
  2. Geben Sie einen Name für die Variation ein, zum Beispiel Detailed summary.
  3. Setzen Sie die Variable prompt_template für diese Variation auf den Prompt-Text.
  4. Klicken Sie auf Save.
  5. Wiederholen Sie diese Schritte für jeden weiteren Prompt, den Sie testen möchten.
Der Variations-Einrichtungsbildschirm zeigt eine Variation namens Detailed summary, bei der die Variable prompt_template auf einen Prompt-Wert gesetzt ist.
Weitere Details finden Sie unter Feature-Variationen definieren.

Ein Ziel zum Messen des Engagements anhängen

Hängen Sie ein Ziel an das Feature Flag an, damit Kameleoon messen kann, welche Prompt-Variation mehr Engagement erzeugt. Da Kameleoon eine einheitliche Plattform ist, können Sie jedes bereits in Ihrer Organisation vorhandene Ziel anhängen, etwa ein von einem anderen Team definiertes Transaktionsziel, oder ein Ziel erstellen, das speziell auf Ihre LLM-basierte Funktion zugeschnitten ist.
  1. Klicken Sie auf der Seite des Flags im Menü Set Up auf Goals > Add goal.
  2. Wählen Sie ein vorhandenes Ziel aus, oder klicken Sie auf Create a new goal, um eines zu definieren, zum Beispiel ein benutzerdefiniertes Ziel, das ausgelöst wird, wenn ein Besucher mit Ihrer LLM-basierten Funktion interagiert.
  3. Klicken Sie auf Save.
Der Goals-Einrichtungsbildschirm zeigt ein an das Feature Flag angehängtes Ziel, mit Optionen zum Hinzufügen eines vorhandenen Ziels oder zum Erstellen eines neuen.
Weitere Details zu Zieltypen, einschließlich wie Sie ein benutzerdefiniertes Ziel von Ihrem Backend aus auslösen, finden Sie unter Ein Ziel erstellen.

Das Experiment ausrollen

Erstellen Sie eine Experiment-Regel, die den Traffic auf Ihre Prompt-Variationen verteilt, und aktivieren Sie dann die Umgebung, um mit der Datenerfassung zu beginnen.
  1. Wählen Sie im Rollout Planner die Umgebung aus, die Sie anvisieren möchten, zum Beispiel Production.
  2. Klicken Sie auf Add a rule > Experiment.
  3. Fügen Sie unter Variations to serve jede Prompt-Variation hinzu und legen Sie deren Expositionsprozentsatz fest. Verteilen Sie den Traffic beispielsweise gleichmäßig auf zwei Variationen mit je 50 %.
  4. Legen Sie das Targeting der Regel so fest, dass es die Besucher einschließt, die Sie testen möchten, zum Beispiel alle Besucher, die die Anwendung erreichen.
  5. Schalten Sie den ON/OFF-Schalter der Umgebung auf ON.
  6. Klicken Sie auf Save.
Der Rollout Planner für die Umgebung Production zeigt eine Experiment-Regel, die alle Besucher anvisiert und den Traffic 50/50 auf zwei Variationen verteilt.
Weitere Details finden Sie unter Feature-Experimente erstellen. Sobald Sie die Regel gespeichert haben, beginnt Kameleoon damit, Besuchern eine Variation zuzuweisen und den entsprechenden Prompt auszuliefern. Um einen Prompt später zu ändern oder eine Variation hinzuzufügen, bearbeiten Sie ihn direkt in der Kameleoon-Plattform. Sie müssen Ihre Anwendung nicht neu bereitstellen, um diese Änderungen vorzunehmen.

Den Prompt in Ihrer Anwendung abrufen

Installieren Sie das Kameleoon Python SDK, rufen Sie dann den dem Besucher zugewiesenen Prompt ab und verfolgen Sie eine Conversion, wenn der Besucher mit Ihrer LLM-basierten Funktion interagiert. Das gleiche Muster gilt für jedes serverseitige Kameleoon SDK, einschließlich Node.js, Java und Go.
  1. Installieren Sie das SDK als Abhängigkeit:
  2. Initialisieren Sie den Client mit Ihrem Site Code und Ihren Zugangsdaten:
  3. Rufen Sie den zugewiesenen Prompt ab, bevor Sie Ihr LLM aufrufen, und verfolgen Sie eine Conversion, wenn der Besucher mit der LLM-basierten Funktion interagiert:
    Rufen Sie get_prompt_for_visitor() mit dem visitor_code des Besuchers auf, bevor Sie eine Anfrage an Ihr LLM senden, und verwenden Sie den zurückgegebenen Wert als Prompt. Rufen Sie track_llm_interaction() auf, wenn der Besucher mit der LLM-basierten Funktion interagiert, zum Beispiel durch das Absenden einer Frage oder den Erhalt einer Antwort.
Verwenden Sie get_visitor_code(), um jedem Besucher eine eindeutige ID zuzuweisen, und set_legal_consent(), falls Ihre Anwendung die Einwilligung des Besuchers vor dem Tracking von Daten benötigt. Die vollständige Referenz zur Client-Initialisierung und -Konfiguration finden Sie im Entwicklerhandbuch des Python SDK.

Überwachen und iterieren

Öffnen Sie die Ergebnisseite des Feature Flags, um die Conversion-Rate jeder Prompt-Variation mit dem angehängten Ziel zu vergleichen. Kameleoon verfolgt Expositionen und Conversions automatisch, sobald Ihre Anwendung get_variation() und track_conversion() aufruft. Sie benötigen daher keine zusätzliche Instrumentierung. Wenn Sie zusätzlich eine KI-Qualitäts- oder operative Metrik als Ziel angehängt haben, vergleichen Sie diese zusammen mit der Conversion-Rate, bevor Sie entscheiden, welche Variation Sie ausrollen. Weitere Details finden Sie unter Die Gesamtergebnisse eines Feature Flags anzeigen.

Nächste Schritte

  • Lesen Sie die Python SDK-Referenz für erweiterte Optionen wie Custom Data, geräteübergreifende Experimente und Targeting-Bedingungen.
  • Hängen Sie präzise Segmentierungskriterien an, um das Experiment auf eine bestimmte Zielgruppe auszurichten.
  • Erkunden Sie Feature-Variablen, um weitere Teile Ihrer LLM-basierten Funktion oder Ihres KI-Agenten zu variabilisieren, etwa Modellparameter, Retrieval-Einstellungen oder Tool-Definitionen.
  • Hängen Sie mehrere Ziele an dasselbe Flag an, etwa einen KI-Qualitäts-Score aus Ihrer Evaluierungs-Pipeline zusammen mit einer Geschäftsmetrik, um Konfigurationen anhand mehrerer Dimensionen gleichzeitig zu vergleichen. Siehe Ziele für Feature Flags erstellen.