Tests mit simulierten Kunden: deinen Agenten nach jeder Änderung prüfen
Schreib Testfälle für deinen KI-Chat-Agenten: Eine KI spielt den Kunden, dein Agent antwortet mit seinen echten Einstellungen und Werkzeugen, und eine KI als Prüfer bewertet jeden Chat mit bestanden oder nicht bestanden. Aktionen werden simuliert, Tests haben also keine Nebenwirkungen.
Eine Änderung an deinen Anweisungen, deinem Wissen oder deinen Abläufen kann eine Antwort verbessern und unbemerkt eine andere verschlechtern. Mit Tests mit simulierten Kunden prüfst du die wichtigsten Gespräche mit einem Klick: Du beschreibst einen Kunden und wie ein guter Chat aussieht, eine KI spielt diesen Kunden und chattet mit deinem Agenten, und eine KI als Prüfer bewertet jeden Chat mit Pass oder Fail und einer Begründung.
Dein Agent antwortet genau so wie auf deiner Website: mit seinen gespeicherten Anweisungen, Guardrails, seinem Wissen, seinen Abläufen und Werkzeugen. Was er in einem Test nicht kann, ist irgendetwas in der Welt zu verändern. Siehe Was simuliert wird.
Test hinzufügen
- Öffne den Tab Playground deines Agenten und scrolle unter dem Chat zu Tests with simulated customers.
- Klicke auf Add test und fülle aus:
- Name: bis zu 80 Zeichen, zum Beispiel „Erstattung für eine verspätete Bestellung“.
- Customer: wer der Kunde ist und wie er sich verhält, bis zu 1.000 Zeichen. Zum Beispiel: „Ein ungeduldiger Kunde, dessen Bestellung eine Woche zu spät ist. Schreibt kurze Nachrichten und nennt Details erst, wenn er danach gefragt wird.“ Der Kunde schreibt in der Sprache, die sich daraus ergibt, „ein deutscher Kunde“ chattet also auf Deutsch.
- Goal: was er mit dem Chat erreichen will, bis zu 1.000 Zeichen. Zum Beispiel: „Sein Geld für Bestellung 1042 zurückbekommen.“
- Success criteria: was der Agent tun oder nie tun muss, damit der Chat besteht, bis zu 1.000 Zeichen. Zum Beispiel: „Fragt nach der Bestellnummer, startet den Erstattungsablauf und verspricht keine Erstattung, bevor sie bestätigt ist.“
- First message (optional): bis zu 500 Zeichen. Lässt du das Feld leer, schreibt der simulierte Kunde seine eigene.
- Max turns: wie viele Antworten der Agent höchstens gibt, von 1 bis 8 (standardmäßig 6).
- Allow read-only actions: standardmäßig aus. Siehe Was simuliert wird.
- Klicke auf Add test.
Ein Agent kann bis zu 25 Tests haben. Edit ändert einen Test, der Papierkorb-Button löscht ihn; frühere Ergebnisse behalten seinen Namen.
Tests ausführen
- Run all führt alle Tests des Agenten nacheinander aus. Run neben einem Test führt nur diesen aus.
- Die Seite zeigt jeden Test, sobald er fertig ist. Lass sie offen, solange die Tests laufen: Die Seite fordert einen Test nach dem anderen an. Schließt du sie oder lädst sie neu, läuft der Durchlauf weiter, sobald jemand mit Bearbeitungsrechten den Playground wieder öffnet; ein Durchlauf, zu dem niemand zurückkommt, wird nach einigen Minuten abgebrochen, wenn ein neuer startet.
- Cancel stoppt den Durchlauf. Der laufende Test stoppt bei seinem nächsten Schritt.
- Pro Agent kann immer nur ein Durchlauf gleichzeitig laufen.
Ein Test endet, wenn der simulierte Kunde den Chat beendet (weil sein Ziel erreicht ist oder er aufgibt) oder wenn der Agent so oft geantwortet hat, wie Max turns erlaubt. Dann liest der Prüfer den ganzen Chat und entscheidet.
Ergebnisse
- Ganz oben: der Anteil der bestandenen Tests, zum Beispiel 80% passed, und wie viele Tests des Durchlaufs bestanden haben.
- Jeder Test zeigt Pass, Fail oder Error. Klicke darauf, um die Begründung des Prüfers und den ganzen Chat zu lesen, mit den Werkzeugen, die der Agent unter jeder Antwort genutzt hat (zum Beispiel eine Übergabe, ein Formular oder eine Aktion), und dem, was unter einer Antwort angezeigt wurde.
- Error heißt, dass der Test nicht bewertet werden konnte, zum Beispiel weil der Agent zu lange für eine Antwort gebraucht hat oder die Antwort des Prüfers nicht gelesen werden konnte. Fehler zählen nicht zur Bestehensquote. Führe den Test erneut aus.
- Recent runs listet deine letzten 10 Durchläufe; klicke auf einen, um seine Ergebnisse zu sehen. Ältere Durchläufe werden gelöscht.
Was simuliert wird
Tests haben nie Nebenwirkungen. Deinem Agenten stehen dieselben Werkzeuge zur Verfügung wie in einem echten Chat, aber:
- API-Aktionen, die auf unserem Server laufen, werden nicht aufgerufen. Der Agent bekommt ein Ergebnis, das als simulierte Testdaten gekennzeichnet ist, und wird angewiesen, daraus keine Details zu erfinden. Ist Allow read-only actions eingeschaltet, laufen Aktionen mit der Methode GET wirklich, sodass Antworten deine Live-Daten nutzen können; alle anderen Aktionen bleiben simuliert.
- Client-seitige Aktionen (JavaScript im Browser des Besuchers) werden übersprungen.
- Übergabe per E-Mail und Anfragen nach einem Live-Chat werden simuliert: Niemand bekommt eine E-Mail, eine Slack-Nachricht, ein Helpdesk-Ticket oder eine Live-Chat-Anfrage.
- Terminbuchung: Kein Kalender wird nach freien Zeiten gefragt, und nichts wird gebucht.
- Bestellungen: Keine Bestellung wird abgefragt, und keine Rücksendeanfrage geht an deinen Shop.
- Abläufe laufen wie gewohnt Schritt für Schritt, ihr Zustand wird aber nur für den Test gespeichert. Ihre Aktionen werden wie alle anderen simuliert.
- Lead-Formulare und Chat-Formulare können unter einer Antwort erscheinen, abgeschickt wird aber nichts. Kontaktdaten, die der Kunde schreibt, werden erkannt, aber kein Lead wird gespeichert und keine Benachrichtigung und kein Webhook verschickt.
- Die Websuche sucht wirklich, wenn sie eingeschaltet ist.
Nichts aus einem Test erscheint unter Conversations, Leads, in den Themen oder in der Dashboard-Statistik. Die Ergebnisse werden nur im Bereich Tests aufbewahrt.
Nachrichten
Jede Antwort, die dein Agent in einem Test gibt, zählt als eine Nachricht auf deinen Plan, wie eine Nachricht im Playground. Der simulierte Kunde und der Prüfer zählen nicht. Vor dem Start zeigt der Bereich, wie viele Nachrichten ein Durchlauf höchstens verbraucht: die Summe der Max turns aller Tests. Oft verbraucht ein Test weniger, weil der Kunde den Chat früher beendet.
Gehen während eines Durchlaufs die Nachrichten deines Plans oder das monatliche Nachrichtenlimit des Agenten aus, stoppen die Tests, und die restlichen zeigen Error. Siehe Pläne und Limits.
Teamrollen
Teammitglieder mit der Rolle Viewer sehen die Tests und ihre Ergebnisse, können sie aber nicht hinzufügen, bearbeiten, löschen oder ausführen. Editoren, Admins und der Owner können das. Siehe Teammitglieder und Rollen.
Tipps
- Fang mit den fünf oder zehn Gesprächen an, auf die es am meisten ankommt: deine häufigste Frage, eine Erstattung oder Kündigung, eine Frage, die dein Agent nicht beantworten darf, die Bitte um eine Person.
- Prüfe pro Kriterium nur eine Sache, in einfachen Worten, und sag auch, was nicht passieren darf.
- Führe alle Tests aus, nachdem du Anweisungen, Guardrails, Wissen oder einen Ablauf geändert hast, und vergleiche die Bestehensquote mit dem letzten Durchlauf.
- Schlägt ein Test fehl, probier dasselbe Gespräch selbst im Playground darüber aus, um zu sehen, was der Agent tut.