Das KI-Modell wählen, mit dem dein Agent antwortet
Wähle das KI-Modell, das die Antworten deines intoCHAT-Agenten schreibt: Modelle von OpenAI, Anthropic und Google, wie viele Nachrichten jede Antwort verbraucht, welche Pläne sie enthalten, Auto, Ersatzmodell, Testen im Playground und wohin die Nachrichten der Besucher gehen.
Jeder Agent schreibt seine Antworten mit einem KI-Modell. Standardmäßig ist das GPT-6 Luna von OpenAI, das für die meisten Support-Gespräche passt. In einem bezahlten Plan kannst du für jeden Agenten ein anderes Modell wählen, von OpenAI, Anthropic oder Google, oder Auto für jede Nachricht eines wählen lassen.
Größere Modelle verbrauchen pro Antwort mehr Nachrichten deines Plans. Alles andere an deinem Agenten bleibt mit jedem Modell gleich: sein Wissen, seine Anweisungen, Guardrails, Aktionen, Formulare und Abläufe.
Ein Modell wählen
- Öffne deinen Agenten und wechsle zum Tab Setup. Die Karte Model steht unter Reply language.
- Wähle ein Modell oder Auto. Zu jedem Modell siehst du den Anbieter, die Stufe, wie viele Nachrichten es pro Antwort verbraucht und den günstigsten Plan, der es enthält.
- Klicke oben auf Save changes.
Modelle, die dein Plan nicht enthält, stehen ausgegraut in der Liste, mit dem Plan, den sie brauchen, etwa Needs Pro. Ein Modell erscheint nur, wenn intoCHAT es eingerichtet hat; ist ein Anbieter nicht eingerichtet, werden seine Modelle nicht aufgeführt.
Die Wahl wird mit den anderen Einstellungen des Agenten gespeichert. Sie erscheint daher im Einstellungsverlauf als Model und lässt sich dort wiederherstellen.
Modelle und was sie kosten
| Modell | Anbieter | Stufe | Nachrichten pro Antwort | Pläne |
|---|---|---|---|---|
| GPT-6 Luna (Standard) | OpenAI | Standard | 1 | Alle Pläne |
| Claude Haiku 4.5 | Anthropic | Schnell | 1 | Ab Starter |
| Gemini Flash | Schnell | 1 | Ab Starter | |
| Claude Sonnet 5.5 | Anthropic | Fortgeschritten | 2 | Ab Pro |
| Gemini Pro | Fortgeschritten | 2 | Ab Pro | |
| Claude Opus 5.5 | Anthropic | Premium | 5 | Ab Pro |
| Auto | Wählt pro Nachricht | 1 | Ab Starter |
„Nachrichten pro Antwort“ gibt an, wie viele der monatlichen Nachrichten deines Plans eine Antwort verbraucht. Mit Claude Opus 5.5 verbrauchen 10 Antworten zum Beispiel 50 Nachrichten. Eine Antwort, die Aktionen oder eine Websuche ausführt, zählt trotzdem nur einmal, zum Satz ihres Modells. Das monatliche Nachrichtenlimit jedes Agenten zählt genauso.
Auto
Mit Auto wählt intoCHAT für jede Nachricht eines Besuchers ein Modell aus, unter den Modellen der Liste, die dein Plan enthält. Die Wahl richtet sich nach der Nachricht, der Länge des Gesprächs, danach, ob Dateien angehängt sind, und danach, ob Aktionen zur Verfügung stehen.
- Jede Antwort mit Auto verbraucht eine Nachricht, egal welches Modell sie schreibt.
- Auto gibt es ab Starter. Im Free-Plan ist es ausgegraut.
- Auto wählt nie ein Modell, das dein Plan nicht enthält oder das nicht eingerichtet ist.
Wie Auto wählt
- Auto verbraucht eine Nachricht pro Antwort und wählt deshalb nur zwischen den Modellen, die eine Nachricht verbrauchen: Claude Haiku 4.5, Gemini Flash und GPT-6 Luna (dem Standard).
- Kein Modell wird gefragt, wie entschieden werden soll. Die Wahl fällt sofort anhand einfacher Regeln zur Nachricht des Besuchers, verzögert also nichts und verbraucht keine Nachrichten.
- Eine Nachricht mit einem Bild oder einer Datei geht an ein Modell, das Bilder lesen kann, zuerst an GPT-6 Luna.
- Komplexe Nachrichten gehen an GPT-6 Luna:
- die Bitte, etwas zu erledigen, etwa eine Bestellung, Erstattung, Buchung, Stornierung, Änderung, Sendungsverfolgung oder Rücksendung, oder eine Nachricht mit einer Bestellnummer wie #1234, wenn der Agent in diesem Gespräch etwas tun kann (zum Beispiel Aktionen, Formulare, Abläufe, Terminbuchung, Bestellungen, Übergabe oder Websuche);
- eine Frage aus mehreren Teilen oder eine Liste von Punkten;
- eine Nachricht mit mehr als 400 Zeichen;
- die Bitte um Code oder eine Tabelle;
- ein Vergleich;
- jede Nachricht, sobald das Gespräch mehr als 12 frühere Nachrichten hat.
- Alles andere, etwa Begrüßungen, Dank, Ja- oder Nein-Antworten, Smalltalk und kurze Fragen, geht an das schnellste verfügbare Modell: Claude Haiku 4.5, dann Gemini Flash, dann GPT-6 Luna.
- Berücksichtigt werden nur Modelle, die auf intoCHAT eingerichtet sind und die dein Plan enthält. Passt keines davon, antwortet GPT-6 Luna.
- Die Sprache ändert an der Wahl nichts: Jedes dieser Modelle ist mehrsprachig, und die Regeln verstehen Englisch, Deutsch, Französisch, Italienisch und Spanisch.
Welche Modelle die Antworten deiner Agenten geschrieben haben, siehst du im Dashboard unter Outcomes in der Karte Models used, für den Zeitraum und den Agenten, den du wählst. Mit Auto zeigt sie das Modell, das für jede Antwort gewählt wurde, oder GPT-6 Luna, wenn es nach einem Problem beim Anbieter stattdessen geantwortet hat.
Ersatzmodell
Deine Besucher bekommen immer eine Antwort. Das Standardmodell GPT-6 Luna antwortet anstelle des Modells des Agenten, wenn:
- der Plan das Modell nicht mehr enthält, zum Beispiel nach einem Downgrade von Pro auf Starter. Die Karte Model sagt dann, dass die Antworten GPT-6 Luna nutzen, bis du upgradest oder ein anderes Modell wählst. An deinen Einstellungen wird nichts geändert, und andere Einstellungen lassen sich weiterhin speichern.
- das Modell auf intoCHAT nicht mehr eingerichtet ist.
- in diesem Monat weniger Nachrichten übrig sind, als das Modell verbraucht, aber mindestens eine. Die Antwort verbraucht dann eine Nachricht. Ist gar keine Nachricht mehr übrig, antworten deine Agenten wie gewohnt nicht mehr; siehe Pläne und Limits.
- der Anbieter ein Problem hat, bevor die Antwort beginnt, zum Beispiel einen Ausfall. intoCHAT versucht es dann einmal mit GPT-6 Luna, und der Rest dieser Antwort bleibt dabei. Die Antwort verbraucht dann eine Nachricht, wie jede Antwort von GPT-6 Luna: Die zusätzlichen Nachrichten eines größeren Modells werden zurückgegeben.
Welches Modell eine Antwort geschrieben hat, siehst du, wenn du im Tab Conversations darunter Why this answer öffnest. Die Zeile Model nennt das Modell, sagt, wann Auto es gewählt hat und warum, und sagt, wann stattdessen das Standardmodell geantwortet hat und aus welchem Grund. Siehe Gespräche und Statistik.
Modelle im Playground ausprobieren
Der Playground nutzt das Modell, das auf dem Bildschirm eingestellt ist, gespeichert oder nicht, genau wie bei den Anweisungen und Guardrails. Wähle ein Modell in der Karte Model und chatte dann im Playground, um es vor dem Speichern auszuprobieren. Nur wer den Agenten bearbeiten darf, kann ein ungespeichertes Modell ausprobieren; alle anderen bekommen das gespeicherte.
In Compare kann jede Seite ihr eigenes Modell nutzen:
- B hat neben seinen anderen Entwurfseinstellungen eine Auswahl Model. Use B übernimmt sie mit dem Rest des Entwurfs in das Einstellungsformular.
- A antwortet mit dem gespeicherten Modell, es sei denn, du wählst unter A's model ein anderes.
Jedes Senden in Compare verbraucht die Nachrichten der Modelle beider Seiten, zum Beispiel zwei bei zwei Modellen, die je eine Nachricht verbrauchen. Für eine Seite, deren Modell dein Plan nicht enthält oder das nicht eingerichtet ist, antwortet GPT-6 Luna, und sie verbraucht eine Nachricht. Die Zeile über den Chats zeigt die Zahl.
Überall, wo dein Agent antwortet
Das Modell des Agenten schreibt jede Antwort, die Besucher bekommen: im Chat-Widget, im eingebetteten iframe und im Chat-Link, auf der Help Page, in Slack, per E-Mail, über die REST API, den MCP-Server und in Tests mit simulierten Kunden. In einem Test nutzen nur die Antworten deines Agenten sein Modell; der simulierte Kunde und der Prüfer verbrauchen keine deiner Nachrichten.
Die KI-Arbeit, die intoCHAT selbst im Hintergrund erledigt, nutzt immer das Standardmodell von OpenAI, das intoCHAT dafür einsetzt, und hängt nicht von deiner Wahl ab: die Suche in deinem Wissen, die Themenanalyse, Spamprüfungen, der Copilot, Fragen zu deinen Gesprächen, die Live-Übersetzung und die Prüfung auf widersprüchliche Fakten.
Die REST API liefert das Modell des Agenten als model bei einem Agenten und das Modell, das eine Antwort geschrieben hat, als model bei den Nachrichten eines Gesprächs. Siehe REST API.
Dateien und Fotos
Jedes aufgeführte Modell liest Bilder, die Besucher anhängen. PDFs lesen nur die Modelle von OpenAI: Mit einem Modell von Anthropic oder Google erfährt der Agent, dass ein PDF angehängt wurde, kann es aber nicht öffnen und antwortet anhand dessen, was der Besucher geschrieben hat.
Datenschutz
Die Nachrichten des Besuchers, das bisherige Gespräch, deine Anweisungen und die für die Antwort genutzten Auszüge aus dem Wissen gehen an den Anbieter des Modells, das die Antwort schreibt: OpenAI, Anthropic oder Google. Mit Auto kann das jeder der drei sein, je nachdem, welches Modell für die jeweilige Nachricht gewählt wird. Antwortet nach einem Problem beim Anbieter stattdessen GPT-6 Luna, geht die Anfrage für die Antwort auch an OpenAI.
Die KI-Arbeit, die intoCHAT selbst im Hintergrund erledigt, etwa die Suche in deinem Wissen, Spamprüfungen und die Themenanalyse, nutzt immer OpenAI. Die Nachrichten der Besucher erreichen OpenAI also auch, egal welches Modell du wählst. Nennt deine Datenschutzerklärung die Unternehmen, die Chatnachrichten verarbeiten, führe OpenAI und die Anbieter der Modelle auf, die du nutzt.
Nutzung nach Modell
Für den Owner des Kontos zeigt Settings, Billing unter Replies by model this period, wie viele Antworten jedes Modell im aktuellen Abrechnungszeitraum geschrieben hat. Gezählt werden Antworten, die in Gesprächen gespeichert sind; temporäre Chats und Tests sind also nicht enthalten. Für dein Limit zählt die Nachrichtenzahl deines Plans darüber.
Grenzen
- Ein Modell pro Agent. Verschiedene Agenten können verschiedene Modelle nutzen.
- Eine Antwort, die bereits gestreamt wird, wenn ein Anbieter ausfällt, kann das Modell nicht wechseln; der Besucher sieht dann womöglich, dass die Antwort abbricht. Das Ersatzmodell springt ein, bevor Text angezeigt wird.
- Die Antworten der Modelle unterscheiden sich in Stil und Länge. Probier ein Modell im Playground aus, bevor du einen viel genutzten Agenten umstellst.
- Größere Modelle brauchen für eine Antwort meist länger als GPT-6 Luna und die schnellen Modelle, besonders bei Antworten, die Aktionen ausführen. intoCHAT wartet bis zu 25 Sekunden auf eine Reaktion von Anthropic oder Google, bevor stattdessen GPT-6 Luna antwortet; ein langsamer Anbieter kann eine Antwort also noch länger dauern lassen.