Ein riesiges Kontextfenster bewahrt einen KI-Charakter nicht automatisch davor, Dinge zu vergessen, die Handlungen des Spielers zu übernehmen oder seine eigene Stimme zu verlieren. Für viele Rollenspieler ist Claude der beste Ausgangspunkt, wenn die Qualität der Figur im Vordergrund steht. Gemini passt besser zu Geschichten mit umfangreichem Kanon, DeepSeek ist der günstige Einstieg über eine API.
Die schnelle Entscheidung: Welcher Fehler wäre für dich ein K.-o.-Kriterium?
Welches KI-Modell sich für Rollenspiele am besten eignet, hängt vor allem davon ab, was über viele Züge hinweg erhalten bleiben muss. Aktuelle Vergleichsseiten kommen zu unterschiedlichen Ergebnissen: Lookatmy.ai sieht Claude Sonnet 4.6 bei Charakterstimme vorn, Gemini 2.5 Pro beim Kanon, GPT-4o bei Wärme und DeepSeek V3.2 beim Preis-Leistungs-Verhältnis. Composite hebt GLM-5.1 und Kimi K2.6 hervor; ModelGrep führt DeepSeek V4 Flash anhand des beobachteten OpenRouter-Rollenspiel-Traffics. (Lookatmy.ai, Composite, ModelGrep)
| Priorität | Bester Einstieg | Warum | Wichtigster Kompromiss |
|---|---|---|---|
| Charakterstimme und emotionaler Subtext | Claude | Starke Prosa, klar unterscheidbare Figuren und gutes Gespür für Szenen | Teuer und bei manchen fiktionalen Themen restriktiver |
| Langer Kanon und Kontinuität | Gemini | Praktisch für umfangreiche Story-Bibeln und Vorgeschichten | Kann förmlich oder blass wirken und Anweisungen übersehen |
| Günstiges Rollenspiel per API | DeepSeek | Niedrige offizielle Tokenpreise für intensive Nutzung | Einzelne Nutzer berichten von Wiederholungen oder überzeichneter Charakterdarstellung |
| Lokale/private Kontrolle | Qwen oder ein anderes Open-Weight-Modell | Hosting, Presets und Datenfluss liegen bei dir | Einrichtung und Hardware beeinflussen die Ergebnisse stark |
| Warmer Chat im Companion-Stil | GPT-4o | Vertrauter Gesprächston und emotionale Wärme | In langen Sitzungen teils schwächere Erinnerung an physische Szenendetails |
Ein SillyTavern-Nutzer schrieb: „Claude is by far the current best RP model“, nannte es zugleich aber „EXTREMELY nice. To a fault.“ Genau darin liegt der zentrale Zielkonflikt: Eine glaubwürdige Figur sorgt nicht zwangsläufig für den Konflikt oder die Eigeninitiative, die eine Geschichte braucht. (u/Level-Championship69 on Reddit)
Claude: Die Standardempfehlung für konsistente Figuren
Wenn eine Figur von Szene zu Szene wie dieselbe Person klingen soll, ist Claude das Modell, das du zuerst ausprobieren solltest. Lookatmy.ai bezeichnet Sonnet 4.6 als Standardwahl für Charakterarbeit und nennt Stimme, Subtext sowie eine langsam aufgebaute emotionale Entwicklung als Stärken. (Lookatmy.ai)
Dem stehen hohe Gefälligkeit, Ausführlichkeit, Sicherheitsbarrieren und eine eingeschränkte Eignung für einige fiktionale Szenarien für Erwachsene gegenüber. Auf der Preisseite von Anthropic wird Sonnet 5 mit $2 für Input und $10 für Output pro Million Tokens aufgeführt, Opus 5 mit $5 beziehungsweise $25 – jeweils vor Caching oder anderen Anpassungen. Soll ein Antagonist in deiner Geschichte eine schlechte Entscheidung treffen, definiere das Ziel der Figur klar und weise das Modell an, den Konflikt nicht für den Spieler aufzulösen.
Für die API-Nutzung bieten sich zunächst die offizielle Claude API documentation und die pricing page von Anthropic an. Falls du statt separater Integrationen je Anbieter ein kompatibles Gateway nutzen möchtest, ist die Claude API page von AIReiter der passende Weg. Halte Charakterkarte, aktuellen Dialog und dauerhafte Erinnerung getrennt, damit du das Modell wechseln kannst, ohne dein Setup neu aufzubauen.
Gemini punktet bei Kontinuität – nicht automatisch beim Schreibstil
Gemini ist sinnvoll, wenn dein Rollenspiel ein großes Kanon-Dokument, eine Zeitleiste, eine Figurenliste oder eine Datei zum Weltzustand umfasst. Lookatmy.ai empfiehlt Gemini 2.5 Pro ausdrücklich für Geschichten mit umfangreichem Kanon und Hunderten Nachrichten, merkt aber an, dass die Prosa ohne Stilvorlage flacher wirken kann. (Lookatmy.ai)
Dass eine Information im Kontext vorhanden ist, heißt noch nicht, dass sie im richtigen Moment auftaucht. Kombiniere den Kanon im Rollenspiel-Setup mit einer kurzen Stilprobe, platziere unverhandelbare Regeln weit oben in der Systemanweisung und fordere das Modell dazu auf, NPC-Aktionen zu beschreiben, ohne die Handlungen des Spielers festzulegen. In der Gemini API documentation von Google findest du aktuelle Modell-IDs, Limits und Preise.
DeepSeek: Die beste API-Option fürs Budget
Wenn die Kosten pro Sitzung wichtiger sind als eine besonders ausgefeilte literarische Stimme, ist DeepSeek ein vernünftiger Einstieg für häufige Rollenspiele. APIsRouter ordnet DeepSeek V4 Flash und V4 Pro seiner Spitzengruppe zu, während ModelGrep DeepSeek V4 Flash in seiner OpenRouter-Stichprobe für Rollenspiele als meistgenutztes Modell ausweist. Das sind unterschiedliche Signale: Eine redaktionelle Bestenliste ist nicht dasselbe wie ein Traffic-Anteil. (APIsRouter, ModelGrep)
Die offizielle DeepSeek-Preisseite führt deepseek-flash außerhalb der Spitzenzeiten mit $0.15 pro Million nicht gecachter Input-Tokens und $0.60 pro Million Output-Tokens. Für deepseek-v4-pro sind es $0.66 beziehungsweise $1.98. Zu Spitzenzeiten verdoppeln sich diese Preise, während Input bei Cache-Treffern deutlich günstiger ist. (DeepSeek API pricing)
| Offizieller Preis außerhalb der Spitzenzeit | deepseek-flash | deepseek-v4-pro |
|---|---|---|
| Input, Cache-Miss / MTok | $0.15 | $0.66 |
| Output / MTok | $0.60 | $1.98 |
| Input, Cache-Hit / MTok | $0.003 | $0.022 |
| Angegebene Parallelität | 2,500 | 500 |
Bei der Ausgabe ist der Kompromiss weniger attraktiv als auf der Rechnung. Ein Nutzer schrieb: „you can't crack more than like 1 joke or deepseek enters ‘funny mode’“ – ein Fehlerbild, das zusätzliche Neugenerierungen erzwingen kann. (u/SillyTavernEnjoya on Reddit)
Ein Modellname garantiert nicht, dass die Ausgabe bei verschiedenen Anbietern oder Proxys identisch ist. Prüfe daher die offizielle DeepSeek API documentation auf direkte API-Endpunkte und aktuelle Modellnamen.
GPT-4o für Wärme und den Companion-Stil
GPT-4o gehört auf die Auswahlliste, wenn sich ein vertrauter, emotionaler Gesprächston wichtiger anfühlt als eine minutiöse Verfolgung physischer Szenendetails. Lookatmy.ai beschreibt das Modell als warm und companion-artig; manche Nutzer kehren gerade wegen seines Konversationstons zurück, auch wenn andere Modelle im langen Kontext stärker sind. (Lookatmy.ai)
Für lange fiktionale Texte ist es keine pauschale Empfehlung. Derselbe Vergleich weist auf eine dünnere Erinnerung an physische Details einer Szene hin. Speichere daher wichtige Orte, Gegenstände und Beziehungsfakten in einem anwendungsseitigen Erinnerungsblock. Welche Modelle aktuell per API verfügbar sind, steht in der API documentation von OpenAI – ChatGPT-Zugang für Endkunden und API-Zugang sind nicht automatisch dasselbe.
Qwen, GLM, Kimi und lokale Modelle: Mehr Kontrolle statt Komfort
Open-Weight-Modelle werden interessant, wenn „das Beste“ Datenschutz, Anpassbarkeit oder Self-Hosting meint – und nicht das reibungsloseste gehostete Erlebnis. Der umfragebasierte Vergleich von Composite hebt GLM-5.1 und Kimi K2.6 hervor. In der Proxy-Rangliste von BenchLM steht Qwen3.5-27B mit einem kombinierten Wert von 95 auf Platz eins, knapp vor Agents-A1 mit 94.8 und Kimi K2.5 mit 93.9. BenchLM weist zugleich darauf hin, dass diese Mischung eine Untergrenze für Zuverlässigkeit misst, nicht die künstlerische Stimme. (Composite, BenchLM)
| Option | Geeignet für | Vor der Wahl prüfen |
|---|---|---|
| Qwen | Lokale Experimente und private Deployments | Quantisierung, VRAM, Sampler-Einstellungen und Kontextverarbeitung |
| GLM | Eine andere Stimme in einer Modellrotation | Zuverlässigkeit des Anbieters und Befolgung von Anweisungen |
| Kimi | Kandidat für Langform-Vergleiche | Aktuelle API-Verfügbarkeit und tatsächliches Kontextverhalten |
| Lokales Fine-Tuning | Maximale Kontrolle über den Stil | Hardware, Presets und Speicherverwaltung |
Ein lokales Modell ist nicht automatisch konsistenter. Es nimmt dir einen Teil der Unsicherheit durch den Anbieter ab, überträgt aber die Verantwortung für Kontextkürzungen, Sampling, Updates und Hardware-Limits auf dich.
Warum Kontextlänge keine echte Erinnerung ersetzt
Für Rollenspiele lassen sich drei Ebenen der Erinnerung unterscheiden:
- Gesprächsverlauf: Was die Anwendung erneut an das Modell sendet.
- Abruf: Ob das System eine ältere Information bei Bedarf hervorholt.
- Charakterzustand: Ob das Modell diese Information in Handlung und Dialog konsistent verwendet.
Ein großes Kontextfenster hilft vor allem bei der ersten Ebene. Ein Character.AI-Nutzer beschrieb die praktische Grenze so: „Currently we're stuck with pipsqueak 2 which does forget things every few messages unless you pin information.“ (u/PhoenixWolf190 on Reddit)
Für eine lange Kampagne solltest du dauerhafte Fakten in einem kompakten Speicherblock ablegen: Beziehungen, Verletzungen, Versprechen, Orte, Inventar und ungelöste Konflikte. Aktualisiere ihn außerhalb der Modellprosa und füge nur relevante Einträge ein. Das ist in der Regel zuverlässiger, als endlos ein immer längeres Transkript mitzusenden.
Ein fairer Modelltest in fünf Minuten
Schicke dieselbe Charakterkarte und dieselbe Eröffnungsszene an zwei oder drei Kandidaten. Prüfe dabei drei Momente:
- Stimme: Ein angespanntes Gespräch mit verborgenem Motiv.
- Eigenständigkeit: Eine Gelegenheit, bei der das Modell handeln darf, ohne die Entscheidung des Spielers zu treffen.
- Rückbezug: Ein indirekter Verweis auf ein früheres Ereignis.
Lies mindestens fünf Züge. Notiere, ob das Modell Fakten vergisst, die Werte einer Figur verändert, Formulierungen wiederholt, Konflikte zu schnell auflöst oder Handlungen des Nutzers schreibt. Gewonnen hat das Modell mit den wenigsten Fehlern, die du tatsächlich bemerkst – nicht das mit der größten beworbenen Kontextzahl.
API-Setup ohne Bindung an eine Marke
Die meisten Rollenspiel-APIs arbeiten mit Systemanweisungen, Chat-Zügen und einer Modell-ID. Endpunkte und Authentifizierung unterscheiden sich jedoch je nach Anbieter.
Für den produktiven Einsatz gehören Token-Budgets, Retry-Logik, eine sichere Schlüsselverwaltung und ein Logging von Modell und Anbieter pro Zug dazu. Ein minimales OpenAI-kompatibles Muster sieht so aus:
from openai import OpenAI
client = OpenAI(api_key="YOUR_API_KEY", base_url="YOUR_ENDPOINT/v1")
response = client.chat.completions.create(model="YOUR_MODEL_ID", messages=messages, temperature=0.8)
Schnellauswahl nach Einsatzzweck
Teste den konkreten Zugangsweg und die Modell-ID, bevor du dich auf eine lange Kampagne festlegst. Wenn du unschlüssig bist, vergleiche Claude und DeepSeek in einer Szene mit Rückbezug und teste danach Gemini mit deinem vollständigen Kanon. Behalte das Modell, das die Figur erhält, ohne die Geschichte an sich zu reißen. Baue eine Erinnerungsebene ein, bevor du zu dem Schluss kommst, ein Modell habe überhaupt kein Gedächtnis.
FAQ
Welches KI-Modell ist am besten für langfristige Rollenspiel-Erinnerungen?
Gemini ist ein starker Kandidat für Geschichten mit viel Kontext, während Claude Charakterdetails häufig natürlicher einsetzt. Keines der Modelle bietet für sich genommen eine perfekte dauerhafte Erinnerung; anwendungsseitiger Abruf und Zustandsaktualisierungen sind wichtiger als die Kontextlänge allein.
Ist Claude für Rollenspiele besser als DeepSeek?
Claude ist die sicherere redaktionelle Empfehlung für Charaktertreue und Prosaqualität. DeepSeek bietet das bessere Preis-Leistungs-Verhältnis, doch die zitierte Nutzerdiskussion zeigt, warum du Stil und Verhalten bei Neugenerierungen mit deinem eigenen Charakter testen solltest.
Welches günstige KI-Modell eignet sich am besten für Rollenspiele?
DeepSeek ist hier der klarste günstige Einstieg per API, weil die offiziellen Preise außerhalb der Spitzenzeit unter den aktuell von Anthropic aufgeführten Claude-Preisen liegen. Die tatsächlichen Kosten hängen von Input-Verlauf, Ausgabelänge, Cache-Treffern und Spitzenzeiten ab.
Funktionieren diese Modelle mit SillyTavern?
Ja, wenn der Anbieter einen kompatiblen API-Endpunkt bereitstellt und das Modell das benötigte Chat-Format unterstützt. Charakterkarte, Lorebook, Kontextlimit und Sampler konfigurierst du unabhängig vom Modellnamen.
Macht ein größeres Kontextfenster Rollenspiele konsistenter?
Nein. Es stellt mehr Verlauf bereit, doch Fehler beim Abruf, widersprüchliche Anweisungen, Unterschiede zwischen Anbietern und schwache Zustandsverwaltung können weiterhin zu Erinnerungsfehlern führen.