Suno Speech Beta macht aus einem Skript eine gesprochene Audiospur samt eigener musikalischer Untermalung. Ein präzises Text-to-Speech-System ist es allerdings nicht. Für kurze, expressive Stücke, bei denen Musik zum Ergebnis gehört, kann Speech spannend sein. Müssen dagegen jedes Wort, jede Pause und jede Aussprache zuverlässig reproduzierbar sein, ist ein spezialisiertes TTS-Tool die bessere Wahl.
Passt Suno Speech zu deinem Projekt?
Suno Speech eignet sich eher für kurze, musikalisch unterlegte Texte als für die Produktion exakt planbarer Voiceovers. Die Beta vom October 2026 spielt ihre Stärken aus, wenn eine gewisse Unberechenbarkeit bei der Performance akzeptabel ist. Schwach wird sie dort, wo Wortlaut, Timing oder Sprecherkonsistenz strikt vorgegeben sind.
| Projekt | Suno Speech verwenden? | Grund |
|---|---|---|
| Gutenachtgeschichte mit sanftem Klavier | Ja | Sprachaufnahme und eigener Soundtrack entstehen in einem Durchlauf. |
| Meditation oder dramatisches Gedicht | Ja, nach Kontrolle | Das expressive Timing passt zum Format, aber Pausen und Akzente können abweichen. |
| Kurzer Monolog einer Figur | Ausprobieren | Die Darbietung kann gut funktionieren, eine exakte Aussprache ist jedoch nicht garantiert. |
| Produkttutorial mit Timecodes | Nein | Ein spezialisiertes TTS-Tool liefert planbareres Timing und einen reproduzierbareren Wortlaut. |
| Kapitel eines Hörbuchs | Nein | Suno hat keine Angaben zu Speech-Dauer, Kontinuität oder Aussprache veröffentlicht. |
| Song mit deiner eigenen verifizierten Stimme | Voices verwenden | Voices ist Sunos separate Funktion, um Songs mit einem wiederverwendbaren Stimmprofil zu erstellen. |
Suno kündigte Speech am October 1, 2026 nach einem begrenzten Test an und öffnete die Beta anschließend für alle. Die offiziellen Release Notes führen die Funktion für Web, iOS und Android auf. In der Ankündigung fehlen jedoch konkrete Angaben zu Speech-spezifischen Credit-Kosten, dem Kontingent je Tarif, der maximalen Dauer, unterstützten Sprachen, Dateispezifikationen oder einer API.
Was Suno Speech Beta erzeugt
Suno Speech Beta erzeugt gesprochene Stimme und eigene Hintergrundmusik als zusammenhängende Audiospur. Nutzer geben eine Idee, ein Gedicht oder ein Skript vor und beschreiben zusätzlich die gewünschte Stimme und den musikalischen Stil – so erklärt es Suno im Launch-Beitrag.
Speech ist ein eigener Create-Modus für gesprochene Inhalte. Sunos Beispiele reichen von Gutenachtgeschichten über sanftem Klavier bis zu Motivationsreden mit Stadion-Drums und musikalisch unterlegten Sprachnotizen.
Das Beta-Label ist hier nicht bloß Formsache. Suno weist selbst darauf hin, dass ein gewünschter britischer Akzent in Richtung Australien kippen und anschließend wieder zurückwechseln kann. Auch dramatische Pausen können übertrieben lang ausfallen. Damit ist Speech selbst dann nicht für eine unbeaufsichtigte Veröffentlichung geeignet, wenn der erste Versuch überzeugend klingt.
In einer frühen Diskussion auf r/SunoAI ging es um Fehler, die bereits in Sunos eigener Demonstration zu hören waren – nicht um einen unabhängigen Produktionstest. Nutzer u/TheWeaverofDreams schrieb:
„Für eine Demo ist das beunruhigend schlecht.“
Diese Einschätzung ist zwar anekdotisch, passt aber zu der Instabilität bei Akzent und Timing, die Suno selbst dokumentiert.
Eine gesprochene Spur in Suno erstellen
Die folgende Anleitung orientiert sich an der aktuellen Create-Oberfläche im Web und auf Mobilgeräten. Während der Beta kann sich der Ablauf noch ändern.
- Öffne Create in Suno im Web, auf iOS oder Android und wähle Speech. Aktualisiere die mobile App, falls Speech nicht angezeigt wird.
- Füge ein kurzes Skript ein oder beschreibe deine Idee. Wenn der Wortlaut kontrollierbar bleiben soll, verwende das fertige Skript, statt Suno um eine automatische Texterstellung zu bitten.
- Beschreibe den Sprecher möglichst konkret: Altersgruppe, Klangfarbe, Emotion, Akzent, Tempo und Vortragsweise. Nenne keine reale Person, deren Stimme du nicht verwenden darfst.
- Beschreibe den Soundtrack separat: Instrumente, Stimmung, Intensität und wie weit er im Hintergrund hinter der Stimme bleiben soll.
- Erzeuge mehrere Varianten. Speech befindet sich weiterhin in der Beta – ein zweiter Durchlauf bringt oft mehr als eine lange Liste zusätzlicher Korrekturanweisungen.
- Vergleiche das Ergebnis vor der Veröffentlichung mit dem Ausgangstext. Prüfe ausgelassene oder veränderte Wörter, Namen, Zahlen, Akzentwechsel, lange Pausen, das Verhältnis von Stimme und Musik sowie das Ende.
Schreibe Texte, die nach gesprochener Sprache klingen
Sprachähnliche Eingaben liefern weniger Hinweise, die den Vortrag in Richtung Gesang ziehen. Formuliere kurze Sätze, nutze Satzzeichen als Atemhilfe, trenne Gedanken durch Absätze und verzichte auf Endreime oder wiederkehrende Refrains – es sei denn, ein rhythmischer Vortrag ist ausdrücklich gewünscht.
Als kompakter Ausgangspunkt eignet sich dieser Prompt:
Skript:
[Den exakten gesprochenen Text in kurzen Absätzen einfügen.]
Stimme:
Warme erwachsene Erzählstimme, intim und dialognah, gleichmäßiges Tempo,
deutliche Aussprache, zurückhaltende Emotion.
Soundtrack:
Reduziertes Filzklavier und dezente Ambient-Fläche, keine Lead-Melodie,
Stimme im Mix im Vordergrund, sanftes Ende.
Die Felder für Stimme und Soundtrack sollten beschreiben, was erzeugt werden soll – nicht nur, was vermieden werden muss. „Ruhige Dokumentarfilm-Erzählstimme, langsames Tempo, dezentes Klavier im Hintergrund“ gibt dem Modell ein klareres Ziel als die wiederholte Anweisung „nicht singen“.
Klare Sprache erzeugen oder die Musik zurücknehmen
Suno Speech kann einen Versuch mit reiner Sprache starten, doch Sunos Launch-Beitrag beschreibt das Produkt in erster Linie als Kombination aus Sprache und eigener Musik. Das SunoAI-News-Archiv berichtet von einer funktionierenden Beta-Konfiguration: Hintergrundmusik deaktivieren, Variety vollständig nach links schieben und No background music. in die Anweisung für den Klang aufnehmen.
Diese Kombination solltest du als Workaround verstehen, nicht als technische Spezifikation. Dieselbe Quelle beobachtete zunächst Musik, obwohl die Einstellung für Hintergrundmusik deaktiviert war. Außerdem hat Suno keine Garantie für eine isolierte Sprachspur dokumentiert. Ist eine saubere Voice-Spur zwingend erforderlich, ist ein spezialisiertes TTS-Produkt die sicherere Wahl.
Wenn die Musik nicht komplett verschwinden, sondern nur möglichst dezent bleiben soll, bitte um eine sparsame Klangfläche und einen sprachbetonten Mix. So bleibt der wichtigste Vorteil von Speech erhalten, während die Wahrscheinlichkeit sinkt, dass ein aktives Arrangement Konsonanten verdeckt oder mit den Pausen konkurriert.
Speech, Voices oder ein spezialisiertes TTS-Tool?
Suno Speech, Suno Voices und dedizierte TTS-Systeme lösen unterschiedliche Aufgaben. Entscheidend ist daher das benötigte Ergebnis – nicht die Tatsache, dass alle drei mit einer generierten Stimme arbeiten.
| Option | Hauptaufgabe | Identität der Eingabe | Geeignet für | Wichtigste Einschränkung |
|---|---|---|---|---|
| Suno Speech | Gesprochene Performance mit eigener musikalischer Untermalung erzeugen | Per Prompt beschriebene Stimme | Geschichten, Gedichte, Meditationen, ungewöhnliche Erzählformate | Beta-bedingte Schwankungen bei Aussprache, Akzent und Timing |
| Suno Voices | Die eigene wiederverwendbare Stimme in generierte Songs einbauen | Verifizierte Aufnahme oder Upload | Personalisierter Gesang und Song-Erstellung | Separater Workflow sowie Alters- und regionale Einschränkungen |
| Dediziertes TTS | Text kontrolliert in Sprache umwandeln | Standard- oder autorisierte individuelle Stimme | Tutorials, Barrierefreiheit, lange Erzählungen, getimte Voiceovers | Musik erfordert in der Regel einen separaten Produktionsschritt |
Der Suno-Leitfaden zur Einrichtung von Voices verlangt eine Ausgangsaufnahme von 15 Sekunden bis 4 Minuten. Daraus kann der Nutzer die besten zwei Minuten auswählen. Zusätzlich wird die Identität über einen vorgegebenen gesprochenen Satz überprüft. Voices ist auf Nutzer ab 18 Jahren beschränkt und möglicherweise nicht an allen Standorten verfügbar. Diese Kontrollen belegen jedoch nicht, dass sich ein gespeichertes Voice-Profil innerhalb von Speech auswählen lässt. In Sunos aktueller Dokumentation werden beide Funktionen als getrennte Möglichkeiten beschrieben.
FAQ zu Suno Speech Beta
Ist Suno Speech Beta bereits verfügbar?
Ja. Suno kündigte die öffentliche Beta am October 1, 2026 an und erklärt, dass Speech nach einem begrenzten Test für alle im Web und auf Mobilgeräten verfügbar ist.
Ist Suno Speech kostenlos?
Suno gibt an, dass die Beta allen offensteht. Die Launch-Materialien nennen jedoch keine Speech-spezifischen Credit-Kosten und kein separates Kontingent für den kostenlosen Tarif. Prüfe deshalb vor einem größeren Projekt die Create-Oberfläche: Verfügbarkeit bedeutet nicht automatisch unbegrenzte Generierung.
Kann Suno Speech Sprache ohne Musik erzeugen?
Speech kann über die Einstellung für Hintergrundmusik einen Versuch mit reiner Sprache unternehmen. Ein Community-Test empfiehlt zusätzlich, Variety auf das Minimum zu setzen und No background music. in die Anweisung für den Klang aufzunehmen. Suno verspricht jedoch keine dauerhaft isolierte Sprachspur. Baue daher keinen Produktions-Workflow auf dieses Verhalten, ohne es vorher selbst getestet zu haben.
Kann ich meine eigene Stimme in Suno Speech verwenden?
Suno dokumentiert persönliche Stimmprofile in der separaten Funktion Voices. Dort wird eine Aufnahme verifiziert, bevor sie in generierten Songs eingesetzt wird. Die aktuelle Speech-Dokumentation bestätigt nicht, dass sich ein gespeichertes Voice-Profil als Erzähler verwenden lässt.
Hat Suno Speech eine API?
In Sunos Ankündigung vom October 1 und den Release Notes wird keine Speech-API angekündigt. Dokumentiert ist die Funktion über die Create-Oberflächen im Web und auf Mobilgeräten.
Darf ich Suno Speech kommerziell nutzen?
Die Speech-Ankündigung nennt keine eigenen Bedingungen für die kommerzielle Nutzung. Prüfe vor der Veröffentlichung die aktuell geltenden Suno-Tarifbedingungen für dein Konto und die erzeugten Inhalte. Das ist besonders wichtig, weil sich die Nutzungsrechte für kostenlose und kostenpflichtige Suno-Ausgaben unterschieden haben.
Für einen ersten Test reichen 100 bis 150 Wörter, zurückhaltende Musik und zwei Generierungen. Bleib bei Suno Speech, wenn eine expressive musikalische Gestaltung wichtiger ist als ein exakt kontrollierter Vortrag. Wechsle zu TTS, sobald Korrekturen, Timing oder eine saubere Sprachisolierung zur eigentlichen Hauptaufgabe werden.