Einen Song komponieren, wenn man keine Ahnung von Musik hat
Ich höre gar nicht besonders oft Musik. Aber Musik kann etwas mit mir machen.
Ich kann in einer Oper sitzen und plötzlich laufen mir die Tränen übers Gesicht. Das ist mir auch im Musical bei Les Misérables passiert. Jean Valjean, diese großen Szenen, Stimmen, Orchester und plötzlich trifft einen etwas, obwohl man gar nicht genau sagen kann, was da gerade musikalisch passiert.
Andererseits gibt es Musik, bei der ich sofort gute Laune bekomme. Bei der ich tanzen möchte. Musik, die mich nervös macht. Musik, die mich langweilt. Stimmen, die ich nach drei Sekunden großartig finde.
Ich kann also ziemlich gut sagen, was Musik mit mir macht. Was ich überhaupt nicht kann:
Beschreiben, warum sie das tut.
Wenn mich jemand gefragt hätte: „Was für eine Musik möchtest du?“, hätte ich ungefähr antworten können:
- „Nicht so viel Bumm-Bumm.“
- „Die Frau muss rotziger singen.“
- „Das ist mir zu brav.“
- „Das klingt nach Klimbim.“
- „Mehr Moulin Rouge.“
- „Der Mann soll klingen, als würde gerade das Schicksal Frankreichs entschieden.“
Musiktheorie ist das eher nicht. Aber erstaunlicherweise hat genau damit dieses Experiment angefangen.
Ich dachte: Ich frage einfach mal ChatGPT
Ich hatte ein etwa 45 Sekunden langes KI-Video.
Eine Dame aus Versailles steigt aus ihrem Gemälde, geht zur Biopause, steht vor der Damentoilette in der Schlange und kehrt anschließend wieder zurück in ihr Bild.
So sieht das Video heute aus, schon mit der neuen Musik.
Erst später ist mir aufgefallen, was ich da eigentlich gebaut habe. In jedem Online-Meeting steigen wir alle aus dem Rahmen. Zur Pause verwandeln sich die Gesichter in schwarze Fenster, nach der Pause klettert jede wieder in ihr Bild zurück. Nur hängt dabei niemand in Versailles. Was man gegen dauerhaft schwarze Fenster tun kann, steht in meinem Beitrag Schwarze Fenster im Online-Meeting.
Wie die Musik entstanden ist, erzähle ich jetzt.
Dafür wollte ich neue Musik.
Ich hatte bereits mit Suno herumgespielt und wusste ungefähr, wie man dort einen Song erzeugt. Aber ich wusste nicht, wie man Musik entwickelt.
- Was gehört eigentlich alles dazu?
- Warum gefällt mir eine Stimme und eine andere nicht?
- Warum wirkt ein Song plötzlich billig?
- Warum nervt mich ein Schlagzeug, obwohl ich noch nicht einmal weiß, welches Instrument mich da eigentlich nervt?
- Warum erinnert mich etwas an eine große Musicalproduktion und etwas anderes an eine Fernsehshow aus den Siebzigern?
Also habe ich ChatGPT gefragt. Nicht: „Mach mir einen Song.“
Sondern eher:
Hilf mir herauszufinden, was ich eigentlich hören möchte.
Damit fing die eigentliche Reise an.
„Dreckige Stimme“ ist bei mir ein Kompliment
Eine der ersten Entdeckungen betraf die Stimme. Ich hatte vorher eine andere Suno-Produktion gehört und sofort gedacht: Diese Frauenstimme mag ich.
Ein bisschen rau. Ein bisschen schräg. Frech. Nicht zu jung. Nicht zu glatt. Ich habe sie irgendwann als „dreckige Frauenstimme“ bezeichnet. Das ist bei mir ausdrücklich ein Kompliment.
Nur: Was bedeutet „dreckig“ musikalisch?
Aus meinen Beschreibungen wurden plötzlich Begriffe wie:
eine leicht raue oder körnige Stimmfarbe, kräftige Bruststimme, eine kleine nasale Kante, starke Artikulation, eine tiefere Mezzo-Lage und eine Stimme, die nicht danach klingt, als wolle sie möglichst hübsch sein.
Aha.
Ich wusste vorher nicht, dass ich genau das suche. Ich wusste nur:
Die eine finde ich spannend. Die andere klingt wie eine Studentin, die sich mit Singen etwas dazuverdient.
Das ist übrigens keine offizielle Kategorie der Gesangspädagogik. Für unsere Arbeit hat sie trotzdem erstaunlich gut funktioniert.
Mein musikalisches Vokabular bestand zunächst aus Geräuschen
Beim Warteraum-Song war irgendwann permanent dieses:
Bumm. Bumm. Bumm. Bumm.
Ich konnte nicht erklären, warum mich das störte.
Ich wusste nur: Es macht alles gleichförmig. Die Stimme verschwindet hinter der Produktion. Der Song klingt plötzlich so, als hätte eine KI beschlossen: „Moderne Musik braucht einen Beat.“
Erst im Gespräch lernte ich Begriffe wie Four-on-the-floor-Kick, pumpenden Bass oder einen ständig durchlaufenden rhythmischen Puls kennen.
Ich musste diese Begriffe nicht vorher wissen. Ich musste erst einmal nur sagen können:
„Das Bumm-Bumm muss weg.“
Danach konnte jemand meine Wahrnehmung in musikalische Sprache übersetzen. Das war für mich vielleicht die überraschendste Erfahrung an diesem ganzen Projekt. Ich musste nicht erst Musik lernen, um mit Musik arbeiten zu dürfen. Ich konnte mit meiner Wahrnehmung anfangen.
Dann landeten wir bei „Klimbim“
Für die Biopause wollten wir zunächst etwas Theatralisches. Mehr Bühne. Mehr Pomp. Etwas Dekadentes.
Das Ergebnis war furchtbar. Nicht technisch schlecht.
Aber plötzlich klang es für mich nach „Klimbim“. Ingrid Steger. Fernsehrevue. Pseudolustige Musik, die einem bereits mit dem Ellenbogen in die Seite stößt und sagt: „Hast du gemerkt? Das hier ist lustig!“
Genau das wollte ich nicht. Denn das Video ist selbst absurd genug. Eine Versailles-Dame steht vor einer Damentoilette. Da muss die Musik nicht zusätzlich einen Toilettenwitz machen.
Das war ein weiterer wichtiger Schritt:
Die Musik darf die Situation vollkommen ernst nehmen.
Plötzlich dachte ich an Moulin Rouge. Nicht, weil ich die Musik aus dem Film kopieren wollte. Sondern wegen ihrer Größe. Große Streicher. Drama. Sinnlichkeit. Moderne Energie und klassische Elemente. Musik, die eine kleine Szene behandelt, als wäre sie von weltbewegender Bedeutung. Genau da wurde es interessant.
Plötzlich wusste ich etwas besser, was ich hörte
Aus „mehr Moulin Rouge“ wurde: cinematischer moderner Art-Pop mit neoklassischem Orchestereinfluss.
Aus „nicht so albern“ wurde: keine Cabaret-Musik, keine Comedy-Instrumentierung, keine lustigen Blechbläser, keine Retro-Revue.
Aus „groß, aber nicht Oper“ wurden: Streicher, Cello, Viola, Klavier, etwas Harfe, orchestrale Steigerungen und moderne elektronische Texturen.
Aus „der Mann muss klingen, als würde er eine Katastrophe verkünden“ wurde: ein sehr tiefer, dunkler, resonanter Bariton mit rauer Klangfarbe und nur wenigen kurzen Einsätzen.
Plötzlich lernte ich Musik nicht über Noten. Ich lernte sie über meine eigenen Reaktionen.
Der Text für das Video war sehr kurz.
Erst entstand ein Song für 45 Sekunden
„Biopause!
Ich bin gleich wieder da.“
„Einmal aus dem Rahmen,
kurz mal raus,
als wär das ganz normal.“
Darauf antwortete die Männerstimme tief und todernst:
„Ganz normal?“
Später:
„Krone richten.
Haltung wahren.
Auch Versailles
muss mal warten.“
Irgendwann hatten wir eine Suno-Version, bei der plötzlich alles zusammenpasste.
Stimme. Orchester. Drama. Der tiefe Mann.
Etwa 45 Sekunden. Genau richtig für das Video. Eigentlich wären wir fertig gewesen …
Nur war der Song plötzlich zu schade, um nach 45 Sekunden vorbei zu sein.
Aus 45 Sekunden wurden 2 Minuten und 24 Sekunden
Also haben wir den Song verlängert. Nicht einfach irgendwie.
Sondern mit einem zweiten Teil, neuen Strophen, wiederkehrenden Motiven und einem größeren Bogen. Daraus entstanden Zeilen wie:
„Die Welt wird nicht zerfallen,
nur weil ich kurz verschwind’.“
Oder:
„Die Türen schließen leise,
der Flur bleibt majestätisch.
Ein kleiner Schritt daneben –
und plötzlich wird es menschlich.“
Und:
„Was draußen auf mich wartet,
das wartet noch auf mich.
Für einen Augenblick
gehört die Zeit nur mir.“
Die kurze Videomusik begann sich wie ein richtiger Song anzufühlen.
Dann machte die KI allerdings das, was KI gelegentlich macht. Sie erfand Deutsch.
Aus „Königreich“ wurde beim Singen irgendein Wort, das vermutlich nicht einmal das Königreich selbst verstanden hätte. Im Textfeld stand weiterhin der richtige Satz. Gesungen wurde etwas anderes. Ausgerechnet die musikalisch beste Fassung hatte den kaputtesten Text.
Irgendwann muss man aufhören zu generieren
Also haben wir neue Versionen erzeugt.
Das Problem:
- Die Aussprache wurde teilweise besser.
- Die Musik wurde schlechter.
- Oder zumindest anders.
- Mit jeder Generation entfernten wir uns weiter von genau jener Version, bei der wir vorher gesagt hatten: Das ist sie.
Hier kam vielleicht meine wichtigste Erkenntnis über generative KI überhaupt:
Es gibt einen Moment, an dem man aufhören muss, Varianten zu erzeugen. Nicht weil die Datei perfekt ist. Sondern weil man das Werk gefunden hat.
Ab diesem Moment lautet die Frage nicht mehr:
„Was kann die KI noch generieren?“ Sondern: „Wie repariere ich das, was ich behalten möchte?“
Genau das haben wir getan. Suno bekam die Reparatur allerdings nicht hin. Was dann kam, war der eigentliche Krimi dieser Geschichte.
23:16 Uhr: „Was brauchst du als Zugang?“
Es war spät am Abend, als ich Claude Code gefragt habe, ob er das hinbekommt. Ich nenne ihn inzwischen Bruder Code. Suno hat eine Funktion, mit der man einzelne Abschnitte eines Songs neu singen lassen kann. Ich wusste, dass es sie gibt. Um diese Uhrzeit wollte ich mich trotzdem nicht selbst durch die Menüs klicken.
Musste ich auch nicht. Bruder Code hat Suno in meinem Browser selbst bedient. Er hat die kaputte Stelle markiert, den richtigen Text eingetragen und die Stimmen verteilt: zwei Zeilen für ihn, zwei für sie. Sechs neue Versionen kamen zurück. Keine einzige sang den Text. Eine fing stattdessen mit „Die Türen schließen leise“ an, also mit einer ganz anderen Strophe.
Sein nächster Vorschlag war, den Song an dieser Stelle noch einmal verlängern zu lassen. Ich habe erst Ja gesagt und dann Stopp gerufen. Genau das hatten wir am Vortag schon gemacht, und jede neue Verlängerung verändert den Sound. Ich wollte aber genau diesen Sound. Meine eigene Regel von oben, diesmal live: nicht weiter würfeln.
Beim Suchen fiel mir etwas ein. In einer anderen Fassung vom Vortag singt die Dame genau diese Strophe. Der Text ist dort ein bisschen anders, die Form ist dieselbe, und sie singt sauber. Konnte man die nicht einfach rüberholen?
Man konnte. Für Bruder Code ist Musik eine lange Zahlenreihe, 48.000 Werte pro Sekunde. Er hat beide Songs vermessen: in beiden 136 Schläge pro Minute, in beiden dieselbe Tonart. Dann hat er die saubere Strophe ausgeschnitten und in meinen Song eingesetzt, genau auf den Schlag, mit einer Überblendung von 30 Millisekunden an jeder Naht.
Der Mensch hört, die Maschine misst
Das Verrückte daran: Er kann nicht hören. Er weiß auf die Hundertstelsekunde, wo ein Schlag sitzt. Ob es schön klingt, weiß er nicht. Das war mein Job. Ich habe reingehört und gesagt: „Da sind zwei Takte, die passen nicht.“ Oder: „Das erste ‚Wir hoffen es‘ muss raus.“ Er hat nachgeschnitten. Fünf Fassungen, bis es saß.
Mein Player zeigte leider nur ganze Sekunden an. Also hat er mir mitten in der Nacht einen eigenen gebaut, mit Zehntelsekunden und einem Knopf, mit dem ich mir Stellen merken kann. Ich saß davor und habe geschrieben: „Oh, du bist ja völlig verrückt.“

Kurz nach eins stand die fertige Fassung. Jetzt gibt es „Biopause“ als vollständigen Song, 2 Minuten und 24 Sekunden lang. Der Sound ist meiner geblieben, ausgetauscht ist nur die kaputte Stelle.
Hier kannst du die ganze Fassung hören.
Was mich an dieser Nacht am meisten beschäftigt: Der Auftrag an Suno war perfekt formuliert. Richtiger Text, richtige Stimmen, richtige Stelle. Suno hat ihn sechsmal ignoriert. Gerettet hat den Song, dass ich wusste, was ich will. Genau diesen Sound. Ein klares Ziel bringt mich weiter als der beste Prompt.
Vielleicht machen wir daraus sogar noch ein Musikvideo. Dann nehme ich entweder die Rolle von Milli oder Vanilli ein.
Ich habe immer noch keine Ahnung von Musik
Zumindest nicht im klassischen Sinn.
- Ich kann keine Partitur schreiben.
- Ich könnte dir weiterhin nicht erklären, welche Akkordfolge gerade läuft.
- Aber ich höre inzwischen anders hin.
- Ich merke genauer: Ist die Stimme vorne oder verschwindet sie in der Produktion?
- Hat sie Kante?
- Ist der Rhythmus ständig da oder lässt er Luft?
- Ist etwas pompös oder nur laut?
- Ist die Musik selbst lustig oder entsteht der Humor durch den Gegensatz?
- Was macht ein Orchester eigentlich mit einer Szene?
- Warum berührt mich eine Stimme?
Das ist für mich neu.
Ich bin einen Schritt in einen Bereich hineingegangen, in dem ich mich vorher kaum bewusst aufgehalten habe … und ich weiß noch nicht, wo das hinführt.
Vielleicht ist das inzwischen meine Musik
Natürlich habe ich diesen Song nicht allein komponiert.
Suno hat Musik erzeugt. ChatGPT hat mir geholfen, meine Eindrücke in musikalische Sprache zu übersetzen, den Text zu entwickeln und die Varianten auseinanderzunehmen. Claude Code hat am Ende geholfen, genau die Fassung zu retten, die wir behalten wollten.
Ich saß dazwischen und sagte Dinge wie:
- „Mehr Pomp.“
- „Weniger Bumm-Bumm.“
- „Die Stimme ist zu brav.“
- „Der Schlagzeuger muss weg.“
- „Nein, jetzt klingt es nach Klimbim.“
Vielleicht funktioniert kreatives Arbeiten mit KI genau so.
- Ich muss nicht plötzlich alles können. Aber ich muss entscheiden.
- Ich muss merken, wann mir etwas gefällt. Ich muss widersprechen können.
- Ich muss sagen können: Das da behalten wir. Das andere nicht.
Irgendwann sitzt man vor einem Song und denkt:
Ja. Das ist meine Musik.
Oder vielleicht unsere.
Meine Musik mit meinen KI-Freunden zu Hause.
Was mich das eigentlich kostet
Natürlich kosten die Werkzeuge Geld.
Ein Suno-Abo. Mein ChatGPT-Abo. Andere KI-Werkzeuge, die ich für Bilder oder Videos benutze, z.B. Higgsfield.
Wenn ich konkrete Preise in diesen Artikel schreibe, werde ich sie zum Veröffentlichungszeitpunkt noch einmal aktuell prüfen. Aber für mich stellt sich inzwischen eine andere Frage:
Was bekomme ich dafür?
- Nicht nur Dateien.
- Ich merke, dass ich mit jeder dieser Aufgaben leichter werde. Also, nicht auf der Waage, nur weil ich vergesse Schokolade zu essen, während wir daran arbeiten. Aber, verstehst du, was ich meine?
- Ich probiere Dinge aus, die ich früher gar nicht angefangen hätte, weil ich dachte: Davon habe ich keine Ahnung.
- Ich bekomme Lust, weiterzumachen.
Vor allem merke ich etwas, das mir sehr wichtig ist:
Meine Kreativität kommt zurück.
Vielleicht nicht so, wie sie früher einmal war, aber mutiger, viel mutiger. Vielleicht mit anderen Werkzeugen, anderen Mitspielenden und gelegentlich einer KI, die „Königreich“ nicht aussprechen kann.
Aber sie ist da, die Kreativität. Dieses Gefühl ist mir ziemlich viel wert.
Natürlich wird es Musiker:innen geben, die bei solchen Experimenten sagen: KI macht unseren Job kaputt. Ja, und diese Diskussion ist wichtig.
Nur hätte ich diesen Song niemals bei einem Musiker in Auftrag gegeben. Nicht, weil mir musikalische Arbeit nichts wert wäre. Sondern weil ich überhaupt nicht auf die Idee gekommen wäre, mehrere hundert oder tausend Euro in einen Song über eine Biopause zu investieren.
Ohne diese Werkzeuge gäbe es ihn einfach nicht.
So aber habe ich für relativ wenig Geld etwas ausprobiert, von dem ich vorher nicht einmal wusste, dass ich es ausprobieren möchte. Bezahlt habe ich trotzdem: mit Zeit, Aufmerksamkeit, vielen verworfenen Versionen und einer erstaunlich langen nächtlichen Diskussion über dreckige Frauenstimmen, zu viel Bumm-Bumm und die Frage, wie ernst Versailles eine Toilettenpause nehmen sollte.
Diese Zeit war es mir wert.
Denn mit jeder solchen Aufgabe passiert etwas, das mir inzwischen wichtiger ist als die einzelne Datei, die am Ende dabei herauskommt:
- Ich traue mich leichter in Bereiche hinein, von denen ich keine Ahnung habe.
- Ich probiere aus.
- Ich entwickle Geschmack.
- Ich lerne eine neue Sprache.
- Und ich merke, wie meine Kreativität zurückkommt.
Keine Ahnung, wo das noch hinführt.
Aber um halb zwei nachts einen eigenen Song über eine Biopause zu hören und ernsthaft darüber nachzudenken, daraus ein Musikvideo zu machen, ist schon mal kein schlechter Anfang.

Für Neugierige: Was Claude Code technisch gemacht hat
- Suno selbst bedient: über die Browser-Erweiterung Claude in Chrome, Funktion „Abschnitt ersetzen“. Sechs Kandidaten, keiner mit dem richtigen Text.
- Beide Fassungen vermessen mit der freien Python-Bibliothek librosa: Tempo, Tonart, Lautstärke und das Raster der Schläge.
- Der Befund: Beide Songs laufen mit 136 Schlägen pro Minute in derselben Tonart. Die zweite Fassung ist eine andere Verlängerung desselben Songs und zweigt nach 32,9 Sekunden ab.
- Schnitt nur auf dem Schlag: Die Zahl der entfernten und der eingesetzten Schläge muss zusammenpassen, sonst verrutscht der Takt und der Rhythmus stolpert.
- Die Siegerfassung: Sekunde 40,76 bis 55,76 ersetzt durch Sekunde 20,64 bis 27,72 der anderen Fassung. Der Song wird dadurch rund 8 Sekunden kürzer.
- Die Nähte: je 30 Millisekunden Überblendung. Am Ende eine weiche Ausblendung über 3 Sekunden, weil Suno mitten im Klang aufhörte.
- Der Player: eine kleine HTML-Seite mit Zehntelsekunden, Schleife, langsamem Abspielen und der Taste M zum Merken von Stellen.
- Die Kosten: sechs verworfene Suno-Versionen und rund anderthalb Stunden in der Nacht. Der Schnitt selbst lief mit freier Software (Python und ffmpeg) und hat nichts gekostet.

Hallo Ihre Majestät,
da hast du dich mal wieder selbst übertroffen. Danke!!! Und ein super Filmchen. Freue mich auf dein Buch und überlege schon, wie meine Pieselpause umgesetzt werden kann.
Herzliche Grüße …. aus dem Nachbarköniginnenreich
Oh Ihre Majestät Hannover, seid gegrüßt! Ich freue mich sehr über Euren Kommentar.
Es hat mir richtig viel Spaß gemacht, die Pieselpause zu erstellen. Eigentlich hat mich eher das Bild dazu gebracht, diese Pieselpause zu erstellen. Vielleicht auch mein wirres Hirn, das mich fragt: Wie sind die eigentlich früher aufs Klo gegangen? Schon war die Idee da. Dann die Frage: Wofür brauche ich das eigentlich? Zack, war auch die Idee da. Jetzt auch noch aus dem Rahmen steigen: Ja, aus dem Rahmen steigen wir dann alle. Wenn wir auch noch online sind, sind wir nämlich plötzlich nicht mehr im Rahmen, weil wir auf dem Klo sind. Ein Teufelskreis. Verrückt, aber man muss es sich erklären, damit man weiß, wofür man Credits und Zeit verballert.
Habt einen wunderbaren Tag, Eure Majestät im fernen Hannover.
Majestätische Grüße aus Braunschweig!
Seid auf das Herzlichste bedankt!!!
Hallo Sandra, wir haben früher öfter mal miteinander Kontakt gehabt und ich habe deine Entwicklung und deine Handlungen seither verfolgt und bin sehr froh, dass ich das getan habe denn deine Schritte sind auch Inspirationen für eigene Überlegungen. Herzlichen Dank dafür und eine gute Zeit ähnlich wie dir hat mir der Umgang mit Menschen immer ungeheuer viel Spaß gemacht Und das Gestalten von Seminaren ebenso ich freu mich darauf, dir auch weiter zu folgen. Der Song gefällt mir ausgesprochen gut. Mit herzlichem Gruß Bärbel Rademacher
Hallo liebe Bärbel,
das ist lange her, ja, aber ich freue mich, dass du hier immer noch bei mir bist und liest.
Ich freue mich, wenn ich dich hier auf meinem Blog weiterhin inspirieren kann.
Herzliche Grüße
Sandra