Audio, Musik und Podcasts mit KI
Nachdem wir in der letzten Folge gesehen haben, wie Algorithmen Bilder malen (siehe Folge 7), tauchen wir nun in die Welt der Akustik ein. Generative KI kann heute weit mehr als monotone Computerstimmen ausgeben: Sie komponiert vollständige Radiosongs mit Gesang und Instrumenten, liest Texte mit feiner emotionaler Betonung vor, restauriert verrauschte Sprachaufnahmen und verwandelt trockene Dokumente auf einen Klick in lebendige Podcast-Diskussionen zweier virtueller Moderatoren. In dieser Folge erfährst du, wie diese Klangwunder entstehen, welche Werkzeuge kostenlos zur Verfügung stehen und welche rechtlichen und ethischen Spielregeln gelten.
Du verstehst das Grundprinzip von Text-zu-Audio, Spektrogrammen und moderner Sprachsynthese. Du erfährst, wie Google Gemini (Lyria 3/3.5) und Plattformen wie Suno oder Udio auf Knopfdruck vollständige Songs komponieren, wie Gemini Notebook lebendige Podcasts erschafft, welche Revolution native Echtzeit-Sprachmodelle und Audio-Restaurierung bedeuten – und welche rechtlichen Meilensteine (wie das Münchner GEMA-Urteil 2026 gegen Suno) sowie Transparenzstandards (SynthID Audio und C2PA) für die Praxis gelten.
Wie KI Töne und Stimmen lernt: Schallwellen als Muster
Genau wie bei Bildern und Texten liegt auch der Audio-Generierung das Erkennen und Vorhersagen von Mustern zugrunde (vgl. Folge 5: Wie KI lernt). Doch wie verwandelt ein Computer geschriebene Wörter in Musik oder Sprache?
Schall besteht physikalisch aus Schwingungen der Luftmoleküle. Macht man diese Schwingungen sichtbar, erhält man ein sogenanntes Spektrogramm – ein zweidimensionales Bild, das Frequenzen (Tonhöhen) auf der vertikalen Achse, den Zeitverlauf auf der horizontalen Achse und die Lautstärke über Farbhelligkeiten darstellt. Für eine KI ist die Klangerzeugung daher eng mit der Bildverarbeitung verwandt: Viele moderne Audiomodelle nutzen ähnliche Diffusions- und Transformermodelle wie Bild-Generatoren (siehe Folge 7). Sie errechnen aus deinem Textbefehl zuerst ein visuelles Frequenzmuster im Rauschen und wandeln dieses Bild über einen sogenannten Vocoder anschließend in glasklare Audiosignale um.
Text-zu-Audio (Text-to-Audio / Text-to-Speech)
In einfacher Sprache: Wie wird aus geschriebenen Worten Klang?
Text-zu-Audio bezeichnet generative KI-Modelle, die aus geschriebenen Anweisungen (Prompts) Klanglandschaften, Soundeffekte, vollständige Musikstücke oder lebensecht gesprochene Sprache berechnen. Die KI hat an Millionen Stunden Tonaufnahmen gelernt, wie Instrumente, Harmonien, Rhythmen und menschliche Sprachmelodien statistisch zusammenhängen.
Spektrogramm
In einfacher Sprache: Das sichtbare „Notenblatt der Physik“ für den Computer.
Eine grafische Darstellung von Schallwellen: Auf der waagerechten Achse verläuft die Zeit, auf der senkrechten Achse die Tonhöhe (Frequenz) und die Helligkeit zeigt die Lautstärke. Weil Ton damit wie ein Bild aussieht, können KI-Modelle Methoden der Bildgenerierung (wie Diffusion) nutzen, um Musik und Stimmen Pixel für Pixel zu komponieren.
Podcasts auf Knopfdruck: Wenn zwei KIs miteinander plaudern
Eine der verblüffendsten Entwicklungen moderner Audio-KI sind vollautomatische Podcasts. Werkzeuge wie Google Gemini Notebook (das nach seiner weltweiten Einführung aus dem beliebten Laborprojekt NotebookLM hervorgegangen ist, mit der Kernfunktion Audio Overview) und Microsoft Copilot machen es möglich, aus beliebigen Texten auf Knopfdruck eine moderierte Radiosendung zu zaubern.
Hinweis für die Praxis: Googles Werkzeug startete ursprünglich unter dem Namen NotebookLM. Google hat den Dienst offiziell als Gemini Notebook in seine Produktfamilie integriert – die Funktion wird unter dem Namen „Audio Overview“ bereitgestellt.
Audio-Overview (KI-Podcast)
In einfacher Sprache: Eine lebendige Radiosendung zweier Moderatoren über deine Notizen.
Eine Audio-Overview analysiert ein oder mehrere hochgeladene Dokumente (PDFs, Notizen, Webseiten) und erzeugt daraus einen 10- bis 25-minütigen Dialog zwischen zwei virtuellen Moderatoren. Sie stellen Fragen, erklären Zusammenhänge anhand anschaulicher Alltagsmetaphern, scherzen und fassen den Inhalt unterhaltsam zusammen.
Was macht diese KI-Podcasts so erstaunlich lebensecht?
- Natürliche Sprechdynamik: Die Stimmen klingen nicht nach Navigationsgerät. Sie machen natürliche Denkpausen, lachen über Pointen, unterbrechen sich gegenseitig höflich und nutzen Füllwörter wie „Genau!“ oder „Das ist ein faszinierender Aspekt“.
- Didaktische Rollenverteilung: Statt den Text einfach abzulesen, übernimmt eine Moderationsstimme die Rolle der neugierigen Einsteigerin (die kluge Zwischenfragen stellt) und der andere Co-Host die Rolle des Experten (der Zusammenhänge mit Beispielen entwirrt).
- Effizientes Lernen für unterwegs: Lange Berichte, Verträge oder Lernunterlagen lassen sich so bequem beim Spazierengehen, Kochen oder Pendeln akustisch verinnerlichen.
Auch wenn die beiden Moderatoren extrem kompetent und sympathisch klingen: Sie wissen nur das, was in deinen hochgeladenen Quelltexten steht. Weisen die Quellen Lücken auf, neigt die KI gelegentlich zum Fabulieren (Halluzinieren, vgl. Folge 3). Nutze KI-Podcasts daher zum Kennenlernen und Vertiefen eines Themas, prüfe wichtige Fakten aber immer in den Originalunterlagen nach!
Genau so klingt ein vollwertiger KI-Podcast in der Realität: Wir haben die Notizen, Leitfragen und Gerichtsakten dieser Lektion in Google Gemini Notebook eingespeist und eine Audio-Overview generieren lassen. Die beiden KI-Hosts fassen die Kernpunkte lebhaft zusammen und beleuchten die Hintergründe der GEMA-Klage und des Stimmklonens.
👉 Podcast herunterladen: „Stimmenklone und Musik aus der KI“ (.m4a-Audiodatei, ca. 27 Minuten) – oder nutze den integrierten Audio-Player direkt am Ende dieser Lektion (zum Podcast springen)!
Musik komponieren mit KI: Von der Textidee zum fertigen Song
Was früher Monate im Tonstudio, teures Equipment und fundierte Harmonielehre erforderte, erledigt moderne KI in unter einer Minute. Heute gibt es zwei zentrale Wege, um eigene Musik zu generieren:
Ähnlich wie bei Text- und Bild-Prompts (siehe Folge 2 und Folge 7) folgt ein wirkungsvoller Musik-Prompt vier klaren Bausteinen: 1. Genre & Epoche (z. B. 80er Synth-Pop oder Klassisches Streichquartett), 2. Instrumentierung (z. B. akustische Gitarre, Flügel, treibender Synthesizer-Bass), 3. Tempo & Rhythmus (z. B. ruhige 75 BPM oder treibende 128 BPM) und 4. Stimmung & Aufbau (z. B. melancholisch, sonnig, rein instrumental oder mit weiblicher Soul-Stimme).
1. Google Gemini und DeepMind Lyria 3.5
Google hat mit seiner Forschungstochter DeepMind das Musik-Grundlagenmodell Lyria (in der aktuellen Generation Lyria 3.5) entwickelt. Dieses Modell ist tief in den Chatbot Gemini integriert.
- Der große Vorteil: Lyria steht in vielen Ländern direkt im kostenlosen Basis-Zugang von Google Gemini zur Verfügung. Du brauchst kein teures Spezial-Abo, um erste Musikstücke zu komponieren.
- Einsatzbereich: Frag Gemini einfach im Chat: „Erstelle mir ein instrumentales, entspanntes Lo-Fi-Musikstück für die Konzentration bei der Arbeit, 60 Sekunden lang“ – und du erhältst direkt im Chatfenster einen abspielbaren Audiotrack.
2. Spezialisierte Plattformen: Suno AI und Udio AI
Geht es um vollwertige Pop-, Rock- oder Chansonsongs mit Gesangsstimme, eigenem Liedtext, Strophen und packendem Refrain, führen Plattformen wie Suno AI und Udio AI den Markt an:
- Songwriting per Prompt: Du gibst Stil und Thema vor (z. B. „Acoustic Indie-Folk, warmer männlicher Gesang, Fernweh nach Skandinavien“) und schreibst entweder eigene Verse oder lässt die KI passende Reime verfassen.
- Das Ergebnis: Innerhalb von 30 bis 60 Sekunden entstehen zwei unterschiedliche Song-Variationen in beachtlicher Radioqualität, inklusive Intro, Strophe, Refrain, Gitarrensolo und Ausklang.
- Spurentrennung (Stems): Fortgeschrittene Plattformen ermöglichen es heute, einzelne Spuren (wie isolierten Gesang, Schlagzeug oder Basslinie) separat als Datei herunterzuladen, um sie in eigenen Videoprojekten abzumischen.
Lokale Musikgenerierung mit ComfyUI (Ausblick)
Genau wie bei Bildern drängt die Open-Source-Gemeinschaft auch bei Audio mit rasanter Geschwindigkeit voran. Ein Meilenstein für anspruchsvolle Tüftler ist das Modell YuE (spezialisiert auf vollständige Lyrics-to-Song-Synthese) sowie Stable Audio Open.
Über das knotenbasierte Werkzeug ComfyUI (mit Erweiterungen wie ComfyUI_YuE) kann man diese Musikmodelle direkt auf der eigenen Grafikkarte betreiben:
- Kostenlos und unbegrenzt: Keine Monatsgebühren, keine verbrauchten Rechen-Credits.
- Vollständige Privatsphäre: Deine Musikideen und Texte verlassen niemals deinen Rechner.
- Keine Cloud-Schranken: Maximale gestalterische Freiheit bei der Synthese.
Keine Sorge für heute: Die Installation von ComfyUI und das Einrichten lokaler Musikmodelle erfordern einiges an technischem Rüstzeug und einer leistungsstarken Grafikkarte (mindestens 12–16 GB Grafikspeicher). In einem späteren Modul dieses Workshops werden wir zeigen, wie man ComfyUI für lokale Generierung Schritt für Schritt meistert!
Stimmensynthese und Voice-Cloning
Neben Musik erlebt auch die Sprachausgabe eine Revolution. Plattformen wie ElevenLabs oder moderne Sprachfunktionen führender Chatbots ermöglichen es, geschriebenen Text in atemberaubend natürlicher Sprache vorzulesen:
- Text-to-Speech (TTS): Die Betonung passt sich dem Sinnzusammenhang des Satzes an. Ein Fragezeichen am Ende hebt die Stimme, Ausrufezeichen klingen begeistert oder warnend, und bei traurigen Texten senkt die KI das Sprechtempo.
- Voice Cloning (Stimmklonen): Lädt man eine kurze Stimmprobe (bereits 30 bis 60 Sekunden sauberes Sprechen reichen oft aus) hoch, lernt das Modell die charakteristische Stimmfarbe, Tonlage und Sprecheigenheiten der Person. Die geklonte Stimme kann anschließend jeden beliebigen Text vorlesen – und sogar in Fremdsprachen wie Spanisch oder Japanisch übersetzen, während der unverwechselbare Klang deiner Stimme erhalten bleibt.
Voice-Cloning (Stimmklonen)
In einfacher Sprache: Das digitale Duplizieren einer menschlichen Stimme.
Ein Verfahren des maschinellen Lernens, bei dem anhand weniger Audiosekunden ein mathematisches Profil der Klangfarbe, Intonation und Artikulation eines Menschen erstellt wird. Dieses Profil ermöglicht es, beliebig neue Texte so klingen zu lassen, als hätte die Originalperson sie selbst eingesprochen.
Echtzeit-Sprache und Audio-Restaurierung im Alltag
Im Jahr 2026 hat sich die Audiowelt noch einmal grundlegend weiterentwickelt. Zwei Technologien haben Einzug in den Alltag gehalten, die für Einsteiger besonders nützlich sind:
1. Die Revolution der Echtzeit-Sprache (Voice-to-Voice)
Frühe Sprachassistenten funktionierten nach einem trägen Dreischritt: Dein Ton wurde aufgenommen, mühsam in Text umgewandelt (Speech-to-Text), an das Sprachmodell geschickt und die Antwort anschließend wieder vorgelesen (Text-to-Speech). Das führte zu stockenden Wartezeiten von drei bis fünf Sekunden.
Moderne multimodale Systeme wie der Advanced Voice Mode (OpenAI) oder Gemini Live (Google) arbeiten nativ von Ton zu Ton: Die KI „hört“ direkt das Audiosignal und antwortet ohne Textumweg in Echtzeit (unter 300 Millisekunden Latenz). Du kannst der KI mitten ins Wort fallen (Barge-In), sie bitten, schneller oder leiser zu flüstern, oder ihr Gefühle und Dialekte vorgeben. Dies bildet die Grundlage für moderne persönliche Assistenten (mehr dazu in Folge 9).
2. Audio-Restaurierung: Kristallklarer Klang für Alltagsaufnahmen
Hast du jemals ein wichtiges Sprachmemo im Auto aufgenommen, ein Interview im halligen Wohnzimmer geführt oder ein altes Familien-Tonband digitalisiert? Schlechte Akustik, Straßenlärm und Nachhall machten solche Aufnahmen früher unbrauchbar.
Spezialisierte KI-Werkzeuge wie Adobe Podcast AI (Enhance Speech) oder Descript Studio Sound analysieren die Stimme, trennen Störgeräusche und Raumhall mathematisch heraus und rekonstruieren fehlende Frequenzen. Das Ergebnis klingt, als hätte die sprechende Person in einer professionellen, schallisolierten Sprecherkabine vor einem 1.000-Euro-Studiomikrofon gesessen – ein unschätzbares Werkzeug für Vereine, Familienchroniken und Selbstständige.
Marktübersicht: Die wichtigsten Audio-Werkzeuge im Überblick
Die folgende Tabelle fasst die führenden Werkzeuge für Klang, Musik und Sprache zusammen:
| Bereich | Werkzeug / Modell | Kosten / Zugang | Besonderheit & Stärke |
|---|---|---|---|
| Podcasts | Gemini Notebook (ehemals NotebookLM) | Kostenlos (Google-Konto) | Erzeugt aus Dokumenten und Notizen lebensechte Audio-Podcasts zweier Hosts (Audio Overview). |
| Podcasts | Microsoft Copilot | Kostenlos / Pro | Generiert gesprochene Zusammenfassungen, Audio-Nachrichten und thematische Audio-Exzerpte. |
| Musik | Google Gemini (Lyria 3.5) | Kostenlos in Gemini | DeepMinds Musikmodell; komponiert Melodien und Stimmungs-Soundtracks direkt im Chatfenster. |
| Musik | Suno AI | Freemium (tägliche Gratis-Credits) | Marktführer für vollständige Songs mit Strophen, Refrain und Gesang aus kurzen Textideen. |
| Musik | Udio AI | Freemium / Abo | Hervorragende klangliche Differenzierung, komplexe Jazz-, Rock- und Instrumental-Arrangements. |
| Musik (Lokal) | ComfyUI (Modell: YuE) | Kostenlos (Open-Source) | Vollsong-Generierung (Lyrics-to-Song) lokal auf der eigenen GPU ohne fremde Cloud-Server. |
| Sprache & Klonen | ElevenLabs | Freemium / Abo | Maßstab für lebensechte KI-Stimmen, Hörbuchproduktion und präzises Stimmklonen. |
| Restaurierung | Adobe Podcast AI (Enhance Speech) | Kostenlos (mit Adobe-ID) | Verwandelt hallige, verrauschte Sprachaufnahmen per Knopfdruck in glasklaren Studiosound. |
Recht, GEMA-Urteil und Ethik: Was du wissen musst (keine Rechtsberatung)
Weil KI-Musik und KI-Stimmen täuschend echt wirken und auf echten menschlichen Kunstwerken aufbauen (siehe Folge 5 zu Trainingsdaten), steht der Audiomarkt im Zentrum juristischer Grundsatzentscheidungen. Die folgenden Hinweise bieten dir eine alltagsnahe Orientierung (Hinweis: Dies stellt keine Rechtsberatung dar):
1. Das wegweisende Münchner GEMA-Urteil gegen Suno (31. Juli 2026):
Die deutsche Verwertungsgesellschaft GEMA zog vor das Landgericht München I (Az. 42 O 763/25), um die unlizenzierte Ausbeutung geschützter Musikwerke durch Suno zu stoppen. Das Gericht gab der GEMA weitestgehend recht: Das systematische Einspeisen geschützter Hits in das Trainingskorpus stellt eine unzulässige Vervielfältigung (§ 16 UrhG) dar, und die Ausnahme für Text- und Data-Mining greift nicht, wenn Werke im Modell dauerhaft memoriert werden.
Die GEMA dokumentierte dies anhand frappierender Plagiate und Soundalikes weltbekannter Klassiker: unter anderem „Atemlos durch die Nacht“ (Helene Fischer / Kristina Bach), „Daddy Cool“ und „Rasputin“ (Boney M. / Frank Farian), „Forever Young“ und „Big in Japan“ (Alphaville) sowie „Mambo No. 5“ (Lou Bega).
👉 Höre selbst hinein: Die GEMA hat die Klangvergleiche öffentlich dokumentiert: GEMA-Hörbeispiele zu Suno-Plagiaten sowie der Entscheidungsbericht des Landgerichts München.
Das Urteil unterstreicht: Wer kommerzielle Musik-KIs betreibt, muss Urheber fair lizenzieren und vergüten.
2. Fehlender Urheberrechtsschutz an eigenen KI-Songs:
Genau wie bei Bildern (vgl. Folge 7) gilt auch bei Musik: Ein Song, der rein durch das Eintippen eines Prompts entsteht, besitzt keinen eigenen Urheberrechtsschutz, da ihm die menschliche Schöpfungshöhe fehlt. Zudem darfst du KI-Songs, die geschützte Melodien oder Stimmen bekannter Stars imitieren, keinesfalls kommerziell veröffentlichen.
3. Stimmklonen und Kriminalitätsgefahr (Enkeltrick 2.0):
Klone niemals ohne ausdrückliche schriftliche Einwilligung die Stimme einer realen Person! Kriminelle nutzen KI-Stimmen bereits für das sogenannte Voice-Phishing („Schockanrufe“ bei Großeltern mit der täuschend echten Stimme des weinenden Enkels). Das Nachahmen fremder Stimmen verletzt das Persönlichkeitsrecht massiv und ist strafbar (ausführlicher Schutzleitfaden in Folge 13).
4. Kennzeichnungspflicht (EU AI Act) & SynthID-Wasserzeichen:
Nach dem europäischen KI-Gesetz (EU AI Act) müssen künstlich generierte Stimmen oder Musikstücke, die mit echten menschlichen Aufnahmen verwechselt werden könnten, transparent als „künstlich erzeugt“ gekennzeichnet werden. Vorreiter wie Google DeepMind integrieren mit SynthID Audio unhörbare digitale Wasserzeichen direkt in die Frequenzen, um die Herkunft fälschungssicher nachzuweisen.
SynthID Audio & C2PA (Akustische Wasserzeichen)
In einfacher Sprache: Der unhörbare Stempel im Klang, der die KI verrät.
Eine Technologie zur Kennzeichnung generativer Audiosignale: Google DeepMinds SynthID bettet ein für das menschliche Gehör unhörbares, kryptografisches Signal direkt in die Tonwellen ein. Dieses Wasserzeichen bleibt selbst dann nachweisbar, wenn die Audiodatei komprimiert (z. B. in MP3), gefiltert oder über Lautsprecher neu aufgenommen wird.
Pflichtübung: Einen Musik-Prompt analysieren und aufbauen
Stell dir vor, du planst ein Erklärvideo über nachhaltige Gartenarbeit und suchst eine fröhliche, entspannte Hintergrundmusik mit Google Gemini (Lyria) oder Suno. Ein Bekannter schlägt dir folgenden Prompt vor:
„Schöne Musik für Garten.“
Deine Aufgabe:
- Warum wird die KI mit diesem Einzeiler nur ein beliebiges, meist unbrauchbares Zufallsergebnis liefern?
- Formuliere den Prompt nach den vier musikalischen Bausteinen (Genre, Instrumentierung, Tempo, Stimmung & Zweck) neu, sodass ein stimmiges, instrumentales Hintergrundstück entsteht.
Musterlösung anzeigen (nach dem eigenen Versuch aufklappen)
1. Analyse der Schwachstellen:
Der Vorschlag lässt alles offen: Welches Musikgenre (Klassik, Techno, Volksmusik?), welches Tempo (einschläfernd oder hektisch?), welche Besetzung (E-Gitarre, Trompete oder Akustik?) und welche Struktur (mit störendem Gesang oder rein instrumental?).
2. Der optimierte 4-Bausteine-Prompt:
„Fröhlicher, leichtfüßiger Akustik-Folk im mittleren Tempo (ca. 105–110 BPM). Warme akustische Gitarre, dezente Ukulele, Glockenspiel und ein sanfter Kontrabass. Sonnige, einladende und naturverbundene Atmosphäre, ideal als unaufdringliche Hintergrundmusik für ein Erklärvideo. Rein instrumental, absolut kein Gesang, sauberes Fade-Out nach 60 Sekunden.“
Erkenntnis: Genau wie bei Bild-Prompts (siehe Folge 7) nimmt erst die präzise Beschreibung von Instrumenten, Rhythmus und Stimmung der KI das unberechenbare Raten ab.
Übung für heute
🎧 Dein erster akustischer Versuch:
Wähle einen kostenlosen KI-Dienst und probiere eines der folgenden Formate selbst aus:
- Der 1-Minuten-Podcast: Öffne Google Gemini Notebook (ehemals NotebookLM), erstelle ein neues Notizbuch und lade eine Notiz oder einen kurzen Artikel hoch. Klicke auf „Audio Overview generieren“ und lausche, wie zwei Moderatoren über deinen Text debattieren!
- Der Instrumental-Jingle: Bitte Google Gemini im Chat: „Erstelle mir ein 30-sekündiges, schwungvolles Jazz-Klavierstück für den Morgenkaffee.“
- Speech Enhancement testen: Nimm ein 20-sekündiges Sprachmemo mit deinem Smartphone auf (z. B. bei offenem Fenster) und lade es bei Adobe Podcast AI hoch. Höre den Vorher-Nachher-Unterschied!
Wissens-Check: Teste dein Wissen
Nachdem du die Lektion durchgearbeitet und den Deep Dive Podcast gehört hast: Wie gut kennst du dich mit Spektrogrammen, Stimmklonen, Google Lyria und der GEMA-Klage aus? Teste dein Wissen in diesem interaktiven Quiz mit 10 Fragen:
Fazit
Künstliche Intelligenz kann heute nicht nur lesen und sehen, sondern auch hören, sprechen, restaurieren und komponieren. Ob automatisierte Podcasts aus Fachdokumenten mit Gemini Notebook, frische Melodien mit Google Gemini (Lyria), Songwriting mit Suno oder glasklare Audio-Restaurierung: Audio-KI erschließt völlig neue Wege des Lernens und Gestaltens. Beachte dabei stets die Urheberrechte und Persönlichkeitsrechte anderer – und nutze die neuen akustischen Werkzeuge verantwortungsvoll. In der nächsten Folge widmen wir uns der Frage, wie du KI als deinen verlässlichen Begleiter im Alltag einsetzt: beim Planen, Organisieren und Automatisieren.
Weiter geht es mit Folge 9: KI als persönlicher Assistent – wie du deinen Alltag planst, Termine koordinierst und Aufgaben automatisierst.