Modul1 – KI-Grundlagen
Folge08
Zeitbedarfca. 50 Minuten (25 Min. Lesezeit + ca. 27 Min. Audio-Podcast)
ZielgruppeAbsolute Einsteiger – keine Vorkenntnisse nötig
WerkzeugeEin beliebiges KI-Audiowerkzeug im Web (z. B. Google Gemini / Gemini Notebook, Suno, Udio oder Copilot)

Audio, Musik und Podcasts mit KI

Nachdem wir in der letzten Folge gesehen haben, wie Algorithmen Bilder malen (siehe Folge 7), tauchen wir nun in die Welt der Akustik ein. Generative KI kann heute weit mehr als monotone Computerstimmen ausgeben: Sie komponiert vollständige Radiosongs mit Gesang und Instrumenten, liest Texte mit feiner emotionaler Betonung vor, restauriert verrauschte Sprachaufnahmen und verwandelt trockene Dokumente auf einen Klick in lebendige Podcast-Diskussionen zweier virtueller Moderatoren. In dieser Folge erfährst du, wie diese Klangwunder entstehen, welche Werkzeuge kostenlos zur Verfügung stehen und welche rechtlichen und ethischen Spielregeln gelten.

Abbildung 16 – Unsere Einsteigerin experimentiert mit KI-generierten Audio-Wellenformen und Podcast-Spuren
Abbildung 16 – Unsere Einsteigerin experimentiert mit KI-generierten Audio-Wellenformen und Podcast-Spuren Prompt: Nutze die Referenzbilder der hochgeladenen KI-generierten Person, um eine fotorealistische Darstellung desselben Charakters zu erhalten. Erstelle ein fotorealistisches Bild im Querformat 16:9. Zeige dieselbe junge Frau an einem gemütlichen, hellen Arbeitsplatz mit großen Over-Ear-Studiokopfhörern auf den Ohren. Vor ihr auf dem Schreibtisch steht ein elegantes Podcast-Tischmikrofon. Auf ihrem Laptop- und Zusatzmonitor sind bunte Tonspuren, Audio-Wellenformen und eine moderne Podcast-Editing-Software zu sehen. Sie lächelt erfreut und hört aufmerksam zu, eine Hand berührt locker eine Hörmuschel. Warmes Tageslicht durch ein Fenster, angenehme und kreative Studio-Atmosphäre, natürliche Hauttöne, ruhige Bildkomposition.
DEIN LERNZIEL

Du verstehst das Grundprinzip von Text-zu-Audio, Spektrogrammen und moderner Sprachsynthese. Du erfährst, wie Google Gemini (Lyria 3/3.5) und Plattformen wie Suno oder Udio auf Knopfdruck vollständige Songs komponieren, wie Gemini Notebook lebendige Podcasts erschafft, welche Revolution native Echtzeit-Sprachmodelle und Audio-Restaurierung bedeuten – und welche rechtlichen Meilensteine (wie das Münchner GEMA-Urteil 2026 gegen Suno) sowie Transparenzstandards (SynthID Audio und C2PA) für die Praxis gelten.

Wie KI Töne und Stimmen lernt: Schallwellen als Muster

Genau wie bei Bildern und Texten liegt auch der Audio-Generierung das Erkennen und Vorhersagen von Mustern zugrunde (vgl. Folge 5: Wie KI lernt). Doch wie verwandelt ein Computer geschriebene Wörter in Musik oder Sprache?

Schall besteht physikalisch aus Schwingungen der Luftmoleküle. Macht man diese Schwingungen sichtbar, erhält man ein sogenanntes Spektrogramm – ein zweidimensionales Bild, das Frequenzen (Tonhöhen) auf der vertikalen Achse, den Zeitverlauf auf der horizontalen Achse und die Lautstärke über Farbhelligkeiten darstellt. Für eine KI ist die Klangerzeugung daher eng mit der Bildverarbeitung verwandt: Viele moderne Audiomodelle nutzen ähnliche Diffusions- und Transformermodelle wie Bild-Generatoren (siehe Folge 7). Sie errechnen aus deinem Textbefehl zuerst ein visuelles Frequenzmuster im Rauschen und wandeln dieses Bild über einen sogenannten Vocoder anschließend in glasklare Audiosignale um.

Text-zu-Audio (Text-to-Audio / Text-to-Speech)

In einfacher Sprache: Wie wird aus geschriebenen Worten Klang?

Text-zu-Audio bezeichnet generative KI-Modelle, die aus geschriebenen Anweisungen (Prompts) Klanglandschaften, Soundeffekte, vollständige Musikstücke oder lebensecht gesprochene Sprache berechnen. Die KI hat an Millionen Stunden Tonaufnahmen gelernt, wie Instrumente, Harmonien, Rhythmen und menschliche Sprachmelodien statistisch zusammenhängen.

Spektrogramm

In einfacher Sprache: Das sichtbare „Notenblatt der Physik“ für den Computer.

Eine grafische Darstellung von Schallwellen: Auf der waagerechten Achse verläuft die Zeit, auf der senkrechten Achse die Tonhöhe (Frequenz) und die Helligkeit zeigt die Lautstärke. Weil Ton damit wie ein Bild aussieht, können KI-Modelle Methoden der Bildgenerierung (wie Diffusion) nutzen, um Musik und Stimmen Pixel für Pixel zu komponieren.

Podcasts auf Knopfdruck: Wenn zwei KIs miteinander plaudern

Eine der verblüffendsten Entwicklungen moderner Audio-KI sind vollautomatische Podcasts. Werkzeuge wie Google Gemini Notebook (das nach seiner weltweiten Einführung aus dem beliebten Laborprojekt NotebookLM hervorgegangen ist, mit der Kernfunktion Audio Overview) und Microsoft Copilot machen es möglich, aus beliebigen Texten auf Knopfdruck eine moderierte Radiosendung zu zaubern.

Hinweis für die Praxis: Googles Werkzeug startete ursprünglich unter dem Namen NotebookLM. Google hat den Dienst offiziell als Gemini Notebook in seine Produktfamilie integriert – die Funktion wird unter dem Namen „Audio Overview“ bereitgestellt.

Audio-Overview (KI-Podcast)

In einfacher Sprache: Eine lebendige Radiosendung zweier Moderatoren über deine Notizen.

Eine Audio-Overview analysiert ein oder mehrere hochgeladene Dokumente (PDFs, Notizen, Webseiten) und erzeugt daraus einen 10- bis 25-minütigen Dialog zwischen zwei virtuellen Moderatoren. Sie stellen Fragen, erklären Zusammenhänge anhand anschaulicher Alltagsmetaphern, scherzen und fassen den Inhalt unterhaltsam zusammen.

Was macht diese KI-Podcasts so erstaunlich lebensecht?

TIPP: QUELLENPRÜFUNG BEI KI-PODCASTS

Auch wenn die beiden Moderatoren extrem kompetent und sympathisch klingen: Sie wissen nur das, was in deinen hochgeladenen Quelltexten steht. Weisen die Quellen Lücken auf, neigt die KI gelegentlich zum Fabulieren (Halluzinieren, vgl. Folge 3). Nutze KI-Podcasts daher zum Kennenlernen und Vertiefen eines Themas, prüfe wichtige Fakten aber immer in den Originalunterlagen nach!

PRAXISBEISPIEL: UNSER DEEP DIVE PODCAST ZU DIESER FOLGE

Genau so klingt ein vollwertiger KI-Podcast in der Realität: Wir haben die Notizen, Leitfragen und Gerichtsakten dieser Lektion in Google Gemini Notebook eingespeist und eine Audio-Overview generieren lassen. Die beiden KI-Hosts fassen die Kernpunkte lebhaft zusammen und beleuchten die Hintergründe der GEMA-Klage und des Stimmklonens.

👉 Podcast herunterladen: „Stimmenklone und Musik aus der KI“ (.m4a-Audiodatei, ca. 27 Minuten) – oder nutze den integrierten Audio-Player direkt am Ende dieser Lektion (zum Podcast springen)!

Musik komponieren mit KI: Von der Textidee zum fertigen Song

Was früher Monate im Tonstudio, teures Equipment und fundierte Harmonielehre erforderte, erledigt moderne KI in unter einer Minute. Heute gibt es zwei zentrale Wege, um eigene Musik zu generieren:

flowchart TD A["Deine Idee: Genre, Stimmung, Thema"] --> B{"Welches Werkzeug?"} B -->|"Direkt im Chat / Kostenlos"| C["Google Gemini (Lyria 3.5)"] B -->|"Vollständiger Song mit Gesang"| D["Suno AI oder Udio AI"] B -->|"Lokal auf eigenem PC"| E["ComfyUI (YuE Modell)"] C --> F["Stimmungsvoller Track / Melodie"] D --> G["Radiofertiger Song mit Strophen & Refrain"] E --> H["100% private Song-Produktion"]

Ähnlich wie bei Text- und Bild-Prompts (siehe Folge 2 und Folge 7) folgt ein wirkungsvoller Musik-Prompt vier klaren Bausteinen: 1. Genre & Epoche (z. B. 80er Synth-Pop oder Klassisches Streichquartett), 2. Instrumentierung (z. B. akustische Gitarre, Flügel, treibender Synthesizer-Bass), 3. Tempo & Rhythmus (z. B. ruhige 75 BPM oder treibende 128 BPM) und 4. Stimmung & Aufbau (z. B. melancholisch, sonnig, rein instrumental oder mit weiblicher Soul-Stimme).

1. Google Gemini und DeepMind Lyria 3.5

Google hat mit seiner Forschungstochter DeepMind das Musik-Grundlagenmodell Lyria (in der aktuellen Generation Lyria 3.5) entwickelt. Dieses Modell ist tief in den Chatbot Gemini integriert.

2. Spezialisierte Plattformen: Suno AI und Udio AI

Geht es um vollwertige Pop-, Rock- oder Chansonsongs mit Gesangsstimme, eigenem Liedtext, Strophen und packendem Refrain, führen Plattformen wie Suno AI und Udio AI den Markt an:

Lokale Musikgenerierung mit ComfyUI (Ausblick)

Genau wie bei Bildern drängt die Open-Source-Gemeinschaft auch bei Audio mit rasanter Geschwindigkeit voran. Ein Meilenstein für anspruchsvolle Tüftler ist das Modell YuE (spezialisiert auf vollständige Lyrics-to-Song-Synthese) sowie Stable Audio Open.

Über das knotenbasierte Werkzeug ComfyUI (mit Erweiterungen wie ComfyUI_YuE) kann man diese Musikmodelle direkt auf der eigenen Grafikkarte betreiben:

AUSBLICK AUF SPÄTERE MODULE

Keine Sorge für heute: Die Installation von ComfyUI und das Einrichten lokaler Musikmodelle erfordern einiges an technischem Rüstzeug und einer leistungsstarken Grafikkarte (mindestens 12–16 GB Grafikspeicher). In einem späteren Modul dieses Workshops werden wir zeigen, wie man ComfyUI für lokale Generierung Schritt für Schritt meistert!

Stimmensynthese und Voice-Cloning

Neben Musik erlebt auch die Sprachausgabe eine Revolution. Plattformen wie ElevenLabs oder moderne Sprachfunktionen führender Chatbots ermöglichen es, geschriebenen Text in atemberaubend natürlicher Sprache vorzulesen:

Voice-Cloning (Stimmklonen)

In einfacher Sprache: Das digitale Duplizieren einer menschlichen Stimme.

Ein Verfahren des maschinellen Lernens, bei dem anhand weniger Audiosekunden ein mathematisches Profil der Klangfarbe, Intonation und Artikulation eines Menschen erstellt wird. Dieses Profil ermöglicht es, beliebig neue Texte so klingen zu lassen, als hätte die Originalperson sie selbst eingesprochen.

Echtzeit-Sprache und Audio-Restaurierung im Alltag

Im Jahr 2026 hat sich die Audiowelt noch einmal grundlegend weiterentwickelt. Zwei Technologien haben Einzug in den Alltag gehalten, die für Einsteiger besonders nützlich sind:

1. Die Revolution der Echtzeit-Sprache (Voice-to-Voice)

Frühe Sprachassistenten funktionierten nach einem trägen Dreischritt: Dein Ton wurde aufgenommen, mühsam in Text umgewandelt (Speech-to-Text), an das Sprachmodell geschickt und die Antwort anschließend wieder vorgelesen (Text-to-Speech). Das führte zu stockenden Wartezeiten von drei bis fünf Sekunden.

Moderne multimodale Systeme wie der Advanced Voice Mode (OpenAI) oder Gemini Live (Google) arbeiten nativ von Ton zu Ton: Die KI „hört“ direkt das Audiosignal und antwortet ohne Textumweg in Echtzeit (unter 300 Millisekunden Latenz). Du kannst der KI mitten ins Wort fallen (Barge-In), sie bitten, schneller oder leiser zu flüstern, oder ihr Gefühle und Dialekte vorgeben. Dies bildet die Grundlage für moderne persönliche Assistenten (mehr dazu in Folge 9).

2. Audio-Restaurierung: Kristallklarer Klang für Alltagsaufnahmen

Hast du jemals ein wichtiges Sprachmemo im Auto aufgenommen, ein Interview im halligen Wohnzimmer geführt oder ein altes Familien-Tonband digitalisiert? Schlechte Akustik, Straßenlärm und Nachhall machten solche Aufnahmen früher unbrauchbar.

Spezialisierte KI-Werkzeuge wie Adobe Podcast AI (Enhance Speech) oder Descript Studio Sound analysieren die Stimme, trennen Störgeräusche und Raumhall mathematisch heraus und rekonstruieren fehlende Frequenzen. Das Ergebnis klingt, als hätte die sprechende Person in einer professionellen, schallisolierten Sprecherkabine vor einem 1.000-Euro-Studiomikrofon gesessen – ein unschätzbares Werkzeug für Vereine, Familienchroniken und Selbstständige.

Marktübersicht: Die wichtigsten Audio-Werkzeuge im Überblick

Die folgende Tabelle fasst die führenden Werkzeuge für Klang, Musik und Sprache zusammen:

Bereich Werkzeug / Modell Kosten / Zugang Besonderheit & Stärke
Podcasts Gemini Notebook (ehemals NotebookLM) Kostenlos (Google-Konto) Erzeugt aus Dokumenten und Notizen lebensechte Audio-Podcasts zweier Hosts (Audio Overview).
Podcasts Microsoft Copilot Kostenlos / Pro Generiert gesprochene Zusammenfassungen, Audio-Nachrichten und thematische Audio-Exzerpte.
Musik Google Gemini (Lyria 3.5) Kostenlos in Gemini DeepMinds Musikmodell; komponiert Melodien und Stimmungs-Soundtracks direkt im Chatfenster.
Musik Suno AI Freemium (tägliche Gratis-Credits) Marktführer für vollständige Songs mit Strophen, Refrain und Gesang aus kurzen Textideen.
Musik Udio AI Freemium / Abo Hervorragende klangliche Differenzierung, komplexe Jazz-, Rock- und Instrumental-Arrangements.
Musik (Lokal) ComfyUI (Modell: YuE) Kostenlos (Open-Source) Vollsong-Generierung (Lyrics-to-Song) lokal auf der eigenen GPU ohne fremde Cloud-Server.
Sprache & Klonen ElevenLabs Freemium / Abo Maßstab für lebensechte KI-Stimmen, Hörbuchproduktion und präzises Stimmklonen.
Restaurierung Adobe Podcast AI (Enhance Speech) Kostenlos (mit Adobe-ID) Verwandelt hallige, verrauschte Sprachaufnahmen per Knopfdruck in glasklaren Studiosound.

Recht, GEMA-Urteil und Ethik: Was du wissen musst (keine Rechtsberatung)

Weil KI-Musik und KI-Stimmen täuschend echt wirken und auf echten menschlichen Kunstwerken aufbauen (siehe Folge 5 zu Trainingsdaten), steht der Audiomarkt im Zentrum juristischer Grundsatzentscheidungen. Die folgenden Hinweise bieten dir eine alltagsnahe Orientierung (Hinweis: Dies stellt keine Rechtsberatung dar):

ACHTUNG: RECHTLICHE UND ETHISCHE SPIELREGELN

1. Das wegweisende Münchner GEMA-Urteil gegen Suno (31. Juli 2026):
Die deutsche Verwertungsgesellschaft GEMA zog vor das Landgericht München I (Az. 42 O 763/25), um die unlizenzierte Ausbeutung geschützter Musikwerke durch Suno zu stoppen. Das Gericht gab der GEMA weitestgehend recht: Das systematische Einspeisen geschützter Hits in das Trainingskorpus stellt eine unzulässige Vervielfältigung (§ 16 UrhG) dar, und die Ausnahme für Text- und Data-Mining greift nicht, wenn Werke im Modell dauerhaft memoriert werden.
Die GEMA dokumentierte dies anhand frappierender Plagiate und Soundalikes weltbekannter Klassiker: unter anderem „Atemlos durch die Nacht“ (Helene Fischer / Kristina Bach), „Daddy Cool“ und „Rasputin“ (Boney M. / Frank Farian), „Forever Young“ und „Big in Japan“ (Alphaville) sowie „Mambo No. 5“ (Lou Bega).
👉 Höre selbst hinein: Die GEMA hat die Klangvergleiche öffentlich dokumentiert: GEMA-Hörbeispiele zu Suno-Plagiaten sowie der Entscheidungsbericht des Landgerichts München.
Das Urteil unterstreicht: Wer kommerzielle Musik-KIs betreibt, muss Urheber fair lizenzieren und vergüten.

2. Fehlender Urheberrechtsschutz an eigenen KI-Songs:
Genau wie bei Bildern (vgl. Folge 7) gilt auch bei Musik: Ein Song, der rein durch das Eintippen eines Prompts entsteht, besitzt keinen eigenen Urheberrechtsschutz, da ihm die menschliche Schöpfungshöhe fehlt. Zudem darfst du KI-Songs, die geschützte Melodien oder Stimmen bekannter Stars imitieren, keinesfalls kommerziell veröffentlichen.

3. Stimmklonen und Kriminalitätsgefahr (Enkeltrick 2.0):
Klone niemals ohne ausdrückliche schriftliche Einwilligung die Stimme einer realen Person! Kriminelle nutzen KI-Stimmen bereits für das sogenannte Voice-Phishing („Schockanrufe“ bei Großeltern mit der täuschend echten Stimme des weinenden Enkels). Das Nachahmen fremder Stimmen verletzt das Persönlichkeitsrecht massiv und ist strafbar (ausführlicher Schutzleitfaden in Folge 13).

4. Kennzeichnungspflicht (EU AI Act) & SynthID-Wasserzeichen:
Nach dem europäischen KI-Gesetz (EU AI Act) müssen künstlich generierte Stimmen oder Musikstücke, die mit echten menschlichen Aufnahmen verwechselt werden könnten, transparent als „künstlich erzeugt“ gekennzeichnet werden. Vorreiter wie Google DeepMind integrieren mit SynthID Audio unhörbare digitale Wasserzeichen direkt in die Frequenzen, um die Herkunft fälschungssicher nachzuweisen.

SynthID Audio & C2PA (Akustische Wasserzeichen)

In einfacher Sprache: Der unhörbare Stempel im Klang, der die KI verrät.

Eine Technologie zur Kennzeichnung generativer Audiosignale: Google DeepMinds SynthID bettet ein für das menschliche Gehör unhörbares, kryptografisches Signal direkt in die Tonwellen ein. Dieses Wasserzeichen bleibt selbst dann nachweisbar, wenn die Audiodatei komprimiert (z. B. in MP3), gefiltert oder über Lautsprecher neu aufgenommen wird.

Pflichtübung: Einen Musik-Prompt analysieren und aufbauen

PFLICHTÜBUNG: EINEN MUSIK-PROMPT ANALYSIEREN UND AUFBAUEN

Stell dir vor, du planst ein Erklärvideo über nachhaltige Gartenarbeit und suchst eine fröhliche, entspannte Hintergrundmusik mit Google Gemini (Lyria) oder Suno. Ein Bekannter schlägt dir folgenden Prompt vor:

„Schöne Musik für Garten.“

Deine Aufgabe:

  1. Warum wird die KI mit diesem Einzeiler nur ein beliebiges, meist unbrauchbares Zufallsergebnis liefern?
  2. Formuliere den Prompt nach den vier musikalischen Bausteinen (Genre, Instrumentierung, Tempo, Stimmung & Zweck) neu, sodass ein stimmiges, instrumentales Hintergrundstück entsteht.
Musterlösung anzeigen (nach dem eigenen Versuch aufklappen)

1. Analyse der Schwachstellen:
Der Vorschlag lässt alles offen: Welches Musikgenre (Klassik, Techno, Volksmusik?), welches Tempo (einschläfernd oder hektisch?), welche Besetzung (E-Gitarre, Trompete oder Akustik?) und welche Struktur (mit störendem Gesang oder rein instrumental?).

2. Der optimierte 4-Bausteine-Prompt:

„Fröhlicher, leichtfüßiger Akustik-Folk im mittleren Tempo (ca. 105–110 BPM). Warme akustische Gitarre, dezente Ukulele, Glockenspiel und ein sanfter Kontrabass. Sonnige, einladende und naturverbundene Atmosphäre, ideal als unaufdringliche Hintergrundmusik für ein Erklärvideo. Rein instrumental, absolut kein Gesang, sauberes Fade-Out nach 60 Sekunden.“

Erkenntnis: Genau wie bei Bild-Prompts (siehe Folge 7) nimmt erst die präzise Beschreibung von Instrumenten, Rhythmus und Stimmung der KI das unberechenbare Raten ab.

Übung für heute

ÜBUNG FÜR HEUTE

🎧 Dein erster akustischer Versuch:

Wähle einen kostenlosen KI-Dienst und probiere eines der folgenden Formate selbst aus:

  1. Der 1-Minuten-Podcast: Öffne Google Gemini Notebook (ehemals NotebookLM), erstelle ein neues Notizbuch und lade eine Notiz oder einen kurzen Artikel hoch. Klicke auf „Audio Overview generieren“ und lausche, wie zwei Moderatoren über deinen Text debattieren!
  2. Der Instrumental-Jingle: Bitte Google Gemini im Chat: „Erstelle mir ein 30-sekündiges, schwungvolles Jazz-Klavierstück für den Morgenkaffee.“
  3. Speech Enhancement testen: Nimm ein 20-sekündiges Sprachmemo mit deinem Smartphone auf (z. B. bei offenem Fenster) und lade es bei Adobe Podcast AI hoch. Höre den Vorher-Nachher-Unterschied!
Podcast-Symbol
DEEP DIVE PODCAST ZUR VERTIEFUNG
Stimmenklone und Musik aus der KI
Erstellt mit Google Gemini Notebook (Audio Overview). Höre die beiden virtuellen KI-Moderatoren, wie sie die Themen dieser Lektion lebhaft diskutieren: Vom Schritt von Schallwellen zu Spektrogrammen über Google Lyria und Suno bis hin zu den Hintergründen des Münchner GEMA-Urteils und dem Schutz vor Stimmklon-Betrug.
Download (.m4a)

Wissens-Check: Teste dein Wissen

Nachdem du die Lektion durchgearbeitet und den Deep Dive Podcast gehört hast: Wie gut kennst du dich mit Spektrogrammen, Stimmklonen, Google Lyria und der GEMA-Klage aus? Teste dein Wissen in diesem interaktiven Quiz mit 10 Fragen:

Fazit

FAZIT

Künstliche Intelligenz kann heute nicht nur lesen und sehen, sondern auch hören, sprechen, restaurieren und komponieren. Ob automatisierte Podcasts aus Fachdokumenten mit Gemini Notebook, frische Melodien mit Google Gemini (Lyria), Songwriting mit Suno oder glasklare Audio-Restaurierung: Audio-KI erschließt völlig neue Wege des Lernens und Gestaltens. Beachte dabei stets die Urheberrechte und Persönlichkeitsrechte anderer – und nutze die neuen akustischen Werkzeuge verantwortungsvoll. In der nächsten Folge widmen wir uns der Frage, wie du KI als deinen verlässlichen Begleiter im Alltag einsetzt: beim Planen, Organisieren und Automatisieren.

Weiter geht es mit Folge 9: KI als persönlicher Assistent – wie du deinen Alltag planst, Termine koordinierst und Aufgaben automatisierst.