Heute braucht es für neue Audioaufnahmen oft nur eine kurze Beschreibung – den Rest übernimmt Künstliche Intelligenz. Mit ihrer Hilfe lassen sich Stimmen erzeugen, Geräusche simulieren oder Tonaufnahmen erstellen, die klingen, als wären sie von echten Menschen gesprochen oder gespielt worden.
KI-Systeme lernen durch Beispiele. Um Audios zu erzeugen, werden sie mit riesigen Mengen an Klangdaten trainiert. Wenn eine KI zum Beispiel lernen soll, wie eine menschliche Stimme klingt, bekommt sie eine Vielzahl an Sprachaufnahmen. Daraus erkennt sie Muster: Wie klingen bestimmte Laute? Wie verändert sich die Stimme bei Emotionen? Wie wird betont? Wie klingt ein bestimmter Dialekt? Nur mit diesen Informationen kann die KI selbst neue Sprachaufnahmen erzeugen, oder die Stimmen nachahmen, sodass der Bot auf Ihrer Homepage genauso klingt wie Sie. Oder sogar eine Sprachübersetzung mit ihrer Stimme erzeugen, deren Sprache sie überhaupt nicht mächtig sind.
Aber auch andere Geräusche können verarbeitet werden – etwa Musikstücke, Umgebungsgeräusche oder Maschinenklänge. Die KI analysiert diese Daten und erkennt Muster: Wie klingt ein bestimmtes Werkzeug? Wie verläuft ein typischer Rhythmus? Welche Tonfolgen gibt es? So erkennt die KI auch, was harmonisch wirkt oder welchem Genre ein Stück entspricht. Mit diesem Wissen werden neue Audios erzeugten. Sie „weiß“, wie ein bestimmter Klang aufgebaut ist, und kann daraus etwas Eigenes erschaffen – sei es ein realistisches Geräusch oder ein komplett neues Klangbild. So entstehen ganze Klangwelten, etwa die Atmosphäre einer Werkstatt, eines Klassenzimmers oder eines Verkaufsraums.
Beispiele zu den Möglichkeiten:
- Texte werden von KI vorgelesen, wie Sicherheits- oder Bedienhinweise und stehen den Mitarbeitenden als kurze Audios zur Verfügung.
- Aus den Folien einer Präsentation oder einfachen Texten kann KI einen Podcast erstellen.
- Hintergrundmusik für Werbevideos kann passgenau zur Stimmung und Länge von KI komponiert werden.
- Eine historische Rede kann mit einer von KI nachgebildeten Stimme rekonstruiert werden.
Abgrenzung zu anderen KI-Fähigkeiten – Kurz und knapp
Unterschiede der Karten
01 | Audios erstellen = Neues erschaffen
02 | Audios verändern = Altes bearbeiten
03 | Audios erkennen = verstehen
04 | Audios identifizieren = eindeutig zuordnen
Der feine Unterschied der Karten 03 und 04:
Audios erkennen ist also die Grundlage für Audios identifizieren. Beim Erkennen wird unterschieden zwischen den Quellen, wie Sprache, Vogelgezwitscher, Motorengeräusch etc. Wenn Audios identifiziert werden, erfolgt eine spezifische Zuordnung. Hierbei kann zum Beispiel zwischen den verschiedenen sprechenden Personen unterschieden werden und wenn diese Sprachmuster bekannt und zugeordnet wurden, können die Personen auch benannt werden