RPM Studio Logo

Blog

Sprecherstimme gegen KI: rechtliche Grenzen, Stimmklonen und Bußgelder bis zu 15 Millionen Euro

AI Act, Audio-Deepfakes, Sprecherrechte und Bußgelder bis zu 15 Mio. Euro — was Unternehmen wissen sollten, bevor sie eine synthetische Stimme veröffentlichen.

Noch vor wenigen Jahren lautete die Frage, ob künstliche Intelligenz irgendwann wie ein Mensch sprechen kann. Heute lautet die wesentlich interessantere Frage: darf sie wie ein ganz bestimmter Mensch sprechen?

Moderne Sprachsynthese erzeugt innerhalb weniger Sekunden erstaunlich natürliche Aufnahmen. Beim Voice Cloning geht es noch weiter: Ein Modell kann Klangfarbe, Rhythmus, Aussprache und charakteristische Merkmale einer realen Person nachbilden.

Für eine Werbeproduktion wirkt das zunächst ideal. Kein Studiotermin. Keine Terminabstimmung mit dem Sprecher. Zwei Sätze im Skript ändern sich – und wenige Augenblicke später existiert eine neue Aufnahme. Dann kommt die Frage, die im Produktionsprozess gerne zu spät gestellt wird: wessen Stimme hören wir eigentlich – und wer hat uns erlaubt, sie zu verwenden?

Seit dem 2. August 2026 ist diese Frage in der Europäischen Union noch bedeutender. Die Transparenzpflichten aus Artikel 50 des EU AI Act sind seit diesem Datum anwendbar.

Eine KI-Stimme ist nicht automatisch illegal

Synthetische Sprache ist grundsätzlich nicht verboten. Unternehmen können Text-to-Speech-Systeme, generische künstliche Stimmen oder ordnungsgemäß lizenzierte Sprachmodelle verwenden.

Problematisch wird es dort, wo eine künstlich erzeugte Stimme einer existierenden Person erkennbar ähnelt. Der AI Act erfasst als Deepfake unter anderem KI-generierte oder manipulierte Audioinhalte, die bestehenden Personen ähneln und fälschlicherweise als authentisch erscheinen können. Wer ein KI-System einsetzt, um einen solchen Audio-Deepfake zu erzeugen oder zu manipulieren, muss die künstliche Entstehung beziehungsweise Bearbeitung grundsätzlich offenlegen.

Gerade für Werbung ist das relevant. Es ist nicht erforderlich, den Namen eines bekannten Sprechers einzublenden. Wenn die Stimme bewusst so gestaltet wurde, dass der Hörer denkt „Das ist doch genau dieser Sprecher“, kann bereits die erkennbare Ähnlichkeit rechtlich relevant werden.

„Wir haben seine Aufnahme nicht kopiert“

Das ist als rechtliche Absicherung deutlich zu wenig. Es geht nicht nur um die Frage, ob eine vorhandene Audiodatei kopiert wurde.

Eine charakteristische Stimme kann Teil der persönlichen Identität eines Menschen sein. Hinzu kommen mögliche Leistungsschutzrechte eines Sprechers oder Schauspielers an seiner konkreten künstlerischen Darbietung. Für professionelle Sprachaufnahmen können daher mehrere Rechtsbereiche gleichzeitig betroffen sein.

Die sinnvollere Frage lautet deshalb: nutzen wir kommerziell die erkennbare stimmliche Identität einer Person, ohne dass diese Nutzung vereinbart wurde?

Eine Lizenz für die Aufnahme ist nicht automatisch eine Lizenz zum Klonen

Ein Sprecher nimmt einen Werbespot auf. Der Auftraggeber erhält das Recht, diesen Spot zwölf Monate online zu verwenden. Daraus folgt nicht automatisch das Recht, das Audiomaterial in ein KI-System hochzuladen, daraus ein Sprachmodell zu erstellen und anschließend neue Aussagen mit der Stimme des Sprechers zu generieren.

Auch das Recht zum Schnitt oder zur Bearbeitung einer Aufnahme ist nicht dasselbe wie das Recht, einen digitalen Zwilling der Stimme zu erschaffen. Wer Voice Cloning einsetzen möchte, sollte diese Nutzung daher ausdrücklich vertraglich regeln.

Bis zu 15 Millionen Euro

Seit dem 2. August 2026 gelten die Transparenzpflichten nach Artikel 50 AI Act. Verstöße gegen die dort genannten Transparenzpflichten fallen in eine Bußgeldkategorie von bis zu 15 Millionen Euro oder 3 Prozent des weltweiten Jahresumsatzes des vorangegangenen Geschäftsjahres. Für kleine und mittlere Unternehmen sieht die Verordnung eine günstigere Obergrenzenregelung vor.

Das bedeutet nicht, dass ein falsch gekennzeichneter Werbespot automatisch ein Bußgeld von 15 Millionen Euro auslöst. Es handelt sich um Höchstgrenzen. Die Zahl zeigt aber, dass Herkunft und Kennzeichnung synthetischer Inhalte nicht mehr lediglich eine Frage der guten Praxis sind.

Ist die Stimme ein biometrisches Datum?

Nicht jede Sprachaufnahme ist automatisch ein biometrisches Datum im besonderen rechtlichen Sinn. Relevant wird dieser Bereich insbesondere dann, wenn eine Stimme technisch verarbeitet wird, um eine Person eindeutig zu identifizieren – beispielsweise über einen Voiceprint oder ein gespeichertes Sprachmodell. Der Europäische Datenschutzausschuss beschreibt genau solche Systeme zur Sprecheridentifikation als Verarbeitung biometrischer Daten.

Bei Voice-Cloning-Projekten können deshalb gleichzeitig Vertragsrecht, Persönlichkeitsrechte, Leistungsschutzrechte, Datenschutz und der AI Act eine Rolle spielen.

Bei KI-Stimmen zählt nicht nur der Klang, sondern die Herkunft

Bei Musik ist diese Denkweise längst selbstverständlich. Woher stammt der Titel? Wer besitzt die Rechte? Ist bezahlte Werbung erlaubt? Für welches Gebiet? Für welchen Zeitraum? Bei synthetischen Stimmen sollten dieselben Fragen gestellt werden.

Bevor eine KI-Stimme in einer Kampagne eingesetzt wird, sollte geklärt sein, auf welcher Grundlage das Modell entstanden ist, ob eine reale Person dahintersteht, welche kommerziellen Nutzungen erlaubt sind und ob der produzierte Inhalt als künstlich erzeugt gekennzeichnet werden muss.

Ein echter Sprecher braucht ebenfalls eine Lizenz

Auch eine klassische Sprachaufnahme darf nicht grenzenlos verwendet werden. Die Rechte für ein internes Schulungsvideo unterscheiden sich von denen für einen Radiospot oder eine große Online-Werbekampagne.

Der Unterschied liegt vor allem in der Nachvollziehbarkeit. Bei einer professionellen Produktion gibt es einen realen Sprecher, einen Auftrag, eine konkrete Aufnahme und einen definierten Nutzungsumfang.

Die Sprecherkartei von RPM Studio ist deshalb nicht nur eine Sammlung von Stimmproben. Sie verbindet die Auswahl eines Sprechers mit einer nachvollziehbaren Produktions- und Rechtekette.

RPM betreibt Aufnahmestudios in Warschau, Breslau und Tarnow und produziert Sprachaufnahmen, Werbung, IVR, Hörbücher sowie Audio-Postproduktion.

Eine echte Sprachaufnahme mag technologisch weniger spektakulär wirken als ein generatives Modell. Wenn jedoch später jemand fragt, woher die Stimme einer Kampagne stammt, ist eine dokumentierte Antwort oft erheblich wertvoller.

Kann man eine geklonte Stimme erkennen?

Verdächtige Aufnahmen lassen sich mit verifizierten Originalaufnahmen einer Person vergleichen. Dabei können digitale Merkmale des Sprechers analysiert und die Stärke der Übereinstimmung bewertet werden.

Eine hohe Übereinstimmung beweist allerdings nicht automatisch, dass künstliche Intelligenz eingesetzt wurde. Auch eine echte Aufnahme derselben Person sollte selbstverständlich eine starke Ähnlichkeit zeigen.

KI wird bleiben. Der Umgang mit Sprachrechten muss sich ändern

Synthetische Stimmen werden aus der Audioproduktion nicht verschwinden. Sie sind für Prototypen, interne Anwendungen, Barrierefreiheit, automatische Ansagen, Übersetzungen und viele andere Anwendungen ausgesprochen nützlich.

Das Risiko entsteht dort, wo die Geschwindigkeit der Technik schneller ist als die Rechteklärung. Bei der Entscheidung zwischen KI-Stimme und professionellem Sprecher sollte deshalb nicht nur gefragt werden, wie viel die Audiodatei kostet. Eine zweite Frage wird immer wichtiger: können wir beweisen, dass wir diese Stimme tatsächlich verwenden dürfen?

Genau deshalb bekommen professionelle Sprachaufnahmen, ein seriöses Tonstudio und eine dokumentierte Sprecherkartei im Zeitalter der KI eine neue Bedeutung. Guter Ton braucht heute nicht nur gute Qualität. Er braucht auch eine nachvollziehbare Herkunft und klare Rechte.