Verarbeitung auf diesem Gerät
Remove Audio

AI Voice Isolator: saubere Sprache aus einem Video extrahieren

Füge ein Video oder eine Aufnahme hinzu. Die KI holt die Sprache als eigene, saubere Tonspur heraus. Musik, Raumklang, Verkehr und Stimmengewirr bleiben zurück, und du bekommst das Video mit unverändertem Bild. Auf einem Computer läuft das kostenlos in deinem Browser, auf diesem Gerät: Es wird nichts hochgeladen und du brauchst kein Konto. Für längere Dateien oder einen Browser, der das Modell nicht ausführen kann, wechsle in die Cloud: Deine ersten 10 Credits sind kostenlos. Das entspricht 10 Minuten mit diesem Tool.

Remove Audio-Maskottchen, eine freundliche Kopfhörerfigur. KI-Audiotool, das nach Möglichkeit kostenlos in deinem Browser läuft oder für längere Dateien auf unseren Servern.

Video- oder Audiodatei hier ablegen oder auf deinem Gerät auswählen

MP4, MOV, MKV, WebM, AVI, MP3, WAV, M4A und mehr

Bis zu 20 Dateien auf einmal

Datenschutz zuerst Keine Uploads Lokale Verarbeitung

Dieser Browser kann das KI-Modell nicht selbst ausführen: Er braucht WebGPU und mindestens 8 GB Arbeitsspeicher. Wechsle in die Cloud, um diese Datei zu verarbeiten.

Kostenlos auf diesem Gerät, wenn das Modell darauf laufen kann. In der Cloud bestimmst du, wie lange das Ergebnis aufbewahrt wird.

Größere Dateien? Verarbeite sie in der Cloud

Dieses Tool läuft kostenlos auf diesem Gerät. Für eine Datei über dem Gerätelimit oder eine lange Aufnahme läuft dasselbe Tool auf unseren Servern: bis zu 5 GB pro Datei und 6 Stunden Audio, schneller, und deine Dateien bleiben bis zu 7 Tage gespeichert, mit jedem Credit-Paket oder Tarif so lange, wie du möchtest. Ab 1 Credit pro Minute, mit 10 Credits kostenlos, sobald du ein Konto erstellst.

Kurze Antwort

So extrahierst du die Stimme aus einem Video

Füge die Datei hinzu. Die KI trennt die Sprache von allem anderen in der Mischung. Auf diesem Gerät läuft das kostenlos in deinem Browser, ohne Upload. Zurück bekommst du nur die gesprochene Stimme, sauber genug zum Transkribieren, Synchronisieren oder für einen neuen Schnitt.

  1. Füge ein MP4, MOV, MKV oder WebM hinzu, oder ein MP3 oder WAV.
  2. Die KI holt die Sprache als eigene Spur heraus.
  3. Hör sie dir an und lade die isolierte Stimme herunter.

Warum dieses Tool statt des Music Removers

Sie behält die Sprache und sonst nichts: Musik, Atmosphäre und Effekte kommen alle heraus. Der Music Remover nutzt dasselbe Modell; diese Seite ist für den Fall, dass die Stimme das Einzige ist, was du weiterverwendest.

Nur Sprache, sonst nichts

Musik, Effekte, Atmosphäre und Raumklang kommen alle heraus, du bekommst also nur die Sprache: im Video, das du hinzugefügt hast, oder als Audiodatei, wenn du Audio hinzugefügt hast.

Für Transkription gemacht

Automatische Transkription und Untertitel scheitern an einer lauten Mischung. Ihnen zuerst eine saubere Sprachspur zu geben, ist der größte Genauigkeitsgewinn überhaupt.

Video rein, Video raus

Füge ein Video hinzu und du bekommst ein Video zurück, das Bild bleibt unangetastet. Die meisten Stimmenextraktoren geben dir eine nackte Audiodatei und überlassen dir den Rest.

Bereit für Synchronisation

Eine saubere Dialogspur ist der Ausgangspunkt zum Übersetzen, Neuvertonen oder Ersetzen einer Stimme, ohne dass die alte Mischung dagegenhält.

Rettet schlechten Drehton

Ein Vortrag in einem vollen Saal oder ein Interview an einer Straße wird brauchbar, wenn die Sprache getrennt statt gefiltert wird.

Kostenlos in deinem Browser

Auf diesem Gerät läuft das KI-Modell auf deinem eigenen Computer und kostet deshalb nichts: kein Konto, kein Upload, keine Credits, beliebig viele Dateien. Für lange Dateien gibt es die Cloud: Jedes neue Konto startet mit 10 Credits kostenlos. Das entspricht 10 Minuten mit diesem Tool. Keine Kreditkarte nötig.

So funktioniert es, Schritt für Schritt

Vier Schritte von einer lauten Mischung zu einer sauberen Sprachspur.

  1. 01

    Datei hinzufügen

    Zieh ein Video oder eine Audiodatei in das Feld oben, oder klicke zum Auswählen. MP4, MOV, MKV und WebM funktionieren, ebenso MP3, WAV und M4A.

  2. 02

    „Dieses Gerät“ oder Cloud wählen

    Auf diesem Gerät läuft die KI in deinem Browser: kostenlos, ohne Konto, ohne Upload, in einem Browser mit WebGPU und mindestens 8 GB Arbeitsspeicher, für bis zu 15 Minuten Audio pro Datei. In der Cloud läuft sie für längere Dateien auf unseren Servern: Melde dich an, deine ersten 10 Credits sind kostenlos.

  3. 03

    Das Modell isoliert die Sprache

    Es hört sich die ganze Spur an und trennt die gesprochene Stimme von Musik, Effekten und allem anderen in der Mischung.

  4. 04

    Anhören, dann herunterladen

    Prüfe das Ergebnis, bevor du dich festlegst. Klingt die Stimme sauber, lade sie herunter und nutze sie, wo du willst. Im Modus „Dieses Gerät“ hat deine Datei dein Gerät nie verlassen; in der Cloud werden die Dateien nach der Aufbewahrungsdauer gelöscht, die du gewählt hast.

Wofür man es nutzt

Jede Aufgabe, bei der die Worte zählen und sonst nichts an der Aufnahme.

Ton für die Transkription vorbereiten

Untertitelwerkzeuge raten falsch, wenn Musik und Gerede unter dem Dialog liegen. Isoliere zuerst die Sprache und das Transkript stimmt schon beim ersten Durchlauf fast.

Ein Zitat aus einem Clip holen

Du willst einen gesprochenen Satz aus einem Video mit Musik darüber. Extrahiere die Stimme und du kannst das Zitat nutzen, ohne die Musik mitzuschleppen.

Ein Video synchronisieren oder übersetzen

Ein Video neu zu vertonen ist mit einer sauberen Dialogspur zum Timing viel leichter als mit einer fertigen Mischung, in der die Worte untergehen.

Ein Interview retten

Du hast an einer Straße oder in einem vollen Raum aufgenommen. Die Sprache zu trennen liefert etwas Brauchbares, wo ein Rauschfilter sie nur verschmieren würde.

Aus einem Video einen Podcast machen

Mach aus einem gefilmten Gespräch eine Audiofolge, indem du nur die Stimmen nimmst, ohne den Ton des Orts.

Eine Stimme zur Analyse isolieren

Für Forschung, Barrierefreiheit oder Prüfarbeit lässt sich eine saubere Sprachspur leichter untersuchen als eine Mischung, in der alles konkurriert.

Womit es gut zurechtkommt und womit nicht

Funktioniert gut beiSchwierig bei
Einer klaren Stimme über Musik oder RaumgeräuschenMehreren Personen, die durchgehend gleichzeitig reden
Interviews, Vorlesungen und Kamera-AnsprachenGeflüsterter Sprache unter einer lauten Mischung
Gefilmten Gesprächen, die du als Audio willstTon, der schon übersteuert oder stark verzerrt ist
Clips, bei denen du nur die Worte brauchstAufnahmen, bei denen die Effekte auch bleiben sollten
Im Vergleich

Welches unserer drei KI-Audiowerkzeuge du brauchst

Wenn du willstNimm das
Die Musik, ohne die StimmeAI Vocal Remover. Gibt die Tonspur ohne Gesang und Sprache zurück.
Deine Sprache im Video, ohne alle anderen GeräuscheMusic Remover. Dasselbe Modell und dieselbe saubere Stimme, auf der Seite, die fürs Entfernen der Musik aus einem Video gedacht ist.
Nur die gesprochenen Worte, sonst nichtsDieses Werkzeug. Dieselbe saubere Stimme, auf der Seite, die fürs Herauslösen der Sprache aus allem geschrieben ist.
Jeden Ton wegVideo-Ton entfernen, auf der Startseite. Läuft auf diesem Gerät, ohne Upload und ohne Konto.
Ein gleichmäßiges Brummen oder Zischen mindernEin einfacher Rauschfilter reicht. Dafür braucht es keine KI-Trennung.

Die zwei Stimm-Werkzeuge und der Vocal Remover teilen sich eine Engine in zwei Richtungen: auf die Stimme, oder auf alles außer der Stimme. Wähle danach, was du behalten willst, nicht danach, was weg soll, dann ist die Entscheidung meist offensichtlich.

Wolltest du eigentlich die Musik aus einem Video entfernen? Der Music Remover ist dasselbe Modell, gedacht für genau das. Geht es um Rauschen statt Musik? Mit dem Tool Rauschen entfernen entfernst du Rauschen, Brummen und Windgeräusche aus der Aufnahme.

Wenn etwas nicht stimmt

Häufig gestellte Fragen

Ja, in deinem Browser. Wähle „Dieses Gerät“, dann läuft das KI-Modell auf deinem eigenen Computer: kein Konto, kein Upload, keine Credits, und es bleibt kostenlos, egal wie viele Dateien du verarbeitest. Du brauchst einen Browser mit WebGPU und mindestens 8 GB Arbeitsspeicher, pro Datei sind bis zu 15 Minuten Audio möglich, und das Modell wird einmalig beim ersten Durchlauf heruntergeladen. Die Cloud ist für längere Dateien und für Geräte gedacht, die das Modell nicht ausführen können: Jedes neue Konto erhält kostenlos 10 Credits. Das entspricht 10 Minuten mit diesem Tool, ohne Kreditkarte. Die Cloud kostet 1 Credit pro Minute. Jede angefangene Minute zählt, ein Clip von 2:30 Minuten wird also als 3 Minuten abgerechnet.

Zuletzt geprüft im September 2026.