AI Voice Isolator: saubere Sprache aus einem Video extrahieren
Füge ein Video oder eine Aufnahme hinzu. Die KI holt die Sprache als eigene, saubere Tonspur heraus. Musik, Raumklang, Verkehr und Stimmengewirr bleiben zurück, und du bekommst das Video mit unverändertem Bild. Auf einem Computer läuft das kostenlos in deinem Browser, auf diesem Gerät: Es wird nichts hochgeladen und du brauchst kein Konto. Für längere Dateien oder einen Browser, der das Modell nicht ausführen kann, wechsle in die Cloud: Deine ersten 10 Credits sind kostenlos. Das entspricht 10 Minuten mit diesem Tool.
Video- oder Audiodatei hier ablegen oder auf deinem Gerät auswählen
MP4, MOV, MKV, WebM, AVI, MP3, WAV, M4A und mehr
Bis zu 20 Dateien auf einmal
Dieser Browser kann das KI-Modell nicht selbst ausführen: Er braucht WebGPU und mindestens 8 GB Arbeitsspeicher. Wechsle in die Cloud, um diese Datei zu verarbeiten.
Kostenlos auf diesem Gerät, wenn das Modell darauf laufen kann. In der Cloud bestimmst du, wie lange das Ergebnis aufbewahrt wird.
Größere Dateien? Verarbeite sie in der Cloud
Dieses Tool läuft kostenlos auf diesem Gerät. Für eine Datei über dem Gerätelimit oder eine lange Aufnahme läuft dasselbe Tool auf unseren Servern: bis zu 5 GB pro Datei und 6 Stunden Audio, schneller, und deine Dateien bleiben bis zu 7 Tage gespeichert, mit jedem Credit-Paket oder Tarif so lange, wie du möchtest. Ab 1 Credit pro Minute, mit 10 Credits kostenlos, sobald du ein Konto erstellst.
So extrahierst du die Stimme aus einem Video
Füge die Datei hinzu. Die KI trennt die Sprache von allem anderen in der Mischung. Auf diesem Gerät läuft das kostenlos in deinem Browser, ohne Upload. Zurück bekommst du nur die gesprochene Stimme, sauber genug zum Transkribieren, Synchronisieren oder für einen neuen Schnitt.
- Füge ein MP4, MOV, MKV oder WebM hinzu, oder ein MP3 oder WAV.
- Die KI holt die Sprache als eigene Spur heraus.
- Hör sie dir an und lade die isolierte Stimme herunter.
Warum dieses Tool statt des Music Removers
Sie behält die Sprache und sonst nichts: Musik, Atmosphäre und Effekte kommen alle heraus. Der Music Remover nutzt dasselbe Modell; diese Seite ist für den Fall, dass die Stimme das Einzige ist, was du weiterverwendest.
Nur Sprache, sonst nichts
Musik, Effekte, Atmosphäre und Raumklang kommen alle heraus, du bekommst also nur die Sprache: im Video, das du hinzugefügt hast, oder als Audiodatei, wenn du Audio hinzugefügt hast.
Für Transkription gemacht
Automatische Transkription und Untertitel scheitern an einer lauten Mischung. Ihnen zuerst eine saubere Sprachspur zu geben, ist der größte Genauigkeitsgewinn überhaupt.
Video rein, Video raus
Füge ein Video hinzu und du bekommst ein Video zurück, das Bild bleibt unangetastet. Die meisten Stimmenextraktoren geben dir eine nackte Audiodatei und überlassen dir den Rest.
Bereit für Synchronisation
Eine saubere Dialogspur ist der Ausgangspunkt zum Übersetzen, Neuvertonen oder Ersetzen einer Stimme, ohne dass die alte Mischung dagegenhält.
Rettet schlechten Drehton
Ein Vortrag in einem vollen Saal oder ein Interview an einer Straße wird brauchbar, wenn die Sprache getrennt statt gefiltert wird.
Kostenlos in deinem Browser
Auf diesem Gerät läuft das KI-Modell auf deinem eigenen Computer und kostet deshalb nichts: kein Konto, kein Upload, keine Credits, beliebig viele Dateien. Für lange Dateien gibt es die Cloud: Jedes neue Konto startet mit 10 Credits kostenlos. Das entspricht 10 Minuten mit diesem Tool. Keine Kreditkarte nötig.
So funktioniert es, Schritt für Schritt
Vier Schritte von einer lauten Mischung zu einer sauberen Sprachspur.
Datei hinzufügen
Zieh ein Video oder eine Audiodatei in das Feld oben, oder klicke zum Auswählen. MP4, MOV, MKV und WebM funktionieren, ebenso MP3, WAV und M4A.
„Dieses Gerät“ oder Cloud wählen
Auf diesem Gerät läuft die KI in deinem Browser: kostenlos, ohne Konto, ohne Upload, in einem Browser mit WebGPU und mindestens 8 GB Arbeitsspeicher, für bis zu 15 Minuten Audio pro Datei. In der Cloud läuft sie für längere Dateien auf unseren Servern: Melde dich an, deine ersten 10 Credits sind kostenlos.
Das Modell isoliert die Sprache
Es hört sich die ganze Spur an und trennt die gesprochene Stimme von Musik, Effekten und allem anderen in der Mischung.
Anhören, dann herunterladen
Prüfe das Ergebnis, bevor du dich festlegst. Klingt die Stimme sauber, lade sie herunter und nutze sie, wo du willst. Im Modus „Dieses Gerät“ hat deine Datei dein Gerät nie verlassen; in der Cloud werden die Dateien nach der Aufbewahrungsdauer gelöscht, die du gewählt hast.
Wofür man es nutzt
Jede Aufgabe, bei der die Worte zählen und sonst nichts an der Aufnahme.
Ton für die Transkription vorbereiten
Untertitelwerkzeuge raten falsch, wenn Musik und Gerede unter dem Dialog liegen. Isoliere zuerst die Sprache und das Transkript stimmt schon beim ersten Durchlauf fast.
Ein Zitat aus einem Clip holen
Du willst einen gesprochenen Satz aus einem Video mit Musik darüber. Extrahiere die Stimme und du kannst das Zitat nutzen, ohne die Musik mitzuschleppen.
Ein Video synchronisieren oder übersetzen
Ein Video neu zu vertonen ist mit einer sauberen Dialogspur zum Timing viel leichter als mit einer fertigen Mischung, in der die Worte untergehen.
Ein Interview retten
Du hast an einer Straße oder in einem vollen Raum aufgenommen. Die Sprache zu trennen liefert etwas Brauchbares, wo ein Rauschfilter sie nur verschmieren würde.
Aus einem Video einen Podcast machen
Mach aus einem gefilmten Gespräch eine Audiofolge, indem du nur die Stimmen nimmst, ohne den Ton des Orts.
Eine Stimme zur Analyse isolieren
Für Forschung, Barrierefreiheit oder Prüfarbeit lässt sich eine saubere Sprachspur leichter untersuchen als eine Mischung, in der alles konkurriert.
Womit es gut zurechtkommt und womit nicht
| Funktioniert gut bei | Schwierig bei |
|---|---|
| Einer klaren Stimme über Musik oder Raumgeräuschen | Mehreren Personen, die durchgehend gleichzeitig reden |
| Interviews, Vorlesungen und Kamera-Ansprachen | Geflüsterter Sprache unter einer lauten Mischung |
| Gefilmten Gesprächen, die du als Audio willst | Ton, der schon übersteuert oder stark verzerrt ist |
| Clips, bei denen du nur die Worte brauchst | Aufnahmen, bei denen die Effekte auch bleiben sollten |
Welches unserer drei KI-Audiowerkzeuge du brauchst
| Wenn du willst | Nimm das |
|---|---|
| Die Musik, ohne die Stimme | AI Vocal Remover. Gibt die Tonspur ohne Gesang und Sprache zurück. |
| Deine Sprache im Video, ohne alle anderen Geräusche | Music Remover. Dasselbe Modell und dieselbe saubere Stimme, auf der Seite, die fürs Entfernen der Musik aus einem Video gedacht ist. |
| Nur die gesprochenen Worte, sonst nichts | Dieses Werkzeug. Dieselbe saubere Stimme, auf der Seite, die fürs Herauslösen der Sprache aus allem geschrieben ist. |
| Jeden Ton weg | Video-Ton entfernen, auf der Startseite. Läuft auf diesem Gerät, ohne Upload und ohne Konto. |
| Ein gleichmäßiges Brummen oder Zischen mindern | Ein einfacher Rauschfilter reicht. Dafür braucht es keine KI-Trennung. |
Die zwei Stimm-Werkzeuge und der Vocal Remover teilen sich eine Engine in zwei Richtungen: auf die Stimme, oder auf alles außer der Stimme. Wähle danach, was du behalten willst, nicht danach, was weg soll, dann ist die Entscheidung meist offensichtlich.
Wolltest du eigentlich die Musik aus einem Video entfernen? Der Music Remover ist dasselbe Modell, gedacht für genau das. Geht es um Rauschen statt Musik? Mit dem Tool Rauschen entfernen entfernst du Rauschen, Brummen und Windgeräusche aus der Aufnahme.
Wenn etwas nicht stimmt
Häufig gestellte Fragen
Ja, in deinem Browser. Wähle „Dieses Gerät“, dann läuft das KI-Modell auf deinem eigenen Computer: kein Konto, kein Upload, keine Credits, und es bleibt kostenlos, egal wie viele Dateien du verarbeitest. Du brauchst einen Browser mit WebGPU und mindestens 8 GB Arbeitsspeicher, pro Datei sind bis zu 15 Minuten Audio möglich, und das Modell wird einmalig beim ersten Durchlauf heruntergeladen. Die Cloud ist für längere Dateien und für Geräte gedacht, die das Modell nicht ausführen können: Jedes neue Konto erhält kostenlos 10 Credits. Das entspricht 10 Minuten mit diesem Tool, ohne Kreditkarte. Die Cloud kostet 1 Credit pro Minute. Jede angefangene Minute zählt, ein Clip von 2:30 Minuten wird also als 3 Minuten abgerechnet.
Zuletzt geprüft im September 2026.
Weitere Tools
Video zu MP3
Zieh die Tonspur aus jedem Video und speichere sie als MP3. Nichts verlässt deinen Browser.
Tool öffnenVideo-Ton entfernen
Entferne jede Audiospur aus einem Video. Kostenlos, im Browser, ohne Upload.
Tool öffnenVideo komprimieren
Verkleinere ein Video, bis es unter die Limits von Discord, WhatsApp oder E-Mail passt. Kostenlos auf diesem Gerät, in deinem Browser.
Tool öffnen