👂 Whisper
Open-ended Speech-to-Text: Whisper versucht nahezu alles Gesprochene zu transkribieren – nicht nur vorher bekannte Hausbefehle.
Speech-to-Phrase aus Folge 7 ist schnell und sparsam. Jetzt wollen wir mehr: nicht nur bekannte Hausbefehle, sondern frei formulierte Sprache. Dafür kommt Whisper ins Spiel.
Whisper versucht alles Gesprochene in Text umzuwandeln. Piper spricht die Antwort wieder aus – ebenfalls lokal.


Whisper ist nicht automatisch besser. Für „Licht an“ ist Speech-to-Phrase oft die schlauere Lösung. Whisper lohnt sich, wenn du wirklich freier sprechen oder später einen LLM-Assistenten nutzen willst.
Open-ended Speech-to-Text: Whisper versucht nahezu alles Gesprochene zu transkribieren – nicht nur vorher bekannte Hausbefehle.
Bleibt unsere lokale Sprachausgabe. Damit verlässt auch die Antwort für die Spracherzeugung nicht dein Zuhause.
Damit kann Whisper auch Sätze in Text verwandeln, die nicht in einem begrenzten Befehlssatz stecken. Das ist die Grundlage für offenere Assist-Anfragen und später auch für einen LLM-basierten Conversation Agent.
Der Preis dafür ist Rechenzeit.
Auf Home Assistant OS installierst du die Whisper-App und startest sie. Unter Einstellungen → Geräte & Dienste sollte Home Assistant den Dienst über Wyoming automatisch entdecken.
Füge Whisper hinzu. Piper aus Folge 7 kannst du weiterverwenden.
Gehe zu Einstellungen → Sprachassistenten → Assistent hinzufügen. Als Namen nehmen wir zum Beispiel „Felix frei lokal“.
Conversation Agent: Home Assistant. Speech-to-Text: Whisper. Text-to-Speech: Piper. Sprache jeweils auf Deutsch.
Home Assistant nennt als Größenordnung für Whisper auf einem Raspberry Pi 4 etwa 8 Sekunden Verarbeitungszeit für einen Sprachbefehl. Auf einem Intel-NUC-Klasse-System kann die Verarbeitung dagegen unter einer Sekunde liegen.
Deshalb gilt: Auf schwacher Hardware fühlt sich Whisper schnell zäh an. Auf einem kräftigeren Mini-PC kann es sich dagegen fast unmittelbar anfühlen.
Speech-to-Phrase: sehr schnell.
Whisper: möglich, aber bei freier Sprache deutlich langsamer.
Unser Tipp: für reine Haussteuerung Speech-to-Phrase bevorzugen.
Speech-to-Phrase: ohnehin schnell.
Whisper: deutlich interessanter, weil die zusätzliche Rechenleistung die Antwortzeit stark verbessert.
Unser Tipp: sinnvoll für freie Sprache und spätere KI.
Whisper lohnt sich erst, wenn wir ihm Sätze geben, die Speech-to-Phrase nicht elegant abdecken kann. Teste zum Beispiel unterschiedlich formulierte Varianten desselben Wunsches und beobachte, was als Text erkannt wird.
Wichtig: Whisper ist zunächst nur Sprache → Text. Ob Home Assistant anschließend versteht, was du willst, entscheidet der Conversation Agent.
Weil Whisper frei formulierte Sprache in Text verwandeln kann, kann dieser Text anschließend auch an einen LLM-basierten Conversation Agent gehen. Das ist der entscheidende Unterschied zu Speech-to-Phrase: Unbekannte Formulierungen können überhaupt erst bis zur KI gelangen.
Du musst dich nicht endgültig entscheiden. Home Assistant erlaubt mehrere Assist-Pipelines. Du kannst eine schnelle „Felix Haus“-Pipeline mit Speech-to-Phrase und eine flexiblere „Felix frei“-Pipeline mit Whisper parallel betreiben und je nach Sprachgerät oder Einsatzzweck auswählen.
Whisper gibt es in unterschiedlich großen Modellen. Größere Modelle können bessere Erkennung liefern, brauchen aber mehr CPU, RAM und teilweise GPU-Leistung. Außerdem unterscheidet sich die Qualität je nach Sprache. Deshalb testen wir immer mit echten deutschen Alltagssätzen statt nur mit technischen Benchmarks.
Ich möchte Home Assistant vollständig lokal mit Whisper + Piper betreiben. Meine Home-Assistant-Hardware: [CPU / Gerät / RAM] Home Assistant läuft als: [HA OS / VM / anderer Aufbau] Meine wichtigsten Sprachwünsche: [Liste] Bitte bewerte: - ob Speech-to-Phrase für meine Wünsche schon reicht, - ob Whisper sinnvoll ist, - welche Engpässe meine Hardware haben könnte, - wie ich die Reaktionszeit testen kann, - ob zwei getrennte Assist-Pipelines sinnvoll wären. Bevorzuge eine lokale Lösung. Empfiehl keine neue Hardware, wenn meine vorhandene voraussichtlich ausreicht. Erkläre alles anfängertauglich.
Home Assistant führt Whisper als offene lokale Speech-to-Text-Variante und Speech-to-Phrase als fokussierte lokale Variante. Die offizielle Dokumentation nennt für Whisper ungefähr 8 Sekunden Verarbeitungszeit auf einem Raspberry Pi 4 und unter einer Sekunde auf einem Intel NUC. Piper ist die lokale Text-to-Speech-Komponente. Whisper und Piper werden über Wyoming in Home Assistant eingebunden.
Speech-to-Phrase + Piper für schnelle Hausbefehle.
Zurück zu Folge 7 →Ein eigener ESPHome-Sprachsatellit mit Mikrofon, Lautsprecher und Wake Word.
Als Nächstes