WATTZAHLS.DE← Sprach-Serie
FOLGE 8 · ICH WILL FREI SPRECHEN

Whisper + Piper: freie Sprache – komplett lokal

Speech-to-Phrase aus Folge 7 ist schnell und sparsam. Jetzt wollen wir mehr: nicht nur bekannte Hausbefehle, sondern frei formulierte Sprache. Dafür kommt Whisper ins Spiel.

Whisper versucht alles Gesprochene in Text umzuwandeln. Piper spricht die Antwort wieder aus – ebenfalls lokal.

Felix erklärt Whisper und Piper in Home Assistant
Felix denkt über Whisper nach
🐶 Felix-Regel: Mehr Freiheit braucht mehr Rechenleistung.

Whisper ist nicht automatisch besser. Für „Licht an“ ist Speech-to-Phrase oft die schlauere Lösung. Whisper lohnt sich, wenn du wirklich freier sprechen oder später einen LLM-Assistenten nutzen willst.

👂 Whisper

Open-ended Speech-to-Text: Whisper versucht nahezu alles Gesprochene zu transkribieren – nicht nur vorher bekannte Hausbefehle.

🗣️ Piper

Bleibt unsere lokale Sprachausgabe. Damit verlässt auch die Antwort für die Spracherzeugung nicht dein Zuhause.

DER GROSSE UNTERSCHIED

Speech-to-Phrase kennt dein Haus. Whisper hört erst einmal alles.

Damit kann Whisper auch Sätze in Text verwandeln, die nicht in einem begrenzten Befehlssatz stecken. Das ist die Grundlage für offenere Assist-Anfragen und später auch für einen LLM-basierten Conversation Agent.

Der Preis dafür ist Rechenzeit.

SCHRITT 1

Whisper installieren

Auf Home Assistant OS installierst du die Whisper-App und startest sie. Unter Einstellungen → Geräte & Dienste sollte Home Assistant den Dienst über Wyoming automatisch entdecken.

Füge Whisper hinzu. Piper aus Folge 7 kannst du weiterverwenden.

SCHRITT 2

Eine eigene Full-Local-Pipeline anlegen

Gehe zu Einstellungen → Sprachassistenten → Assistent hinzufügen. Als Namen nehmen wir zum Beispiel „Felix frei lokal“.

Conversation Agent: Home Assistant. Speech-to-Text: Whisper. Text-to-Speech: Piper. Sprache jeweils auf Deutsch.

⏱️ Jetzt entscheidet die Hardware

Home Assistant nennt als Größenordnung für Whisper auf einem Raspberry Pi 4 etwa 8 Sekunden Verarbeitungszeit für einen Sprachbefehl. Auf einem Intel-NUC-Klasse-System kann die Verarbeitung dagegen unter einer Sekunde liegen.

Deshalb gilt: Auf schwacher Hardware fühlt sich Whisper schnell zäh an. Auf einem kräftigeren Mini-PC kann es sich dagegen fast unmittelbar anfühlen.

🍓 Raspberry Pi / Green

Speech-to-Phrase: sehr schnell.

Whisper: möglich, aber bei freier Sprache deutlich langsamer.

Unser Tipp: für reine Haussteuerung Speech-to-Phrase bevorzugen.

🖥️ Mini-PC / NUC-Klasse

Speech-to-Phrase: ohnehin schnell.

Whisper: deutlich interessanter, weil die zusätzliche Rechenleistung die Antwortzeit stark verbessert.

Unser Tipp: sinnvoll für freie Sprache und spätere KI.

SCHRITT 3

Nicht nur „Licht an“ testen

Whisper lohnt sich erst, wenn wir ihm Sätze geben, die Speech-to-Phrase nicht elegant abdecken kann. Teste zum Beispiel unterschiedlich formulierte Varianten desselben Wunsches und beobachte, was als Text erkannt wird.

Wichtig: Whisper ist zunächst nur Sprache → Text. Ob Home Assistant anschließend versteht, was du willst, entscheidet der Conversation Agent.

🤖 Genau hier wird KI später interessant

Weil Whisper frei formulierte Sprache in Text verwandeln kann, kann dieser Text anschließend auch an einen LLM-basierten Conversation Agent gehen. Das ist der entscheidende Unterschied zu Speech-to-Phrase: Unbekannte Formulierungen können überhaupt erst bis zur KI gelangen.

💡 Zwei Pipelines statt entweder/oder

Du musst dich nicht endgültig entscheiden. Home Assistant erlaubt mehrere Assist-Pipelines. Du kannst eine schnelle „Felix Haus“-Pipeline mit Speech-to-Phrase und eine flexiblere „Felix frei“-Pipeline mit Whisper parallel betreiben und je nach Sprachgerät oder Einsatzzweck auswählen.

🌍 Sprache und Modellgröße zählen

Whisper gibt es in unterschiedlich großen Modellen. Größere Modelle können bessere Erkennung liefern, brauchen aber mehr CPU, RAM und teilweise GPU-Leistung. Außerdem unterscheidet sich die Qualität je nach Sprache. Deshalb testen wir immer mit echten deutschen Alltagssätzen statt nur mit technischen Benchmarks.

KI-PROMPT ZUM KOPIEREN

Reicht meine Hardware für Whisper?

Ich möchte Home Assistant vollständig lokal mit Whisper + Piper betreiben.

Meine Home-Assistant-Hardware:
[CPU / Gerät / RAM]

Home Assistant läuft als:
[HA OS / VM / anderer Aufbau]

Meine wichtigsten Sprachwünsche:
[Liste]

Bitte bewerte:
- ob Speech-to-Phrase für meine Wünsche schon reicht,
- ob Whisper sinnvoll ist,
- welche Engpässe meine Hardware haben könnte,
- wie ich die Reaktionszeit testen kann,
- ob zwei getrennte Assist-Pipelines sinnvoll wären.

Bevorzuge eine lokale Lösung.
Empfiehl keine neue Hardware, wenn meine vorhandene voraussichtlich ausreicht.
Erkläre alles anfängertauglich.
Technikstand · September 2026

Home Assistant führt Whisper als offene lokale Speech-to-Text-Variante und Speech-to-Phrase als fokussierte lokale Variante. Die offizielle Dokumentation nennt für Whisper ungefähr 8 Sekunden Verarbeitungszeit auf einem Raspberry Pi 4 und unter einer Sekunde auf einem Intel NUC. Piper ist die lokale Text-to-Speech-Komponente. Whisper und Piper werden über Wyoming in Home Assistant eingebunden.

Lokale Assist-Pipeline ↗
Whisper ↗
Piper ↗

← FOLGE 7

Ganz lokal, bitte!

Speech-to-Phrase + Piper für schnelle Hausbefehle.

Zurück zu Folge 7 →
FOLGE 9

Felix baut ein Sprachrohr

Ein eigener ESPHome-Sprachsatellit mit Mikrofon, Lautsprecher und Wake Word.

Als Nächstes