Sprache (STT & TTS)
Pia bringt lokale Sprachverarbeitung mit — ganz ohne Cloud-APIs.
Spracherkennung (STT)
Abschnitt betitelt „Spracherkennung (STT)“Pia erkennt Sprache lokal auf deinem Gerät und bietet zwei Engines zur Auswahl:
- Parakeet (Standard) — mehrsprachig, erkennt die gesprochene Sprache automatisch.
- Whisper — lässt dich eine Modellgröße wählen und so zwischen Geschwindigkeit und Genauigkeit abwägen.
Engine auswählen
Abschnitt betitelt „Engine auswählen“- Öffne Einstellungen → Allgemein → Sprache
- Wähle deine Engine im Dropdown Spracherkennungs-Engine
- Klicke auf Herunterladen, um die nötigen Dateien zu laden — das ist pro Engine nur einmal nötig
Parakeet
Abschnitt betitelt „Parakeet“Parakeet ist die Standard-Engine. Eine Modellgröße musst du nicht wählen — sie funktioniert auf Anhieb und erkennt automatisch, welche Sprache du sprichst. Klicke einfach auf Herunterladen, um sie einzurichten.
Whisper
Abschnitt betitelt „Whisper“Bei Whisper wählst du im Dropdown eine Modellgröße: Tiny, Base, Small, Medium oder Large. Klicke dann auf Herunterladen.
Aufnahme
Abschnitt betitelt „Aufnahme“Sobald deine Engine eingerichtet ist, klicke im Chat auf das Mikrofon-Symbol, um die Aufnahme zu starten.
Sprachausgabe (TTS)
Abschnitt betitelt „Sprachausgabe (TTS)“Pia synthetisiert Sprache direkt in der App, offline, und lädt ihre Stimmen von Pias eigenen Servern. Es gibt keine separate Sprachausgabe-Engine zum Herunterladen, und Netzwerke, die den bisher genutzten Drittanbieter-Modell-Host blockiert hatten, können jetzt wieder eine Stimme installieren.
Stimme herunterladen
Abschnitt betitelt „Stimme herunterladen“- Öffne Einstellungen → Allgemein → Sprache und scrolle zu Sprachausgabe
- Stöbere in der Stimmenliste — jede Karte zeigt Name, Sprache, Geschlecht und Qualität der Stimme
- Suche dir eine Stimme aus und klicke auf Herunterladen
- Warte, bis der Fortschrittsbalken fertig ist
Du kannst so viele Stimmen herunterladen, wie du möchtest. Alba (Englisch GB) ist die Stimme, mit der Pia von Haus aus vorliest.
Stimme auswählen
Abschnitt betitelt „Stimme auswählen“Eine Stimme wird ausgewählt, sobald ihr Download abgeschlossen ist — Sprachausgabe funktioniert also ohne einen zweiten Schritt. Die Karte zeigt dann das Badge Aktiv, um zu bestätigen, welche Stimme gerade verwendet wird.
Es kann immer nur eine Stimme aktiv sein. Zum Wechseln klickst du bei einer anderen heruntergeladenen Stimme auf Auswählen. Ist die gespeicherte Stimme nicht mehr auf diesem Gerät vorhanden, greift Pia auf eine vorhandene zurück, statt stumm zu bleiben.
Eine Stimme entfernen
Abschnitt betitelt „Eine Stimme entfernen“Von diesem Gerät entfernen in der Zeile einer Stimme löscht sie und gibt den belegten Speicherplatz wieder frei. Pia fragt vorher nach — „Die Stimme X von diesem Gerät entfernen? Du kannst sie jederzeit erneut herunterladen.“ — und war es die gerade verwendete Stimme, wechselt Pia zu einer anderen installierten.
Zwei Stimmen werden nicht mehr angeboten
Abschnitt betitelt „Zwei Stimmen werden nicht mehr angeboten“Die Aufnahmen, aus denen Lessac und Ryan entstanden sind, sind nur für Forschung und nicht-kommerzielle Nutzung lizenziert, deshalb bietet Pia sie nicht mehr an. Hattest du eine davon ausgewählt, wechselt Pia zu einer anderen installierten Stimme oder bittet dich, eine auszuwählen.
Vorlesen lassen
Abschnitt betitelt „Vorlesen lassen“Sobald eine Stimme aktiv ist, liest Pia KI-Antworten automatisch vor. Gesprochene Antworten beginnen früher als zuvor, und die kurzen Phrasen, die Pia sagt, während sie nachdenkt, stehen bereit, sobald eine Stimme installiert ist.
Sprachunterhaltung
Abschnitt betitelt „Sprachunterhaltung“Statt zu tippen und zu lesen, kannst du auch einfach reden. Klicke in der Nachrichtenleiste auf die Sprachunterhaltung-Schaltfläche, und Pia öffnet ein Vollbild-Overlay: Es hört zu, denkt nach, antwortet laut und hört danach wieder zu. Dabei verwendet es die Engine und die Stimme, die du weiter oben eingerichtet hast.
So funktioniert ein Durchgang
Abschnitt betitelt „So funktioniert ein Durchgang“- Zuhören — sprich ganz normal. Eine Pegelanzeige zeigt, dass Pia dich hört.
- Nach etwa anderthalb Sekunden Stille endet dein Redebeitrag von selbst — du musst also nichts drücken.
- Verarbeiten — Pia transkribiert, was du gesagt hast, und erarbeitet eine Antwort.
- Sprechen — die Antwort wird laut vorgelesen und erscheint im laufenden Transkript auf dem Bildschirm.
- Danach geht es zurück zum Zuhören, bis du den Sprachmodus verlässt.
Am unteren Rand stehen drei Schaltflächen:
| Schaltfläche | Wann sie erscheint | Was sie macht |
|---|---|---|
| Fertig | Während des Zuhörens | Beendet deinen Redebeitrag sofort, ohne auf die Stille zu warten. |
| Stopp | Während des Sprechens | Bricht die Antwort ab und beginnt sofort wieder mit dem Zuhören. |
| Beenden | Immer | Verlässt den Sprachmodus. |
Alles, was du sagst, und alles, was Pia antwortet, wird dem Chat hinzugefügt, in dem du warst — du kannst später wie bei jeder anderen Unterhaltung darin zurückscrollen. Antworten werden der aktiven Persona zugeordnet, genau wie bei getippten Nachrichten.
Tools im Sprachmodus
Abschnitt betitelt „Tools im Sprachmodus“Wenn du nicht auf den Bildschirm schaust, gibt es keine Möglichkeit, dir eine Aktionskarte anzuzeigen — deshalb ist der Sprachmodus strenger als das Chat-Fenster. Ein Tool, das etwas verändert, läuft nur, wenn es bereits abgedeckt ist:
- du dafür Immer zulassen gewählt hast, oder
- die Agenten-Autonomie aktiv ist und es sich um eines von Pias eigenen Schreibwerkzeugen handelt
Alles andere lehnt Pia hörbar ab und bittet dich, es im Chat-Fenster erneut zu versuchen.
Datenschutz
Abschnitt betitelt „Datenschutz“Die gesamte Sprachverarbeitung läuft lokal auf deinem Gerät. Audio wird niemals an externe Server gesendet.