Ptichi wird als Desktop-System für gezieltes Sprechtraining entwickelt. Nicht als Test, der eine Person auf einen einzigen Score reduziert, und nicht als endloser KI-Dialog, der jeden Satz kommentiert. Im Zentrum steht eine kontrollierte Veränderung zwischen zwei Versuchen.
Wie Ptichi funktioniert: die Technologie hinter dem Sprechtraining
So bauen wir Ptichi: Programme, vorbereitete Übungstexte, zwei vergleichbare Versuche, lokale Aufnahme, begrenztes Feedback, Retests und Lernverlauf.
Man wählt eine konkrete Aufgabe, spricht, hört den ersten Versuch an, verändert eine Sache, spricht erneut und vergleicht. Danach wird dieselbe Fähigkeit mit anderem Wortlaut ausprobiert und später noch einmal getestet.
Kurz gesagt:
Aufgabe → Take A → anhören → ein Hinweis → Take B → anderer Wortlaut → späterer Retest
Von außen soll dieser Ablauf einfach wirken. Darunter bauen wir mehrere technische Schichten, damit der Vergleich tatsächlich aussagekräftig bleibt.
Der aktuelle Status ist wichtig: Auf Ptichi.site gibt es bereits kostenlose Übungen und textbasierte Praxis. Die Desktop-App für macOS auf Apple Silicon und Windows 11 x64 ist in Entwicklung; verifizierte öffentliche Installer gibt es noch nicht. Text-Following und einige automatische Messungen sind geplante oder experimentelle Richtungen, keine veröffentlichten Funktionen.
Warum Analyse allein nicht reicht
Sprache lässt sich sehr leicht in ein Dashboard verwandeln.
Software kann Pausenlänge, Sprechtempo, Energie, Tonhöhenbewegung, Wortzahlen und viele weitere Signale messen. Die schwierigere Frage kommt danach: Was soll die Person jetzt konkret verändern?
Auch eine präzise Zahl kann die falsche Frage beantworten.
153 Wörter pro Minute sagen noch nicht, ob dieses Tempo für diese Erklärung passend war. Eine Tonhöhenkurve beweist nicht automatisch, dass ein beabsichtigter Kontrast beim Zuhörer ankam. Ein Modell mit einem „Confidence Score“ macht Selbstsicherheit nicht zu einer direkt messbaren Eigenschaft der Stimme.
Ptichi beginnt deshalb mit einer Übungsaufgabe, nicht mit einer Kennzahl.
Eine Aufgabe kann zum Beispiel sein, eine wichtige Bedingung am Satzende hörbar zu lassen, die Grenze zwischen zwei Gedanken klar zu machen, beim Planen eine Pause statt Füllwörter zu nutzen oder einen technischen Zusammenhang so zu erklären, dass seine Struktur nachvollziehbar bleibt.
Eine Messung ist nur dann nützlich, wenn sie eine solche begrenzte Frage unterstützt.
Der Kern: der Listening Loop
Der Arbeitsname für den zentralen Ablauf ist Listening Loop.
Statt „etwas aufnehmen und einen Bericht erhalten“ soll Ptichi durch eine feste Trainingsfolge führen.
Zuerst wählen, was trainiert wird
Ein leerer Record-Button ist kein guter Standardzustand. Wer an Interviewantworten, Erklärungen, Pausen oder Satzenden arbeiten will, sollte sofort eine sinnvolle Aufgabe sehen.
Darum organisieren wir Ptichi um Programme und eine Übungsbibliothek.
Ein Programm ist mehr als ein Ordner mit Übungen. Es legt fest, was jetzt trainiert wird, warum es für den Zuhörer relevant ist, welche Veränderung gesucht wird und welcher nächste Schritt sinnvoll ist.
Vorbereitetes Material statt zufälliger Hinweise
Wir nennen vorbereitete Übungstexte practice scores.
Das ist kein Skript mit einer einzigen richtigen Darbietung. Ein Text kann eine Gedankengrenze markieren, ein Kontrastwort hervorheben oder eine Bedingung sichtbar machen, die beim Sprechen nicht verschwinden soll.
Zum Beispiel:
Wir können am Freitag starten / aber erst nach dem Sicherheitscheck.
Der Schrägstrich bedeutet nicht „exakt 430 Millisekunden pausieren“. Er markiert die Trainingsfrage: bleibt hörbar, dass der zweite Teil den ersten einschränkt?
Vorbereitetes Material macht Übungen reproduzierbar. Wir wissen, welche Textversion verwendet wurde, welches Ziel galt und welcher Hinweis zu diesem Versuch gehörte.
Aufnahme prüfen, bevor Analyse vertraut wird
Dass ein Audiostream startet, beweist noch keine brauchbare Aufnahme.
Ein ausgewähltes Mikrofon kann ein zu schwaches Signal liefern. Ein USB-Gerät kann während des Takes verschwinden. Betriebssystem oder Treiber können Signalverarbeitung anwenden. Mikrofonmodi können sich ändern.
Dafür entsteht der Microphone Passport.
Er soll kein Mikrofon benoten. Er soll engere Fragen beantworten: Gibt es ein brauchbares Sprachsignal? Welches Gerät und welcher Aufnahmeweg wurden verwendet? Haben sich wichtige Bedingungen zwischen den Takes verändert? Kann eine bestimmte Messung unter diesen Bedingungen überhaupt verwendet werden?
Wenn sich der Aufnahmezustand ändert, darf das System nicht so tun, als seien Take A und Take B vollständig vergleichbar.
Take A gehört zuerst dem Menschen
Wir wollen nicht, dass KI immer die erste Stimme im Raum ist.
Nach Take A soll man sich selbst anhören können, bevor die Hauptkorrektur erscheint. Dadurch lernt die Person, Merkmale selbst wahrzunehmen, statt nur auf eine Bewertung zu warten.
Danach kann Automatisierung helfen, aber begrenzt.
Nicht:
Hier sind 17 Dinge, die du verbessern musst.
Sondern eher:
Achte auf das Ende der Kernaussage. Nimm noch einmal auf und halte den Rest möglichst ähnlich.
Der Arbeitsbegriff dafür ist Intervention Card: eine Korrektur oder Hörfrage, ihre Begründung, ihre Grenze und eine Transferaufgabe.
Warum eine Veränderung oft besser ist als zwanzig
Beim Sprechen verändern sich gleichzeitig Atmung, Artikulation, Tempo, Pausen, Lautstärke, Tonhöhe, Rhythmus, Satzstruktur, Wortwahl und emotionale Wirkung.
Wenn alles auf einmal geändert wird, verliert der Vergleich seinen Wert.
Ptichi versucht deshalb, ein kleines Experiment zu erhalten:
Was passiert, wenn wir nur X verändern?
Menschliche Sprache besteht natürlich nicht aus unabhängigen Reglern. Für Training ist es trotzdem nützlich, die Zahl der veränderten Variablen so weit wie vernünftig zu begrenzen.
Take B ist deshalb kein zweiter Versuch, einfach „besser zu klingen“. Er testet eine bestimmte Intervention.
Take B ist noch kein Lernnachweis
Ein guter zweiter Versuch kann nur zeigen, dass der Hinweis kurzfristig kopiert wurde.
Darum folgt auf den A/B-Vergleich Transfer: dieselbe Fähigkeit mit anderem Wortlaut.
Wenn eine Gedankengrenze trainiert wird, ändert sich der Satz. Bei Interviewtraining ändert sich die Frage oder das Beispiel. Bei einem Satzende wird die Technik auf eine andere Aussage übertragen.
Später kommt ein separater Retest. Die Fähigkeit wird nach einer Pause erneut geprüft.
Fortschritt ist nicht nur eine Zahl
Ptichi soll mehrere Zustände auseinanderhalten:
- Completion — die Übung wurde tatsächlich durchgeführt.
- Controlled change — die gewünschte Veränderung erschien im geübten Take.
- Transfer — sie blieb bei anderem Wortlaut oder Kontext erhalten.
- Retention — sie erschien bei einem späteren Retest erneut.
Das sind unterschiedliche Aussagen.
Abgeschlossene Lektionen beweisen keine veränderte Sprache. Ein guter Take B beweist keinen Transfer. Transfer in einer Sitzung beweist keine Retention.
Der geplante Learning State soll deshalb speichern, was trainiert wurde, was reproduzierbar war, was noch unbekannt ist und was als Nächstes sinnvoll wäre.
Automatische Analyse soll modular bleiben
Unterschiedliche Prüfungen brauchen unterschiedliche Vertrauensgrenzen.
Für eine Aufgabe reicht vielleicht Boundary Timing. Eine andere kann ASR nutzen, um einem vorbereiteten Text zu folgen. Bei einer weiteren ist ein Energie-Kontrast interessant. Manchmal ist eine automatische Schlussfolgerung schlicht nicht zuverlässig genug; dann sind Playback und eine gute Hörfrage die bessere Funktion.
Darum gilt ein capability-spezifisches Vertrauensmodell. Nicht „Vertrauen wir dem Ptichi-Analyzer?“, sondern: „Vertrauen wir dieser Fähigkeit, in dieser Sprache, unter diesen Aufnahmebedingungen, für genau diese Aussage?“
Wenn eine Korrektur nicht ausreichend gestützt werden kann, sollte die Software ihre Grenze zeigen.
Real-time-Unterstützung soll ruhig bleiben
Wir untersuchen eine Real-time-Schicht, aber bewusst mit kleiner Rolle.
Während eines Takes soll das System zuerst zuverlässig aufnehmen, den Capture-Status zeigen, optional dem vorbereiteten Text folgen und mit Wiederholungen, ausgelassenen Zeilen oder Rücksprüngen umgehen. Wenn die Position verloren geht, soll es nicht weiter raten.
Wir wollen nicht, dass jemand spricht und gleichzeitig fünf laufende Bewertungen beobachtet.
Die wichtigste Coaching-Rückmeldung kommt deshalb nach dem Take.
Warum local-first wichtig ist
Sprechtraining enthält oft Arbeitsdetails, Namen, unfertige Gedanken, Interviewantworten und private Entwürfe.
Die Desktop-App wird so konzipiert, dass Aufnahmen und Kernanalyse standardmäßig auf dem Gerät bleiben.
Das ist nicht nur eine Datenschutzentscheidung. Lokale Historie wird dadurch ein normaler Teil des Trainings. Aufnahmen lassen sich schnell erneut anhören und vergleichen. Diagnostik kann metadata-first bleiben, statt automatisch Audio oder Transkripte an einen Supportfall anzuhängen.
Die aktuelle Website Ptichi.site selbst nimmt kein Audio auf und fordert keinen Mikrofonzugriff an. Bis zur öffentlichen Desktop-Veröffentlichung nutzt man für Aufnahmeübungen einen eigenen Recorder.
Zuverlässigkeit ist Teil der Produkttechnologie
Ein Speech-Produkt kann gut aussehen, lange bevor es eigene Fehler von Fehlern des Sprechers unterscheiden kann.
Darum trennen wir vier Fragen:
Funktioniert die Software korrekt?
Stimmt eine Messung mit unabhängig geprüftem Audio überein?
Läuft das System zuverlässig auf dem echten Zielrechner und Gerät?
Hilft das Trainingsverfahren einem Menschen?
Ein bestandenes Kriterium beantwortet die anderen nicht.
Unit Tests beweisen keine Messqualität. Ein guter Algorithmus auf einer vorbereiteten Datei beweist nicht, dass ein USB-Mikrofon Suspend/Resume korrekt übersteht. Eine zuverlässige Aufnahme beweist nicht, dass eine Übung Lernen erzeugt.
Wenn Evidenz fehlt, sollte Ptichi das offen sagen.
Was die Person am Ende sehen soll
Die technische Tiefe soll nicht zur Bedienaufgabe werden.
Die erste Produktschicht bleibt bewusst klein:
Home — was sollte ich als Nächstes trainieren?
Train — Programme, Bibliothek und aktuelle Übung.
Recordings — eigene Takes, Playback und Vergleich.
Progress — was hat sich verändert, was ist noch unklar und woran lohnt sich die nächste Übung?
Settings — Werkzeug, nicht Mittelpunkt des Produkts.
Messdetails, Provenance und technische Grenzen bleiben zugänglich, aber sie sollen nicht der erste Bildschirm sein.
Was heute verfügbar ist und was wir entwickeln
Heute auf Ptichi.site
- kostenlose Übungen und Guides;
- textbasierte Praxis ohne Aufnahme auf der Website;
- Material zum Selbsthören;
- ein englischer Texthelfer für die Vorbereitung einer Nachricht;
- veröffentlichte Übungstexte und Erklärungen von Techniken.
In Entwicklung
- Desktop-App für macOS Apple Silicon und Windows 11 x64;
- lokale Aufnahme und Wiedergabe;
- Take-A-/Take-B-Vergleich;
- Programme und Übungsbibliothek;
- Aufnahmehistorie und Learning State;
- Microphone Passport und klarere Capture-Readiness.
Geplant oder experimentell
- robustes Folgen vorbereiteter Texte während des Sprechens;
- begrenzte automatische Beobachtungen für einzelne Fähigkeiten;
- Transfer und spätere Retests als feste Produktschritte;
- bessere Authoring-Werkzeuge für Übungsmaterial;
- langfristige Historie einzelner Sprechfähigkeiten.
Diese Punkte sind Entwicklungsrichtungen, keine Aussage über bereits veröffentlichte Funktionen.
Wo KI hineinpasst
KI ist für uns eine Komponente, nicht die Produktidee.
Sie kann Sprache erkennen, einen Take einem vorbereiteten Text zuordnen, eine relevante Passage finden, Markup vorschlagen oder eine begrenzte semantische Beobachtung liefern.
Die Produktfrage bleibt aber:
Was soll die Person im nächsten Versuch verändern, und wie erkennen wir, ob genau diese Sache verändert wurde?
Wenn KI diese Frage nicht zuverlässig unterstützt, macht allein ihre Anwesenheit das Training nicht besser.
Die dauerhafte Stärke von Ptichi soll aus der Verbindung entstehen:
Programm + vorbereitetes Material + zuverlässige Aufnahme + begrenztes Feedback + Vergleich + Transfer + Historie
Modelle werden sich ändern. Ein guter Trainingsablauf und die eigene Entwicklungsgeschichte sollten Modellwechsel überleben.
Welches Projekt Ptichi werden soll
Ptichi ist langfristig nicht einfach ein Voice Recorder.
Wir bauen eine Werkbank für deliberate speech practice.
Menschen kommen mit unterschiedlichen Zielen: Interview, Assessment, Präsentation, technische Erklärung, berufliche Geschichte, schwierige Frage, Zweitsprache oder Mikrofonarbeit.
Statt „verbessere deine Stimme“ soll das System ein Ziel in kleine, prüfbare Trainingsprobleme zerlegen.
Das Endziel ist bewusst etwas paradox: Je besser das Training funktioniert, desto weniger sollte man Ptichi brauchen.
Zuerst hilft Ptichi, eine Veränderung wahrzunehmen. Dann sie zu wiederholen. Danach wird der Kontext schwieriger, Hilfen werden entfernt und die Fähigkeit wird später noch einmal geprüft.
Das Ziel ist nicht, Ptichi gut bedienen zu können. Das Ziel ist, dass die Sprechfähigkeit bleibt, wenn Ptichi geschlossen ist.
Den Grundgedanken schon heute testen
Für den einfachsten Ptichi-Zyklus reicht jeder Recorder.
- Take A aufnehmen.
- Nur eine Sache wählen: Pause, Satzende, Kontrast oder Gedankengrenze.
- Take B aufnehmen, ohne bewusst alles andere zu korrigieren.
- Nur das gewählte Merkmal vergleichen.
- Einen neuen Satz mit derselben Technik sprechen.
Wenn die Veränderung bei Schritt fünf verschwindet, ist das nützliche Information. Es ist kein nicht bestandener Test. Es zeigt die aktuelle Grenze der Fähigkeit.
Genau diese Grenze soll Ptichi trainierbar machen.
