Sie reichen Ihr Telefon an einen Creator weiter, der für seine Demütigungsfähigkeiten bekannt ist. Ich habe beobachtet, wie GPT-Live-1 bei einem einwortigen Zähltest stolperte. Für einen Moment klang die Maschine überzeugend menschlich – und falsch.
Er fragte das Modell, wie viele E’s in „seventeen“ sind – und es antwortete „zwei“
Husk, ein TikToker, der zum Ein-Spieler-Red-Team des Internets geworden ist, flüsterte dem neuen Full-Duplex-Sprachmodell von OpenAI ein Kinderrätsel zu. Der Clip ist drei Sekunden reine diagnostische Grausamkeit: klare Eingabeaufforderung, selbstbewusste Stimme, falsche Antwort. Ich saß da und wartete auf die Genesung, die nie kam.
Had to give the new voice model the classic test pic.twitter.com/fQYHbBRNuL
— Husk (@huskirl) July 8, 2026
OpenAI präsentierte GPT-Live-1 als Schritt in Richtung reibungsloserer Wechselgespräche – Echtzeit-Zuhören und -Sprechen, damit der Assistent mitten im Satz antworten kann. Stattdessen deckte Husks Clip eine brüchige Kante in der öffentlichen Demo auf: Flüssigkeit ohne zuverlässige Wahrheit. Das selbstbewusste „zwei“ des Modells landete wie ein Magier, der einen Münztrick vermasselt.
Die Leute verwenden klassische Benchmarks wieder und das Modell versagt immer wieder
Jeder, der mit Sprachassistenten herumgespielt hat, hat eine kleine Liste von Demütigungen parat: Timer, die nicht eingestellt werden, Buchstabenzählungen, die schiefgehen, einfache Paraphrasen, die schmelzen. Diese Tests sind günstig, replizierbar und verheerend, wenn sie vor der Kamera fehlschlagen.
OpenAI’s brand new voice model vs counting the r’s in strawberry. I really tried to help it along. pic.twitter.com/Pm0RfLyxIA
— Himelstech (@himelstech) July 9, 2026
Himelstech unterzog das Modell dem „Erdbeer“-Test, und es stolperte erneut. Hunderte von Ingenieuren bei OpenAI – einschließlich der Codex-Leute – haben diese Clips wahrscheinlich in Gruppenchats wiedergegeben. Jason Liu, ein Developer Experience Engineer, der mit OpenAI Codex verbunden ist, repostete Husk’s Video und schrieb ein einziges, ehrliches Wort: FUCK. Selbst Sam Altman hat diese Inhalte in seinem Feed aufscheinen sehen; diese Clips erreichen die Spitze der Unternehmenshierarchie schneller als jeder interne Fehlerbericht.
Full-Duplex fügte eine neue Belästigung hinzu: Geplapper, während Sie sprechen
Die Aktivierung von Bestätigungen mitten im Satz sollte Gespräche lebendiger machen. Stattdessen berichten Benutzer von einem unterbrechenden Assistenten, der immer wieder „mhm“ und „yeah“ summt, auch wenn man es nicht möchte.
Diese zusätzliche Ebene der Signalproduktion lässt das System aufmerksam erscheinen, bis es aufdringlich wird – wie ein Haarriss in einem Damm, zuerst klein und dann unmöglich zu ignorieren. Auf X scherzen die Leute, das Modell sei zu einer unterbrechenden Maschine geworden, einem kleinen, aber hartnäckigen Fehler, der die Geduld weitaus schneller strapaziert als eine einzelne falsche Antwort.
Warum hat GPT-Live-1 einfache Zählaufgaben nicht bewältigt?
Kurze Antwort: Das Modell optimiert für konversationellen Fluss und probabilistischen Text, nicht für die symbolische Gewissheit, die ein Mensch auf Buchstaben-Zählprobleme anwendet. Sie und ich erwarten eine sofortige, deterministische Antwort für seventeen; das Modell jongliert mit Phonetik, Tokenisierungsfehlern und Sicherheitsebenen, die seine Ausgabe von präzisen arithmetischen oder zeichenbasierten Zählungen ablenken können.
Können diese Probleme behoben werden, ohne das Produkt zurückzuziehen?
Ja, aber die Behebungen sind unübersichtlich. Ingenieure bei OpenAI werden wahrscheinlich das Token-Handling reparieren, den Sprachstapel optimieren und gezielte Tests hinzufügen, die diese Mikrofehler erkennen. Sie haben die Telemetrie – ChatGPT und die GPT-APIs speisen bereits Nutzungsmetriken zurück an das Unternehmen –, aber die Spannung liegt zwischen Produkt-Kadenz und öffentlicher Wahrnehmung. Jeder virale Clip erhöht den Druck von Aufsichtsräten, Entwicklern und Kunden, die Zuverlässigkeit über Slack, TikTok und X hinweg bezahlen.
Die Leute nutzen Tests mit geringem Aufwand als Signale mit hoher Sichtbarkeit
Diese drei Sekunden langen Mikro-Fehler verursachen mehr Reputationsschäden als ein langer technischer Post-Mortem. Ein Creator postet einen kurzen Clip, er erreicht Millionen, und plötzlich wandelt sich die Erzählung von „Fortschritt“ in eine Erzählung über Fragilität.
Als jemand, der beobachtet, wie Modelle ausgeliefert werden und dann auf das öffentliche Echo treffen, bemerke ich einen vorhersehbaren Bogen: Demos, virale Stresstests, PR-Versuche, die Dinge herunterzuspielen, und dann ein Sprint der technischen Triage. Die neuen Fähigkeiten des Sprachmodells – Live-Übersetzung und Antworten mitten im Satz – sind echte Fortschritte und werden für Barrierefreiheit und Agenten wichtig sein. Aber wenn grundlegende Aufgaben vor der Kamera fehlschlagen, schwindet das Vertrauen schneller, als sich Funktionen ansammeln.
OpenAI hat Optionen: Veröffentlichungen drosseln, Schutzvorrichtungen hinzufügen oder auf Transparenz setzen und Testartefakte zeigen. Sie können ihre Kompromisse in den Reaktionen der Entwickler-Community und den direkteren Reaktionen von Creators wie Husk sehen. Die Frage ist nicht, ob die Technologie beeindruckend ist; es ist, ob sie die grundlegenden Erwartungen des alltäglichen Austauschs erfüllt.
Wenn Sie ein Produkt auf Basis von GPT-Live-1 entwickeln würden – auf ChatGPT-Sprachintegrationen in Apps oder auf einem TikTok-Bot –, müssten Sie sich fragen, welches Risiko Sie eingehen können: Ein Assistent, der gut klingt, aber gelegentlich lügt, oder ein leiseres Werkzeug, das korrekt antwortet. Was würden Sie wählen?
Unterstützen Sie unsere Arbeit ❤️
Wenn Ihnen dieser Artikel gefallen hat, können Sie uns mit einem Trinkgeld unterstützen, damit wir weiterhin großartige Inhalte veröffentlichen können.


























