ChatGPTs neuer fortschrittlicher Sprachmodus: Was Sie wissen müssen

OpenAI hat mit der Einführung der Alphaversion des fortschrittlichen Sprachmodus von ChatGPT für eine ausgewählte Gruppe von ChatGPT Plus-Nutzern begonnen. Diese neue Funktion bietet hyperrealistische Audioantworten und bedeutende Fortschritte in den Sprachfähigkeiten der KI. Während die Sky-Stimme aus der Demo nicht mehr verfügbar ist, können Benutzer nun vier voreingestellte Stimmen erleben. OpenAI hat strenge Maßnahmen ergriffen, um Missbrauch zu verhindern und eine ethische Nutzung dieser Technologie zu gewährleisten. Zukünftige Updates werden Funktionen für Video- und Bildschirmfreigabe umfassen.
OpenAI hat am Dienstag mit der Einführung des fortschrittlichen Sprachmodus von ChatGPT begonnen und gibt den Nutzern erstmals Zugriff auf die hyperrealistischen Audioantworten von GPT-4o. Die Alphaversion wird heute einer kleinen Gruppe von ChatGPT Plus-Nutzern zur Verfügung stehen, und OpenAI sagt, dass die Funktion im Herbst 2024 schrittweise für alle Plus-Nutzer eingeführt wird.
Als OpenAI im Mai erstmals die Stimme von GPT-4o präsentierte, schockierte die Funktion das Publikum mit schnellen Antworten und einer unheimlichen Ähnlichkeit mit einer echten menschlichen Stimme – einer ganz bestimmten. Die Stimme, Sky, ähnelte der von Scarlett Johansson, der Schauspielerin hinter der künstlichen Assistentin im Film „Her“. Kurz nach der Demo von OpenAI sagte Johansson, sie habe mehrere Anfragen von CEO Sam Altman abgelehnt, ihre Stimme zu verwenden, und nachdem sie die Demo von GPT-4o gesehen hatte, engagierte sie einen Rechtsbeistand, um ihr Bild zu verteidigen. OpenAI bestritt die Verwendung von Johanssons Stimme, entfernte jedoch später die in der Demo gezeigte Stimme. Im Juni sagte OpenAI, dass die Veröffentlichung des fortschrittlichen Sprachmodus verschoben werden würde, um die Sicherheitsmaßnahmen zu verbessern.
Ein Monat später ist das Warten vorbei (irgendwie). OpenAI sagt, dass die in seinem Frühlingsupdate vorgestellten Video- und Bildschirmfreigabefunktionen nicht Teil dieser Alpha-Version sein werden und zu einem „späteren Zeitpunkt“ eingeführt werden. Vorerst bleibt die GPT-4o-Demo, die alle beeindruckt hat, nur eine Demo, aber einige Premium-Nutzer haben nun Zugriff auf die dort gezeigte Sprachfunktion von ChatGPT.
Funktionen und Fähigkeiten
Vielleicht haben Sie den derzeit verfügbaren Sprachmodus von ChatGPT bereits ausprobiert, aber OpenAI sagt, dass der fortschrittliche Sprachmodus anders ist. Die alte Lösung von ChatGPT für Audio verwendete drei separate Modelle: eines, um Ihre Stimme in Text umzuwandeln, GPT-4 zur Verarbeitung Ihrer Eingabe und ein drittes, um den Text von ChatGPT in Sprache umzuwandeln. Aber GPT-4o ist multimodal und kann diese Aufgaben ohne die Hilfe von Hilfsmodellen verarbeiten, was zu erheblich geringeren Latenzzeiten führt. OpenAI behauptet auch, dass GPT-4o emotionale Intonationen in Ihrer Stimme erkennen kann, einschließlich Traurigkeit, Aufregung oder Gesang.
In diesem Pilotprojekt werden ChatGPT Plus-Nutzer aus erster Hand erleben, wie hyperrealistisch der fortschrittliche Sprachmodus von OpenAI wirklich ist. TechCrunch konnte die Funktion vor der Veröffentlichung dieses Artikels nicht testen, wird sie aber überprüfen, sobald sie Zugriff darauf haben.
Rechtliche und ethische Überlegungen
OpenAI sagt, dass es die neue Stimme von ChatGPT schrittweise einführt, um die Nutzung genau zu überwachen. Personen in der Alpha-Gruppe erhalten eine Benachrichtigung in der ChatGPT-App, gefolgt von einer E-Mail mit Anweisungen zur Verwendung. In den Monaten seit der Demo von OpenAI hat das Unternehmen die Sprachfähigkeiten von GPT-4o mit mehr als 100 externen Red-Teams getestet, die 45 verschiedene Sprachen sprechen. OpenAI sagt, dass ein Bericht über diese Sicherheitsbemühungen Anfang August veröffentlicht wird.
Das Unternehmen sagt, dass der fortschrittliche Sprachmodus auf die vier voreingestellten Stimmen von ChatGPT – Juniper, Breeze, Cove und Ember – beschränkt sein wird, die in Zusammenarbeit mit bezahlten Synchronsprechern erstellt wurden. Die in der Mai-Demo von OpenAI gezeigte Sky-Stimme ist in ChatGPT nicht mehr verfügbar. OpenAI-Sprecherin Lindsay McCallum sagt: „ChatGPT kann die Stimmen anderer Personen, sowohl von Einzelpersonen als auch von öffentlichen Figuren, nicht nachahmen und blockiert Ausgaben, die von einer dieser voreingestellten Stimmen abweichen.“
OpenAI versucht, Deepfake-Kontroversen zu vermeiden. Im Januar wurde die Stimmklontechnologie von ElevenLabs, einem KI-Startup, verwendet, um Präsident Biden zu imitieren und Wähler in New Hampshire zu täuschen.
Benutzererfahrung und zukünftige Entwicklungen
OpenAI sagt auch, dass neue Filter eingeführt wurden, um bestimmte Anfragen zur Erstellung von Musik oder anderen urheberrechtlich geschützten Audiodateien zu blockieren. Im letzten Jahr hatten KI-Unternehmen rechtliche Probleme wegen Urheberrechtsverletzungen, und Audiomodelle wie GPT-4o eröffnen eine ganz neue Kategorie von Unternehmen, die eine Beschwerde einreichen können. Insbesondere Plattenlabels, die dafür bekannt sind, klagefreudig zu sein, haben bereits die KI-Song-Generatoren Suno und Udio verklagt.
Die Verwendung des neuen fortschrittlichen Sprachmodus fühlt sich an, als würde man mit einer echten Person sprechen. Die Reaktionsfähigkeit und die natürlichen Intonationen sind wirklich beeindruckend. OpenAI sagt, dass es die neue Stimme von ChatGPT schrittweise einführt, um die Nutzung genau zu überwachen. Personen in der Alpha-Gruppe erhalten eine Benachrichtigung in der ChatGPT-App, gefolgt von einer E-Mail mit Anweisungen zur Verwendung.
In den kommenden Monaten plant OpenAI, die Sprachfunktionen weiter zu verbessern und die Funktionen für Video- und Bildschirmfreigabe zu erweitern. Benutzerfeedback wird eine entscheidende Rolle bei der Gestaltung der zukünftigen Entwicklungen des fortschrittlichen Sprachmodus von ChatGPT spielen.







