Der Sprachmodus von ChatGPT wurde komplett überarbeitet: Man wird vergessen, dass man mit einer KI spricht
OpenAI hat die Modelle GPT-Live-1 und GPT-Live-1 mini vorgestellt, die darauf abzielen, das Spracherlebnis von ChatGPT natürlicher zu gestalten.
12punto
OpenAI hat neue Sprachmodelle für den Sprachmodus von ChatGPT angekündigt. Die Modelle mit den Namen GPT-Live-1 und GPT-Live-1 mini zielen darauf ab, dass Nutzer natürlicher und unterbrechungsfreier mit der künstlichen Intelligenz kommunizieren können.
Nach Angaben des Unternehmens können die neuen Modelle Pausen und Übergänge während eines Gesprächs besser steuern. Auf diese Weise soll erreicht werden, dass sich die Sprachgespräche mit ChatGPT weniger wie eine klassische Befehl-Antwort-Erfahrung anfühlen, sondern eher wie ein echtes Gespräch zwischen zwei Personen.
GLEICHZEITIG SPRECHEN UND ZUHÖREN
Eines der herausragenden Merkmale der neuen Sprachmodelle ist die Unterstützung der sogenannten „Full-Duplex“-Kommunikation. Dank dieser Struktur kann der Assistent gleichzeitig sprechen und dem Nutzer zuhören. Dies soll insbesondere bei längeren Gesprächen für ein flüssigeres Erlebnis sorgen.
Es wurde mitgeteilt, dass der aktuelle Sprachmodus in ChatGPT standardmäßig durch das Modell GPT-Live-1 mini ersetzt wird. Nutzer mit kostenpflichtigen Abonnements erhalten Zugriff auf GPT-Live-1, das als das größere und fortschrittlichere Modell angeboten wird.
Die bisherige Sprachinfrastruktur von OpenAI bestand aus mehreren Stufen, darunter ein Spracherkennungssystem, das die Stimme des Nutzers in Text umwandelt, ein Sprachmodell, das die Antwort generiert, und ein Text-zu-Sprache-System, das diese Antwort wiedergibt. Es heißt, dass die neuen Modelle diese Struktur in ein direkteres, sprachbasiertes Erlebnis umwandeln.
Das Unternehmen betont, dass der neue Sprachmodus für längere Unterhaltungen entwickelt wurde. Berichten zufolge sagte eine Führungskraft von OpenAI, dass sie während Spaziergängen über diese Funktion 30 bis 40 Minuten lange, ununterbrochene Gespräche führen konnte. Die neue Struktur soll zudem Probleme wie das unnötige Unterbrechen des Nutzers durch den Assistenten reduzieren.
Der Sprachmodus kann bei komplexeren Anfragen, die eine Suche, logisches Denken oder Agentenfähigkeiten erfordern, im Hintergrund auf das aktuelle Textmodell des Unternehmens, GPT-5.5, zurückgreifen. Dabei ist das Ziel, dass der Fluss des Sprachgesprächs ohne Unterbrechung fortgesetzt wird.
Es ist jedoch noch nicht klar, ob das neue System in allen Sprachen die gleiche Leistung erbringen wird. In einer Live-Demo zur Übersetzung ins Hindi wurde berichtet, dass der Assistent mit einem deutlichen amerikanischen Akzent sprach und die Sprache künstlich klang. Obwohl OpenAI angibt, dass der neue Modus für „die meisten der meistgesprochenen Sprachen“ optimiert wurde, wurde keine detaillierte Sprachliste veröffentlicht.