GPT-Live-1 startet als Full-Duplex-Voice-Modell in der API

Erstellt vor 1 Stunde 104 Aufrufe
Heinz Martin vor 1 Stunde
#239
16:9, futuristische Sprach-KI-Visualisierung mit zwei sich überlagernden Audio-Wellen für gleichzeitiges Sprechen und Zuhören, Mikrofon-Silhouette, dynamische Signalpartikel, farbig, kontrastreich, keine echten Personen, keine Markenlogos, kein Zufallstext
OpenAI bringt GPT-Live-1 in die API und zielt damit auf deutlich natürlichere Voice-Anwendungen. Das Modell arbeitet Full-Duplex: Es kann zuhören und sprechen, ohne den klassischen starren Wechsel zwischen Eingabe und Antwort erzwingen zu müssen. Besonders interessant ist der Umgang mit Unterbrechungen, Pausen und Hintergrundgeräuschen. Entwickler können außerdem Tonfall, Tempo und Gesprächsstil steuern, während komplexeres Reasoning oder Tool-Aufrufe an gekoppelte Modelle im Hintergrund weitergegeben werden können. Für Creator, Avatare und interaktive Formate ist das mehr als ein kleines Voice-Update. Je natürlicher Echtzeit-Dialog funktioniert, desto näher rücken KI-Figuren, Live-Assistenten und sprachgesteuerte Produktionsabläufe an echte Gesprächsdynamik. Quellen: - OpenAI: https://openai.com/index/introducing-gpt-live-1-in-the-api/