ChatGPT iOS-App erhält Gestenfunktion zum einfachen Hochladen aktueller Fotos in Chats

Als neue Generation der visuellen Suchhilfe hat ChatGPT diese Woche im iOS-Ökosystem den Nutzungsvorgang optimiert, wodurch es für Nutzer einfacher wird, aktuelle Fotos in Gespräche einzufügen. Früher mussten Nutzer zuerst auf die +-Taste klicken, „Fotos“ auswählen und dann aus dem Album wählen. Obwohl dieser Prozess nicht kompliziert war, unterbrach er dennoch den natürlichen Gesprächsfluss, wenn mehrere Fotos schnell hochgeladen oder mehrere visuelle Anfragen verknüpft werden mussten. OpenAI hat in der Community von Adam Fry angeregt, dass man jetzt einfach die +-Taste links im Eingabefeld lange drücken kann, um ein Schnellwahlfeld mit den letzten vier Fotos des Systems aufzurufen. Durch die Auswahl eines Fotos kann dieses dann dem Gespräch angehängt werden, gefolgt von einer direkten Frage oder der Integration in die Eingabeaufforderung. Diese neue Geste wurde zusammen mit anderen Verbesserungen in dieser Woche eingeführt, wie z.B. einer genaueren Erfassung der aktuellen Zeit, einer verbesserten Lade- und Reaktionsgeschwindigkeit bei langen Gesprächen auf der Weboberfläche sowie klareren Benutzeroberflächenaktualisierungen während der Wartezeit bei der Internetverbindung. Diese Veränderungen zeigen, dass OpenAI mit einem intuitiveren Interaktionsdesign die Hürden für alltägliche visuelle Anfragen senkt, sodass Nutzer schnelle „visuelle Abfragen“ durchführen können, ohne den Gesprächsfluss zu unterbrechen.

Im Hintergrund läuft die Funktion „Visual Intelligence“ bereits seit fast zwei Jahren im iOS-System, unterstützt jedoch derzeit nur relativ neue iPhone-Modelle und hat in Bezug auf die globale Abdeckung noch Einschränkungen. Für Nutzer, die auf ChatGPT für ähnliche visuelle Suchanfragen angewiesen sind, bietet die neue Geste eine sofortige Alternative: Es ist nicht mehr nötig, die Benutzeroberfläche zu wechseln oder manuell auszuwählen, sondern man kann die letzten Fotos direkt im Gesprächsfenster schnell senden, um die Anfragen näher am aktuellen Kontext zu halten. Diese Änderungen zeigen, dass OpenAI Wert auf den „visuellen Kontext“ legt und eine nahtlosere Interaktionserfahrung über verschiedene Geräte hinweg bietet. Im Vergleich zu früheren Prozessen könnte dieser Ansatz die Effizienz im hektischen Arbeitsalltag steigern, insbesondere bei Aufgaben, die einen schnellen Abgleich von physischen Erscheinungen mit textuellen Beschreibungen erfordern.

Neue Gesten machen visuelle Anfragen in ChatGPT intuitiver und fördern den Rhythmus der geräteübergreifenden Zusammenarbeit

Darüber hinaus konzentriert sich dieses Update nicht nur auf das schnelle Hochladen, sondern ermöglicht es Nutzern auch, den gesamten Prozess von „Foto auswählen“ bis „visuell relevante Fragen stellen“ auf demselben Bildschirm abzuschließen. In der praktischen Anwendung hält der Nutzer die +-Taste gedrückt, das System zeigt die letzten vier Fotos an, und durch das Auswählen eines beliebigen Fotos wird es als Anhang in das Gespräch eingefügt. Anschließend kann der Nutzer direkt im Eingabefeld Anweisungen, Detailbeschreibungen oder spezifische Fragen zu den Inhalten des Fotos hinzufügen. Der Kern dieses Designs liegt darin, die kognitive Belastung zu reduzieren, sodass Nutzer schnell eine fotozentrierte Abfrageumgebung aufbauen können, ohne zwischen mehreren Benutzeroberflächen wechseln zu müssen. Außerdem hilft die schnelle Auswahl der letzten Fotos, wenn diese aus verschiedenen Zeitpunkten stammen, effizient zu vergleichen und zu schlussfolgern, was besonders in alltäglichen Situationen wie Einkäufen, Bildbearbeitung und Reiseplanung nützlich ist. Dies zeigt, dass OpenAI weiterhin nutzerzentriert arbeitet und durch intuitivere Bedienung die Verbreitung von Bildsuchen vorantreibt.

Das aktuelle Update legt auch den Fokus auf Leistung und Stabilität. Neben der Verbesserung der Echtzeitreaktion der Frontend-Oberfläche wurde auch die Verarbeitungsgeschwindigkeit bei langen Gesprächen auf der Weboberfläche optimiert. In Situationen, in denen mehrere visuelle Inhalte im Gespräch kontinuierlich zitiert oder verglichen werden müssen, können solche Optimierungen die Wartezeiten erheblich reduzieren und das gesamte Erlebnis flüssiger gestalten. Klarere Anweisungen zur Wartezeit bei der Verbindung bedeuten, dass Nutzer bei instabilen Internetverbindungen schneller den aktuellen Status verstehen können, um Verwirrung durch verzögerte Anzeigen zu vermeiden. Diese Veränderungen weisen alle in eine Richtung: ChatGPT verbessert die Praktikabilität in digitalen visuellen Abfragen mit einem robusteren und intuitiveren Design für alltägliche Arbeits- und Unterhaltungsszenarien.

In Bezug auf regionale und geräteübergreifende Abdeckung, obwohl die Verbreitung von Visual Intelligence durch Geräte und Regionen eingeschränkt ist, investiert OpenAI weiterhin in die Optimierung der entsprechenden Unterstützung und Benutzererfahrung. Für die Nutzer wird die Praktikabilität und Zugänglichkeit visueller Abfragen erheblich steigen, wenn in zukünftigen Updates eine breitere Geräteunterstützung und schnellere geräteübergreifende Synchronisation realisiert werden können. Diese Reihe von Verbesserungen von OpenAI könnte auch die Entwicklergemeinschaft dazu anregen, in Drittanbieteranwendungen natürlichere visuelle Dialogreferenzen einzuführen und so die Arbeits- und Unterhaltungsszenarien von „sehen und verstehen“ weiter auszubauen.

Vergleich und Ausblick: Unterschiede zu anderen ähnlichen KI und zukünftige Entwicklungen

Originalinhalt
Dieser Artikel ist die deutsche Fassung eines Originalbeitrags von TechRitual.
Stein Yep
Stein Yep