Technologie

Was in der Sekunde zwischen Frage und Antwort passiert

Wenn du fragst „Was ist vor mir?“, setzt das Telefon in deiner Hand die ganze Maschinerie in Gang: vom Foto und der Entfernungsmessung über KI-Modelle bis zu Sprache und Vibration. Scrolle, um jeden Schritt zu sehen.

Schritt eins

Foto und Tiefe

Die Kamera nimmt ein Bild auf, während der LiDAR-Sensor die Entfernung zu allem im Blickfeld misst. Hat das Telefon kein LiDAR, schätzt stattdessen ein Machine-Learning-Modell die Tiefe.

  • LiDAR
  • Tiefenkarte
  • ML-Modell (Fallback)
Schritt zwei

Analyse auf dem Gerät

Bevor irgendetwas das Telefon verlässt, analysieren zwei Modelle dasselbe Bild: Eines erkennt, ob du draußen oder drinnen bist, das andere anhand von Merkmalspunkten, ob sich die Szene seit dem letzten Bild verändert hat. Wenn nicht, muss nichts gesendet werden.

  • ML-Modelle
  • Merkmalspunkte
  • Auf dem Gerät
Schritt drei

Sichere Übertragung an die KI

Das Bild, die Tiefenkarte und der Gesprächskontext gehen an das Modell GPT Realtime von OpenAI in der Cloud. App Attest bestätigt, dass wirklich die echte App die Verbindung aufbaut, und alles ist verschlüsselt. Diese Arbeit wird in Token gemessen, und daraus ergibt sich der Preis.

  • GPT Realtime
  • App Attest
  • Verschlüsselung
  • Token
Schritt vier

Sprache und Vibration

Pfosten, rechts, sehr nah.

Die Antwort kommt als Sprache zurück: kurz und vorhersehbar, was, welche Seite, wie weit. In der Nähe eines Hindernisses vibriert das Telefon zusätzlich, und diese Funktion arbeitet auch ohne Internet.

  • Sprachsynthese
  • Haptik
  • VoiceOver

Sieh, wie es auf dem Bildschirm aussieht

Diese ganze Maschinerie steckt hinter einem einzigen Bildschirm mit vier Schaltflächen. Der Bildschirmführer erklärt dir jede davon.